~10 минут чтения · Февраль 2026
Почему все строят свои LLM
2024–2026 годы стали эпохой национальных языковых моделей. Правительства по всему миру осознали: зависимость от чужих AI-систем — это стратегический риск. Данные уходят за рубеж, модели не понимают местный контекст, а инфраструктура принадлежит иностранным компаниям.
Кто уже построил
| Страна | Проект | Параметры | Бюджет |
|---|---|---|---|
| ОАЭ | Falcon (TII) | 7B–180B | $50–200M |
| Саудовская Аравия | ALLaM (HUMAIN) | 34B | Часть $100B HUMAIN |
| Франция | Mistral AI | до 123B | $3B+ привлечено |
| Турция | Kumru AI (TUBITAK) | 14B | $10–50M |
| Казахстан | KAZ-LLM (ISSAI) | 8B + 70B | ~$5–20M |
Узбекистан — единственная крупная страна Центральной Азии без собственной языковой модели. При этом в октябре 2024 президент подписал стратегию развития ИИ (ПП-358), а Минцифры объявило о разработке национальной модели. Цель — $1.5 млрд AI-продуктов к 2030 году.
Кому нужна кастомная LLM
Не только правительствам. Своя модель решает конкретные бизнес-задачи, которые невозможно закрыть через API OpenAI или Anthropic.
- Государство — суверенитет данных. Обращения граждан, медицинские записи, судебные дела — всё остаётся внутри страны. Госуслуги на национальном языке без зависимости от иностранных API.
- Банки и телеком — compliance и безопасность. Данные клиентов не уходят в OpenAI. Чат-боты понимают местный контекст: валюта, законодательство, продукты. Регуляторы требуют локальное хранение.
- IT-компании — специализированные агенты. Модель, обученная на ваших API: Telegram, CRM, база данных. Tool calling без промежуточных слоёв. Полный контроль над поведением.
- Образование — адаптация под местный контекст. AI-репетитор, который знает программу узбекской школы, объясняет на родном языке и учитывает культурные особенности.
- Стартапы — 80–90% экономия. GPT-4o стоит $2.50–15 за миллион токенов. Своя 14B-модель на одном GPU — $0.30–0.50/1M. При масштабе это разница в десятки тысяч долларов.
- Контент и медиа — генерация на национальном языке. GPT-4o и Claude пишут на узбекском посредственно. Своя модель — правильная грамматика, стиль и культурный код.
Когда НЕ нужна своя модель
Честный анализ. Своя LLM — не серебряная пуля. Вот когда лучше использовать готовые API:
- Нужен уровень GPT-4o / Claude. Если задача требует frontier-качества — сложные рассуждения, генерация кода уровня Senior, мультимодальность — 14B-модель не заменит 200B+ модель. Используйте API и RAG.
- Нет данных для обучения. Fine-tuning без качественных данных бесполезен. Нужно минимум 500–1,000 размеченных примеров для базового результата, 5,000+ для качественного. Если данных нет — начните с промпт-инжиниринга.
- Бюджет менее $500. Сам fine-tuning стоит $2–8 за прогон. Но подготовка данных, тестирование, итерации и инфраструктура суммарно требуют $500–1,200 для прототипа. Если бюджет жёстко ограничен — используйте API с оптимизацией.
Правило: начните с API (Anthropic, OpenAI) + RAG. Если упираетесь в стоимость, privacy или качество на вашем языке — тогда fine-tune.
Что мы сделали · MILA LLM v0.1
Мы прошли весь путь от идеи до работающей модели. Вот пошаговый разбор нашего кейса.
BASE MODEL — Qwen3-14B. Почему именно эта модель: Apache 2.0 лицензия (полная свобода), нативная поддержка 119 языков включая узбекский, 14 миллиардов параметров — достаточно для качественных ответов, помещается на один GPU.
METHOD — QLoRA Fine-Tuning. Замораживаем все 8.8 миллиардов параметров, сжимаем в 4-bit. Добавляем маленькие обучаемые адаптеры — 256M параметров (2.91% от общего числа). Обучаем только их. Результат: модель учит новое, не забывая старое.
DATA — 12 кастомных примеров. Для proof-of-concept: 8 примеров function calling (Telegram, Calendar, Linear, Convex), 2 примера узбекских знаний, 2 примера доменных знаний. Формат ChatML. Языковой микс: узбекский (латиница), русский, английский.
INFRA — RunPod A100, ~20 минут. NVIDIA A100 80GB на RunPod. Полный цикл: создание пода, загрузка данных, обучение (18 секунд на 12 примерах), merge LoRA-адаптеров, GGUF-квантизация, скачивание результата. Итого: ~$15.
Результат
| Параметр | Значение |
|---|---|
| Размер GGUF | 8.4 ГБ (Q4_K_M) |
| Inference | `ollama run mila-llm:14b` |
| Языки | Узбекский, русский, английский |
| Function calling | Telegram, Calendar, Linear, Web |
| Стоимость | ~$15 за полный прогон |
Модель работает локально на обычном Mac через Ollama. Отвечает на узбекском, русском и английском. Вызывает инструменты через tool_calls. Полный pipeline отлажен и воспроизводим.
Экономика · Кастомные LLM
Сравнение стоимости
| GPT-4o API | Fine-tuned 14B (self-hosted) | Fine-tuned 14B (cloud) | |
|---|---|---|---|
| Стоимость | $2.50–15/1M токенов | $0 (hardware costs) | $0.30–0.50/1M |
| Данные | Уходят в OpenAI | Остаются у вас | На вашем сервере |
| Кастомизация | Только промпт | Полная | Полная |
| Latency | ~500 мс | ~100 мс (GPU) | ~200 мс |
Стоимость обучения
- QLoRA (рекомендуем): обновляет 0.1% параметров, 10–16 ГБ VRAM — $2–8 за прогон
- LoRA: обновляет 0.1–1% параметров, 24–48 ГБ VRAM — $50–200
- Full fine-tuning: все параметры, ~200 ГБ VRAM — $2,000–5,000
Сколько пользователей обслужит 1 GPU
| GPU | Покупка | Аренда/час | Пользователей |
|---|---|---|---|
| RTX 4090 | $1,600–2,000 | $0.34–0.44 | 30–60 |
| L40S | $7,000–10,000 | $0.59–1.24 | 50–100 |
| A100 80GB | $10,000–15,000 | $0.67–2.06 | 80–150 |
| H100 SXM | $27,000–40,000 | $1.99–6.16 | 150–300 |
Один RTX 4090 за $1,600 обслуживает 30–60 пользователей одновременно. Для стартапа или пилотного проекта — достаточно одной карточки.
Roadmap · От прототипа к продукту
- СДЕЛАНО — Прототип. MILA-LLM-14B v0.1 на базе Qwen3-14B. QLoRA, 12 примеров, GGUF 8.4 ГБ, работает через Ollama. Стоимость: ~$15.
- 1–3 МЕСЯЦА — Валидация. 5,000–10,000 обучающих примеров. Бенчмарки: FC accuracy, Uzbek QA, MMLU. A/B тестирование с base моделью. Публикация на HuggingFace. Первые пилотные клиенты.
- 3–6 МЕСЯЦЕВ — Масштабирование. Full fine-tuning на государственном GPU-кластере (NVIDIA Blackwell B200). Расширенный языковой корпус. DPO alignment. Варианты модели: 4B (edge), 14B (standard), 32B (premium).
- 6–12 МЕСЯЦЕВ — Продакшн. 4–8 GPU в Ташкенте, inference API, 10+ клиентов. UzbekMMLU бенчмарк. Партнёрство с Минцифры. Inference как сервис для бизнеса.
Что нужно для следующего этапа
- GPU-кластер — для full fine-tuning и inference (доступен через гос. программу или грант)
- Языковой корпус — узбекский текст: новости, книги, документы (проект Минцифры)
- Грант $15–40K — на ML-инженеров, расширение данных, инфраструктуру
MILA LLM — open-source модель для Узбекистана
Работающий прототип. Полный pipeline. Apache 2.0 лицензия. Готовы к партнёрству: государство, бизнес, инвесторы, ML-инженеры.