Большое исследование рынка LLM, которое объединяет мнение экспертов и современные тренды развития
Экосистема открытого кода·Аналитика 2026
Исследование российского рынка LLM и данных для их обучения
Мы исследовали качество и конкурентоспособность российских LLM, требования к данным для их обучения и ключевые шаги для развития отрасли.
Исследование основано на экспертных интервью с представителями российской LLM-отрасли — бигтеха, независимых команд, академических и государственных организаций — и анализе рынка, отечественных моделей и бенчмарков.
Как устроено исследование
этапов обучения проанализировано: от адаптации токенизатора до верифицируемых наград
7
объектов обзора: 16 отечественных моделей и 12 русскоязычных бенчмарков
28
глубинных полуструктурированных интервью с экспертами отрасли
14
Методология
05
Качество курирования важнее объёма
Опыт DeepSeek показывает, что тщательно подготовленный корпус меньшего размера может обеспечивать качество, сопоставимое с гораздо большими, но «сырыми» датасетами. Конкурентоспособность всё больше определяется не только доступом к данным, но и тем, как они отбираются, очищаются и используются для обучения моделей.
01
Рост качества зависит от правил, данных, инфраструктуры и кадров
Государство сделало первый шаг — принятый федеральный закон объясняет механизмы работы с общедоступным контентом для обучения моделей. Дальше отрасли нужны свободные вычислительные мощности, продуктовые внедрения бизнеса, методологическая база и бенчмарки от науки и профильная подготовка LLM-специалистов.
Шесть выводов о состоянии и будущем российского рынка LLM.
Полная аргументация, цитаты экспертов и примеры — в отчёте.
Ключевые выводы исследования
02
Открытие существующих данных — точка роста
В России уже есть значительные объёмы библиотечных, архивных, образовательных, культурных и профессиональных данных, которые сегодня недоступны моделям из-за организационных, юридических и технических барьеров. Открытие и оцифровка тех массивов, которые не содержат чувствительной информации и могут использоваться в открытом доступе, способны стать конкурентным преимуществом отечественных моделей.
03
Преимущество — там, где важны русский язык и «культурный код»
В начале 2026 года первые шесть позиций рейтинга бенчмарка SLAVA заняли отечественные LLM. Ключевые направления внедрения — специализированные отрасли: медицина, право, строительство, геология и другие сферы, где локальный контекст и специфика особенно важны.
06
Конкурентоспособность будущего — коллективный результат
Повышение качества российских LLM требует системной отраслевой стратегии: развитие фундаментальных исследований, расширение вычислительной инфраструктуры, подготовка и удержание кадров, консолидация компаний, государства, университетов и open source сообщества в единую экосистему обмена данными и разработками.
04
Российские модели должны быть многоязычными
Изоляция от международных корпусов приведёт к отставанию: данные на других языках расширяют не словарь, а представление модели о мире. ФЗ № 243-ФЗ закрепляет этот подход, разрешая обучение национальных и суверенных фундаментальных моделей на всех публичных и легально доступных данных.
С кем мы говорили
Участники исследования
Анатолий Потапов
Т-Банк — руководитель группы фундаментальных технологий LLM
Алёна Феногенова
Исполнительный директор департамента развития ИИ и машинного обучения Сбербанка
Александр Крайнов
Директор по развитию технологий искусственного интеллекта Яндекса
Александр Бухановский
ИТМО — доктор технических наук, руководитель Института искусственного интеллекта; директор мегафакультета трансляционных информационных технологий
Алан Газзаев
AI VK, ML-инженер
Остальные участники
Затраты бизнеса РФ
257 млрд ₽
Совокупные расходы российского бизнеса на внедрение и применение ИИ-технологий в 2025 году.
Источник: ТАСС
Мировые расходы на ИИ
~233 трлн ₽
Прогноз мировых расходов на искусственный интеллект в 2026 году: $ 2,59 трлн в пересчёте по текущему курсу.
Источник: Gartner
Разрыв мощностей
×660
Российские разработчики LLM работают в условиях ограниченного доступа к вычислительным ресурсам. Разрыв в вычислительных мощностях между США и РФ оценивается примерно в 660 раз.
Источник: ComNews
Экономические ориентиры, в которых развивается рынок больших языковых моделей в России и мире. Данные из открытых источников, на фоне которых интерпретируются выводы исследования.
Контекст рынка
Сегодня
Экономический эффект в РФ
7,9–12,8 трлн ₽
Ожидаемый ежегодный вклад ИИ в экономику России к 2030 году.
Доля в ВВП
до 5,5%
До 5,5% прогнозного ВВП России может формироваться за счёт технологий искусственного интеллекта.
Компании с генеративным ИИ
71%
Крупных российских компаний применяют генеративный ИИ хотя бы в одной бизнес-функции по итогам 2025 года.
Прогноз до 2030 года
Российский рынок LLM в цифрах
Несмотря на то, что российские разработчики LLM находятся в условиях ограниченного объёма доступных ресурсов (разрыв в вычислительных мощностях между США и РФ оценивается приблизительно в 660 раз), российский рынок LLM развивается, появляются новые игроки, а технологии доходят до практического применения в широком спектре областей: в медицине, логистике, промышленности и других сферах.
Подробное исследование