Hitech logo

Кейсы

«Яндекс» создал суверенную большую языковую модель на 80 млрд параметров

TODO:
Екатерина ШемякинскаяСегодня, 09:06 AM

«Яндекс» разработал большую языковую модель Alice AI Foundation LLM, обученную с нуля без использования сторонних иностранных компонентов. Модель содержит 80 млрд параметров, из которых активны 3 млрд, и обучена на 18 трлн токенов. Компания открыла ее веса и позиционирует разработку как полностью суверенную. Модель должна стать основой для будущей рассуждающей версии и агентных возможностей «Алисы AI». Это значит, что у суверенной модели Сбера GigaChat 3.5 Reasoning появился сильный конкурент.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Alice AI Foundation использует гибридную архитектуру с MoE-слоями. В модели 512 экспертов, из которых при обработке каждого токена выбираются 10, а также один общий эксперт. Максимальная длина контекста составляет 262 144 токена. Опубликованная версия является базовой: она не проходила постобучение и выравнивание и предназначена для дальнейшей доработки. Веса модели «Яндекс» распространяет по лицензии Apache 2.0, разрешающей их использование в коммерческих и исследовательских проектах.

По данным собственных бенчмарков «Яндекса», Alice AI Foundation показывает высокие результаты на русскоязычных тестах: в WikiWebFacts модель набрала 86,5 балла, а в HardMultiQA — 67,9, опередив Qwen3.5-35B-A3B, GLM-4.5-Air и Nemotron-3-Super от NVIDIA. В AIME 2026, тесте на решение олимпиадных задач по математике, модель получила 96,7 балла и разделила первое место с Qwen3.5-35B-A3B-Base. В тестах на программирование Alice AI Foundation также показала результат выше Nemotron-3-Super-120B-A12B-Base — 60,4 против 34,7 балла в LiveCodeBench v5-6 при оценке pass@1, используя при этом в четыре раза меньше активных параметров.

В русскоязычных задачах на фактические знания модель также обошла более крупную DeepSeek-V4-Flash-Base.

Стоимость разработки «Яндекс» не раскрывает, а оценки затрат со стороны экспертов существенно различаются в зависимости от методики подсчета. Собеседник «Ведомостей» в крупном облачном провайдере оценил основной этап обучения в 150–450 млн руб., руководитель центра разработки больших языковых моделей Валентин Малых — примерно в 4 млрд руб. при аренде систем Nvidia DGX. По оценке директора по развитию бизнеса Data Light Александра Громова, с учетом экспериментов и неудачных запусков вычисления могли стоить 0,5–1 млрд руб. В целом на вычисления может приходиться 30–50% бюджета проекта, а остальные расходы — на данные, команду и инфраструктуру. «Яндекс» ранее сообщал, что в 2026 году потратит на ИИ-тренеров 3,5 млрд руб.

При этом юридически статус Alice AI Foundation как суверенной модели пока не подтвержден.

Понятия национальной и суверенной ИИ-моделей появились в законе об искусственном интеллекте, вступившем в силу 1 сентября. Для суверенной модели предусмотрены более жесткие требования: полностью отечественными должны быть программный код, архитектура и инфраструктура. Порядок присвоения такого статуса правительство еще разрабатывает, а правила учета моделей начнут действовать с 1 марта 2027 года. Поэтому до этой даты определение модели как суверенной остается характеристикой самой компании.

По словам экспертов, одного обучения модели с нуля для признания ее суверенной недостаточно. Разработчику потребуется подтвердить отечественное происхождение всех компонентов и воспроизводимость полного цикла ее создания — от подготовки данных и архитектуры до обучения, постобучения и инференса. Под это определение до сих пор подпадала только GigaChat от «Сбера».

По мнению представителей Альянса в сфере ИИ, собственные технологические стеки «Яндекса» и Сбербанка позволяют создавать продукты без привязки к зарубежным платформам. Заведующий кафедрой ИИ Финансового университета Михаил Коротеев считает, что Alice AI Foundation стала ответом «Яндекса» на развитие собственных фундаментальных моделей Сбербанка. После дополнительного постобучения она может конкурировать с GigaChat 3.5 Reasoning, полагает эксперт.