Hitech logo

Кейсы

Moonshot AI открыла веса Kimi K3 — модели с 2,8 трлн параметров

TODO:
Екатерина ШемякинскаяСегодня, 10:34 AM

Китайская компания предоставила доступ  к весам своей новой модели искусственного интеллекта Kimi K3. Опубликованный технический отчет показывает, какие архитектурные и аппаратные решения позволяют модели с 2,8 трлн параметров работать относительно дешево. Разработчики теперь могут самостоятельно запускать Kimi K3 на собственных GPU-серверах. Moonshot AI утверждает, что по производительности новинка приблизилась к лучшим закрытым системам OpenAI и Anthropic.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Kimi K3 построена на архитектуре «Смесь экспертов» (Mixture of Experts, MoE): из 2,8 трлн параметров во время одного запроса активируется только 104,2 млрд. При этом внутри системы из 896 экспертных блоков одновременно работают лишь 16. Такая разреженность позволяет не задействовать все вычислительные ресурсы при каждом запросе и тем самым снизить стоимость инференса. Для экономии видеопамяти Moonshot перевела модель на низкоточные форматы данных (MXFP4 для весов и MXFP8 для активаций). Проще говоря, параметры записаны с помощью менее громоздких форматов, благодаря чему она сжимается в размерах и требует гораздо меньше памяти графического процессора.

Еще одна особенность Kimi K3 — собственная технология Kimi Delta Attention. В обычных ИИ-моделях объем памяти, необходимый для обработки длинного текста (KV-cache), растет по мере увеличения контекста. Kimi K3 вместо этого использует хранилище фиксированного размера, поэтому ей требуется меньше видеопамяти и вычислительных ресурсов.

Технический отчет также дает больше информации о том, на каком оборудовании тестировалась модель. Для части экспериментов с программированием Moonshot использовала ускорители Nvidia H20 — не самые мощные современные GPU. Это может говорить о том, что Kimi K3 рассчитана на относительно экономичный запуск и не требует исключительно передового оборудования. Впрочем, данных пока недостаточно, чтобы точно оценить ее эффективность на более новых ускорителях с поддержкой низкоточных форматов MX.

Такая архитектура позволяет Kimi K3 конкурировать с новейшими закрытыми моделями. В собственных тестах компания заявляет, что Kimi K3 превосходит предыдущие поколения Claude и GPT и лишь немного уступает Claude Fable и GPT-5.6 Sol. При этом ее эксплуатация, по расчетам разработчиков, обходится в 2-3 раза дешевле конкурентов, а при эффективном использовании кэширования разница может быть десятикратной.

В качестве примера Moonshot приводит стоимость обработки входных данных: $3 за 1 млн токенов для Kimi K3 против $10 у Claude Fable и $5 у GPT-5.6 Sol. Для задач программирования компания оценивает долю обращений к кэшу примерно в 90%, что теоретически снижает стоимость до $0,30 за 1 млн токенов. При этом Moonshot подчеркивает, что ее показатели основаны на внутренних расчетах, тогда как цены конкурентов взяты из публичных тарифов, поэтому сравнение нельзя назвать полностью независимым.

Открытие весов означает, что разработчики и компании с подходящей GPU-инфраструктурой могут самостоятельно развернуть Kimi K3 и создавать на ее основе собственные продукты. При этом Moonshot не раскрывает весь исходный код модели, процесс ее обучения и использованные датасеты. Тем не менее, публикация технических деталей позволяет разработчикам заглянуть внутрь одной из крупнейших открытых моделей и понять, за счет каких инженерных решений китайской компании удалось совместить масштаб в 2,8 трлн параметров и относительно низкую стоимость эксплуатации.