Nemotron 3.5 Lightning относится к архитектуре Mixture of Experts (MoE) и имеет 30 млрд параметров, из которых для обработки каждого токена активируется 3 млрд. Такой подход позволяет снизить вычислительные затраты по сравнению с полноразмерными моделями. NVIDIA заявляет, что модель может работать на одном GPU и предназначена для агентных задач — от вызова инструментов и написания кода до обработки большого количества рутинных операций.
NVIDIA предлагает использовать Lightning не как замену наиболее мощным моделям, а как часть системы из нескольких моделей. В такой архитектуре сложные модели будут отвечать за планирование и принятие решений, а более компактная Lightning — за выполнение большого количества простых операций. Для автоматического распределения задач компания представила маршрутизатор NVIDIA NeMo Switchyard. Эта система определяет, какую модель лучше использовать для конкретного запроса, направляя сложные задачи более мощным моделям, а рутинные — Lightning.
Особое внимание NVIDIA уделила скорости работы. В тесте PinchBench модель Nemotron 3.5 Lightning достигла точности 86% и выполнила 10 тыс. агентских задач на 30% быстрее, чем Qwen3.6 35B, при сопоставимом качестве. Компания заявляет, что модель обрабатывает задачи до четырёх раз быстрее аналогичных по размеру решений. Однако эти показатели получены в тестах самой компании и требуют независимой проверки.
Ускорение достигается в том числе за счёт спекулятивного декодирования и низкоточных форматов данных. При спекулятивном декодировании специальная вспомогательная модель быстро предсказывает несколько следующих токенов, а основная модель затем проверяет и подтверждает или исправляет их. NVIDIA предлагает DFlash и DSpark в качестве вспомогательных моделей для разных сценариев инференса. Формат NVFP4 позволяет обрабатывать данные с меньшей точностью, экономя вычислительные ресурсы и память, а BF16 обеспечивает компромисс между скоростью и точностью.
Модель может работать как в дата-центрах, так и на локальных системах, включая DGX Spark, Jetson и GeForce RTX 5090. Ее можно дообучать под конкретные задачи — NVIDIA публикует веса, данные для обучения и инструкции по настройке. В комплект поставки входит открытый набор данных Nemotron-RL Agentic Terminal Pivot, предназначенный для обучения агентным сценариям, включая программирование.
Релиз вписывается в более широкую стратегию NVIDIA по развитию открытых ИИ-моделей. Компания стремится конкурировать не только с закрытыми системами вроде OpenAI и Anthropic, но и с открытыми китайскими моделями Qwen, DeepSeek и Kimi.
Следующим крупным релизом должна стать Nemotron 4: по данным Reuters, NVIDIA разрабатывает модель с более чем триллионом параметров и рассчитывает выпустить ее до конца осени.
NVIDIA фактически строит экосистему, в которой собственные модели, инструменты маршрутизации и программное обеспечение стимулируют использование ее оборудования. Nemotron 3.5 Lightning доступна для загрузки через Hugging Face и ModelScope, а также для тестирования через сервисы NVIDIA и OpenRouter.

