Hitech logo

Кейсы

NVIDIA показала, как повысить эффективность Claude Opus 5 на 300%

TODO:
Екатерина ШемякинскаяСегодня, 01:29 PM

В NVIDIA пришли к выводу, что для автономных ИИ-агентов важна не только базовая модель, но и инфраструктура, которая ее окружает. Исследователи подключили Claude Opus 5 к собственной агентной архитектуре Agentic Variation Operators (AVO) и получили 100% на интерактивном бенчмарке ARC-AGI-3. В базовой конфигурации эта же модель показывала на том же бенчмарке результат около 30%. Иными словами, модель остается «мозгом» агента, но его способность справляться с долгими и сложными задачами во многом зависит от того, как устроена сопутствующая «инфраструктура».

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

AVO — это не новая модель, а система вокруг модели. Она добавляет постоянную память, инструменты для взаимодействия с внешней средой, механизмы обратной связи и отдельного «супервизора». Память сохраняет результаты предыдущих действий, версии решений и накопленную информацию, а «супервизор» следит за общей траекторией работы и может вмешаться, если основной агент застрял, начал повторяться или действует непродуктивно. Такой подход рассчитан на задачи с длинным горизонтом — когда для результата нужно последовательно принимать множество решений на протяжении часов или дней.

Сначала NVIDIA протестировала AVO на инженерной задаче — оптимизации ядер графического процессора с помощью ИИ. За семь дней агент исследовал более 500 вариантов и создал 40 версий ядра. На системах NVIDIA DGX B200 лучшее ядро оказалось на 3,5% производительнее cuDNN (библиотеки NVIDIA для ИИ-вычислений) и на 10,5% быстрее FlashAttention-4 (технологии ускорения механизма внимания).

Затем исследователи проверили AVO на ARC-AGI-3 — наборе интерактивных 2D-игр без инструкций и заранее заданных целей. Агент должен самостоятельно исследовать среду и проанализировать возможные последствия своих действий. AVO с Claude Opus 5 прошла все 183 уровня в 25 средах, набрав максимальные 100,00 RHAE — показатель эффективности действий агента по сравнению с человеком. На это потребовалось 6624 действия — на 12% меньше, чем другой агентной системе VISTA с той же моделью в основе (7542 действия). Для сравнения, Claude Opus 5 без AVO показывала 30% при высоком уровне рассуждений.

Однако напрямую сопоставлять эти результаты нельзя: тесты проводились при разных настройках и с разной архитектурой агентной системы. Скорее, это показывает, что результат самой модели не всегда отражает возможности полноценного ИИ-агента.

AVO может работать с разными моделями. В ограниченных экспериментах NVIDIA запускала AVO с GPT-5.6 Sol: она достигала сопоставимого результата быстрее, тогда как Claude Opus 5 решала задачи с меньшим числом действий. При этом GPT-5.6 Sol без дополнительной агентной системы показала на ARC-AGI-3 всего 13,3%. OpenAI обнаружила, что сохранение предыдущих рассуждений и сжатие контекста повышают результат до 38,3%, но это всё ещё далеко от результата, которого удалось достичь NVIDIA.

Инсайт NVIDIA заключается в том, что модель — это только один компонент агента, и часто не самый важный. Адель Эль Халлак, вице-президент по продуктам подразделения ИИ NVIDIA, объясняет это так: «В целом, мир воспринимает агента почти как API модели. Но агент на самом деле представляет собой нечто большое — это модель плюс каркас вокруг неё, набор инструментов, среда выполнения и связанные навыки и библиотеки». Исследование показало, что в правильно выстроенной архитектуре Claude Opus 5 может превзойти свои собственные показатели. В июле компания Databricks показала, что инструментарий вокруг модели может влиять на стоимость ИИ даже больше, чем выбор самой модели.

NVIDIA планирует открыть большую часть компонентов AVO в рамках своей платформы Nemo, что позволит разработчикам по всему миру построить свои собственные универсальные агентские системы с поддержкой различных моделей.