Hitech logo

Кейсы

Anthropic выпустила Claude Opus 5.5 — модель обошла GPT-6 Astra в тестах на программирование

TODO:
Екатерина ШемякинскаяСегодня, 09:07 AM

Anthropic представила Claude Opus 5.5 — новую флагманскую ИИ-модель, которая, по данным компании, заметно превосходит предыдущую версию в программировании, работе с компьютером и сложных многоэтапных задачах. При этом модель стала более чем на 30% быстрее и примерно на 40% дешевле Opus 5 при типичных рабочих нагрузках. Anthropic также заявила об улучшении безопасности Opus 5.5 и представила ее как первую модель новой линейки Claude 5.5.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Основной прирост производительности разработчики отмечают в программировании, работе с компьютером и выполнении сложных многоэтапных задач. В одном из тестов ранний пользователь с помощью Opus 5.5 перенес 680 тыс. строк кода менее чем за день — работа, которая заняла бы у команды инженеров несколько недель. В другом тесте модель успешно оптимизировала загрузку веб-приложения в 39 из 40 случаев. Другой тестировщик создал игру из одного запроса с помощью нескольких моделей Claude. Вариант Opus 5.5 оказался лучшим по качеству графики и общей проработке.

В бенчмарках Opus 5.5 показала лучшие результаты среди протестированных моделей в агентном программировании и работе с интеллектуальными задачами. Например, в GDPval-AA v2.1, который оценивает выполнение задач в 44 профессиональных областях, модель набрала 1846 баллов Elo против 1735 у Fable 5.1 и 1708 у Opus 5. В агентных тестах программирования Opus 5.5 также обошла GPT-6 Astra: в Terminal-Bench 4.0 она набрала 66,4% против 57,9% у Astra, а в FrontierCode — 54,4% против 53,3%. При этом, по данным Anthropic, выполнение задач Opus 5.5 обходится дешевле. В тесте OSWorld 2.0 на использование компьютера модель получила 81,8%.

Разработчики также улучшили стиль общения модели. Ответы Opus 5.5 теперь проще воспринимать с первого взгляда: она выносит наиболее важную информацию на первое место, реже использует жаргон и лучше соблюдает заданные пользователем правила написания. По словам первых тестировщиков, это особенно заметно во время длительных рабочих сессий. Opus 5.5 получила контекстное окно на 1 млн токенов, что позволяет модели работать с очень большими объемами информации за один запрос. При этом Anthropic не раскрывает количество параметров модели.

Одним из ключевых преимуществ модели Anthropic называет экономичность. Стоимость входных токенов Opus 5.5 составляет $4 за 1 млн, выходных — $20, а чтения из кэша — $0,20. Это соответственно на 20%, 20% и 60% дешевле, чем у Opus 5. При типичных рабочих нагрузках общая стоимость использования, по оценке компании, снизилась на 40%, а скорость генерации выросла более чем на 30%.

Отдельное внимание Anthropic уделила безопасности. Перед выпуском модель тестировали внешние организации, включая METR и Frontier Design. В автоматизированном поведенческом аудите, включавшем почти 2 тыс. смоделированных сценариев, Opus 5.5 показала лучшие результаты среди последних моделей Claude. По данным компании, она на 85% реже Opus 5 и Fable 5.1 пыталась обойти ограничения изоляции в специальном тесте.

Из-за высоких рисков в сфере биологии и кибербезопасности Anthropic применила в Opus 5.5 те же меры защиты, что и в Fable 5.1. Для верифицированных организаций компания откроет доступ к специальным программам, позволяющим применять ИИ в профильных биоисследованиях и кибербезопасности. При этом разработчик признает, что гарантированно выявлять любые отклонения в поведении модели до ее развертывания пока невозможно.

Claude Opus 5.5 уже доступен на платформах Anthropic, а также через Amazon Web Services, Google Cloud и Microsoft Azure. Компания также сообщила, что в ближайшие недели выпустит модели Claude Sonnet 5.5 и Claude Haiku 5.5, которые получат часть улучшений Opus 5.5 в производительности, эффективности и безопасности.