Hitech logo

Кейсы

Первый чип OpenAI почти вдвое превосходит системы NVIDIA по эффективности

TODO:
Екатерина ШемякинскаяСегодня, 09:53 AM

OpenAI представила первые результаты испытаний собственного чипа Jalapeño, разработанного для инференса ИИ-моделей. По данным компании, он обеспечивает в 1,5–1,9 раза больше вычислительной работы на ватт и в 1,7–3,6 раза меньшую задержку по сравнению с коммерческими ускорителями NVIDIA. Таким образом, Jalapeño призван одновременно повысить энергоэффективность и сократить время отклика моделей. OpenAI планирует начать его развёртывание в собственной вычислительной инфраструктуре до конца 2026 года.

Самые интересные технологические и научные новости выходят в нашем телеграм-канале Хайтек+. Подпишитесь, чтобы быть в курсе.

Jalapeño протестировали на трёх моделях с открытыми весами: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. В качестве систем для сравнения OpenAI использовала коммерческие ускорители NVIDIA: GB200 для GPT-OSS 120B и GB300 для DeepSeek R1 и Kimi K2.5. Во всех тестах Jalapeño показал более высокую эффективность и меньшую задержку. На пиковом уровне пропускной способности чип обеспечил в 1,5–1,9 раза больше ИИ-работы на ватт, а сквозная задержка оказалась в 1,7–3,6 раза ниже. Для высокоинтерактивных нагрузок преимущество по производительности составило 2,1–4,1 раза.

На самой большой модели, Kimi K2.5 1T, чип оказался в 1,5 раза эффективнее на ватт и в 3,4 раза быстрее. Для DeepSeek R1 670B — в 1,7 и 3,6 раза соответственно. Тесты проводились на бенчмарке InferenceX от SemiAnalysis.

OpenAI пыталась решить компромисс между скоростью обработки большого количества запросов и быстрым ответом на отдельный запрос. При работе языковой модели разные этапы инференса предъявляют разные требования к железу: обработка входного запроса требует больших вычислительных ресурсов, а генерация ответа токен за токеном сильнее зависит от работы с памятью. OpenAI спроектировала Jalapeño так, чтобы вычисления, память и сетевое взаимодействие работали как единая система и требовали меньше передачи данных между отдельными компонентами.

Чип рассчитан на мощность 700 Вт, при этом во время тестов его устойчивая потребляемая мощность не превышала 550 Вт. OpenAI отмечает, что оценивала системы не только по производительности самого ускорителя, но и по тому, сколько полезной ИИ-работы они выполняют на единицу энергии при сопоставимой задержке.

По результатам этих испытаний Jalapeño оказался на так называемой границе Парето — среди других систем не было варианта, который одновременно обеспечивал бы более высокую производительность на ватт и меньшую задержку.

При разработке Jalapeño OpenAI сама использовала ИИ. Модели помогали инженерам исследовать варианты архитектуры, ускорять проектирование и проверку решений и оптимизировать вычислительные схемы. От начала разработки до tapeout — этапа, на котором готовый проект чипа передают в производство, — команда дошла за девять месяцев. Позже с помощью Codex и GPT-Astra инженеры за два месяца оптимизировали чип для трёх моделей, которые изначально не входили в план его производства.

OpenAI планирует начать развёртывание Jalapeño в собственной вычислительной инфраструктуре до конца 2026 года. Компания называет его первым поколением собственной аппаратной платформы — второе поколение уже разрабатывается, а третье находится на стадии формирования. При этом OpenAI продолжит использовать ускорители NVIDIA и других партнеров для обучения и инференса.