Jalapeño протестировали на трёх моделях с открытыми весами: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. В качестве систем для сравнения OpenAI использовала коммерческие ускорители NVIDIA: GB200 для GPT-OSS 120B и GB300 для DeepSeek R1 и Kimi K2.5. Во всех тестах Jalapeño показал более высокую эффективность и меньшую задержку. На пиковом уровне пропускной способности чип обеспечил в 1,5–1,9 раза больше ИИ-работы на ватт, а сквозная задержка оказалась в 1,7–3,6 раза ниже. Для высокоинтерактивных нагрузок преимущество по производительности составило 2,1–4,1 раза.
На самой большой модели, Kimi K2.5 1T, чип оказался в 1,5 раза эффективнее на ватт и в 3,4 раза быстрее. Для DeepSeek R1 670B — в 1,7 и 3,6 раза соответственно. Тесты проводились на бенчмарке InferenceX от SemiAnalysis.
OpenAI пыталась решить компромисс между скоростью обработки большого количества запросов и быстрым ответом на отдельный запрос. При работе языковой модели разные этапы инференса предъявляют разные требования к железу: обработка входного запроса требует больших вычислительных ресурсов, а генерация ответа токен за токеном сильнее зависит от работы с памятью. OpenAI спроектировала Jalapeño так, чтобы вычисления, память и сетевое взаимодействие работали как единая система и требовали меньше передачи данных между отдельными компонентами.
Чип рассчитан на мощность 700 Вт, при этом во время тестов его устойчивая потребляемая мощность не превышала 550 Вт. OpenAI отмечает, что оценивала системы не только по производительности самого ускорителя, но и по тому, сколько полезной ИИ-работы они выполняют на единицу энергии при сопоставимой задержке.
По результатам этих испытаний Jalapeño оказался на так называемой границе Парето — среди других систем не было варианта, который одновременно обеспечивал бы более высокую производительность на ватт и меньшую задержку.
При разработке Jalapeño OpenAI сама использовала ИИ. Модели помогали инженерам исследовать варианты архитектуры, ускорять проектирование и проверку решений и оптимизировать вычислительные схемы. От начала разработки до tapeout — этапа, на котором готовый проект чипа передают в производство, — команда дошла за девять месяцев. Позже с помощью Codex и GPT-Astra инженеры за два месяца оптимизировали чип для трёх моделей, которые изначально не входили в план его производства.
OpenAI планирует начать развёртывание Jalapeño в собственной вычислительной инфраструктуре до конца 2026 года. Компания называет его первым поколением собственной аппаратной платформы — второе поколение уже разрабатывается, а третье находится на стадии формирования. При этом OpenAI продолжит использовать ускорители NVIDIA и других партнеров для обучения и инференса.

