OpenAI показала результаты своего inference-чипа Jalapeño: он обошел системы на NVIDIA

3 мин
OpenAI показала результаты своего inference-чипа Jalapeño: он обошел системы на NVIDIA

OpenAI опубликовала первые результаты тестирования Jalapeño — собственного ASIC для инференса языковых моделей. На публичном бенчмарке InferenceX процессор представил более высокую производительность на ватт и меньшую задержку по сравнению с коммерческими системами на NVIDIA GB200 и GB300.

Тесты проводили на трех open-weight моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Во всех трех случаях OpenAI заявляет преимущество Jalapeño по совокупности ключевых метрик.

GPT-OSS 120B
GPT-OSS 120B

На пиковых нагрузках процессор представил в 1,5–1,9 раза больше полезной ИИ-работы на ватт, а end-to-end latency оказалась ниже в 1,7–3,6 раза. В интерактивных сценариях преимущество по производительности составило 2,1–4,1 раза.

Для GPT-OSS 120B OpenAI приводит показатель около 1459 токенов в секунду на пользователя против 535 у системы конкурента. Для DeepSeek R1 670B — приблизительно 700 токенов в секунду на пользователя против 169. На Kimi K2.5 1T результат составил приблизительно 694 токенов в секунду против 182.

Kimi K2.5
Kimi K2.5

Откуда у OpenAI такие результаты

Jalapeño проектировали именно под современные LLM и агентные нагрузки. OpenAI одновременно оптимизировала вычислительные блоки, хранилище, сетевое взаимодействие и программный стек, чтобы уменьшить лишнее перемещение данных.

Это особенно важно для инференса LLM: на этапе prefill основным ограничением часто становятся вычисления, а во время decode, когда схема генерирует ответ токен за токеном, существенную роль играет пропускная способность памяти. Дополнительную задержку может разрабатывать обмен данными между чипами.

В Jalapeño OpenAI старается держать состояние модели, в том числе KV-cache, максимально близко к вычислительным блокам. Сеть одновременно является частью общей архитектуры, а не отдельным уровнем инфраструктуры.

Процессор имеет заявленный TDP 700 Вт, но во время проведенных тестов фактическое устойчивое потребление не превышало 550 Вт. Для сравнения OpenAI нормализовала результаты с учетом опубликованного энергопотребления сопоставляемых ускорителей.

Есть и более интересный эксперимент. С помощью Codex и GPT-Astra инженеры перенесли на Jalapeño три open-weight модели, которые изначально не входили в производственный план, менее чем за два месяца. Для отдельных attention- и MoE-блоков реализации, сгенерированные ИИ, оказались в 1,5–1,8 раза быстрее написанных экспертами вручную. Отмечу, речь идет только об отдельных блоках, а не о полной модели.

Что дальше будет с чипом OpenAI

OpenAI планирует начать развертывание Jalapeño в собственной вычислительной инфраструктуре до конца этого года. Компания уже работает над вторым поколением, а архитектура третьего поколения находится на стадии формирования.

Одновременно OpenAI не собирается отказываться от сторонних ускорителей. Компания прямо заявляет, что продолжит применять NVIDIA и других поставщиков для training и inference. Jalapeño рассматривается не как полная замена GPU, а как собственный специализированный слой инфраструктуры для тех нагрузок, где оптимизация под реальные модели OpenAI дает максимальный эффект.

По существу, OpenAI постепенно движется к фулл-стек подходу: собственные модели, серверное ПО, сеть, хранилище и специализированный кремний проектируются как единая система. Если результаты InferenceX сохранятся на production-нагрузках, Jalapeño может стать одним из ключевых инструментов для снижения стоимости и задержки инференса по мере роста числа AI-агентов.

Читают сейчас

В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО

1 час назад

В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО

Коллегия присяжных в штате Калифорния предъявила обвинения 40-летнему гражданину России Серажудину Актулаеву за участие в фишинговой кампании, в результате которой компьютеры 80 тыс. фрилансеров были

2 часа назад

Лиды по осени считают: 6 мероприятий для продуктивного сентября

Осенью прогноз простой: где-то обязательно польет. С рекламным рынком сложнее. Где подорожает лид? Какой канал упрется в потолок? Сработает ли UGC? Что уже можно поручить ИИ? И какие изменения в закон

Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL

2 часа назад

Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL

Postgres Professional выпустила «нулевые» релизы корпоративных редакций СУБД Postgres Pro с исправлениями актуальных уязвимостей PostgreSQL. Компания первой и пока единственной среди коммерческих форк

Дайджест GetAClass: август 2026

2 часа назад

Дайджест GetAClass: август 2026

Поздравляем всех с началом нового учебного года! Каникулы закончились – значит, пора подвести итоги последнего летнего месяца. Читать далее

НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса

3 часа назад

НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса

Американское космическое агентство заключило с Blue Origin контракт на разработку Mars Telecommunications Network — системы обеспечения высокоскоростной связи и навигации для текущих и будущих миссий