
OpenAI говорит, что его первый собственный инференс-чип Jalapeño способен выполнять существенно больше ИИ-работы на ватт, одновременно снижая задержку ответа в нескольких больших языковых моделях. Компания утверждает, что система спроектирована так, чтобы избежать обычного компромисса между пропускной способностью и отзывчивостью — это может иметь значение по мере того, как ИИ-агенты увеличивают число обращений к модели, необходимых для завершения задачи.
Результаты основаны на тестировании OpenAI с публичным бенчмарком InferenceX и сравнении с коммерчески доступными системами-ускорителями. OpenAI планирует начать развёртывание Jalapeño внутри своей вычислительной инфраструктуры до конца года, продолжая при этом производственную квалификацию, разработку ПО и тестирование на дополнительных моделях.
По данным OpenAI, Jalapeño обеспечил от 1,5 до 1,9 раза больше ИИ-работы на ватт при пиковой пропускной способности по сравнению с системами-соперниками на GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Компания также сообщает о снижении сквозной задержки в 1,7–3,6 раза на протестированных нагрузках.
Для высокоинтерактивных нагрузок OpenAI говорит, что производительность была в 2,1–4,1 раза выше. На Kimi K2.5, который компания описывает как крупнейшую публичную модель в тестовом наборе, Jalapeño, по её данным, показал примерно в 1,5 раза более высокую пиковую производительность на ватт и в 3,4 раза меньшую сквозную задержку, чем система-соперник.
Эти цифры — результаты, сообщённые OpenAI, а не независимая валидация, представленная в доступных материалах. Компания утверждает, что использовала InferenceX, публичный бенчмарк SemiAnalysis, который измеряет весь процесс обслуживания ИИ-запроса, а не сосредотачивается только на спецификациях чипа.
OpenAI нормализовала сравнения, используя опубликованный показатель мощности каждого ускорителя. У Jalapeño рейтинг 700 ватт, хотя OpenAI говорит, что измеренная устойчивая мощность во время тестируемых нагрузок была на уровне 550 ватт или ниже. В список сравнений OpenAI входят системы на базе платформ NVIDIA GB200 и GB300 с показателями пакетной расчётной тепловой мощности 1 200 и 1 400 ватт соответственно.
Аргумент OpenAI состоит в том, что преимущество Jalapeño объясняется не только самим ускорителем. Компания утверждает, что проектировала чип, память, сеть, программное обеспечение и rack-scale-систему вместе, ориентируясь на поведение современного инференса языковых моделей.
Это поведение неоднородно. Фаза prefill, когда обрабатывается prompt, как правило, вычислительно интенсивна. Decode, когда модель генерирует ответ токен за токеном, сильнее ограничен пропускной способностью памяти. Связь между чипами может добавить ещё один источник задержки, особенно когда состояние модели нужно перемещать между отдельными ресурсами.
Jalapeño предназначен для того, чтобы держать данные, включая key-value cache, используемый при генерации, ближе к вычислительным ресурсам, которым они нужны. OpenAI говорит, что его сетевая архитектура позволяет нагрузке оставаться внутри одной связанной системы, сокращая перемещение данных и помогая системе эффективно обрабатывать как prefill, так и decode.
Такая цель особенно актуальна для ИИ-агентов. Агентам часто требуется выполнять несколько последовательных обращений к модели, использовать инструменты и оценивать промежуточные результаты. Небольшая задержка на каждом шаге может накапливаться, превращая задачу в заметно более медленную. Более высокая пропускная способность также помогает операторам инфраструктуры обслуживать больше одновременных запросов, но только если задержка остаётся приемлемой для интерактивного использования.
OpenAI утверждает, что инструменты ИИ напрямую участвовали в разработке Jalapeño. Компания сообщает, что прошла путь от первоначального дизайна до tapeout за девять месяцев, используя ИИ для изучения вариантов реализации, сокращения циклов проектирования и верификации и итераций на основе модельных нагрузок. Она также говорит, что работа с помощью ИИ помогла оптимизировать арифметические схемы и вписать дополнительную вычислительную производительность в график чипа.
Программирование даёт ещё одну часть аргумента OpenAI в пользу собственного железа. Используя Codex с GPT‑Astra, инженеры, по словам компании, за два месяца вывели на высокий уровень производительности три open-weight модели, которые не входили в первоначальный производственный план Jalapeño.
OpenAI говорит, что сгенерированные ИИ реализации для выбранных блоков attention и mixture-of-experts в GPT‑OSS работали в 1,5–1,8 раза быстрее, чем существующие реализации, написанные человеческими экспертами. Компания явно ограничивает это утверждение выбранными блоками, а не полными моделями, поэтому не следует воспринимать его как ускорение всей модели.
Поддержка новых семейств моделей по-прежнему требует новых kernels и оптимизации под конкретные модели. Это важное уточнение для покупателей и инфраструктурных команд, оценивающих, сможет ли пользовательский ускоритель адаптироваться по мере изменения архитектур моделей.
Для OpenAI непосредственная выгода — это операционный рычаг. Больше полезного вывода модели при той же мощности и аппаратных ресурсах может снизить стоимость обслуживания запросов или позволить компании справляться с большим спросом без пропорционального наращивания инфраструктуры. Более низкая задержка также может сделать более практичными интерактивные агентные сценарии.
Этот чип не означает отказ от коммерческих поставщиков оборудования. OpenAI говорит, что продолжит развёртывать ускорители NVIDIA и других партнёров как для обучения, так и для инференса. Поэтому Jalapeño, по-видимому, позиционируется как дополнительная платформа в смешанной инфраструктурной стратегии, а не как немедленная замена внешнего кремния.
Для создателей ИИ и корпоративных покупателей главный вопрос будет в том, сохраняются ли заявленные улучшения в производственных условиях. Производительность в бенчмарках может отличаться от производительности в реальном развёртывании из-за зрелости ПО, компиляции модели, объёма памяти, сетевых накладных расходов, паттернов использования и сложности поддержки новых семейств моделей.
Полностековый подход OpenAI может дать ей более жёсткий контроль над этими переменными для собственных рабочих нагрузок. Но это также создаёт компромисс: пользовательское железо может давать сильные результаты для тех моделей и сценариев обслуживания, под которые оно создавалось, однако его долгосрочная ценность зависит от того, насколько быстро программный стек сможет поддерживать модели, не предусмотренные на этапе проектирования.
Первым сигналом станет развёртывание. OpenAI говорит, что Jalapeño должен войти в её вычислительную инфраструктуру до конца года, но в материалах не указаны ни первоначальный масштаб, ни продукты, ни клиентские нагрузки, которые будут его использовать.
Рынку также следует следить за независимыми или проверяемыми клиентами измерениями, выходящими за рамки результатов InferenceX от OpenAI. Полезными были бы данные о стабильной производительности при производственной загрузке, программных накладных расходах, стоимости за завершённый запрос, покрытии моделей и сравнениях, учитывающих полную мощность системы, а не только опубликованные показатели пакета.
OpenAI говорит, что Gen 2 уже находится в разработке, а Gen 3 обретает форму. Прогресс этих поколений, а также темпы разработки kernels для новых моделей покажут, становится ли Jalapeño долговечной платформой или в основном оптимизацией для внутреннего стека OpenAI.
Jalapeño важен потому, что OpenAI переходит от покупки мощности для инференса к формированию большей части hardware-software стека, который определяет, насколько эффективно обслуживаются её модели. Заявленная комбинация пропускной способности и задержки стратегически полезнее, чем одна цифра пиковой скорости, особенно для продуктов, построенных вокруг ИИ-агентов.
Тем не менее самые сильные утверждения остаются сообщёнными самим поставщиком, и чип пока не был показан в широком производственном развёртывании в представленных материалах. Следующая проверка — операционная: сможет ли OpenAI превратить эффективность бенчмарка в надёжный, гибкий и экономически эффективный сервис на фоне меняющихся моделей и реального спроса клиентов.
OpenAI утверждает, что чип Jalapeño повышает скорость инференса ИИ и энергоэффективность across models, но результаты пока исходят от самого вендора и предшествуют внедрению.