
OpenAI опубликовала первые результаты производительности Jalapeño — своего собственного чипа, предназначенного для запуска, а не обучения ИИ-моделей. Компания утверждает, что акселератор обеспечил более высокий throughput на единицу мощности и меньшую задержку ответа, чем доступные сейчас системы, в тестах с использованием бенчмарка InferenceX от SemiAnalysis.
Результаты, представленные во вторник на конференции Hot Chips, указывают на более широкую попытку OpenAI взять под контроль больше инфраструктуры, стоящей за её продуктами. Но у сравнения есть важные ограничения: численные данные для бенчмарка предоставила сама OpenAI, некоторые прогоны были проверены SemiAnalysis на месте, а Jalapeño, как ожидается, не выйдет даже на маломасштабное развёртывание до конца 2026 года. Более существенное использование запланировано на 2027 год.
Jalapeño — это акселератор инференса, то есть он предназначен для генерации ответов из обученных моделей. В отличие от универсальных систем, используемых и для обучения, и для инференса, чип спроектирован вокруг задержек и перемещения данных, связанных с обслуживанием больших языковых моделей.
OpenAI заявляет, что система держит состояние модели, включая KV cache, используемый при генерации ответов, рядом с соответствующими вычислительными и памятью ресурсами. Она также нацелена на этапы prefill и коммуникации, которые могут замедлять инференс, особенно когда модели должны обрабатывать длинные запросы или обслуживать множество пользователей одновременно.
Компания сообщила, что на пиковом throughput по трём протестированным моделям было от 1,5 до 1,9 раза больше работы ИИ на ватт. Она также заявила об улучшении сквозной задержки в 1,7–3,6 раза по сравнению с лучшими коммерчески доступными системами в сравнении. Для интерактивных нагрузок OpenAI сообщила о росте производительности в 2,1–4,1 раза.
Тестировались модели GPT-OSS 120B, Deepseek R1 670B и Kimi K2.5 1T. Согласно изложению презентации The Decoder, Jalapeño достиг примерно 1 400 токенов в секунду на пользователя на GPT-OSS и более 700 токенов в секунду на Deepseek R1 при одном одновременном запросе.
Эти цифры не являются универсальным рейтингом ИИ-оборудования. OpenAI предоставила числа, использованные в результатах InferenceX, а SemiAnalysis проверила некоторые прогоны в своей лаборатории. Сравниваемые системы также использовали методы оптимизации, включая multi-token prediction и speculative decoding, которых Jalapeño в описанных тестах не применял. Это может оставить пространство для улучшения, но и делает результаты труднее сравнивать без изучения полных конфигураций и рабочих нагрузок.
Главное сравнение было с системой Nvidia Blackwell, которая сейчас широко развёрнута для задач ИИ. The Decoder также сообщил, что SemiAnalysis считает более подходящей для сравнения новую платформу Vera Rubin от Nvidia, поскольку обе системы используют память HBM4. В этом сравнении Jalapeño, как сообщается, выдавал больше выходных токенов на мегаватт, хотя по общей стоимости владения на токен обе платформы были примерно равны.
Время имеет значение. Системы Vera Rubin уже поставляются клиентам, тогда как Jalapeño, по сообщениям, всё ещё находится на стадии инженерного образца. Nvidia и AMD также публиковали результаты по более крупным или более новым моделям, включая DeepSeek V4 Pro и Kimi K3, которые не вошли в упомянутые здесь тесты Jalapeño.
Это делает преимущество OpenAI в производительности скорее многообещающим ранним результатом, чем устоявшейся позицией на рынке. Аппаратные бенчмарки могут существенно меняться при изменении моделей, ядер, конфигураций памяти, программных стеков и политики обслуживания. Окончательным испытанием станет то, как Jalapeño покажет себя на моделях и паттернах трафика, которые OpenAI обслуживает в промышленном масштабе.
Согласно сообщениям, OpenAI начала разрабатывать Jalapeño вместе с Broadcom в 2024 году. Финальный дизайн был отправлен на производство в ноябре 2025 года. OpenAI заявила, что полный цикл занял около 16 месяцев, из которых девять месяцев прошли между первоначальным проектированием чипа и отправкой готового чертежа на фабрику.
Компания также заявила, что в процессе разработки использовала собственные ИИ-модели. Старые модели помогали с проектированием чипа, а более новые системы — с программированием и оптимизацией. Эти утверждения иллюстрируют предполагаемую петлю обратной связи: модели помогают создавать железо, железо обслуживает модели, а производственные нагрузки дают данные для дальнейших решений по ПО и архитектуре.
OpenAI представляет Jalapeño как многопоколенную платформу, а не как одноразовый процессор. Такой подход координирует чипы, память, сеть и модели вокруг фаз инференса. Финансовый директор OpenAI Sarah Friar описала это как часть более широкой вычислительной стратегии, связывающей дата-центры, модели, продукты и устройства.
Эта стратегия не обязательно означает, что OpenAI отказывается от внешних поставщиков. The Decoder сообщил, что компания рассматривает Jalapeño как дополнение к отношениям с Nvidia, AMD, AWS, Cerebras, CoreWeave и другими инфраструктурными провайдерами. На практике собственная аппаратная инициатива OpenAI существует рядом с этими партнёрствами, одновременно давая компании ещё один вариант для переговоров и планирования мощностей.
Для команд, создающих ИИ-продукты, наиболее важное обещание — не сам по себе рекорд бенчмарка, а возможность снизить стоимость обслуживания при высокой загрузке. Больший выход на ватт может улучшить экономику чатов, ассистентов для кодинга, голосовых систем и других продуктов, которые генерируют большое количество ответов. Более низкая задержка также может сделать приложения с длинным контекстом более отзывчивыми.
Архитектурный акцент на prefill, коммуникации и локальном размещении KV cache особенно важен для команд, обслуживающих большие модели для множества одновременных пользователей. Эти этапы могут стать узкими местами даже при наличии сырой вычислительной мощности акселератора. Поэтому система, спроектированная вокруг полного пути инференса, может превосходить более быстрый универсальный акселератор на определённых производственных паттернах.
Однако покупателям не следует воспринимать текущие результаты как доказательство того, что Jalapeño готов к широкому внешнему внедрению. OpenAI не заявляла, что чип будет широко доступен как коммерческая платформа, и его первоначальное развёртывание, как ожидается, будет небольшим. Разработчикам, строящим решения на облачной инфраструктуре, всё равно придётся оценивать доступные сейчас системы, включая совместимость программного обеспечения, ёмкость, цены и надёжность.
Тем не менее результаты поднимают конкурентный вопрос для программной экосистемы Nvidia. SemiAnalysis утверждала, что производительность может ослабить преимущество CUDA у компании, но это рыночная интерпретация, а не доказанное изменение поведения разработчиков. Совместимость с CUDA, инструменты, библиотеки операторов, поддержка и способность масштабироваться между поставщиками остаются важными факторами покупки наряду с количеством токенов в секунду.
Первым сигналом станет то, выполнит ли OpenAI свой прогноз по маломасштабному развёртыванию Jalapeño к концу 2026 года. Именно производственная доступность, а не производительность инженерного образца, покажет, можно ли надёжно производить и эксплуатировать эту конструкцию в масштабе.
Следующий раунд бенчмарков должен включать более новые модели, такие как DeepSeek V4 Pro и Kimi K3, более высокие уровни параллелизма и согласованные программные оптимизации для всех систем. Независимое тестирование также будет важно для оценки энергопотребления, распределения задержек, утилизации и общей стоимости на токен.
Корпоративным покупателям стоит следить за деталями доступа, цен, поддерживаемых архитектур моделей и интеграции со стеком обслуживания OpenAI. Для более широкого рынка ключевой вопрос состоит в том, сможет ли OpenAI повторить результат на последующих поколениях чипов, пока Nvidia, AMD и другие поставщики продолжают улучшать собственные платформы инференса.
Jalapeño стратегически важен, потому что показывает: OpenAI рассматривает экономику инференса как задачу проектирования продукта, а не только как решение о закупке. Если заявленные преимущества сохранятся в независимых тестах и в производственном трафике, собственный кремний может дать OpenAI больше контроля над задержкой, энергопотреблением и ёмкостью для самых востребованных сервисов.
Данные всё ещё ранние и частично контролируются поставщиком. Самый сильный вывод на сегодня состоит в том, что OpenAI создала убедительную конструкцию инференса первого поколения с обнадёживающими результатами бенчмарков — а не в том, что она уже вытеснила Nvidia или установила новый аппаратный стандарт.
OpenAI представила бенчмарки инференса Jalapeño, которые обгоняют системы Nvidia по скорости и эффективности, но ограниченное развёртывание и данные, предоставленные поставщиком, смягчают это утверждение.