
OpenAI 公布了 Jalapeño 的首批效能結果;這是該公司自訂設計的晶片,目的是用來執行 AI 模型,而不是訓練模型。公司表示,在使用 SemiAnalysis 的 InferenceX 基準進行的測試中,這款加速器在每單位功耗的吞吐量與回應延遲方面,都優於目前可取得的系統。
這些結果於週二在 Hot Chips 大會上發表,顯示 OpenAI ცდილ進一步掌控支撐其產品的基礎設施。不過,這項比較也有重要限制:OpenAI 提供了基準數據,部分測試由 SemiAnalysis 在現場驗證,而且 Jalapeño 預計要到 2026 年底之後才會進入小規模部署。更大規模的使用則規劃在 2027 年。
Jalapeño 是一款推論加速器,也就是說,它的用途是從已訓練的模型產生回應。與同時用於訓練與推論的通用系統不同,這顆晶片是圍繞著大型語言模型在服務時所涉及的延遲與資料搬移來設計的。
OpenAI 表示,系統會將模型狀態(包括回應生成期間使用的 KV cache)盡量維持在相關運算與記憶體資源附近。它也針對 prefill 與通訊階段進行最佳化,因為這些階段可能拖慢推論,尤其是當模型必須處理長提示詞,或同時服務大量使用者時。
公司指出,在三個受測模型上,峰值吞吐量時每瓦可做 1.5 到 1.9 倍的 AI 工作量。相較於此次比較中最佳的商用系統,它也宣稱端到端延遲改善了 1.7 到 3.6 倍。對互動式工作負載,OpenAI 回報的效能提升介於 2.1 到 4.1 倍之間。
受測模型包括 GPT-OSS 120B、Deepseek R1 670B 與 Kimi K2.5 1T。根據 The Decoder 對該場發表的報導,Jalapeño 在 GPT-OSS 上每位使用者每秒約可達 1,400 個 token,而在單一並發請求下,Deepseek R1 的速度則超過每秒 700 個 token。
這些數字並不能代表 AI 硬體的全球通用排名。InferenceX 結果中使用的數據由 OpenAI 提供,而 SemiAnalysis 則在實驗室中驗證了部分測試。對照系統也使用了包括 multi-token prediction 與 speculative decoding 在內的最佳化技術,但 Jalapeño 在報告中的測試並未使用這些技術。這可能意味著仍有改善空間,但也讓在未檢視完整配置與工作負載之前,更難做出公平比較。
最受矚目的比較對象是 Nvidia Blackwell 系統,這套系統目前已廣泛部署於 AI 工作負載。The Decoder 也報導,SemiAnalysis 認為 Nvidia 更新的 Vera Rubin 平台更適合作為比較,因為兩者都使用 HBM4 記憶體。在那項比較中,Jalapeño 據稱每兆瓦可產生更多輸出 token,不過兩個平台在每 token 的總持有成本上大致相當。
時機很關鍵。Vera Rubin 系統已經開始出貨給客戶,而 Jalapeño 據報仍停留在工程樣品階段。Nvidia 與 AMD 也已公布更大或更新模型的結果,包括 DeepSeek V4 Pro 與 Kimi K3,而這些並未納入此處引用的 Jalapeño 測試。
因此,OpenAI 的效能優勢目前更像是一個值得期待的早期結果,而不是已經確立的市場地位。當模型、kernel、記憶體配置、軟體堆疊與服務政策改變時,硬體基準測試可能會大幅變動。真正的考驗將是 Jalapeño 在 OpenAI 以生產規模運行的模型與流量模式上表現如何。
根據報導,OpenAI 於 2024 年開始與 Broadcom 一同開發 Jalapeño。最終設計已在 2025 年 11 月送交製造。OpenAI 表示,整個週期約花了 16 個月,其中從最初晶片設計到完成藍圖送往工廠之間花了 9 個月。
公司也表示,在開發過程中使用了自家的 AI 模型。較舊的模型協助晶片設計,而較新的系統則幫助程式撰寫與最佳化。這些說法說明了預期中的回饋循環:模型幫助打造硬體,硬體服務模型,而生產工作負載又提供資料,供後續軟體與架構決策使用。
OpenAI 將 Jalapeño 描述為一個多世代平台,而非一次性的處理器。這種做法會依推論階段協調晶片、記憶體、網路與模型。OpenAI 財務長 Sarah Friar 將其形容為更大型運算策略的一部分,連結資料中心、模型、產品與裝置。
這項策略並不一定代表 OpenAI 要放棄外部供應商。The Decoder 報導稱,OpenAI 認為 Jalapeño 與 Nvidia、AMD、AWS、Cerebras、CoreWeave 及其他基礎設施供應商的合作是互補關係。實務上,OpenAI 的客製硬體努力與這些合作並行,同時也讓公司多了一個談判與容量規劃的選項。
對 AI 產品團隊而言,最重要的承諾不是單一的基準紀錄,而是在高利用率下可能降低服務成本。每瓦更多輸出,可能改善聊天機器人、程式助理、語音系統,以及其他會產生大量回應的產品經濟效益。更低的延遲也能讓長上下文應用感覺更即時。
架構特別聚焦於 prefill、通訊與本地 KV cache 擺放,這點對於同時服務大量使用者的大型模型團隊尤其重要。即使原始加速器算力充足,這些階段也可能成為瓶頸。因此,若系統是圍繞完整推論路徑設計,便可能在某些生產模式下勝過更快的通用加速器。
不過,買家不應把目前結果視為 Jalapeño 已準備好大規模對外採用的證據。OpenAI 並未表示這顆晶片會以商業平台形式全面開放,而初期部署預計也會很小。基於雲端基礎設施開發的團隊,仍需評估目前可用的系統,包括軟體相容性、容量、定價與可靠性。
這些結果也對 Nvidia 的軟體生態系提出了競爭疑問。SemiAnalysis 認為這樣的效能可能削弱 Nvidia 的 CUDA 優勢,但那是市場解讀,並非已被證實的開發者行為改變。CUDA 相容性、工具、運算子函式庫、支援,以及跨供應商擴展的能力,仍然是超越每秒 token 數之外的重要採購因素。
第一個訊號將是 OpenAI 是否能在 2026 年底達成其對小規模 Jalapeño 部署的預測。決定這項設計能否大規模且可靠地製造與運作的,不是工程樣品的效能,而是生產可用性。
下一輪基準測試應納入更高 concurrency、更高版本的模型,例如 DeepSeek V4 Pro 與 Kimi K3,並在所有系統上套用一致的軟體最佳化。獨立測試對於評估功耗、延遲分布、利用率與每 token 總成本也同樣重要。
企業買家應留意存取方式、定價、支援的模型架構,以及與 OpenAI 服務堆疊整合的細節。對整體市場來說,關鍵問題是:在 Nvidia、AMD 與其他供應商持續改進自家推論平台之際,OpenAI 能否在後續晶片世代重現同樣的成果。
Jalapeño 具有策略上的重要性,因為它顯示 OpenAI 將推論經濟性視為產品設計問題,而不只是採購決策。如果這些據稱的優勢能在獨立測試與實際生產流量中維持,客製化矽晶可讓 OpenAI 對其最常使用的服務在延遲、功耗與容量方面擁有更多控制權。
目前的證據仍屬早期,且部分由供應商掌控。今天最強的結論是:OpenAI 已經做出一個可信的第一代推論設計,並取得令人鼓舞的基準結果;但這還不能說它已經取代 Nvidia 或建立了新的硬體標準。
OpenAI 公布的 Jalapeño 推論基準在速度與效率上超越 Nvidia 系統,但受限於部署規模與供應商提供的數據,這項說法仍需保留。