AI News

OpenAI 表示,其首款客製化推論晶片 Jalapeño,能在多個大型語言模型上,以更少的每瓦功耗完成更多 AI 工作,同時降低回應延遲。公司稱,這套系統的設計目標是避免吞吐量與回應速度之間常見的取捨;隨著 AI 代理完成任務所需的模型呼叫次數增加,這項主張可能變得更加重要。

這些結果來自 OpenAI 使用公開 InferenceX 基準所做的測試,以及與商用加速器系統的比較。OpenAI 計畫在今年底前開始將 Jalapeño 部署到其運算基礎設施中,同時持續進行量產認證、軟體開發,以及更多模型的測試。

OpenAI 報告的效能提升

根據 OpenAI,Jalapeño 在 GPT‑OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 的比較中,在峰值吞吐量下提供了 1.5 到 1.9 倍的每瓦 AI 工作量。公司也表示,所測試工作負載的端到端延遲降低了 1.7 到 3.6 倍。

對於高度互動型工作負載,OpenAI 表示效能高出 2.1 到 4.1 倍。在測試集中被公司描述為最大公開模型的 Kimi K2.5 上,Jalapeño 據稱比比較系統提供約 1.5 倍更高的峰值每瓦效能,以及 3.4 倍更低的端到端延遲。

這些數字是 OpenAI 自行報告的結果,並非目前可得證據中所呈現的獨立驗證。公司表示,測試使用了 InferenceX,這是 SemiAnalysis 的公開基準,衡量的是服務 AI 請求的完整流程,而不只是聚焦於晶片層級規格。

OpenAI 以各加速器公開的晶片功耗額定值進行標準化比較。Jalapeño 的額定功耗為 700 瓦,但 OpenAI 表示,在所測工作負載期間,實測持續功耗為 550 瓦或更低。OpenAI 列出的比較對象包括以 NVIDIA GB200 與 GB300 平台為基礎的系統,其封裝熱設計功耗分別為 1,200 與 1,400 瓦。

以推論工作負載為核心設計的系統

OpenAI 的論點是,Jalapeño 的優勢不只來自加速器本身。公司表示,它是將晶片、記憶體、網路、軟體與機櫃級系統一併設計,並圍繞現代語言模型推論行為來打造。

這種行為並不平均。prefill 階段,也就是處理 prompt 的時候,通常屬於計算密集型。decode 階段,也就是模型逐 token 產生回應時,則更受記憶體頻寬限制。晶片間通訊還可能帶來另一層延遲,尤其是當模型狀態必須在不同資源之間移動時。

Jalapeño 的設計目標是讓資料,包括生成過程中使用的 key-value cache,盡量靠近所需的運算資源。OpenAI 表示,其網路架構可讓工作負載維持在同一個互聯系統內,減少資料移動,並協助系統高效率處理 prefill 與 decode。

這樣的設計目標對 AI 代理尤其重要。代理經常需要連續呼叫多次模型、使用工具,並評估中間結果。每一步只有一點點延遲,累積起來就會讓整體任務明顯變慢。更高吞吐量也能幫助基礎設施營運者同時服務更多請求,但前提是延遲仍須維持在互動使用可接受的範圍內。

AI 幫助打造並程式化這顆晶片

OpenAI 表示,AI 工具直接參與了 Jalapeño 的開發。公司稱,透過 AI 探索實作方案、縮短設計與驗證週期,並針對模型工作負載反覆調整,從初始設計到 tapeout 共花了九個月。公司也說,AI 輔助的工作幫助優化了算術電路,並將更多運算效能納入晶片時程中。

程式化工作也構成 OpenAI 支持客製化硬體的另一部分。根據公司說法,工程師使用 Codex 搭配 GPT‑Astra,將三個原本未納入 Jalapeño 初始量產計畫的 open-weight 模型,在兩個月內提升到高效能。

OpenAI 表示,針對部分 GPT‑OSS attention 與 mixture-of-experts 模組所生成的 AI 實作,運行速度比人類專家撰寫的既有實作快 1.5 到 1.8 倍。公司明確將這項主張限制在特定模組,而非完整模型,因此不應解讀為整個模型都獲得同等加速。

要支援新的模型家族,仍然需要新的 kernel 與模型專屬最佳化。對於評估客製化加速器是否能隨模型架構變化而適應的買家與基礎設施團隊而言,這點非常重要。

Jalapeño 對 AI 基礎設施的意義

對 OpenAI 而言,眼前的好處是營運槓桿。若能在相同電力與硬體容量下產生更多有用的模型輸出,就能降低服務請求的成本,或讓公司在不同比例擴增基礎設施的情況下應付更大的需求。更低的延遲也可能讓更具互動性的代理工作流程變得可行。

這顆晶片並不代表 OpenAI 要退出商用硬體供應商。OpenAI 表示,未來仍會持續部署來自 NVIDIA 與其他合作夥伴的加速器,供訓練與推論使用。因此,Jalapeño 看起來比較像是混合型基礎設施策略中的額外平台,而不是外部晶片的立即替代品。

對 AI 開發者與企業買家來說,核心問題將是這些報告中的提升是否能在生產環境中維持。基準測試效能可能與實際部署效能不同,原因包括軟體成熟度、模型編譯、記憶體容量、網路額外開銷、使用模式,以及支援新模型家族的難度。

OpenAI 的全堆疊做法,可能讓它對自家工作負載的這些變數擁有更高控制力。它同時也帶來取捨:客製化硬體可能為其原本設計對應的模型與服務模式帶來強大成果,但其長期價值取決於軟體堆疊能多快適應那些在設計時未被預見的模型。

接下來要觀察什麼

第一個訊號會是部署。OpenAI 表示,Jalapeño 預定在今年底前進入其運算基礎設施,但目前證據並未說明初始規模、將使用它的產品,或客戶工作負載。

市場也應關注超出 OpenAI InferenceX 結果之外的獨立或可由客戶驗證的測量。實用資訊包括:在生產負載下的持續效能、軟體額外開銷、每筆完成請求成本、模型覆蓋範圍,以及不只看公開封裝功耗額定值、而是考慮整體系統功耗的比較。

OpenAI 表示,Gen 2 已在開發中,Gen 3 也正在成形。這些世代的進展,以及新模型 kernel 開發的速度,將顯示 Jalapeño 是正在成為長期平台,還是主要作為 OpenAI 內部技術堆疊的最佳化。

Creati.ai 觀點

Jalapeño 的重要性在於,OpenAI 正從購買推論能力,轉向塑造更多決定模型服務效率的硬體與軟體堆疊。相較於單一的峰值速度數字,這種吞吐量與延遲的組合在策略上更有價值,特別是對以 AI 代理為核心的產品而言。

不過,目前最強烈的說法仍屬供應商自述,而在所提供證據中,這顆晶片尚未在大規模生產部署中得到證明。下一個考驗是營運面:OpenAI 是否能把基準測試上的效率,轉化為能隨模型變化與真實客戶需求而穩定、彈性且具成本效益的服務。

精選

OpenAI रिपोर्ट其 Jalapeño 推論晶片帶來顯著速度與功耗提升

OpenAI 表示,Jalapeño 晶片可提升多種模型的 AI 推論速度與能效,但目前結果仍屬於供應商自述,且尚未正式部署。