
由前 OpenAI CTO Mira Murati 創立的 AI 實驗室 Thinking Machines,推出了第二款模型 Inkling Small,將焦點從原始規模轉向效率。根據 The Decoder 的報導,這款新模型使用的活躍參數遠少於公司先前的 Inkling 模型,但在廣泛的基準指標上表現接近,並在某些程式設計與推理測試中超越了前者。
這樣的定位很重要,因為它直接觸及當前模型市場中的一個壓力點:許多開發者與企業買家想要強大的推理表現,但不想支付大型前沿系統常伴隨的推理成本、延遲與部署複雜度。如果 Thinking Machines 能證明較小的開放模型在有意義的任務上仍能保持競爭力,就能強化針對特定領域、經過微調的部署,而不是一味追求越來越大的模型的論點。
核心消息很直接。Thinking Machines 將 Inkling Small 介紹為一款開放權重的推理模型,而 The Decoder 報導稱,就所引用的關鍵參數數字而言,它的規模不到 Inkling 的三分之一。根據 Artificial Analysis 的基準追蹤,Inkling Small 在該公司的 Intelligence Index 中拿下 40 分,而 Inkling 為 41 分。
同一報導指出,這款模型共有 2760 億個參數,以及 120 億個活躍參數。這個區別很重要。在當前的模型設計中,尤其是稀疏或 mixture 類系統,活躍參數數量往往比總參數更能反映執行成本,因為它反映的是在某個 token 上實際被啟用的網路比例。雖然目前可得的來源材料沒有詳細說明 Inkling Small 背後的架構,但總參數與活躍參數之間的差距暗示 Thinking Machines 不只是在模型行銷上強調效率,也在推論實際可能的管理方式上強調效率。
VentureBeat 在另一篇報導中也以類似方式形容這次發布,稱 Inkling Small 是一款開源 AI 模型,以約四分之一的規模逼近其前身的表現。由於該報導全文未包含在所提供的來源證據中,這裡更詳細的技術與基準描述主要依據 The Decoder 的報導,以及它引用的第三方基準資料。
根據 The Decoder,Inkling Small 在多項以推理與程式設計為主的評測中勝過其較大的兄弟模型。報導舉例包括 Humanity's Last Exam,Inkling Small 得分 32%,而 Inkling 為 30%;以及 GPQA Diamond,Inkling Small 為 89%,Inkling 為 87%。
這些都不是微不足道的勝利。Humanity's Last Exam 一直被用作一項難度高、旨在測試更進階推理能力的基準,而 GPQA Diamond 則常見於高階科學與專家級問答的討論。這些進步顯示,Thinking Machines 可能將 Inkling Small 調校為擅長緊湊且困難的推理任務,而不只是維持廣泛的基礎能力。
同時,這款模型據報在基於代理的任務與事實知識方面落後於較大的 Inkling。這個取捨很重要。對於打造程式設計助手、內部研究副駕駛或狹窄推理工作流程的團隊而言,每 token 的表現更好,可能比更廣泛的知識深度更有價值。但對於必須檢索事實、在更長時間範圍內使用工具,或在許多企業任務中穩定運作的通用代理來說,這些缺點仍可能很重要。
另一個性能角度是輸出效率。The Decoder 報導,Inkling Small 平均每個任務輸出 24K tokens,相較之下 Deepseek V4 Flash 為 45K,GPT-5.4 mini 為 78K。如果這個比較在相似條件下成立,它指出了一項實際優勢:一款以更少生成 token 就能達成結果的模型,可以降低成本並減少使用者可感知的延遲。然而,和許多基準式效率比較一樣,確切的任務組成與評估設定非常重要,買家不應在沒有獨立測試的情況下,過度解讀單一 token 效率數字。
這次發布也值得注意的是 Thinking Machines 如何包裝這款模型。The Decoder 表示,Inkling Small 支援文字、圖片與語音輸入,因此具有多模態特性,而不是僅定位為純文字推理引擎。它還擁有 256K token 的上下文視窗,這使它達到大型文件分析、程式碼庫工作與長時間對話會話所預期的範圍。
在存取方面,這款模型以 Apache 2.0 授權發布,權重可在 Hugging Face 取得。這個授權選擇對商業採用很重要。Apache 2.0 一般被視為對企業友善,因為它支持廣泛使用、修改與散佈,而不會帶來某些較嚴格社群授權常伴隨的法律不確定性。
根據 The Decoder,Thinking Machines 也透過 Tinker Playground 提供 Inkling Small,使用者可以在瀏覽器中微調模型。這符合一種產品策略:與其銷售單一標準化模型端點,不如把基礎模型變成可自訂的起點。報導中描述,該公司將自家模型定位為可由使用者以自身資料調整的基礎。
這樣的訊息在一個越來越重視所有權與專精的市場中會引起共鳴。許多產品團隊現在希望掌控延遲、部署拓撲、安全行為與領域適配。透過 Hugging Face 發布、並搭配輕量微調工具的開放權重模型,讓 Thinking Machines 比起僅提供封閉 API 的方案,更能清楚切入這類買家族群。
支撐 Inkling Small 發布的證據令人期待,但仍相對有限。這一組材料中最詳細的來源是 The Decoder,而它又把主要性能框架歸因於 Artificial Analysis。這表示核心主張——以更小的活躍規模達到接近 Inkling 的能力——是建立在第三方基準追蹤之上,而不是建立在這裡提供的完整技術論文之上。
有些說法很直接,且大概容易直接驗證,包括 Apache 2.0 授權、Hugging Face 上有權重、256K 上下文視窗,以及可透過 Tinker Playground 使用。其他說法則需要更謹慎。像 Intelligence Index、Humanity's Last Exam、GPQA Diamond 這類基準分數,取決於評估流程、提示設計與模型版本。The Decoder 引述的「沒有同等或更小尺寸的開放模型能拿到更高分」這一說法,來自 Artificial Analysis,而不是這裡所提供材料中獨立重現的整體市場審核。
來源證據中也沒有詳細的部署資料。我們尚未有吞吐量、實際服務成本、企業使用、微調穩定性,或在對抗性測試下的安全表現等直接數據。因此,雖然 Inkling Small 在紙面上看起來是一個令人信服的高效率開放權重發布,買家仍應把目前的情況視為由基準驅動,而非已在實戰中證明。
對 AI 建構者來說,這次發布最強烈的訊號不只是 Thinking Machines 又交付了一個模型,而是該公司在主張一個不同的最佳化目標。在一個仍由旗艦模型發表主導的市場中,Inkling Small 顯示,圍繞有用的推理、更小的活躍規模、更少的 token 消耗與更容易客製化來打造產品策略,仍然有空間。
這可能會在幾種工作流程中引起共鳴。需要快速反覆建議的程式設計助手,可能從 token 效率中獲得比最大可能的世界知識更大的好處。圍繞專有文件建立的企業內部 AI 系統,可能更偏好可用公司資料微調、並以寬鬆授權部署的模型。處理多模態輸入的團隊,可能會認為只用單一模型同時處理文字、圖片與語音,而不是預設切換到更大的專有堆疊,很有價值。
競爭角度也很清楚。透過與 Deepseek V4 Flash 和 GPT-5.4 mini 比較輸出 token 效率,這次發布進入了一個擁擠的中階模型區間,這些模型競爭的是成本效能,而不只是絕對的基準領先。這正是許多企業 AI 預算真正決定的地方。問題不再只是「哪個模型最聰明?」而是「哪個足夠好、足夠可控、又足夠便宜,值得投入生產?」
對 Thinking Machines 而言,這次發布有助於定義其身分。與其單靠聲勢去硬碰最大的封閉模型供應商,該公司似乎在押注:開放部署、效率化推理與微調彈性,能夠開闢一個持久的位置。
接下來要追蹤的訊號,比起宣傳,更偏向實務。首先,針對 Inkling Small 在程式設計助手任務、代理可靠性與事實依據上的獨立測試,將顯示基準敘事是否能轉化為生產用途。
其次,要觀察 Hugging Face 發布是否帶來實質的社群熱度:衍生 checkpoint、微調配方、框架整合,以及可重現的延遲報告。開放權重發布只有在吸引到生態系時,才比單純下載更有意義。
第三,Tinker Playground 的角色值得追蹤。如果基於瀏覽器的微調降低了專精門檻,Thinking Machines 可能會在缺乏重型 ML 基礎設施的小型團隊中獲得採用。
最後,Thinking Machines 未來任何技術揭露都很重要。若能提供更多關於架構、訓練方法、安全行為與推理經濟性的細節,將有助於企業判斷 Inkling Small 主要是基準高效模型,還是真正可作為大型專有系統替代方案的實際運作選擇。
Inkling Small 契合企業 AI 採購中的更大轉變:最佳化正在從原始模型聲望,轉向部署層面的數學。即使在排行榜上稍微落後,但在 token 使用、微調彈性與授權上明顯更好的模型,可能才是更重要的產品。
未解的問題是,Thinking Machines 能否把這個論點轉化為採用。Inkling Small 讓公司在開放權重市場中有了一個可信的入口,特別是透過 Apache 2.0、Hugging Face 與 Tinker Playground。但要真正突破,它需要的不只是與 Inkling 的基準接近而已。它還需要證據證明,團隊能在其上可靠地打造真正的企業 AI 和 AI 代理,而且在成本、控制與速度上都比封閉替代方案更好。
Thinking Machines 發布了 Inkling Small,這是一款採用 Apache 2.0 授權的開放權重推理模型,以少得多的 فعال 參數逼近 Inkling 的表現。