AI News

Nous Research 已發布 NousCoder-14B,這是一個 140 億參數的開源模型,專為競技程式設計而設計;隨著開發者越來越常測試 AI 系統能否承擔軟體開發更大部分的工作,這項發布引起關注。公司表示,該模型在 48 顆 Nvidia B200 GPU 上經過四天強化學習訓練後,在 LiveCodeBench v6 上達到 67.87% 的準確率。

這個時間點使該發布與 Anthropic 的代理式程式設計工具 Claude Code 所受到的高度關注並列。雖然 Claude Code 已吸引端到端軟體工作的公開示範,Nous Research 則採取不同路線:公開模型、訓練環境與評估機制,讓其他研究者能夠檢視或延伸該系統。對於要決定採用代管式程式設計代理,還是自行控制模型運作的開發者而言,這項差異相當重要。

開放模型進入擁擠的程式設計市場

根據隨發布附上的技術報告,NousCoder-14B 是以 Alibaba 的 Qwen3-14B 為基礎。Nous Research 表示,強化學習讓模型在 LiveCodeBench v6 上的分數較基礎模型提升了 7.08 個百分點,達到 67.87%。

LiveCodeBench v6 會根據 2024 年 8 月到 2025 年 5 月間發布的競技程式設計題目來評估模型。由於生成的解法可以被編譯並對照已知測試案例檢查,因此它是測試演算法式程式能力的有用工具。不過,它並不能完整衡量軟體工程表現。現有證據無法證明 NousCoder-14B 在儲存庫層級變更、跨多檔案除錯、工具使用、程式碼審查或自主任務規劃方面的表現。

當市場注意力從一次性程式碼生成轉向代理式工作流程時,這個限制非常重要。模型可以在孤立的程式題目上表現出色,卻不一定能與能夠讀取程式碼庫、編輯檔案、執行測試、解讀失敗並重複流程的工具相比。來源材料也無法確認 NousCoder-14B 是否針對這種多步驟使用情境進行最佳化。

訓練堆疊也是這次公告的一部分

這次發布不只是模型權重。Nous Research 也公開了 Atropos 強化學習框架、訓練 harness,以及相關的環境與基準組件。該模型可在 Hugging Face 以 Apache 2.0 授權取得,讓開發者與研究者能在自身基礎設施與營運限制下下載、檢視並調整系統。

訓練過程使用可驗證的獎勵。模型產生程式碼,系統將其在測試案例上執行,而正確或錯誤的結果則提供回饋訊號。Nous Research 使用 Modal 進行沙盒化程式執行的平行運算,並依時間與記憶體限制檢查生成的解法。

技術報告將 DAPO,也就是 Dynamic Sampling Policy Optimization,描述為團隊實驗中的首選訓練方法。系統會丟棄所有嘗試都成功或所有嘗試都失敗的例子,因為這兩種情況都無法提供多少有用的學習訊號。系統也將推論、驗證與訓練重疊執行,以便在解答被檢查時持續讓 GPU 叢集運作。

團隊最初使用 32,000 token 的上下文視窗訓練,之後將其延伸到 40,000 token。報告中的最佳評估結果使用了大約 80,000 token 的上下文。這些實作細節對其他研究者而言,可能比標題中的分數更重要:可重現的程式執行與高效率的強化學習管線,能降低嘗試小型與中型程式設計模型的門檻。

證據、基準與資料問題

這則故事中最有力的表現主張來自 Nous Research 自家的技術報告,如 VentureBeat 所述。因此,67.87% 的 LiveCodeBench v6 結果屬於供應商回報的基準,而不是在可用來源材料中呈現的獨立評估。與專有系統的比較應審慎看待,因為結果可能取決於提示、抽樣、上下文長度、測試時計算量,以及系統是否允許使用外部工具。

不過,該報告確實提供了一個更具實質性的資料面發現。Nous Research 使用 24,000 道競技程式設計題目進行訓練,並表示這代表在標準化格式中,容易取得且可驗證題目中的相當一部分。研究員 Joe Li 得出結論,該領域可能正在接近這個狹窄領域的高品質資料供應上限。

這個限制不同於單純蒐集更大文本語料的常見問題。程式設計題需要可靠解答與自動測試,因此適合二元獎勵,卻難以大規模建立。報告提出合成題目生成與 self-play 作為可能的下一步,同時也承認模型在生成有用且有趣的題目方面仍有困難。

報告還將模型的進步與 Li 自己在 Codeforces 上的進展作比較。這個類比比較偏向說明性質,而非學習效率的科學測量。模型使用了 24,000 道題,而 Li 在比較期間約解出 1,000 道,這凸顯出表面上的速度優勢,其實建立在對範例與自動回饋的巨大更多曝光之上。

這次發布對開發者與企業的意義

對研究者而言,NousCoder-14B 提供了一個相當容易檢視的套件,用於研究程式碼上的強化學習。團隊可以檢視獎勵流程、修改抽樣方式,並測試類似方法是否可遷移到其他程式設計任務。Apache 2.0 授權也可能讓此模型在擔心專有 API 條款或資料處理政策的環境中更容易評估,不過部署仍需要適當的安全審查。

對產品團隊而言,這項公告與其說是代替代管式程式設計代理,不如說是基礎設施堆疊中的另一個選項。當延遲、可預測的服務成本、客製化或資料駐留很重要時,140 億參數模型可能具有吸引力。但買方仍需要針對儲存庫層級任務、工具整合、重複嘗試下的可靠性,以及在自家程式碼庫上的表現取得證據,不能只靠 LiveCodeBench 下結論。

這次發布也凸顯 AI 程式設計中的策略分歧。Anthropic 的 Claude Code 代表一種產品化、以代理為導向的體驗,建立在專有模型與工作流程之上。Nous Research 則強調開放權重與可重現的訓練基礎設施。這些路線未來或許會匯流,但目前它們回答的是不同的買方問題:誰能以最少設定提供最強大的體驗?誰能提供一個組織可以檢視與控制的模型與堆疊?

接下來值得觀察的重點

最明確的後續訊號,將是對 NousCoder-14B 在儲存庫層級軟體任務與多輪除錯上的獨立測試。團隊本身將多輪強化學習列為優先事項,特別是訓練模型在多次嘗試中使用編譯器錯誤、失敗測試與時間限制回饋。

研究者也應觀察 Atropos 是否能在其他模型與資料集上產生類似結果,而不只是重現這次發布。其他訊號包括:回答長度控制的改善、使用工具或代理式部署的公開證據,以及合成程式設計題生成的進展。在市場端,關鍵比較將是與 Claude Code 等工具相比的實際成本與可靠性,而不是單獨看基準準確率。

Creati.ai 觀點

NousCoder-14B 之所以重要,是因為它在市場聚焦於成熟 AI 代理之際,讓程式設計模型改進的機制變得異常可見。它的分數值得注意,但更持久的貢獻可能是開放的強化學習管線,以及證明一個相對緊湊的模型能透過經驗證的回饋與謹慎的系統工程大幅進步。

這次發布也揭示了程式設計模型供應商無法迴避的界線:基準題目的供給是有限的,而有用的軟體行為則是廣泛且互動的。開放模型若要在孤立的程式競賽之外挑戰專有程式設計代理,將需要更強的多輪學習、更好的工具使用,以及在真實儲存庫上的可信評估。就目前而言,Nous Research 已經交出一項嚴肅的研究發布,但證據尚未顯示它能達到 Claude Code 的完整產品能力。

精選

當開放式程式設計模型迎上 Claude Code 時刻,Nous Research 發布 NousCoder-14B

Nous Research 發布了 NousCoder-14B,這是一個僅用四天訓練完成的開放式程式設計模型,進一步加劇了與 Claude Code 等專有工具的競爭。