
Nous Research 已發布 NousCoder-14B,這是一款擁有 140 億參數的開源程式碼模型,公司表示它可以與更大型的專有系統競爭。此次發布正值 Anthropic 的 Claude Code 吸引開發者高度關注之際,也讓外界重新聚焦於開源模型是否能在實際軟體工作中帶來類似的提升。
根據 VentureBeat AI,Nous Research 使用 48 顆 Nvidia B200 GPU,在四天內訓練完成該模型。公司已公開模型權重、其強化學習環境,以及用來產生模型的訓練框架。這使得此次發布不僅因其據稱的基準分數而值得注意,也因為外部研究者可檢視、重現或延伸的基礎設施相當完整。
根據隨發布附帶的技術報告,NousCoder-14B 建立在阿里巴巴的 Qwen3-14B 之上。Nous Research 表示,它在 LiveCodeBench v6 上取得 67.87% 的準確率;這是一項針對 2024 年 8 月至 2025 年 5 月間發布的競賽程式題目的測試。公司稱,這個結果比基礎模型高出 7.08 個百分點。
這些數據應被視為供應商所報告的基準結果,而不是程式助理品質的完整衡量。LiveCodeBench v6 評估的是答案已知的程式題解法。單靠這項測試,無法證明 NousCoder-14B 對大型程式碼庫、陌生儲存庫、工具使用、多輪除錯或生產環境限制的處理能力。
這個區別很重要,因為當前市場討論越來越受到 agentic 工具的影響。Claude Code 透過展示其可檢視專案、進行修改,並反覆迭代到可運作軟體的能力而受到關注。相較之下,Nous Research 的報告結果聚焦於競賽程式設計,在那裡生成的程式碼可以自動執行並被標記為正確或錯誤。
此次發布採用了 Atropos 框架,Nous Research 已與模型一同公開。訓練涉及 24,000 道競賽程式題,並採用基於可驗證回饋的強化學習流程:模型生成解答,系統將其對照測試案例執行,結果則提供學習訊號。
VentureBeat 報導,Nous Research 使用 Modal 來平行執行沙箱化程式碼。系統對提交內容施加時間與記憶體限制,並讓生成、驗證與進一步訓練重疊進行,以保持 GPU 叢集持續運作。研究人員在與其他方法比較後,選擇了 Dynamic Sampling Policy Optimization,也就是 DAPO。
據報導,有一項技術會移除那些模型每次都成功或每次都失敗的題目。在這兩種情況下,研究人員認為這些範例對改善模型幾乎沒有有用訊號。他們也先以 32,000 token 的上下文視窗訓練,之後再擴大;在約 80,000 token 的評估下,取得了所報告的最高分數。
這種技術路線對開發者很重要,因為它展示了一條提升較小模型的方法,而不必完全依賴更大的預訓練系統。當輸出可以自動測試時,強化學習便能精準鎖定某種行為。但這項優勢在有可靠評估器的領域最為明顯;對於程式可維護性、產品需求或架構判斷等模糊任務,則較難套用。
技術報告也指出了一個可能影響未來程式碼模型研究的限制。報告作者 Joe Li 表示,Nous Research 使用的 24,000 道題目,代表了在標準化且可驗證格式中相當大一部分可輕易取得的競賽程式題。
Li 認為,這個領域可能已接近高品質公開訓練資料的供應上限。這並不表示程式碼模型已停止進步,而是說,未來的額外提升可能更依賴資料效率、合成範例,以及更好的訓練目標,而不只是單純蒐集更多線上題目。
研究人員指出,題目生成與 self-play 可能是下一步。一個能夠創造出有用且可解的程式挑戰的模型,或許可以為另一個模型——或為它自己——生成持續的課程。報告也呼籲進行多輪強化學習,讓系統在反覆嘗試中利用編譯器錯誤、失敗測試與時間限制回饋,而不是只收到最終的通過或失敗獎勵。
這些提案仍然只是研究方向,而不是 NousCoder-14B 已被證明具備的能力。報告也指出,錯誤解答往往更長,而多種技術都未能解決模型在訓練中傾向消耗可用上下文的問題。
對開發者與創業者而言,最直接的吸引力是控制權。NousCoder-14B 已在 Hugging Face 以 Apache 2.0 授權提供,而配套的 Atropos 技術堆疊,讓團隊比一般封閉式 API 擁有更多訓練過程可視性。具備適當基礎設施的組織可以私下評估模型,將其調整為內部工作流程,或把訓練環境作為新實驗的基礎。
但這不代表它可以直接取代託管式程式助理。產品團隊仍須評估推論成本、延遲、上下文處理、儲存庫規模表現、安全隔離,以及模型從錯誤中恢復的能力。對單次解題表現良好的開源模型,在面對長期維護的程式碼庫或需要協調多種工具的任務時,行為可能會大不相同。
儘管如此,這個時間點仍然提升了競爭壓力。Claude Code 幫助端到端程式助理成為極具能見度的產品類別,而 Nous Research 則強調可重現性與開放基礎設施。這是兩條不同的採用路徑:一條重視打磨完善、受管理的工作流程;另一條則給研究者與企業更多對模型及其運作環境的控制權。
公司的更廣泛開源策略也很重要。Nous Research 獲得加密創投公司 Paradigm 支持,先前已發布 Hermes 4 和 DeepHermes-3 等模型。VentureBeat 報導其總募資達 6,500 萬美元,其中包括 2025 年 4 月由 Paradigm 領投的 5,000 萬美元輪次。這些融資細節與公司的競爭定位來自報導來源,而非對 NousCoder-14B 商業動能的獨立驗證。
最有價值的後續發展,將是超越 LiveCodeBench v6 的獨立測試。開發者應留意儲存庫層級修補、多檔案修改、工具輔助工作流程,以及與測試和編譯器的反覆互動結果。與其他開源模型的比較也應能釐清 NousCoder-14B 的優勢是否能延伸到競賽程式設計之外。
研究者很可能會關注已公開的 Atropos 技術堆疊是否能在相近硬體上產生可重現的結果,以及模型表現有多大程度取決於那 24,000 題的特定資料集。進一步關於推論成本與長上下文可靠性的證據,將決定這個模型是適合產品實用部署,還是主要作為研究產物更有價值。
NousCoder-14B 的重要性,與其說是某個基準分數已解決開放與封閉之爭,不如說它揭示了一條可信且可檢視的路徑,能夠改進一個相對精簡的程式碼模型。可驗證回饋與已公開訓練基礎設施的結合,給 AI 開發者提供了具體可研究的對象。
更難的考驗是部署。程式碼產品需要可靠的反覆迭代、對儲存庫的理解與安全執行,而不只是競賽題的正確答案。如果 Nous Research 或外部團隊能把這次發布擴展到那些工作流程,它可能成為對 Claude Code 有力的制衡。就目前而言,最有力的說法更為狹義:開放研究在程式碼的可衡量部分進展迅速,而較難量化的產品挑戰仍未解決。
Nous Research 發布了 NousCoder-14B,這款開放式程式碼模型據稱在 LiveCodeBench 上有提升,進一步加劇了 AI 軟體開發領域的競爭。