AI News

中國 AI 公司 Zhipu AI 已發布 GLM-5.3,這是一款該公司宣稱為同級別中最強開源權重系統的程式碼模型。公司表示,該模型僅透過後訓練便可大幅優於 GLM-5.2,而最大的提升出現在基於代理的軟體任務上。

此版本已可透過 GLM Coding Plan 立即使用,並可搭配 ZCode、Claude Code 和 OpenCode 等程式碼代理使用。不過,開發者目前仍無法下載模型權重。Zhipu 表示,預計在完成安全審查後約兩週內釋出。

這次發布之所以重要,是因為開源權重程式碼模型的評估標準,正日益不僅看程式碼生成,也看其能否在更長的軟體工作流程中運作。Zhipu 正將 GLM-5.3 定位於這個更廣泛的使用情境,同時將網路安全作為具體的改進領域加以強調。

為程式碼代理打造的後訓練升級

根據 The Decoder 的報導,GLM-5.3 使用與 GLM-5.2 相同的基礎模型。Zhipu 將新模型的效能提升歸因於擴展後的後訓練,而非新的底層模型架構或更大且已揭露的基礎模型。

該公司聲稱 GLM-5.3 較前代提升了 50%。目前可得資訊並未提供評估方法的完整拆解、包含哪些任務,或該數字是否為各項基準測試的平均值。因此,這項說法更適合視為供應商自述的比較,而非經獨立確認的效能結果。

Zhipu 強調基於代理的程式碼開發,對於將模型視為開發工具而非單純聊天介面的團隊而言意義重大。程式碼代理需要理解儲存庫、規劃多個步驟、修改檔案、執行測試、回應錯誤,並在整個任務過程中維持上下文。即使模型在單一程式碼問題上表現良好,面對這樣較長的一連串動作時仍可能吃力。

GLM-5.3 透過 GLM Coding Plan 立即可用,讓使用者能在權重公開前先測試這些工作流程。計畫中的權重釋出,也可能為需要本地部署、自訂推論,或對原始碼處理有更嚴格控制的組織擴大可及性。

網路安全是模型的核心考驗

Zhipu 以旨在協助模型識別軟體漏洞的資料與環境訓練 GLM-5.3。公司表示,該模型能推理多個利用階段,並為完整的利用鏈制定計畫,並將此能力視為相較早期系統的改進。

Zhipu 與中國的安全團隊合作,稱 GLM-5.3 在 269 個專案中發現了 2,436 個漏洞。據報導,這些專案包含最早可追溯至 40 年前的軟體,而被識別出的缺陷也已記錄在公開登錄冊中。

這些數字同樣是由公司提供。現有證據無法獨立驗證這些漏洞,也未說明發現結果如何被驗證,亦未顯示模型的誤報率。這些細節對安全團隊而言很重要:找出潛在弱點,並不等同於證明可被利用、展示影響,或提出可靠的修補路徑。

對網路安全的重點投入,反映了模型市場中的競爭壓力。The Decoder 報導稱,Kimi 和 Qwen 等中國領先模型,在部分網路安全評估中仍落後於美國前沿模型。透過在專門的安全環境中訓練,Zhipu 正嘗試鎖定一般程式碼基準測試未必能揭露的弱點。

證據顯示了什麼——以及沒有顯示什麼

關於 GLM-5.3 最強的說法都來自 Zhipu 本身。公司表示,這是最強的開源權重程式碼模型,在代理任務上取得最大進展,且相較 GLM-5.2 提升了 50%。目前可取得的來源資料中,沒有獨立的基準測試結果或比較測試。

這並不代表此次發布無關緊要,但會改變開發者應如何解讀它。「最強」取決於模型集合、任務設計、工具配置、上下文長度、推論設定與評估日期。程式碼代理的結果也可能因儲存庫品質、測試覆蓋率、工具權限,以及允許多少人工介入而大幅波動。

權重釋出時間也是這次公告中尚未解決的一環。GLM-5.3 現在可透過託管存取與支援的程式碼工具使用,但開源權重釋出仍以安全審查為前提。在權重尚未發布前,開發者無法自行評估本地推論需求、授權條款、量化選項或可重現性。

對開發者與企業團隊的影響

對軟體團隊而言,最實際的問題是 GLM-5.3 是否能提升真實儲存庫的完成率,而不只是標題式基準測試。團隊應使用自己的程式碼與核准規則,測試問題解決、除錯、測試生成、依賴變更與 pull request 準備。

對安全敏感的組織而言,應分開評估資料處理與營運控制。透過 GLM Coding Plan 的託管存取可用於實驗,但對專有程式碼、受監管工作負載或漏洞研究而言,本地或私有部署可能是決定性需求。最終的權重釋出將決定 GLM-5.3 是否能支援這些部署模式,以及其硬體成本為何。

該模型的網路安全訓練也帶來雙重用途風險。能夠識別漏洞並推理利用鏈的系統,既可協助防禦方,也可能降低進行攻擊活動的門檻。因此,Zhipu 在發布權重前先進行安全審查的決定,影響的不只是發布時間。當將模型整合進自動化安全工作流程時,開發者還需要檢視存取控制、可接受使用限制、日誌記錄與防護措施。

對競爭模型供應商而言,這次發布加大了改進開源權重程式碼系統的壓力,尤其是在長時間運行的代理任務上,而不僅是傳統的程式碼生成測試。它也顯示,專門化後訓練與任務環境可用來區隔模型,而無須更換其基礎模型。

接下來值得關注的事項

第一個訊號將是 Zhipu 是否依照宣稱時程發布 GLM-5.3 權重,並披露適用授權、模型大小、硬體指引與安全文件。這些細節將決定「開源權重」這個標籤對商業與研究使用者有多大意義。

接著,獨立評測應在相同的程式碼代理設定下,比較 GLM-5.3、GLM-5.2、Kimi、Qwen 以及領先的美國模型。安全測試應同時報告成功發現與誤報,並說明 2,436 個漏洞數字背後的人工作業審查程度。

開發者也應觀察其在真實儲存庫中的表現、工具使用的可靠性、推論成本、延遲,以及模型在遇到不完整測試或模糊需求時的行為。這些指標比單一供應商基準測試,更可能決定 GLM-5.3 是否能支援生產環境中的工程工作。

Creati.ai 觀點

GLM-5.3 是一項值得注意的發布,因為 Zhipu 結合了三個主張:相較既有基礎模型的後訓練改進、在程式碼代理工作流程中的更強表現,以及針對性的網路安全能力。但目前的證據只能支持這是一項發布宣告,尚不足以確立開源權重市場的最終排名。

真正的關鍵考驗,將在權重可取得、且獨立團隊能重現結果時開始。在那之前,開發者應將 GLM-5.3 視為值得進行受控評估的有希望候選者,特別留意代理可靠性、安全防護、部署經濟性,以及供應商報告基準與實際生產結果之間的差距。

精選

Zhipu AI 發布 GLM-5.3,宣稱其為最強的開源權重程式碼模型

Zhipu AI 發布了 GLM-5.3,主打更強的開源權重程式碼與網路安全表現,同時將權重釋出延後至審查完成後。