
OpenAI 正在開發一個名為 Astra 的模型家族,據稱它能夠協調多個 AI 代理,針對困難問題連續工作數小時或數天。根據 The Decoder 的報導,該公司已使用這套系統的內部版本,針對十個先前未解的數學與理論電腦科學問題產生了解答。
這項工作提供了迄今最清楚的公開訊號,顯示 OpenAI 正試圖從短篇互動式回答,轉向長時間運作的研究工作流程。據報導,Astra 已由執行長 Sam Altman 在華盛頓向政策制定者示範,而這些模型仍在測試中,尚未公布公開發布日期。
Astra 專案旨在結合多個代理,讓它們能夠分工、調查、批判並修正一個複雜問題的工作。這種設計會使它與傳統聊天機器人和程式編寫助手有所不同,後者通常會在較短的互動時間內完成任務。
The Decoder 報導,Astra 最終可能會以 GPT-6 或未來的 GPT-5 變體形式出現,但 OpenAI 尚未決定要如何命名或包裝這套系統。該專案也被描述為一個新的模型類別,與 OpenAI 先前報導的 Sol、Terra 和 Luna 系列並列。
公司的長期目標是打造能夠規劃、推理、實驗,並在沒有持續人類介入的情況下繼續工作的系統。根據 The Decoder,OpenAI 首席科學家 Jakub Pachocki 先前曾談到,希望 AI 系統能夠連續數小時或數天處理問題。Astra 看起來就是把這項雄心轉化為經過測試的產品方向。
OpenAI 的數學報告指出,一個內部 Astra 系統解決了十個開放問題,領域包括高維幾何、編碼理論、群論、量子複雜度、格基密碼學與極值組合學。據報導,這些問題至少已有十年未見進展,許多甚至更久。
其中一項報告中的成果證明了非 sofic 群的存在,解決了群論中的一個重大問題。這些結果的數學意義目前正由研究人員評估,而非僅由 OpenAI 決定。經營 erdosproblems.com 的曼徹斯特大學數學家 Thomas Bloom 在 The Decoder 報導的評論中,將這些構造形容為重大新聞。
OpenAI 表示,模型生成了數學論證,而研究人員協助將其轉化為論文,並在 Lean 中將每個證明形式化。這種形式化產生了可由機器驗證的證書,提供了一層重要的驗證,而不只是看起來合理的自然語言答案。
這個差異很重要。OpenAI 表示,其研究人員對已發表工作的準確性負責,但核心論證來自 Astra。該公司也主張,若把由 AI 系統生成的證明完全歸於人類作者,將會誤導人們對該系統貢獻的理解。這些結果的最終地位,將取決於數學家及其他獨立專家的審查,而不僅僅是模型能否產出 Lean 產物或說明性步驟。
這個故事中最強的效能主張來自 OpenAI 自己的報告,並由 The Decoder 轉述。現有證據中沒有獨立基準顯示 Astra 在長期研究任務上持續優於其他先進系統。
OpenAI 估計,產生這十個解答所使用的 tokens,以 Sol 的 API 價格計算,成本約為 2,000 美元。這個數字是供應商的估算,並未包含系統開發、營運、監督與驗證的更廣泛成本。它也無法證明同樣的方法在大量研究問題上都具備經濟效益。
與 Astra 所使用的測試時推理技術相關的研究員 Noam Brown 表示,這套系統尚未解出七個千禧年大獎問題。他也指出,若能大幅增加測試時運算量,結果可能會改善。他的評論同時指出了這種方法的潛力與限制:困難推理或許可行,但前提是需要大量推論時間與資源。
因此,這些成果不應被解讀為 AI 已經取代數學家。Bloom 反對這種解讀,並指出該系統依賴超過一個世紀的數學知識,以及建構與訓練它的研究人員所做的工作。人類專家仍然參與問題選擇、評估、形式化與發表。
對 AI 建構者而言,Astra 強調了一個轉變:模型品質不再只看單次回應,而是看系統能否維持一個工作流程。真正有用的長時間代理必須能維持目標、管理不斷增加的上下文、偵測失敗的做法,並判斷何時需要人類介入。這些要求更接近運作一支研究團隊,而不是按需產生文字。
多代理設計也帶來新的可靠性風險。The Decoder 指出,隨著流程持續,錯誤可能會逐步累積,而且協調開銷可能使多個代理在緊密相連的規劃任務上效率更低。一個經過數小時後才產生看似合理但其實錯誤結論的系統,可能比一個很快失敗的系統更難稽核。
這使得 Lean 形式化對高風險技術工作尤其重要。可由機器驗證的證明無法解決所有關於研究品質的問題,但它們提供了一種具體的驗證機制。在其他領域,建構者也需要類似的控制:可重現的執行、來源追蹤、中間檢查點、測試,以及針對不確定結果的清楚升級路徑。
企業買家也應注意成本結構。花費數小時或數天處理任務的系統,可能在科學發現、工程或複雜分析中創造價值,但其經濟性會與一般聊天或檢索工作負載大不相同。OpenAI 報告的 token 估算只是有用背景,而不是完整的營運成本模型。
The Decoder 報導指出,Astra 模型預計會成為美國政府計畫中的審查框架最早考慮的系統之一,且在公開發布前需要批准。根據目前可得證據,該框架的時程與最終結構仍不明確。
審查流程可能會影響 OpenAI 如何部署長時間運作的 AI 代理,尤其是當它們能進行研究、撰寫軟體或在有限監督下運作時。這也可能建立一個先例,將長時間的自主工作流程與一般模型發布區別對待。
OpenAI 尚未宣布 Astra 是會透過 API 提供、整合進 ChatGPT、以研究預覽形式發布,還是保持內部使用。只要這些決定尚未做出,開發者就無法評估其延遲、定價、工具存取、保護措施或實際限制。
接下來最直接的信號將是 OpenAI 完整的數學報告,以及獨立數學家是否會驗證這十個結果。Lean 形式化的品質、人類介入的程度,以及所報告解答的可重現性,會比標題中的數字更具資訊性。
市場也應關注一份公開的 Astra 評估,重點放在長時間任務,而非單點示範。實用的衡量指標包括成功率、從失敗推理路徑中恢復的能力、消耗的運算量,以及與單一代理替代方案的表現比較。
最後,OpenAI 的產品命名、發布管道與政府審查狀態,將有助於釐清 Astra 是實驗性的研究系統,還是公司下一代主流模型的基礎。
Astra 的重要性不在於十個數學答案本身,而在於 OpenAI 正在追求的營運模式:AI 系統在一個問題上投入大量運算與時間、協調專門化流程,並產出可檢查的成果。這可能擴大 AI 在研究中的角色,但前提是可靠性與成本必須隨著原始推理能力一起改善。
對建構者而言,實務上的啟示是把長時間代理視為系統工程專案。持久狀態、驗證、資源控制與人類審核,將和底層模型一樣重要。OpenAI 的主張固然重要,但 Astra 的真正考驗將在於,當獨立使用者能在精心挑選的示範之外衡量它是否能穩定完成困難工作流程時,才會到來。
OpenAI 表示,其 Astra 模型家族已解決十個長期存在的數學難題,顯示公司正推進用於長時間研究任務的多代理 AI。