Danijar Hafner 正在打造會為陌生環境做規劃的隱密 AI 代理

Danijar Hafner 正在為機器人開發世界模型代理,這些代理能預測結果並適應陌生的家居、物件與環境。

AI News

根據 MIT Technology Review 發表的一篇人物專訪,由前 Google DeepMind 研究員 Danijar Hafner 領導的一家新創公司,正在開發旨在預先判斷尚未見過環境中可能發生什麼事的 AI 代理。這家公司仍處於隱密模式,尚未公開揭露名稱或產品,並在舊金山一間陳設簡樸、擺放著人形機器人的辦公室中運作。

這項工作延伸了 Hafner 長期以來對於先在模擬環境中學習、再在真實世界採取行動的代理研究。其直接意義並不是商業發布,而是一個技術方向:利用對現實的內在模型,讓機器人能夠提前規劃,而不是主要依賴部署後的試誤法。

圍繞世界模型打造的隱密新創

Hafner 在 2025 年秋天離開 Google DeepMind,成立了這家新創。他對營運細節披露甚少,包括公司名稱、融資、預定客戶或上市時程。MIT Technology Review 報導指出,辦公室裡有來自中國的人形機器人,這暗示實體機器人是該公司目前工作的核心,儘管報導並未確定具體產品或部署目標。

技術基礎是基於模型的強化學習。在這種方法中,代理會學習其周遭環境的模型,並利用該模型預測各種可能行動的後果。代理不必在實體環境中反覆測試每個動作,而是可以評估想像中的結果,並根據這些預測選擇行動路徑。

對於在家中運作的機器人來說,這可能意味著要適應不同的平面配置、家具擺設,或是訓練資料中不存在的突發中斷。這個概念對服務型機器人尤其重要,因為環境多變,而失誤可能造成財物損壞或安全風險。

從遊戲世界到實體機器人

Hafner 的研究紀錄提供了這種做法最清楚的公開證據。他的 PlaNet 系統使用學得的模型來支援前瞻規劃。之後 Dreamer 系列代理的研究,把同樣的核心想法應用到越來越困難的模擬任務上。

根據 MIT Technology Review,Dreamer 2 使用世界模型在 Atari 2600 遊戲中達到人類等級表現,而 Dreamer 3 則透過學習開採遊戲中的資源,解決了 Minecraft Diamond 挑戰。據報導,Dreamer 4 更進一步,透過已錄製的遊戲資料學習,且在訓練期間沒有直接與遊戲互動。

這些結果之所以重要,是因為它們顯示規劃如何減少學習過程中所需的直接互動量。然而,遊戲中的成功並不足以證明在家中、工廠、倉庫或公共空間中的可靠表現。遊戲有明確規則與可量化目標;真實世界較難預測、更難精確模擬,而且當行動失敗時,後果也更加嚴重。

Hafner 的 DayDreamer 專案代表了通往機器人技術的橋樑。該專案使用 Dreamer 方法,幫助機器人在陌生環境中運作並對新經驗做出反應,包括被推倒的情況。這家新創看起來正在追求這個轉換的更雄心版本,並以人形機器作為實體平台。

證據顯示了什麼——以及沒有顯示什麼

目前最強的證據,是 Hafner 已公開的研究歷程,以及他目前實驗室環境的描述。關於 PlaNet、Dreamer 與 DayDreamer 的說法,是 MIT Technology Review 在 Hafner 過往工作的脈絡下所報導的。這些內容描述的是研究成果與示範,而非經過獨立驗證的新創商業能力。

在所提供的報導中,也沒有任何公開證據顯示客戶部署、量產合約、營收、安全認證,或與其他機器人系統的比較測試。Hafner 在 Google 的前同事 Timothy Lillicrap 曾稱讚他是傑出的研究者,但那只是個人背書,而不是性能基準。

這個區別對買家與開發者都很重要。即使模型能預測遊戲狀態,或適應受控的機器人實驗,它仍然必須證明:當感測器充滿雜訊、物體意外移動,且錯誤決策代價很高時,它的預測依然準確。新創的隱密狀態,讓今天無法評估這些問題。

為什麼這種方法對打造者與企業很重要

如果 Hafner 的系統能在嚴格控制的示範之外運作,它們可能解決機器人領域的核心瓶頸之一:蒐集足夠真實世界經驗的成本與難度。透過反覆的實體失敗來訓練機器人,速度慢、成本高,而且可能不安全。在學得的環境中先規劃,或許能減少部署前所需的實體試驗次數。

對產品團隊而言,實際測試重點會是:代理是否能在不進行大量重新訓練的情況下,把知識轉移到不同場景。舉例來說,倉儲營運者需要機器人能處理不斷變動的布局和陌生包裹。家用機器人則必須分辨出哪些新情況是無害的,哪些則需要停下來或尋求協助。

這會帶來超出預測之外的額外需求。企業需要清楚了解世界模型是如何建立的、不確定性如何被表示,以及機器人何時會退回安全行為。它們也需要工具來評估罕見事件、在部署後更新系統,以及區分真正的適應與不安全的臨場發揮。

這項工作也可能加劇具身 AI 中兩種大方向的競爭:一種是用更多示範資料訓練更大的模型,另一種是學會模擬與規劃的、更有結構的代理。這兩種方法並非互斥,但 Hafner 的研究提出了一個觀點:更好的內在預測,可能和更多訓練資料一樣重要。

接下來值得關注什麼

第一個訊號會是新創是否公開身分,並說明其初始產品或研究目標。投資人、合作夥伴與潛在客戶也會尋找證據,看看這些人形機器人是否被用於超越實驗室測試的用途。

技術揭露會比泛泛的說法更重要。實用的細節包括:用來評估的環境、需要多少真實世界資料、在陌生情境下表現如何變化,以及當預測不確定時系統如何反應。針對操作、導航、跌倒復原與安全關鍵中斷所做的獨立測試,會比單純的遊戲基準提供更有力的證據。

最後,公司的商業模式選擇也會釐清其雄心。機器人平台、授權控制系統,以及垂直整合的機器人產品,對硬體可靠性、部署支援與企業經濟性,都會有不同要求。

Creati.ai 觀點

Hafner 的新創值得注意,因為它瞄準了當前 AI 系統的一項特定弱點:當條件與訓練不同時,無法可靠行動。世界模型與基於模型的強化學習提供了一條合理路徑,可望帶來更有思考性的行為,但虛擬成果與可靠實體運作之間仍存在相當大的落差。

就目前而言,這是一家值得持續關注的研究型公司,而不是已被驗證的機器人供應商。真正的關鍵在於,Hafner 是否能把預測式規劃轉化為在真實環境中的可衡量提升——更少的訓練試驗、面對突發狀況時更安全的復原,以及在每個新地點都不需要客製工程的穩定表現。

廣告