Reka AI 的 Rho-1 將文字、影像、影片與機器人控制結合在一個 190 億參數研究模型中,顯示其正朝統一式 AI 系統推進。

Reka AI 發布了 Rho-1 的研究預覽版。這是一個擁有 190 億參數的模型,設計目標是在同一個神經網路中處理並生成文字、影像、影片與機器人控制動作。這項發布之所以重要,是因為它試圖為通常分散在語言模型、視覺系統、影片生成器與機器人策略中的能力,建立一種共同架構。
根據 The Decoder 的報導,Rho-1 將不同媒體與動作視為共享上下文視窗中的 token,而不是透過工具呼叫把任務交給不同模型。Reka 表示,該系統可以即時生成連續影片,並在場景持續發展時回應新指令,而不必重新啟動生成流程。
這項公告讓 Reka AI 成為探索單一模型能否充當感知、生成與行動之更通用介面的研究團隊之一。不過,這仍是研究預覽版,現有證據並不足以說明 Rho-1 相較於領先商業模型或真實世界機器人系統的表現。
大多數投入生產環境的 AI 技術堆疊,會把多模態工作分成不同元件。語言模型可以解讀使用者請求,視覺模型可以檢查影像,影片模型可以生成畫格,而獨立的策略則可以把觀察結果轉換為實體動作。這些元件可以彼此連接,但每次交接都會增加工程複雜度、延遲與潛在故障點。
Rho-1 的目標是避免這種安排。據報導,該模型在同一個共享序列中表示文字、影像、影片與機器人動作。原則上,同一個上下文可以包含指令、視覺觀察、生成畫格與動作輸出,讓系統能將它看到的內容與應該採取的行動連結起來。
這種方法也讓 Rho-1 在視覺預測與控制之間建立直接關係。The Decoder 報導指出,用於預測攝影機影像的相同權重,也會驅動機器人移動。這並不代表模型已準備好在實體環境中廣泛部署,但它反映了一種研究方向:將影片預測與行動規劃一起訓練,而不是把它們視為互不相關的問題。
根據 The Decoder 對此次發布的描述,該模型使用 320 個 H100 GPU,訓練時間約為三個月。Reka AI 也開發了逆動力學模型,以處理機器人技術中的一項核心問題:相較於一般網路影片,高品質的機器人控制資料十分稀缺。
逆動力學通常試圖推斷造成場景中觀察到的變化之動作。在 Reka 所報導的方法中,這項能力被用來從沒有機器人的影片中擷取可能的控制訊號。這可能擴大系統可用的訓練資料量,協助它學習動作如何影響世界;不過,網路影片並不具備從特定機器人蒐集的示範資料所擁有的相同可靠性、具身性或感測器細節。
報導中的運算需求值得注意,因為 Rho-1 擁有 190 億參數,明顯小於市場上經常討論的許多前沿系統。然而,使用 320 個 H100 GPU、持續三個月,仍代表一項重大的訓練投資。因此,這個數字應被理解為對該研究執行的描述,而不是證明模型在所有部署情境下都能以低成本訓練或運作。
本報告目前可取得的最有力細節,來自 The Decoder 對 Reka AI 研究預覽版的報導。MarkTechPost 另行將 Rho-1 描述為擁有 190 億參數的全能推理模型,能理解並生成影片,同時產生機器人動作;但所提供的 MarkTechPost 資料並未包含完整文章或獨立測試結果。
現有證據沒有提供基準測試分數、模型存取條件、延遲測量、安全性評估,或可在此獨立評估的示範。因此,關於即時影片生成、自適應回應,以及視覺預測與機器人移動之間關係的說法,應被視為公司或消息來源所報導的能力,而非已確立的效能結果。
這項區分對開發者與採購者很重要。統一模型可能減少維護多個介面的需求,但也可能讓故障更難隔離。一個能生成流暢語言與逼真影片的系統,在被要求控制設備時,仍可能做出不安全或不符合物理規則的決定。Rho-1 的研究預覽狀態,也讓可靠性、評估方法,以及模型與權重的存取權限等問題仍待解答。
Reka AI 過去已經開發過多模態系統。該公司在 2024 年 4 月發布 Reka Core,並在基準評估中將其定位為 GPT-4、Claude 3 與 Gemini Ultra 的競爭者。Rho-1 則將這一方向從多模態理解延伸到影片生成與具身行動。
對產品團隊而言,Rho-1 的主要意義在於架構。如果單一模型能維持語言、視覺內容、時間變化與動作的共享表示,開發者就可能圍繞單一推論介面建立應用程式,而不必協調多個專門服務。潛在用途包括互動式影片助理、模擬環境、視覺代理,以及機器人研究工具。
取捨在於風險集中。專門系統可以獨立替換或調整;相較之下,當某一模態表現不佳時,統一模型可能需要重新訓練或進行更廣泛的評估。例如,一個文字能力強但時間推理能力弱的模型,可能產生看似合理的解釋,卻無法追蹤持續變化的實體場景。
考慮這類系統的企業也需要檢視基礎設施與治理。連續影片生成可能帶來很高的頻寬與儲存需求。機器人控制輸出需要嚴格的安全邊界、監控,以及能夠覆寫模型的備援策略。在受監管或安全敏感的部署中,能否解釋哪些視覺證據導致某項動作,可能與模型的一般基準效能同樣重要。
更廣泛的研究辯論涉及世界模型:旨在表示環境如何變化,以及動作如何影響環境的系統。Rho-1 將視覺預測與動作生成結合,符合這一研究方向;但僅僅擁有統一的 token 串流,並不能證明模型具備可靠的物理世界模型。長期規劃、異常狀況,以及在不同機器人之間的遷移,仍是艱難的測試。
首先要觀察的是,Reka AI 是否會發布針對各項能力、分別以及綜合使用時的可重現評估。具有參考價值的結果應包括影片品質與時間一致性、場景變化時的指令遵循能力,以及在明確定義任務上的機器人控制成功率。
存取權限將是另一項關鍵指標。如果 Rho-1 向外部研究人員開放,獨立測試就能釐清其統一架構是否相較於由專門模型組成的流程具備實際優勢。推論硬體、上下文長度、授權方式與延遲等細節,將決定該系統是否不只是展示用途。
對機器人技術而言,最重要的後續證據將來自真實硬體,而不是網路影片或模擬結果。研究人員需要測試安全性、從意外事件中恢復的能力、在不同具身形態上的表現,以及攝影機與感測器雜訊輸入的影響。
最後,市場將觀察 Reka 的方法會繼續停留在研究預覽階段,還是成為產品平台。答案將顯示全能模型能否從吸引人的架構,轉變為服務於 AI 代理、影片應用程式與實體自動化的可靠工具。
Rho-1 是一項有意義的研究訊號,因為它將多模態性描述為一個包含行動的共享建模問題,而不只是文字、影像與影片。這可能簡化 AI 技術堆疊的部分環節,並讓建立連結感知與回應的系統變得更容易。
但這項公告尚未證明單一模型優於經過精心設計的專門模型集合。在獨立評估與真實機器人結果出現之前,開發者應將 Rho-1 視為一項範圍令人期待的架構實驗,而不是已驗證、可取代生產級多模態或機器人系統的方案。