Reka AIのRho-1は、テキスト、画像、動画、ロボット制御を1つの190億パラメーター研究モデルに統合し、統合型AIシステムへの動きを示している。

Reka AIは、Rho-1の研究プレビューを公開した。Rho-1は、1つのニューラルネットワーク内でテキスト、画像、動画、ロボット制御のアクションを処理・生成するよう設計された、190億パラメーターのモデルだ。この発表が重要なのは、通常は言語モデル、視覚システム、動画生成モデル、ロボットポリシーに分かれている能力を、共通のアーキテクチャで扱おうとしているためだ。
The Decoderの報道によると、Rho-1は異なるメディアやアクションを共有コンテキストウィンドウ内のトークンとして扱い、ツール呼び出しによって別々のモデルにタスクを渡す方式を取らない。Rekaによれば、このシステムはリアルタイムで連続動画を生成し、シーンが進行している最中にも新しい指示に応答できる。生成プロセスを再開する必要もないという。
この発表により、Reka AIは、単一モデルが知覚、生成、行動のためのより汎用的なインターフェースになり得るかを探る研究者の一員となった。ただし、現時点では研究プレビューであり、入手可能な証拠だけでは、主要な商用モデルや実世界のロボットシステムに対するRho-1の性能は判断できない。
本番環境のAIスタックの多くは、マルチモーダル処理を複数のコンポーネントに分けている。言語モデルがユーザーの要求を解釈し、視覚モデルが画像を調べ、動画モデルがフレームを生成し、別のポリシーが観測結果を物理的な動きに変換する、といった構成だ。これらは接続できるが、引き渡しが増えるたびに、エンジニアリングの複雑さ、遅延、潜在的な障害点も増える。
Rho-1はこの構成を避けることを目指している。報道によれば、モデルはテキスト、画像、動画、ロボットのアクションを1つの共有シーケンスとして表現する。原理上は、同じコンテキストに指示、視覚的な観測、生成されたフレーム、アクション出力を含められるため、システムは「何を見ているか」と「何をすべきか」を結び付けられる。
このアプローチは、Rho-1に視覚予測と制御の直接的な関係も与える。The Decoderは、カメラ画像の予測に使われる同じ重みが、ロボットの動きも駆動すると報じている。これは、モデルが物理環境での広範な導入に対応できるという意味ではない。しかし、動画予測と行動計画を別々の問題として扱わず、同時に学習する研究の方向性を示している。
The Decoderによる発表内容の説明によると、モデルは320基のH100 GPUを使い、およそ3カ月にわたって訓練された。Reka AIはまた、ロボット制御に関する中心的な問題に対処するため、逆動力学モデルを開発した。通常のインターネット動画と比べ、質の高いロボット制御データは少ないためだ。
逆動力学は一般に、シーンで観測された変化を生み出したアクションを推定する。Rekaが報告した方式では、この能力を使って、ロボットが映っていない動画から制御信号の候補を抽出する。これにより、アクションが世界にどのような影響を与えるかを学ぶシステムが利用できる訓練素材を増やせる可能性がある。ただし、インターネット動画は、特定のロボットから収集したデモンストレーションと同じ信頼性、身体性、センサーの詳細さを備えていない。
報告された計算資源の要件は注目に値する。Rho-1は190億パラメーターで、多くの市場最先端システムより大幅に小さい。それでも、320基のH100 GPUを3カ月使うことは大規模な訓練投資に相当する。したがって、この数字は研究実行の内容を示すものとして読むべきであり、あらゆる導入シナリオで訓練や運用が安価だという証拠ではない。
この報告で入手できる最も強い情報は、Reka AIの研究プレビューに関するThe Decoderの報道に由来する。MarkTechPostもRho-1を、動画を理解・生成しながらロボットアクションを出力する190億パラメーターのオムニ推論モデルとして別途紹介した。ただし、提供されたMarkTechPostの資料には、記事全文や独立したテスト結果は含まれていない。
現在の証拠には、ベンチマークスコア、モデルへのアクセス条件、遅延測定、安全性評価、ここで独立に検証できるデモンストレーションがない。そのため、リアルタイム動画生成、適応的な応答、視覚予測とロボットの動きの関係に関する主張は、確定した性能結果ではなく、企業または情報源が報告した能力として扱うべきだ。
この区別は、開発者と購入者にとって重要だ。統合モデルは複数のインターフェースを維持する必要性を減らせる一方、障害の切り分けを難しくする可能性もある。流暢な言語と説得力のある動画を生成できるシステムでも、機器の制御を求められたときに、安全でない、あるいは物理的に誤った判断をすることはあり得る。Rho-1が研究プレビューであることから、信頼性、評価手法、モデルと重みへのアクセスについては未解決の問題が残る。
Reka AIは以前からマルチモーダルシステムに取り組んできた。同社は2024年4月にReka Coreを公開し、ベンチマーク評価でGPT-4、Claude 3、Gemini Ultraの競合として位置付けた。Rho-1は、その方向性をマルチモーダル理解から動画生成と身体を持つ行動へと広げるものだ。
プロダクトチームにとって、Rho-1の主な意義はアーキテクチャにある。1つのモデルが言語、視覚コンテンツ、時間的変化、アクションの共有表現を維持できれば、開発者は複数の専門サービスを調整する代わりに、単一の推論インターフェースを中心にアプリケーションを構築できる可能性がある。想定される用途には、インタラクティブな動画アシスタント、シミュレーション環境、視覚エージェント、ロボティクス研究ツールなどがある。
トレードオフは、リスクが集中することだ。専門システムなら個別に置き換えたり調整したりできるが、統合モデルでは、あるモダリティの性能が低い場合に再訓練やより広範な評価が必要になる可能性がある。例えば、テキストには強いが時間的推論に弱いモデルは、もっともらしい説明を生成しながら、変化する物理シーンの追跡には失敗するかもしれない。
こうしたシステムを検討する企業は、インフラとガバナンスも調べる必要がある。連続動画の生成は、大きな帯域幅とストレージを要求する可能性がある。ロボット制御の出力には、厳格な安全境界、監視、そしてモデルを上書きできるフォールバックポリシーが必要だ。規制対象または安全性が重要な導入では、どの視覚的証拠がアクションにつながったかを説明できることが、モデルの一般的なベンチマーク性能と同じくらい重要になり得る。
より広い研究上の議論は、世界モデルに関するものだ。世界モデルとは、環境がどのように変化し、アクションが環境にどう影響するかを表現することを目指すシステムである。Rho-1は視覚予測とアクション生成を組み合わせることでこの流れに合致するが、トークンを1つのストリームに統合しただけで、信頼できる物理的な世界モデルを持つことが証明されるわけではない。長期計画、例外的な状況、異なるロボット間の転移は、依然として難しいテストだ。
最初に注目すべきシグナルは、Reka AIが各能力を単独および組み合わせで再現可能に評価した結果を公開するかどうかだ。有用な結果には、動画の品質と時間的一貫性、シーンが変化する状況での指示追従、明確に定義されたタスクにおけるロボット制御の成功率が含まれる。
アクセスも重要な指標になる。Rho-1が外部研究者に提供されれば、独立したテストによって、統合アーキテクチャが専門モデルから構成されたパイプラインに対して実用上の利点を持つかどうかが明らかになる可能性がある。推論ハードウェア、コンテキスト長、ライセンス、遅延に関する詳細が、デモンストレーションを超えてシステムが役立つかを決める。
ロボティクスでは、インターネット動画やシミュレーションの結果ではなく、実機からの証拠が最も重要なフォローアップになる。研究者は、安全性、予期せぬ事象からの復旧、異なる身体構成での性能、ノイズの多いカメラやセンサー入力の影響を検証する必要がある。
最後に、市場はRekaのアプローチが研究プレビューにとどまるのか、製品プラットフォームになるのかを注視する。その答えは、オムニモデルが魅力的なアーキテクチャから、AIエージェント、動画アプリケーション、物理的自動化のための信頼できるツールへ移行できるかを示すだろう。
Rho-1は、マルチモダリティをテキスト、画像、動画だけでなくアクションも含む共有モデリングの問題として捉えている点で、重要な研究シグナルだ。これはAIスタックの一部を簡素化し、知覚と応答を結び付けるシステムを作りやすくする可能性がある。
しかし、この発表は、1つのモデルが慎重に設計された専門モデル群より優れていることをまだ証明していない。独立評価と実際のロボットによる結果が得られるまでは、開発者はRho-1を有望な範囲を持つアーキテクチャ実験として扱うべきであり、本番用のマルチモーダルまたはロボティクスシステムに対する検証済みの代替品とみなすべきではない。