ダニヤル・ハフナー、未知の環境を計画するステルスAIエージェントを開発中

ダニヤル・ハフナーは、結果を予測し、見知らぬ家、物体、環境に適応できるロボット向けの世界モデル・エージェントを開発している。

AI News

元Google DeepMind研究者のダニヤル・ハフナー氏が率いる新しいスタートアップが、これまで見たことのない環境で何が起こるかを予測するよう設計されたAIエージェントを開発していると、MIT Technology Reviewのプロフィール記事は伝えている。同社は依然としてステルスモードで、会社名や製品を公表しておらず、人型ロボットが置かれた簡素なサンフランシスコのオフィスから運営されている。

この取り組みは、シミュレーション環境の中で学習してから現実世界で行動するエージェントに関するハフナー氏の長年の研究を拡張するものだ。その直接的な意義は商業ローンチではなく、技術的な方向性にある。つまり、現実の内部モデルを使って、ロボットが展開後の試行錯誤に主に頼るのではなく、先を見越して計画できるようにすることだ。

世界モデルを中心に据えたステルス・スタートアップ

ハフナー氏は2025年秋にGoogle DeepMindを離れ、このスタートアップを立ち上げた。会社名、資金調達、想定顧客、ローンチ時期など、運営に関する詳細はほとんど明かしていない。MIT Technology Reviewは、オフィスには中国製の人型ロボットが置かれていると報じており、物理ロボティクスが現在の事業の中心であることを示唆しているが、記事は具体的な製品や導入先を特定していない。

技術的基盤はモデルベース強化学習だ。このアプローチでは、エージェントは周囲の環境のモデルを学習し、そのモデルを使って可能な行動の結果を予測する。物理環境であらゆる行動を繰り返し試すのではなく、想定される結果を評価し、その予測に基づいて行動方針を選べる。

家庭内で動作するロボットにとっては、間取りや家具の配置、あるいは学習データにはなかった予期せぬ中断に適応することを意味しうる。この考え方は、環境が変化しやすく、誤りが財産損害や安全リスクにつながるサービスロボットにとくに重要だ。

ゲーム世界から物理ロボットへ

ハフナー氏の研究実績は、このアプローチの最も明確な公開証拠を提供している。彼のPlaNetシステムは、学習したモデルを使って先読み計画を支援した。後のDreamer系エージェントの研究では、同じ基本的な考え方が、シミュレーション環境でより難しい課題へと適用された。

MIT Technology Reviewによると、Dreamer 2は世界モデルを用いてAtari 2600のゲームで人間レベルの性能に到達し、Dreamer 3はゲーム内資源を採掘することを学ぶことでMinecraft Diamondチャレンジを解いた。Dreamer 4は、訓練中にゲームへ直接関与することなく、記録されたゲームプレイデータから学習したことで、さらに先へ進んだと報じられている。

これらの結果が重要なのは、計画によって学習中に必要な直接的な相互作用の量を減らせることを示しているからだ。しかし、ゲームでの成功だけでは、家庭、工場、倉庫、公共空間で信頼できる性能を示したことにはならない。ゲームには明確なルールと測定可能な目標があるが、物理世界は予測しにくく、正確にシミュレートするのが難しく、行動が失敗したときの影響も大きい。

ハフナー氏のDayDreamerプロジェクトは、ロボティクスへの橋渡しとなるものだ。このプロジェクトはDreamerアプローチを使い、ロボットが未知の環境で動作し、押し倒されることを含む新しい経験に対応できるようにした。スタートアップは、人型マシンを物理プラットフォームとして、より野心的なこの移行版を追求しているようだ。

何が示されているのか、そして何が示されていないのか

入手可能な最も強い証拠は、ハフナー氏の公開された研究履歴と、彼の現在の研究環境に関する説明だ。PlaNet、Dreamer、DayDreamerに関する主張は、MIT Technology Reviewがハフナー氏の過去の仕事の文脈で報じたものだ。これらは研究成果とデモンストレーションを示すものであり、新しいスタートアップの商業的能力を独立に検証したものではない。

また、提供された報道には、顧客導入、製造契約、収益、安全認証、他のロボティクスシステムとの比較試験に関する公開証拠もない。ハフナー氏の元Google同僚ティモシー・リリクラップ氏は彼を卓越した研究者と称賛したが、それは個人的な推薦であり、性能ベンチマークではない。

この区別は、購入者や開発者にとって重要だ。ゲーム状態を予測したり、制御されたロボット実験に適応したりするモデルは、センサーにノイズがあり、物体が予想外に動き、誤った判断のコストが高い状況でも予測が正確であり続けることを示さなければならない。スタートアップがステルス状態であるため、今日その問いを評価することはできない。

なぜこのアプローチが開発者と企業にとって重要なのか

ハフナー氏のシステムが厳密に管理されたデモを超えて機能するなら、ロボティクスの中心的なボトルネックの一つ、つまり十分な実世界経験を集めるコストと難しさに対処できるかもしれない。物理的な失敗を繰り返してロボットを訓練するのは遅く、高くつき、潜在的に危険だ。学習した環境内で計画することができれば、導入前に必要な物理試行回数を減らせる可能性がある。

プロダクトチームにとっての実践的な試金石は、広範な再学習なしに、エージェントが異なる設定間で知識を転移できるかどうかだ。たとえば倉庫運営者は、レイアウトの変化や未知の荷物を扱えるロボットを必要とするだろう。家庭用ロボットは、無害な新規状況と、停止したり助けを求めたりする必要がある状況を見分けなければならない。

それは予測を超えた追加要件を生む。企業は、世界モデルがどのように構築されたのか、不確実性がどう表現されているのか、そしてロボットがいつ安全な行動に切り替えるのかを把握する必要がある。また、まれな事象を評価し、導入後にシステムを更新し、真の適応と安全でない即興を区別するためのツールも必要になる。

この研究は、具現化AIにおける2つの広い戦略、すなわち、より多くのデモンストレーションで訓練された大規模モデルと、シミュレーションと計画を学習するより構造化されたエージェントとの競争を激化させる可能性もある。両者は排他的ではないが、ハフナー氏の研究は、より良い内部予測がより多くの訓練データと同じくらい重要になりうることを示している。

次に注目すべきこと

最初のシグナルは、スタートアップが自社を明らかにし、初期製品や研究目標を説明するかどうかだ。投資家、パートナー、潜在顧客もまた、人型ロボットが研究室での実験以上に使われている証拠を求めるだろう。

技術的な開示は、漠然とした主張よりも重要になる。役立つ詳細には、評価に使われた環境、必要とされた実世界データの量、未知の状況で性能がどう変化するか、予測が不確かなときのシステムの挙動などが含まれる。操作、ナビゲーション、転倒からの回復、安全性が重要な中断に関する独立テストは、ゲームベンチマークだけよりも強い証拠となる。

最後に、同社のビジネスモデルの選択がその野心を明確にするだろう。ロボティクス・プラットフォーム、ライセンスされた制御システム、垂直統合型のロボット製品は、それぞれハードウェアの信頼性、導入サポート、企業向け経済性に異なる要件を示唆する。

Creati.aiの視点

ハフナー氏の新事業が注目に値するのは、現在のAIシステムの特定の弱点、つまり訓練時と条件が異なるときに信頼性高く行動できないことを狙っているからだ。世界モデルとモデルベース強化学習の活用は、より熟慮された行動へのもっともらしい道筋を示しているが、仮想での成果と信頼できる物理運用との間のギャップは依然として大きい。

現時点では、これは検証済みのロボティクス供給企業ではなく、研究主導の企業として注目すべき存在だ。決定的な問いは、ハフナー氏が予測的計画を現実環境で測定可能な改善、つまり訓練試行の削減、予期せぬ事態からのより安全な復帰、そして新しい場所ごとに個別のエンジニアリングを必要としない一貫した性能へと変えられるかどうかである。

広告