Danijar Hafner entwickelt Weltmodell-Agenten für Roboter, die Ergebnisse vorhersagen und sich an unbekannte Häuser, Objekte und Umgebungen anpassen können.

Ein neues Startup unter der Leitung des ehemaligen Google-DeepMind-Forschers Danijar Hafner entwickelt KI-Agenten, die darauf ausgelegt sind, vorauszusehen, was in Umgebungen geschehen könnte, die sie noch nie zuvor gesehen haben, so ein Profilbericht von MIT Technology Review. Das Unternehmen befindet sich weiterhin im Stealth-Modus, hat seinen Namen oder sein Produkt nicht öffentlich bekannt gegeben und arbeitet aus einem spärlich eingerichteten Büro in San Francisco, in dem humanoide Roboter stehen.
Die Arbeit knüpft an Hafners langjährige Forschung zu Agenten an, die in simulierten Umgebungen lernen, bevor sie in der realen Welt handeln. Ihre unmittelbare Bedeutung ist nicht ein kommerzieller Start, sondern eine technische Richtung: mithilfe interner Modelle der Realität Robotern zu ermöglichen, vorausschauend zu planen, statt sich nach dem Einsatz primär auf Versuch und Irrtum zu verlassen.
Hafner verließ Google DeepMind, um das Startup im Herbst 2025 zu gründen. Er hat nur wenige operative Details preisgegeben, darunter den Namen des Unternehmens, die Finanzierung, geplante Kunden oder den Zeitplan für den Start. MIT Technology Review berichtete, dass das Büro über aus China bezogene humanoide Roboter verfügt, was darauf hindeutet, dass physische Robotik im Zentrum der aktuellen Arbeit des Unternehmens steht, auch wenn der Bericht kein konkretes Produkt oder Ziel für den Einsatz benennt.
Die technische Grundlage ist modellbasiertes Reinforcement Learning. Bei diesem Ansatz lernt ein Agent ein Modell seiner Umgebung und nutzt dieses Modell, um die Folgen möglicher Handlungen vorherzusagen. Anstatt in einer physischen Umgebung wiederholt jede Aktion zu testen, kann der Agent imaginierte Ergebnisse bewerten und auf Grundlage dieser Vorhersagen einen Handlungsweg auswählen.
Für einen Roboter in einem Haus könnte das bedeuten, sich an einen Grundriss, die Anordnung von Möbeln oder eine unerwartete Unterbrechung anzupassen, die in seinen Trainingsdaten nicht vorkam. Das Konzept ist besonders relevant für Serviceroboter, bei denen Umgebungen variabel sind und Fehler Eigentum beschädigen oder Sicherheitsrisiken verursachen können.
Hafners Forschungsbilanz liefert den klarsten öffentlichen Beleg für diesen Ansatz. Sein PlaNet-System nutzte ein gelerntes Modell zur Unterstützung der Vorwärtsplanung. Spätere Arbeiten an der Dreamer-Familie von Agenten wandten dieselbe grundlegende Idee auf zunehmend schwierigere Aufgaben in simulierten Umgebungen an.
Laut MIT Technology Review erreichte Dreamer 2 mithilfe eines Weltmodells eine Leistung auf menschlichem Niveau bei Atari-2600-Spielen, während Dreamer 3 die Minecraft-Diamond-Herausforderung löste, indem es lernte, die In-Game-Ressource abzubauen. Dreamer 4 ging Berichten zufolge noch weiter, indem es aus aufgezeichneten Spieldaten lernte, ohne während des Trainings direkt mit dem Spiel zu interagieren.
Diese Ergebnisse sind wichtig, weil sie zeigen, wie Planung den Umfang direkter Interaktion während des Lernens verringern kann. Erfolg in Spielen beweist jedoch für sich genommen keine verlässliche Leistung in Häusern, Fabriken, Lagerhallen oder öffentlichen Räumen. Spiele bieten klar definierte Regeln und messbare Ziele; die physische Welt ist weniger vorhersehbar, schwerer exakt zu simulieren und hat gravierendere Folgen, wenn eine Handlung fehlschlägt.
Hafners DayDreamer-Projekt stellt die Brücke zur Robotik dar. Das Projekt nutzte den Dreamer-Ansatz, um Robotern zu helfen, in unbekannten Umgebungen zu arbeiten und auf neue Erfahrungen zu reagieren, einschließlich des Umstoßens. Das Startup scheint eine ehrgeizigere Version dieses Übergangs mit humanoiden Maschinen als physischer Plattform zu verfolgen.
Die stärksten verfügbaren Belege sind Hafners veröffentlichte Forschungsgeschichte und die Beschreibung seiner aktuellen Laborumgebung. Die Aussagen über PlaNet, Dreamer und DayDreamer werden von MIT Technology Review im Kontext von Hafners früherer Arbeit berichtet. Sie beschreiben Forschungsleistungen und Demonstrationen, nicht unabhängig verifizierte kommerzielle Fähigkeiten des neuen Startups.
Es gibt außerdem in den vorliegenden Berichten keine öffentlichen Belege für Kundeneinsätze, Produktionsverträge, Umsatz, Sicherheitszertifizierungen oder Vergleichstests mit anderen Robotersystemen. Hafners ehemaliger Google-Kollege Timothy Lillicrap lobte ihn als außergewöhnlichen Forscher, doch diese Einschätzung ist eine persönliche Empfehlung und kein Leistungsmaßstab.
Diese Unterscheidung ist für Käufer und Entwickler wichtig. Ein Modell, das Spielzustände vorhersagt oder sich an ein kontrolliertes Robotik-Experiment anpasst, muss erst noch beweisen, dass seine Vorhersagen auch dann genau bleiben, wenn Sensoren verrauscht sind, Objekte sich unerwartet bewegen und die Kosten einer Fehlentscheidung hoch sind. Der Stealth-Status des Startups macht es unmöglich, diese Fragen heute zu beurteilen.
Wenn Hafners Systeme außerhalb streng kontrollierter Demonstrationen funktionieren, könnten sie einen der zentralen Engpässe der Robotik angehen: die Kosten und Schwierigkeiten, ausreichend reale Erfahrungen zu sammeln. Roboter durch wiederholte physische Fehler zu trainieren ist langsam, teuer und potenziell unsicher. Das Planen in einer erlernten Umgebung könnte die Zahl der physischen Versuche vor dem Einsatz verringern.
Für Produktteams wird die praktische Prüfung sein, ob der Agent Wissen zwischen verschiedenen Umgebungen übertragen kann, ohne umfangreiches Retraining. Ein Lagerbetreiber bräuchte beispielsweise einen Roboter, der mit wechselnden Layouts und unbekannten Paketen umgehen kann. Ein Haushaltsroboter müsste zwischen neuartigen, harmlosen Situationen und solchen unterscheiden, die ein Anhalten oder das Bitten um Hilfe erfordern.
Das schafft zusätzliche Anforderungen über die Vorhersage hinaus. Unternehmen werden Transparenz darüber benötigen, wie das Weltmodell aufgebaut wurde, wie Unsicherheit dargestellt wird und wann der Roboter auf ein sicheres Verhalten zurückfällt. Sie werden außerdem Werkzeuge brauchen, um seltene Ereignisse zu bewerten, das System nach dem Einsatz zu aktualisieren und echte Anpassungsfähigkeit von unsicherem Improvisieren zu unterscheiden.
Die Arbeit könnte auch den Wettbewerb zwischen zwei breiten Strategien in der verkörperten KI verschärfen: größere Modelle, die auf mehr Demonstrationen trainiert werden, und stärker strukturierte Agenten, die lernen zu simulieren und zu planen. Die beiden Ansätze schließen sich nicht aus, aber Hafners Forschung spricht dafür, dass bessere innere Vorhersage ebenso wichtig sein könnte wie mehr Trainingsdaten.
Das erste Signal wird sein, ob das Startup seine Identität offenlegt und sein erstes Produkt oder Forschungsziel erklärt. Investoren, Partner und potenzielle Kunden werden ebenfalls nach Beweisen suchen, dass die humanoiden Roboter für mehr als Laborversuche eingesetzt werden.
Technische Offenlegungen werden wichtiger sein als allgemeine Behauptungen. Nützliche Details wären die für die Bewertung verwendeten Umgebungen, die Menge an realen Daten, die erforderlich ist, wie sich die Leistung in unbekannten Umgebungen verändert und wie sich das System verhält, wenn seine Vorhersagen unsicher sind. Unabhängige Tests zu Manipulation, Navigation, Erholung nach Stürzen und sicherheitskritischen Unterbrechungen würden stärkere Belege liefern als reine Spiel-Benchmarks.
Schließlich wird die Wahl des Geschäftsmodells die Ambition des Unternehmens klarer machen. Eine Robotikplattform, ein lizenzierter Kontrollsystem-Stack und ein vertikal integriertes Roboterprodukt würden jeweils unterschiedliche Anforderungen an Hardwarezuverlässigkeit, Einsatzunterstützung und Unternehmensökonomie implizieren.
Hafners neues Vorhaben ist bemerkenswert, weil es eine spezifische Schwäche aktueller KI-Systeme adressiert: die Unfähigkeit, zuverlässig zu handeln, wenn die Bedingungen von der Trainingssituation abweichen. Der Einsatz von Weltmodellen und modellbasiertem Reinforcement Learning bietet einen plausiblen Weg zu überlegterem Verhalten, doch die Lücke zwischen virtuellem Erfolg und zuverlässigem physischen Betrieb bleibt erheblich.
Für den Moment ist dies ein forschungsgetriebenes Unternehmen, das man beobachten sollte, und kein validierter Robotiklieferant. Die entscheidende Frage wird sein, ob Hafner vorausschauende Planung in messbare Verbesserungen in realen Umgebungen umsetzen kann — weniger Trainingsversuche, sicherere Erholung nach Überraschungen und konstante Leistung ohne kundenspezifische Entwicklung für jeden neuen Standort.