Reka AIs Rho-1 vereint Text, Video und Robotersteuerung in einem 19-Milliarden-Parameter-Modell

Reka AIs Rho-1 kombiniert Text, Bilder, Video und Robotersteuerung in einem 19-Milliarden-Parameter-Forschungsmodell und signalisiert damit den Vorstoß zu vereinheitlichten KI-Systemen.

AI News

Reka AI hat eine Forschungsvorschau von Rho-1 veröffentlicht, einem Modell mit 19 Milliarden Parametern, das Text, Bilder, Video und Robotersteuerungsaktionen innerhalb eines einzigen neuronalen Netzes verarbeiten und erzeugen soll. Die Veröffentlichung ist relevant, weil sie auf eine gemeinsame Architektur für Fähigkeiten abzielt, die normalerweise auf Sprachmodelle, Bildverarbeitungssysteme, Videogeneratoren und Robotik-Policies verteilt sind.

Laut einem Bericht von The Decoder behandelt Rho-1 verschiedene Medien und Aktionen als Tokens in einem gemeinsamen Kontextfenster, statt Aufgaben über Tool-Aufrufe an separate Modelle zu übergeben. Reka zufolge kann das System kontinuierliches Video in Echtzeit erzeugen und auf neue Anweisungen reagieren, während sich eine Szene entwickelt, ohne den Generierungsprozess neu zu starten.

Die Ankündigung positioniert Reka AI unter den Forschern, die untersuchen, ob ein einzelnes Modell als allgemeinere Schnittstelle für Wahrnehmung, Generierung und Handlung dienen kann. Es handelt sich jedoch weiterhin um eine Forschungsvorschau, und die verfügbaren Belege zeigen nicht, wie Rho-1 im Vergleich zu führenden kommerziellen Modellen oder realen Robotersystemen abschneidet.

Ein Modell für Wahrnehmung, Generierung und Handlung

Die meisten produktiven KI-Stacks teilen multimodale Arbeit in Komponenten auf. Ein Sprachmodell kann eine Nutzeranfrage interpretieren, ein Bildmodell ein Bild untersuchen, ein Videomodell Einzelbilder erzeugen und eine separate Policy Beobachtungen in physische Bewegungen übersetzen. Diese Komponenten können verbunden werden, doch jede Übergabe erhöht die technische Komplexität, die Latenz und die Zahl potenzieller Fehlerquellen.

Rho-1 soll diese Anordnung vermeiden. Das Modell stellt Berichten zufolge Text, Bilder, Video und Roboteraktionen in einer gemeinsamen Sequenz dar. Im Prinzip kann derselbe Kontext eine Anweisung, visuelle Beobachtungen, erzeugte Bilder und Aktionsausgaben enthalten, sodass das System verbinden kann, was es sieht, mit dem, was es tun soll.

Der Ansatz gibt Rho-1 außerdem eine direkte Verbindung zwischen visueller Vorhersage und Steuerung. The Decoder berichtet, dass dieselben Gewichte, die Kamerabilder vorhersagen, auch Roboterbewegungen steuern. Das bedeutet nicht, dass das Modell bereits für den breiten Einsatz in physischen Umgebungen bereit ist, spiegelt aber eine Forschungsrichtung wider, in der Videovorhersage und Aktionsplanung gemeinsam trainiert werden, statt als voneinander unabhängige Probleme zu gelten.

Wie Reka Rho-1 trainiert hat

Das Modell wurde laut The Decoders Darstellung der Veröffentlichung über etwa drei Monate auf 320 H100-GPUs trainiert. Reka AI entwickelte außerdem ein inverses Dynamikmodell, um ein zentrales Robotikproblem anzugehen: Hochwertige Daten zur Robotersteuerung sind im Vergleich zu gewöhnlichen Internetvideos knapp.

Inverse Dynamik versucht im Allgemeinen, die Aktion zu erschließen, die eine beobachtete Veränderung in einer Szene verursacht hat. In Rekas beschriebenem Ansatz wird diese Fähigkeit genutzt, um aus Videos ohne Roboter mögliche Steuersignale zu extrahieren. Dadurch könnte sich die Menge des Trainingsmaterials für ein System vergrößern, das lernen muss, wie Aktionen die Welt beeinflussen. Internetvideos bieten jedoch nicht dieselbe Zuverlässigkeit, Verkörperung oder Sensordetailtiefe wie Demonstrationen, die mit einem bestimmten Roboter aufgezeichnet wurden.

Der angegebene Rechenaufwand ist bemerkenswert, weil Rho-1 19 Milliarden Parameter besitzt und damit deutlich kleiner ist als viele häufig diskutierte Frontier-Systeme. Dennoch stellen 320 H100-GPUs über drei Monate eine erhebliche Trainingsinvestition dar. Die Zahl sollte daher als Beschreibung dieses Forschungsdurchlaufs verstanden werden, nicht als Beleg dafür, dass das Modell in jedem Einsatzszenario kostengünstig zu trainieren oder zu betreiben ist.

Belege hinter der Ankündigung

Die stärksten in diesem Bericht verfügbaren Details stammen aus The Decoders Berichterstattung über Rekas Forschungsvorschau. MarkTechPost beschrieb Rho-1 separat als ein Modell für „Omni-Reasoning“ mit 19 Milliarden Parametern, das Video versteht und erzeugt und zugleich Roboteraktionen produziert. Das bereitgestellte Material von MarkTechPost enthält jedoch weder den vollständigen Artikel noch unabhängige Testergebnisse.

Die verfügbaren Belege enthalten keine Benchmarkwerte, Angaben zu Modellzugang, Latenzmessungen, Sicherheitsbewertungen oder unabhängig überprüfbare Demonstrationen. Behauptungen über Echtzeit-Videogenerierung, adaptive Reaktionen und die Verbindung zwischen visueller Vorhersage und Roboterbewegung sollten daher als vom Unternehmen oder von Quellen berichtete Fähigkeiten verstanden werden, nicht als endgültig belegte Leistungswerte.

Diese Unterscheidung ist für Entwickler und Käufer wichtig. Ein einheitliches Modell kann den Bedarf an mehreren Schnittstellen verringern, aber es kann auch schwieriger machen, Fehler zu isolieren. Ein System, das flüssige Sprache und überzeugende Videos erzeugt, kann dennoch unsichere oder physisch falsche Entscheidungen treffen, wenn es Geräte steuern soll. Der Status von Rho-1 als Forschungsvorschau lässt Fragen zu Zuverlässigkeit, Bewertungsmethodik sowie zum Zugang zu Modell und Gewichten offen.

Reka AI hat bereits zuvor an multimodalen Systemen gearbeitet. Das Unternehmen veröffentlichte im April 2024 Reka Core und positionierte es in Benchmark-Evaluierungen als Konkurrenten von GPT-4, Claude 3 und Gemini Ultra. Rho-1 führt diese Richtung über multimodales Verständnis hinaus zu Videogenerierung und verkörperter Handlung weiter.

Warum die Architektur für KI-Teams wichtig ist

Für Produktteams liegt die wichtigste Bedeutung von Rho-1 in der Architektur. Wenn ein Modell eine gemeinsame Repräsentation von Sprache, visuellen Inhalten, zeitlichen Veränderungen und Aktionen aufrechterhalten kann, könnten Entwickler Anwendungen auf einer einzigen Inferenzschnittstelle aufbauen, statt mehrere spezialisierte Dienste zu koordinieren. Mögliche Einsatzbereiche sind interaktive Videoassistenten, Simulationsumgebungen, visuelle Agenten und Forschungswerkzeuge für Robotik.

Der Nachteil ist die Konzentration von Risiken. Spezialisierte Systeme können unabhängig ersetzt oder angepasst werden, während ein einheitliches Modell bei schlechter Leistung in einer Modalität möglicherweise neu trainiert oder umfassender evaluiert werden muss. Ein Modell, das bei Text stark, bei zeitlichem Schlussfolgern aber schwach ist, könnte beispielsweise plausible Erklärungen liefern und dennoch eine sich verändernde physische Szene nicht verfolgen.

Unternehmen, die solche Systeme erwägen, müssen außerdem Infrastruktur und Governance prüfen. Kontinuierliche Videogenerierung kann hohe Anforderungen an Bandbreite und Speicher erzeugen. Ausgaben zur Robotersteuerung erfordern harte Sicherheitsgrenzen, Überwachung und eine Fallback-Policy, die das Modell überstimmen kann. Bei regulierten oder sicherheitskritischen Anwendungen kann die Fähigkeit zu erklären, welche visuellen Belege zu einer Aktion geführt haben, ebenso wichtig sein wie die allgemeine Benchmark-Leistung des Modells.

Die umfassendere Forschungsdebatte betrifft Weltmodelle: Systeme, die darstellen sollen, wie sich Umgebungen verändern und wie Aktionen sie beeinflussen. Rho-1 passt zu diesem Ziel, indem es visuelle Vorhersage mit Aktionsgenerierung verbindet. Ein einheitlicher Token-Strom allein beweist jedoch nicht, dass das Modell über ein verlässliches physisches Weltmodell verfügt. Langfristige Planung, ungewöhnliche Bedingungen und der Transfer zwischen verschiedenen Robotern bleiben schwierige Prüfungen.

Worauf als Nächstes zu achten ist

Das erste Signal wird sein, ob Reka AI reproduzierbare Evaluierungen für jede Fähigkeit einzeln und in Kombination veröffentlicht. Aussagekräftige Ergebnisse würden Videoqualität und zeitliche Konsistenz, Befolgung von Anweisungen bei sich verändernden Szenen sowie Erfolgsraten der Robotersteuerung bei klar definierten Aufgaben umfassen.

Der Zugang wird ein weiterer wichtiger Indikator sein. Falls Rho-1 externen Forschern zugänglich wird, könnten unabhängige Tests klären, ob die einheitliche Architektur praktische Vorteile gegenüber Pipelines aus spezialisierten Modellen bietet. Details zu Inferenzhardware, Kontextlänge, Lizenzierung und Latenz werden bestimmen, ob das System über Demonstrationen hinaus nützlich ist.

Für die Robotik werden Nachweise von echter Hardware statt aus Internetvideos oder Simulationen besonders wichtig sein. Forscher müssen Sicherheit, Erholung von unerwarteten Ereignissen, Leistung über verschiedene Verkörperungen hinweg und den Einfluss verrauschter Kamera- und Sensordaten testen.

Schließlich wird der Markt beobachten, ob Rekas Ansatz eine Forschungsvorschau bleibt oder zu einer Produktplattform wird. Die Antwort wird zeigen, ob Omni-Modelle von einer attraktiven Architektur zu zuverlässigen Werkzeugen für KI-Agenten, Videoanwendungen und physische Automatisierung werden können.

Creati.ai-Perspektive

Rho-1 ist ein bedeutsames Forschungssignal, weil es Multimodalität als gemeinsames Modellierungsproblem auffasst, das auch Handlungen und nicht nur Text, Bilder und Video umfasst. Das könnte Teile des KI-Stacks vereinfachen und den Bau von Systemen erleichtern, die Wahrnehmung mit Reaktion verbinden.

Die Ankündigung ist jedoch noch kein Beleg dafür, dass ein Modell besser ist als eine sorgfältig entwickelte Sammlung spezialisierter Modelle. Solange unabhängige Evaluierungen und Ergebnisse mit echten Robotern fehlen, sollten Entwickler Rho-1 als Architektur-Experiment mit vielversprechendem Umfang betrachten – nicht als validierten Ersatz für produktive multimodale oder robotische Systeme.

Anzeigen