O Rho-1 da Reka AI combina texto, imagens, vídeo e controle de robôs em um modelo de pesquisa de 19 bilhões de parâmetros, sinalizando um avanço rumo a sistemas de IA unificados.

A Reka AI lançou uma prévia de pesquisa do Rho-1, um modelo de 19 bilhões de parâmetros projetado para processar e gerar texto, imagens, vídeo e ações de controle robótico dentro de uma única rede neural. O lançamento é importante porque busca uma arquitetura comum para capacidades que normalmente são divididas entre modelos de linguagem, sistemas de visão, geradores de vídeo e políticas de robótica.
Segundo uma reportagem do The Decoder, o Rho-1 trata diferentes mídias e ações como tokens em uma janela de contexto compartilhada, em vez de encaminhar tarefas para modelos separados por meio de chamadas de ferramentas. A Reka afirma que o sistema pode gerar vídeo contínuo em tempo real e responder a novas instruções enquanto uma cena se desenrola, sem reiniciar o processo de geração.
O anúncio coloca a Reka AI entre os pesquisadores que investigam se um único modelo pode servir como uma interface mais geral para percepção, geração e ação. Ainda assim, trata-se de uma prévia de pesquisa, e as evidências disponíveis não estabelecem como o Rho-1 se compara aos principais modelos comerciais ou a sistemas robóticos do mundo real.
A maioria das pilhas de IA em produção divide o trabalho multimodal em componentes. Um modelo de linguagem pode interpretar uma solicitação do usuário, um modelo de visão pode examinar uma imagem, um modelo de vídeo pode gerar quadros e uma política separada pode traduzir observações em movimentos físicos. Esses componentes podem ser conectados, mas cada transferência acrescenta complexidade de engenharia, latência e possíveis pontos de falha.
O Rho-1 pretende evitar essa organização. Segundo os relatos, o modelo representa texto, imagens, vídeo e ações robóticas em uma única sequência compartilhada. Em princípio, o mesmo contexto pode conter uma instrução, observações visuais, quadros gerados e saídas de ação, permitindo que o sistema conecte o que vê ao que deve fazer.
A abordagem também dá ao Rho-1 uma relação direta entre previsão visual e controle. O The Decoder informa que os mesmos pesos usados para prever imagens de câmeras também conduzem os movimentos do robô. Isso não significa que o modelo esteja pronto para uma ampla implantação em ambientes físicos, mas reflete uma direção de pesquisa em que previsão de vídeo e planejamento de ações são treinados juntos, em vez de tratados como problemas não relacionados.
Segundo o relato do The Decoder sobre o lançamento, o modelo foi treinado em 320 GPUs H100 durante aproximadamente três meses. A Reka AI também desenvolveu um modelo de dinâmica inversa para lidar com um problema central da robótica: dados de alta qualidade para controle robótico são escassos em comparação com vídeos comuns da internet.
A dinâmica inversa geralmente tenta inferir a ação que produziu uma mudança observada em uma cena. Na abordagem divulgada pela Reka, essa capacidade é usada para extrair possíveis sinais de controle de vídeos que não mostram robôs. Isso poderia ampliar a quantidade de material de treinamento disponível para um sistema que precisa aprender como as ações afetam o mundo, embora vídeos da internet não ofereçam a mesma confiabilidade, incorporação física ou riqueza de dados de sensores que demonstrações coletadas de um robô específico.
A exigência computacional relatada é notável porque o Rho-1 tem 19 bilhões de parâmetros, substancialmente menos que muitos sistemas de fronteira frequentemente discutidos no mercado. Ainda assim, 320 GPUs H100 usadas durante três meses representam um investimento significativo em treinamento. Portanto, o número deve ser interpretado como uma descrição da execução de pesquisa, não como evidência de que o modelo seja barato de treinar ou operar em todos os cenários de implantação.
Os detalhes mais sólidos disponíveis neste relatório vêm da cobertura do The Decoder sobre a prévia de pesquisa da Reka AI. O MarkTechPost descreveu separadamente o Rho-1 como um modelo de raciocínio omni de 19 bilhões de parâmetros que entende e gera vídeo enquanto produz ações robóticas, mas o material fornecido pelo MarkTechPost não inclui o artigo completo nem resultados de testes independentes.
As evidências disponíveis não fornecem pontuações de benchmark, termos de acesso ao modelo, medições de latência, avaliações de segurança ou demonstrações que possam ser avaliadas independentemente aqui. Portanto, as alegações sobre geração de vídeo em tempo real, respostas adaptativas e a relação entre previsão visual e movimento robótico devem ser tratadas como capacidades reportadas pela empresa ou pelas fontes, não como resultados de desempenho estabelecidos.
Essa distinção é importante para desenvolvedores e compradores. Um modelo unificado pode reduzir a necessidade de manter várias interfaces, mas também pode dificultar o isolamento de falhas. Um sistema que produz linguagem fluente e vídeo convincente ainda pode tomar decisões inseguras ou fisicamente incorretas quando solicitado a controlar equipamentos. O status de prévia de pesquisa do Rho-1 deixa em aberto questões sobre confiabilidade, metodologia de avaliação e acesso ao modelo e aos seus pesos.
A Reka AI já havia trabalhado em sistemas multimodais. A empresa lançou o Reka Core em abril de 2024, posicionando-o como concorrente de GPT-4, Claude 3 e Gemini Ultra em avaliações de benchmark. O Rho-1 amplia essa direção para além da compreensão multimodal, chegando à geração de vídeo e à ação incorporada.
Para as equipes de produto, o principal significado do Rho-1 é arquitetural. Se um modelo puder manter uma representação compartilhada de linguagem, conteúdo visual, mudanças temporais e ações, os desenvolvedores poderão criar aplicações em torno de uma única superfície de inferência, em vez de coordenar vários serviços especializados. Os possíveis casos de uso incluem assistentes de vídeo interativos, ambientes de simulação, agentes visuais e ferramentas de pesquisa em robótica.
A desvantagem é a concentração de riscos. Sistemas especializados podem ser substituídos ou ajustados de forma independente, enquanto um modelo unificado pode exigir novo treinamento ou uma avaliação mais ampla quando uma modalidade apresentar desempenho inferior. Um modelo forte em texto, mas fraco em raciocínio temporal, por exemplo, pode produzir explicações plausíveis e ainda assim não acompanhar uma cena física em mudança.
As empresas que considerarem esses sistemas também precisarão analisar infraestrutura e governança. A geração contínua de vídeo pode criar grandes demandas de largura de banda e armazenamento. Saídas de controle robótico exigem limites rígidos de segurança, monitoramento e uma política de fallback capaz de substituir o modelo. Em implantações regulamentadas ou sensíveis à segurança, a capacidade de explicar quais evidências visuais levaram a uma ação pode ser tão importante quanto o desempenho geral do modelo em benchmarks.
O debate de pesquisa mais amplo envolve modelos de mundo: sistemas destinados a representar como os ambientes mudam e como as ações os afetam. O Rho-1 se encaixa nessa agenda ao combinar previsão visual com geração de ações, mas um fluxo unificado de tokens, por si só, não prova que o modelo tenha um modelo físico confiável do mundo. Planejamento de longo prazo, condições incomuns e transferência entre robôs diferentes continuam sendo testes difíceis.
O primeiro sinal será saber se a Reka AI publicará avaliações reproduzíveis de cada capacidade separadamente e em conjunto. Resultados úteis incluiriam qualidade e consistência temporal do vídeo, seguimento de instruções em cenas em mudança e taxas de sucesso do controle robótico em tarefas claramente definidas.
O acesso será outro indicador importante. Se o Rho-1 ficar disponível para pesquisadores externos, testes independentes poderão esclarecer se sua arquitetura unificada oferece vantagens práticas sobre pipelines construídos com modelos especializados. Detalhes sobre hardware de inferência, tamanho do contexto, licenciamento e latência determinarão se o sistema é útil além das demonstrações.
Na robótica, o acompanhamento mais importante será a evidência obtida com hardware real, não com vídeos da internet ou resultados de simulação. Os pesquisadores precisarão testar segurança, recuperação de eventos inesperados, desempenho em diferentes configurações físicas e o efeito de entradas ruidosas de câmeras e sensores.
Por fim, o mercado observará se a abordagem da Reka permanecerá como uma prévia de pesquisa ou se tornará uma plataforma de produto. A resposta mostrará se os modelos omni podem passar de uma arquitetura atraente a ferramentas confiáveis para agentes de IA, aplicações de vídeo e automação física.
O Rho-1 é um sinal de pesquisa relevante porque apresenta a multimodalidade como um problema de modelagem compartilhada que inclui ação, e não apenas texto, imagens e vídeo. Isso poderia simplificar partes da pilha de IA e facilitar a criação de sistemas que conectem percepção e resposta.
Mas o anúncio ainda não prova que um único modelo seja melhor que uma coleção cuidadosamente projetada de especialistas. Até que avaliações independentes e resultados com robôs reais estejam disponíveis, os desenvolvedores devem tratar o Rho-1 como um experimento arquitetural de escopo promissor — não como um substituto validado para sistemas multimodais ou robóticos de produção.