Reka AI의 Rho-1은 텍스트, 이미지, 비디오, 로봇 제어를 하나의 190억 매개변수 연구 모델에 결합하며 통합 AI 시스템을 향한 움직임을 보여준다.

Reka AI가 하나의 신경망 안에서 텍스트, 이미지, 비디오, 로봇 제어 동작을 처리하고 생성하도록 설계된 190억 매개변수 모델 Rho-1의 연구 프리뷰를 공개했다. 이번 공개가 중요한 이유는 일반적으로 언어 모델, 비전 시스템, 비디오 생성기, 로보틱스 정책으로 나뉘는 기능을 위한 공통 아키텍처를 겨냥하기 때문이다.
The Decoder의 보도에 따르면 Rho-1은 서로 다른 미디어와 동작을 공유 컨텍스트 창의 토큰으로 취급하며, 툴 호출을 통해 별도 모델에 작업을 넘기지 않는다. Reka는 이 시스템이 실시간으로 연속 비디오를 생성하고, 장면이 진행되는 동안 새로운 지시에 응답할 수 있으며, 생성 과정을 다시 시작할 필요가 없다고 밝혔다.
이번 발표로 Reka AI는 하나의 모델이 인식, 생성, 행동을 위한 더 범용적인 인터페이스가 될 수 있는지 탐구하는 연구자 대열에 합류했다. 그러나 여전히 연구 프리뷰 단계이며, 현재 이용 가능한 증거만으로는 Rho-1이 상용 선도 모델이나 실제 로봇 시스템과 비교해 어떤 성능을 보이는지 확인할 수 없다.
대부분의 프로덕션 AI 스택은 멀티모달 작업을 여러 구성 요소로 나눈다. 언어 모델이 사용자의 요청을 해석하고, 비전 모델이 이미지를 검사하며, 비디오 모델이 프레임을 생성하고, 별도의 정책이 관측 결과를 물리적 움직임으로 변환할 수 있다. 이 구성 요소들은 연결할 수 있지만, 각각의 전달 단계는 엔지니어링 복잡성, 지연 시간, 잠재적 장애 지점을 늘린다.
Rho-1은 이러한 구성을 피하려는 모델이다. 보도에 따르면 이 모델은 텍스트, 이미지, 비디오, 로봇 동작을 하나의 공유 시퀀스로 표현한다. 원칙적으로 동일한 컨텍스트 안에 지시, 시각적 관측, 생성된 프레임, 행동 출력이 들어갈 수 있으므로 시스템은 본 것이 무엇인지와 해야 할 일이 무엇인지를 연결할 수 있다.
이 접근법은 Rho-1에 시각적 예측과 제어 사이의 직접적인 관계도 제공한다. The Decoder는 카메라 이미지를 예측하는 데 사용되는 동일한 가중치가 로봇 움직임도 구동한다고 보도했다. 이는 이 모델이 물리 환경에 광범위하게 배포할 준비가 됐다는 뜻은 아니지만, 비디오 예측과 행동 계획을 별개의 문제로 다루지 않고 함께 학습하는 연구 방향을 보여준다.
The Decoder의 발표 설명에 따르면 이 모델은 약 3개월 동안 320개의 H100 GPU에서 학습됐다. Reka AI는 로봇 제어의 핵심 문제를 해결하기 위해 역동역학 모델도 개발했다. 일반 인터넷 비디오에 비해 고품질 로봇 제어 데이터가 부족하기 때문이다.
역동역학은 일반적으로 장면에서 관측된 변화를 만들어낸 동작을 추론하려 한다. Reka가 설명한 방식에서는 로봇이 등장하지 않는 비디오에서 가능한 제어 신호를 추출하는 데 이 기능을 사용한다. 이는 행동이 세상에 어떤 영향을 주는지 학습해야 하는 시스템이 이용할 수 있는 훈련 자료를 늘릴 수 있다. 다만 인터넷 비디오는 특정 로봇에서 수집한 시연과 동일한 신뢰성, 체화 정도, 센서 세부 정보를 제공하지 않는다.
보고된 연산 요구량은 Rho-1이 190억 매개변수를 갖는다는 점에서 주목할 만하다. 이는 시장에서 흔히 언급되는 많은 프런티어 시스템보다 상당히 작다. 그럼에도 3개월 동안 320개의 H100 GPU를 사용한 것은 상당한 학습 투자다. 따라서 이 수치는 연구 실행에 대한 설명으로 읽어야 하며, 모든 배포 시나리오에서 모델을 저렴하게 학습하거나 운영할 수 있다는 증거로 봐서는 안 된다.
이 보고서에서 확인할 수 있는 가장 강력한 세부 정보는 Reka AI의 연구 프리뷰를 다룬 The Decoder의 보도에서 나온다. MarkTechPost는 Rho-1을 비디오를 이해하고 생성하면서 로봇 동작을 출력하는 190억 매개변수의 옴니 추론 모델로 별도 소개했지만, 제공된 MarkTechPost 자료에는 전체 기사나 독립적인 테스트 결과가 포함돼 있지 않다.
현재 증거에는 벤치마크 점수, 모델 접근 조건, 지연 시간 측정, 안전성 평가, 여기서 독립적으로 평가할 수 있는 시연이 없다. 따라서 실시간 비디오 생성, 적응형 응답, 시각적 예측과 로봇 움직임의 관계에 대한 주장은 확정된 성능 결과가 아니라 회사 또는 출처가 보고한 기능으로 취급해야 한다.
이 구분은 개발자와 구매자에게 중요하다. 통합 모델은 여러 인터페이스를 유지할 필요를 줄일 수 있지만, 장애를 분리해 파악하기 어렵게 만들 수도 있다. 유창한 언어와 설득력 있는 비디오를 생성하는 시스템도 장비를 제어하라는 요청을 받으면 안전하지 않거나 물리적으로 잘못된 결정을 내릴 수 있다. Rho-1이 연구 프리뷰라는 사실은 신뢰성, 평가 방법론, 모델 및 가중치 접근성에 관한 질문을 남긴다.
Reka AI는 이전에도 멀티모달 시스템을 개발해 왔다. 2024년 4월 Reka Core를 출시하면서 벤치마크 평가에서 GPT-4, Claude 3, Gemini Ultra의 경쟁자로 포지셔닝했다. Rho-1은 이러한 방향을 멀티모달 이해에서 비디오 생성과 체화된 행동으로 확장한다.
제품 팀에게 Rho-1의 가장 큰 의미는 아키텍처에 있다. 하나의 모델이 언어, 시각 콘텐츠, 시간적 변화, 행동에 대한 공유 표현을 유지할 수 있다면 개발자는 여러 전문 서비스를 조율하는 대신 하나의 추론 표면을 중심으로 애플리케이션을 구축할 수 있다. 잠재적 사용 사례로는 인터랙티브 비디오 비서, 시뮬레이션 환경, 시각 에이전트, 로보틱스 연구 도구 등이 있다.
절충점은 위험의 집중이다. 전문 시스템은 각각 독립적으로 교체하거나 조정할 수 있지만, 통합 모델은 한 모달리티의 성능이 떨어질 때 재학습이나 더 폭넓은 평가가 필요할 수 있다. 예를 들어 텍스트에는 강하지만 시간적 추론에는 약한 모델은 그럴듯한 설명을 만들어내면서도 변화하는 물리적 장면을 추적하지 못할 수 있다.
이러한 시스템을 고려하는 기업은 인프라와 거버넌스도 살펴봐야 한다. 연속 비디오 생성은 높은 대역폭과 저장 용량을 요구할 수 있다. 로봇 제어 출력에는 엄격한 안전 경계, 모니터링, 모델을 무시할 수 있는 대체 정책이 필요하다. 규제 대상이거나 안전이 중요한 배포에서는 어떤 시각적 증거가 행동으로 이어졌는지 설명하는 능력이 모델의 일반적인 벤치마크 성능만큼 중요할 수 있다.
더 큰 연구 논쟁은 월드 모델에 관한 것이다. 월드 모델은 환경이 어떻게 변하고 행동이 환경에 어떤 영향을 미치는지 표현하려는 시스템이다. Rho-1은 시각적 예측과 행동 생성을 결합함으로써 이 흐름에 부합하지만, 토큰 스트림을 통합했다는 사실만으로 모델이 신뢰할 수 있는 물리적 세계 모델을 갖췄다는 것이 증명되지는 않는다. 장기 계획, 이례적인 조건, 서로 다른 로봇 간의 전이는 여전히 어려운 시험이다.
첫 번째 신호는 Reka AI가 각 기능을 개별적으로, 또 결합된 형태로 재현 가능한 평가 결과를 공개하는지 여부다. 유용한 결과에는 비디오 품질과 시간적 일관성, 변화하는 장면에서의 지시 따르기, 명확히 정의된 과제에서의 로봇 제어 성공률이 포함될 것이다.
접근성도 중요한 지표다. Rho-1이 외부 연구자에게 제공된다면 독립적인 테스트를 통해 통합 아키텍처가 전문 모델로 구성된 파이프라인보다 실용적인 이점을 제공하는지 확인할 수 있다. 추론 하드웨어, 컨텍스트 길이, 라이선스, 지연 시간에 관한 세부 정보가 시연 이상의 유용성을 결정할 것이다.
로보틱스에서는 인터넷 비디오나 시뮬레이션 결과가 아니라 실제 하드웨어에서 얻은 증거가 가장 중요한 후속 정보가 된다. 연구자들은 안전성, 예기치 않은 사건에서의 회복, 다양한 로봇 형태에서의 성능, 잡음이 섞인 카메라와 센서 입력의 영향을 시험해야 한다.
마지막으로 시장은 Reka의 접근법이 연구 프리뷰에 머무를지 제품 플랫폼이 될지 지켜볼 것이다. 그 답은 옴니 모델이 매력적인 아키텍처에서 AI 에이전트, 비디오 애플리케이션, 물리적 자동화를 위한 신뢰할 수 있는 도구로 나아갈 수 있는지를 보여줄 것이다.
Rho-1은 멀티모달리티를 텍스트, 이미지, 비디오뿐 아니라 행동까지 포함하는 공유 모델링 문제로 제시한다는 점에서 의미 있는 연구 신호다. 이는 AI 스택의 일부를 단순화하고 인식과 응답을 연결하는 시스템을 쉽게 만들 수 있게 할 것이다.
그러나 이번 발표는 하나의 모델이 신중하게 설계된 전문 모델 모음보다 낫다는 증거는 아직 아니다. 독립적인 평가와 실제 로봇 결과가 나오기 전까지 개발자는 Rho-1을 가능성 있는 범위의 아키텍처 실험으로 봐야 하며, 프로덕션 멀티모달 또는 로보틱스 시스템을 대체하는 검증된 모델로 간주해서는 안 된다.