Danijar Hafner, 낯선 환경을 계획하는 스텔스 AI 에이전트 개발 중

Danijar Hafner는 결과를 예측하고 낯선 집, 물체, 환경에 적응할 수 있는 로봇용 월드 모델 에이전트를 개발하고 있다.

AI News

전 Google DeepMind 연구원 Danijar Hafner가 이끄는 새로운 스타트업이 한 번도 본 적 없는 환경에서 일어날 일을 예상하도록 설계된 AI 에이전트를 개발하고 있다고 MIT Technology Review의 프로필이 전했다. 회사는 여전히 스텔스 모드이며, 이름이나 제품을 공개하지 않았고, 인형 로봇이 놓인 소박한 샌프란시스코 사무실에서 운영되고 있다.

이 작업은 가상 환경에서 먼저 학습한 뒤 현실 세계에서 행동하는 에이전트에 대한 Hafner의 오랜 연구를 확장한 것이다. 당장의 의미는 상업적 출시가 아니라 기술적 방향에 있다. 즉, 현실에 대한 내부 모델을 사용해 로봇이 배포 이후 주로 시행착오에 의존하는 대신 미리 계획하도록 하는 것이다.

월드 모델을 중심으로 구축된 스텔스 스타트업

Hafner는 2025년 가을 Google DeepMind를 떠나 이 스타트업을 설립했다. 그는 회사 이름, 자금 조달, 예정 고객, 출시 일정 등 운영 세부 사항을 거의 공개하지 않았다. MIT Technology Review는 사무실에 중국에서 들여온 인형 로봇이 있다고 보도했으며, 이는 물리 로보틱스가 현재 회사 작업의 핵심임을 시사하지만, 보도는 특정 제품이나 배포 목표를 확정하지는 않았다.

기술적 기반은 모델 기반 강화학습이다. 이 접근법에서 에이전트는 주변 환경의 모델을 학습하고, 그 모델을 사용해 가능한 행동의 결과를 예측한다. 물리적 환경에서 모든 행동을 반복해서 시험하는 대신, 에이전트는 상상된 결과를 평가하고 그 예측을 바탕으로 행동 방침을 선택할 수 있다.

집 안에서 작동하는 로봇의 경우, 이는 학습 데이터에 없던 바닥 구조, 가구 배치, 또는 예상치 못한 중단에 적응하는 것을 의미할 수 있다. 이 개념은 환경이 변동적이고 실수가 재산 피해나 안전 위험으로 이어질 수 있는 서비스 로봇에 특히 중요하다.

게임 세계에서 물리 로봇으로

Hafner의 연구 실적은 이 접근법에 대한 가장 명확한 공개 증거를 제공한다. 그의 PlaNet 시스템은 학습된 모델을 사용해 전방 계획을 지원했다. 이후 Dreamer 계열 에이전트 연구는 같은 큰 아이디어를 점점 더 어려운 시뮬레이션 환경의 과제에 적용했다.

MIT Technology Review에 따르면 Dreamer 2는 월드 모델을 사용해 Atari 2600 게임에서 인간 수준의 성능에 도달했고, Dreamer 3는 게임 내 자원을 채굴하는 방법을 배워 Minecraft Diamond 도전을 해결했다. Dreamer 4는 훈련 중 게임과 직접 상호작용하지 않고 기록된 플레이 데이터만으로 학습해 더 나아간 것으로 전해졌다.

이 결과들이 중요한 이유는 계획이 학습 중 필요한 직접 상호작용의 양을 줄일 수 있음을 보여주기 때문이다. 그러나 게임에서의 성공만으로는 집, 공장, 창고, 공공장소에서 신뢰할 수 있는 성능을 입증하지 못한다. 게임은 명확한 규칙과 측정 가능한 목표를 제공하지만, 물리 세계는 예측하기 더 어렵고 정확히 시뮬레이션하기도 어려우며, 행동이 실패했을 때의 결과도 더 크다.

Hafner의 DayDreamer 프로젝트는 로보틱스로 가는 다리 역할을 한다. 이 프로젝트는 Dreamer 접근법을 사용해 로봇이 낯선 환경에서 작동하고, 밀려 넘어지는 것까지 포함한 새로운 경험에 대응하도록 했다. 스타트업은 인간형 기계를 물리 플랫폼으로 삼아 그 전환의 더 야심 찬 버전을 추구하는 것으로 보인다.

무엇이 입증됐고, 무엇이 입증되지 않았나

현재 이용 가능한 가장 강력한 증거는 Hafner의 공개된 연구 이력과 그의 현재 연구실 환경에 대한 설명이다. PlaNet, Dreamer, DayDreamer에 대한 주장은 MIT Technology Review가 Hafner의 이전 작업 맥락에서 보도한 것이다. 이는 연구 성과와 데모를 설명하는 것이지, 새 스타트업의 상업적 역량을 독립적으로 검증한 것은 아니다.

또한 제공된 보도에는 고객 배포, 생산 계약, 매출, 안전 인증, 다른 로봇 시스템과의 비교 테스트에 대한 공개 증거도 없다. Hafner의 전 Google 동료 Timothy Lillicrap은 그를 뛰어난 연구자라고 칭찬했지만, 이는 개인적 추천일 뿐 성능 벤치마크는 아니다.

이 구분은 구매자와 개발자에게 중요하다. 게임 상태를 예측하거나 통제된 로봇 실험에 적응하는 모델도 센서 잡음이 있고, 물체가 예기치 않게 움직이며, 잘못된 결정의 비용이 큰 상황에서 그 예측이 정확하게 유지되는지 입증해야 한다. 스타트업의 스텔스 상태 때문에 오늘날 이러한 질문을 평가하는 것은 불가능하다.

이 접근법이 빌더와 기업에 중요한 이유

Hafner의 시스템이 엄격히 통제된 데모 밖에서도 작동한다면, 로보틱스의 핵심 병목 중 하나인 충분한 실제 경험을 수집하는 비용과 어려움을 해결할 수 있다. 물리적 실패를 반복하며 로봇을 훈련하는 것은 느리고, 비싸고, 잠재적으로 위험하다. 학습된 환경 안에서 계획하면 배포 전에 필요한 물리적 시행 횟수를 줄일 수 있다.

제품 팀에게 실질적인 시험은 에이전트가 광범위한 재학습 없이 서로 다른 환경 간에 지식을 이전할 수 있는지 여부가 될 것이다. 예를 들어 창고 운영자는 변화하는 배치와 낯선 패키지를 처리할 수 있는 로봇이 필요하다. 가정용 로봇은 무해한 새로운 상황과 멈추거나 도움을 요청해야 하는 상황을 구분해야 한다.

이는 예측을 넘어서는 추가 요구사항을 만든다. 기업은 월드 모델이 어떻게 만들어졌는지, 불확실성이 어떻게 표현되는지, 그리고 로봇이 언제 안전한 행동으로 되돌아가는지를 파악할 수 있어야 한다. 또한 희귀 사건을 평가하고, 배포 후 시스템을 업데이트하며, 진정한 적응과 위험한 즉흥을 구분할 도구도 필요하다.

이 작업은 또한 구현형 AI에서 두 가지 큰 전략, 즉 더 많은 데모로 학습한 더 큰 모델과, 시뮬레이션하고 계획하는 법을 배우는 더 구조화된 에이전트 간 경쟁을 심화시킬 수 있다. 두 접근법은 상호 배타적이지 않지만, Hafner의 연구는 더 나은 내부 예측이 더 많은 학습 데이터만큼 중요할 수 있음을 제시한다.

다음에 주목할 점

첫 번째 신호는 스타트업이 자신을 공개하고 초기 제품 또는 연구 목표를 설명할지 여부다. 투자자, 파트너, 잠재 고객도 인형 로봇이 연구실 실험 이상의 용도로 쓰이고 있다는 증거를 찾을 것이다.

기술 공개는 막연한 주장보다 더 중요하다. 유용한 세부 정보에는 평가에 사용된 환경, 필요한 실제 데이터의 양, 낯선 환경에서 성능이 어떻게 바뀌는지, 예측이 불확실할 때 시스템이 어떻게 동작하는지 등이 포함된다. 조작, 내비게이션, 낙상 복구, 안전이 중요한 중단에 대한 독립적 테스트는 게임 벤치마크만으로는 얻을 수 없는 더 강력한 증거를 제공할 것이다.

마지막으로, 회사의 비즈니스 모델 선택이 그 야심을 분명히 보여줄 것이다. 로보틱스 플랫폼, 라이선스된 제어 시스템, 수직 통합형 로봇 제품은 각각 하드웨어 신뢰성, 배포 지원, 기업 경제성에 서로 다른 요구를 의미한다.

Creati.ai 관점

Hafner의 새 벤처가 주목할 만한 이유는 현재 AI 시스템의 특정 약점, 즉 훈련과 조건이 다를 때 신뢰성 있게 행동하지 못하는 문제를 겨냥하기 때문이다. 월드 모델과 모델 기반 강화학습의 활용은 더 신중한 행동으로 가는 그럴듯한 경로를 제공하지만, 가상 성과와 신뢰할 수 있는 물리적 운용 사이의 간극은 여전히 크다.

지금으로서는 검증된 로보틱스 공급업체라기보다 연구 주도 기업으로 지켜봐야 할 대상이다. निर्ण적인 질문은 Hafner가 예측적 계획을 실제 환경에서 측정 가능한 개선으로 바꿀 수 있느냐, 즉 훈련 시행 감소, 예상치 못한 상황에서 더 안전한 복구, 그리고 새로운 장소마다 맞춤형 엔지니어링이 필요 없는 일관된 성능을 달성할 수 있느냐이다.

광고