Tencent의 Gander는 실시간 대화와 백그라운드 에이전트 작업을 분리해 중단을 줄이겠다고 약속하지만, 정확도와 멀티모달 이해에서는 절충점을 드러낸다.

Tencent가 Gander를 공개했다. 이는 배경에서 더 느리고 복잡한 작업을 수행하면서도 실시간 대화를 이어가도록 설계된 연구용 모델이다. 이 시스템은 음성, 이미지, 텍스트를 함께 처리하고, 중단에 대응하며, 에이전트가 파일을 검색하거나 코드를 작성하거나 다른 작업을 처리하는 동안 진행 상황을 업데이트할 수 있다.
이 접근법은 음성 비서의 지속적인 약점을 겨냥한다. 시스템이 종종 멈추거나, 사용자가 말을 끝내길 기다리거나, 행동을 계획하는 동안 응답을 중지하기 때문이다. The Decoder가 Tencent의 기술 보고서를 바탕으로 보도한 바에 따르면, Gander는 여러 경쟁사에 비해 대화 타이밍을 개선하지만, 그 과정에서 작업 정확도와 멀티모달 성능의 일부를 포기한다.
Gander는 Tencent 연구진이 인간의 해부학에 비유해 설명하는 두 구성 요소로 작업을 나눈다. ‘소뇌’는 즉각적인 상호작용을 관리하며, 사용자가 끼어들면 언제 듣고, 말하고, 멈출지 결정한다. 교체 가능한 ‘뇌’는 더 까다로운 추론과 에이전트 작업을 수행한다.
이 분리는 하나의 모델이 서로 충돌하는 두 가지 요구 사항을 동시에 최적화해야 하는 상황을 피하려는 의도다. 대화는 낮은 지연 시간과 정확한 턴테이킹이 필요하지만, 코딩이나 파일 검색 같은 작업은 계획을 위해 더 많은 시간이 필요하다. The Decoder가 설명한 기술 보고서에 따르면, 백그라운드 구성 요소는 대화 모델을 다시 학습하지 않고도 Codex나 Claude Code 같은 에이전트 시스템으로 교체할 수 있다.
Gander는 상호작용을 1초 단위로 나누고, 타이밍 결정을 위해 직전 약 2분의 대화를 맥락으로 사용한다. The Decoder가 설명한 기술 보고서에 따르면, 이 모델은 별도의 음성 시작·종료 탐지기에 의존하지 않는다. 사용자는 Gander가 말하는 동안 끼어들 수 있고, 요청한 작업을 바꾸거나, 작업이 진행되는 동안 후속 질문에 답할 수 있다.
이 아키텍처는 상호작용의 모든 단계를 하나의 모델이 처리하는 대신, 조율된 AI 에이전트로 향하는 업계의 더 큰 흐름과 닮아 있다. OpenAI 역시 실시간 대화와 백그라운드 추론을 분리하는 방식을 탐색해 왔으며, 다른 연구 시스템들은 여러 모델에 작업을 분산한다.
Gander에 대해 제시된 가장 강한 증거는 일반 지능보다 턴테이킹에 관한 것이다. 다양한 작업 시나리오의 음성 비서를 위한 벤치마크인 Full-Duplex-Bench v3에서, Tencent 시스템은 테스트한 100개 시나리오 모두에서 적절한 순간에 말을 시작했고, 사용자에게 끼어든 경우는 8%였다.
The Decoder는 같은 평가에서 GPT-Realtime이 13.5%, 가장 약한 경쟁자는 거의 48%라는 비교 수치를 보도했다. 이 수치는 독립 평가가 아니라 연구팀이 보고한 벤치마크 결과에서 나온 것이며, 해당 벤치마크는 대화와 백그라운드 에이전트를 결합한 시스템을 위한 전용 표준이 아니다.
Gander는 작업 정확도에서 더 약했다. 연구진은 그 격차의 일부를 전체 시스템을 평가하는 방식에 돌렸다. 음성 인식과 생성 출력의 오류가 추론 모델의 성능과 함께 계산되기 때문이다. 기반이 되는 ‘뇌’에 텍스트를 직접 입력하면, 보고서에 따르면 성능이 훨씬 좋아진다.
이 모델은 최소한 한 개의 오디오·비디오 이해 테스트에서도 베이스 모델보다 낮은 성능을 보였다. 연구진은 그 결과를 물체 개수 세기나 이미지 내 위치 찾기 같은 과제에서 정확한 지각보다 매끄러운 대화를 우선시하는 학습과 연결했다. 지속적인 멀티모달 상호작용을 내세우는 시스템은 대화를 관리할 뿐 아니라 사용자가 보여 주고 말하는 내용을 정확히 해석해야 하므로 이 한계는 중요하다.
Tencent 팀은 Gander를 약 270만 개의 예시로 학습시킨 것으로 전해졌다. 일부 예시는 주변 소음이 있거나 그룹 내 아무도 모델에게 말하고 있지 않아 보일 때 침묵을 유지하도록 가르친다. 이러한 행동은 잘못된 활성화가 지연 응답만큼이나 방해가 될 수 있는 실제 배포에서 중요하다.
연구진은 이 작업을 초기 단계로 규정하며 아키텍처 확장 문제는 여전히 해결되지 않았다고 인정한다. 또한 낮은 지연의 대화, 중단 처리, 멀티모달 지각, 장시간 작업 실행의 조합을 평가하기 위한 널리 확립된 평가 프레임워크도 없다.
Tencent는 이른바 오픈소스 공개 절차를 마친 뒤 모델 가중치와 학습 데이터를 공개할 계획이다. The Decoder에 따르면 코드와 프로젝트 시연을 위한 GitHub 저장소는 이미 존재한다. 그러나 가중치와 데이터가 공개되기 전까지 외부 개발자는 보고된 결과를 완전히 재현하거나 시스템의 학습 선택을 평가할 수 없다.
회사의 더 넓은 AI 활동도 맥락을 제공한다. Gander는 WorkBuddy, Yuanbao, WeChat 같은 제품에 사용되는 오픈 언어 모델 Hy3의 공개에 이어 나온 것으로 알려졌다. 회사는 또한 에이전트 스타트업 Manus의 지분 확대를 협상 중인 것으로 전해지며, 이는 기존 소비자 플랫폼에 에이전트 기능을 통합하려는 Tencent의 관심과 맞아떨어진다.
음성 인터페이스를 만드는 개발자에게 Gander는 유용한 시스템 설계 원칙을 보여 준다. 대화의 반응성과 작업 실행은 분리된 구성 요소가 더 잘 처리할 수 있다. 가벼운 상호작용 모델은 사용자의 통제감을 유지하면서, 더 강력한 모델이 비동기적으로 작업할 수 있다. 이는 검색, 코드 생성 단계 또는 워크플로 작업을 위해 사용자가 조용히 기다려야 하는 필요성을 줄일 수 있다.
그 대가는 운영 복잡성이다. 분리된 시스템은 대화 레이어와 백그라운드 에이전트 간 상태를 조정하고, 어떤 중단이 작업을 취소해야 하는지 결정하며, 사용자가 방향을 바꾼 뒤 오래된 결과가 전달되지 않도록 막아야 한다. 또한 시스템이 듣고 있는지, 추론 중인지, 데이터를 기다리는지, 아니면 아직 작업을 실행 중인지 사용자가 이해할 수 있도록 명확한 상태 신호가 필요하다.
정확도는 여전히 핵심 우려 사항이다. 벤치마크 결과는 중단이 적다고 해서 자동으로 더 나은 결과가 나오지는 않는다는 점을 시사한다. AI 에이전트를 배포하는 제품 팀은 지연 시간과 턴테이킹뿐 아니라 전사 품질, 시각적 접지, 작업 완료, 중단 후 복구, 여러 모델을 동시에 실행하는 비용도 테스트해야 한다.
기업 구매자에게 예정된 공개는 Gander를 즉시 배포 가능한 제품이라기보다 참조 아키텍처로 더 의미 있게 만들 수 있다. 오픈 가중치와 학습 데이터가 있으면 팀은 Tencent가 소음 환경, 겹치는 발화, 맥락 유지 문제를 어떻게 처리하는지 살펴볼 수 있다. 또한 GPT-Realtime, Gemini Live, Grok 같은 상용 시스템과 일관된 조건에서 비교하기도 쉬워진다.
첫 번째 신호는 Tencent가 약속한 가중치와 학습 데이터를 공개하는지, 그리고 공개 패키지에 독립적 재현을 위한 충분한 코드와 평가 자료가 포함되는지 여부다. 개발자들은 백그라운드 계획과 중단이 상태 관리 실패를 더 많이 일으키는 장기 작업의 결과도 주시해야 한다.
두 번째 신호는 Gander가 타이밍 우위를 잃지 않으면서 오디오와 비디오 이해를 개선할 수 있는지다. 더 나은 지각은 이 아키텍처가 시각 입력을 받는 음성 시스템이 아니라 진정한 멀티모달 비서를 지원할 수 있는지를 결정할 것이다.
마지막으로 시장은 지속적 상호작용을 위한 더 명확한 벤치마크가 필요하다. Full-Duplex-Bench v3의 결과는 턴테이킹에는 유용하지만, 개발자들은 중단 처리와 작업 정확도, 안전성, 신뢰성, 운영 비용을 함께 평가하는 지표가 필요하다.
Gander의 의미는 단일 벤치마크 점수보다 대화와 작업 사이의 제어 경계를 명확히 했다는 데 있다. 사용자는 작업이 실행되는 동안 비서가 계속 이용 가능하길 기대하지만, 그 경험은 단순히 더 큰 모델이 아니라 세심한 오케스트레이션에 달려 있다.
Tencent의 결과는 또 다른 점도 보여 준다. 즉, 제품 팀은 유연한 대화를 신뢰할 수 있는 실행의 대체물로 취급하는 것을 경계해야 한다. Gander는 타이밍 면에서 유망해 보이지만, 작업 정확도와 멀티모달 이해의 약점은 더 어려운 질문을 남긴다. 즉, 일이 중요할 때 비서는 덜 신뢰할 수 있게 되지 않으면서도 자연스러움을 유지할 수 있는가?