O Gander da Tencent separa a conversa em tempo real do trabalho de agentes em segundo plano, prometendo menos interrupções, mas expondo compromissos em precisão e compreensão multimodal.

A Tencent apresentou o Gander, um modelo de pesquisa projetado para manter uma conversa em tempo real enquanto realiza, em segundo plano, trabalhos mais lentos e complexos. O sistema pode processar voz, imagens e texto em conjunto, responder a interrupções e fornecer atualizações de progresso enquanto um agente procura arquivos, escreve código ou lida com outra tarefa.
A abordagem ataca uma fraqueza persistente dos assistentes de voz: os sistemas muitas vezes pausam, esperam o usuário terminar ou deixam de responder enquanto planejam uma ação. Segundo a cobertura do The Decoder com base no relatório técnico da Tencent, o Gander melhora o timing conversacional em comparação com vários concorrentes, mas abre mão de alguma precisão em tarefas e desempenho multimodal no processo.
O Gander divide o trabalho entre dois componentes que os pesquisadores da Tencent descrevem usando a anatomia humana. Um “cerebelo” gerencia a troca imediata, decidindo quando ouvir, falar ou parar se o usuário interromper. Um “cérebro” intercambiável executa o raciocínio mais exigente e as tarefas de agente.
A separação pretende evitar forçar um único modelo a otimizar dois requisitos em conflito. Conversação exige baixa latência e boa alternância de turnos, enquanto tarefas como programação ou recuperação de arquivos precisam de mais tempo para planejamento. Segundo o relatório técnico descrito pelo The Decoder, o componente de segundo plano pode ser substituído por sistemas de agentes como Codex ou Claude Code sem re-treinar o modelo conversacional.
O Gander divide a interação em segmentos de um segundo e usa aproximadamente os dois minutos anteriores da conversa como contexto para suas decisões de tempo. O modelo não depende de um detector separado de início e fim de fala, segundo o relatório técnico descrito pelo The Decoder. Os usuários podem interromper enquanto o Gander fala, mudar a tarefa solicitada ou responder a perguntas de acompanhamento enquanto o trabalho avança.
Essa arquitetura lembra uma mudança mais ampla do setor em direção a agentes de IA orquestrados, em vez de um único modelo cuidando de cada etapa de uma interação. A OpenAI também explorou separar a conversa ao vivo do raciocínio em segundo plano, enquanto outros sistemas de pesquisa delegam trabalho entre vários modelos.
A evidência mais forte apresentada para o Gander diz respeito à alternância de turnos, e não à inteligência geral. No Full-Duplex-Bench v3, um benchmark para assistentes de voz em vários cenários de tarefas, o sistema da Tencent teria começado a falar no momento apropriado em todos os 100 cenários testados e interrompido usuários em 8% dos casos.
O The Decoder informou números comparativos de 13,5% para o GPT-Realtime e quase 48% para o concorrente mais fraco na mesma avaliação. Esses números vêm dos resultados de benchmark relatados pela equipe de pesquisa, não de uma avaliação independente, e o benchmark não é um padrão dedicado para sistemas que combinam conversa com agentes de segundo plano.
O Gander foi mais fraco na precisão das tarefas. Os pesquisadores atribuíram parte dessa diferença à forma como o sistema completo é avaliado: erros de reconhecimento de fala e de saída gerada contam juntamente com o desempenho do modelo de raciocínio. Quando o “cérebro” subjacente recebe texto diretamente, ele apresenta desempenho substancialmente melhor, segundo o relatório.
O modelo também ficou abaixo do seu modelo base em pelo menos um teste de compreensão de áudio e vídeo. Os pesquisadores ligaram esse resultado ao treinamento que prioriza uma conversa fluida em vez de percepção precisa, incluindo tarefas como contar objetos ou localizá-los em uma imagem. Essa limitação é importante porque um sistema comercializado para interação multimodal contínua precisa não apenas gerenciar o diálogo, mas também interpretar com precisão o que os usuários mostram e dizem.
A equipe da Tencent teria treinado o Gander com cerca de 2,7 milhões de exemplos. Alguns exemplos ensinam o modelo a permanecer em silêncio quando há ruído de fundo ou quando ninguém em um grupo parece estar se dirigindo a ele. Esses comportamentos são importantes para implantações práticas, em que ativações falsas podem ser tão perturbadoras quanto respostas atrasadas.
Os pesquisadores caracterizam o trabalho como inicial e reconhecem que escalar a arquitetura continua sem solução. Também não existe um framework de avaliação amplamente estabelecido para julgar a combinação de conversa de baixa latência, tratamento de interrupções, percepção multimodal e execução de tarefas de longa duração.
A Tencent planeja liberar os pesos do modelo e os dados de treinamento depois de concluir o que chama de processo de lançamento de código aberto. Um repositório no GitHub para o código e as demonstrações do projeto já existe, segundo o The Decoder. Até que os pesos e os dados estejam disponíveis, porém, desenvolvedores externos não podem reproduzir completamente os resultados relatados nem avaliar as escolhas de treinamento do sistema.
A atividade mais ampla de IA da empresa fornece contexto. O Gander vem após o lançamento relatado do Hy3 pela Tencent, um modelo de linguagem aberto usado em produtos como WorkBuddy, Yuanbao e WeChat. A empresa também estaria negociando uma participação significativa na startup de agentes Manus, um movimento que se encaixaria no interesse da Tencent em incorporar capacidades de agente em plataformas de consumo já existentes.
Para desenvolvedores que constroem interfaces de voz, o Gander destaca um princípio útil de design de sistemas: a capacidade de resposta conversacional e a execução de tarefas podem ser melhor tratadas por componentes separados. Um modelo de interação leve pode preservar a sensação de controle do usuário enquanto um modelo mais capaz trabalha de forma assíncrona. Isso poderia reduzir a necessidade de fazer os usuários esperarem em silêncio por uma busca, uma etapa de geração de código ou uma ação de fluxo de trabalho.
A compensação é a complexidade operacional. Um sistema dividido precisa coordenar o estado entre a camada conversacional e o agente em segundo plano, decidir quais interrupções devem cancelar o trabalho e evitar que resultados desatualizados sejam entregues depois que o usuário muda de direção. Ele também precisa de sinais de status claros para que os usuários entendam se o sistema está ouvindo, raciocinando, aguardando dados ou ainda executando uma ação.
A precisão continua sendo uma preocupação central. Os resultados de benchmark sugerem que menos interrupções não produzem automaticamente melhores resultados. As equipes de produto que implantam agentes de IA terão de testar não apenas latência e alternância de turnos, mas também qualidade de transcrição, grounding visual, conclusão de tarefas, recuperação após interrupção e o custo de executar vários modelos ao mesmo tempo.
Para compradores corporativos, o lançamento planejado pode tornar o Gander mais relevante como arquitetura de referência do que como produto imediatamente implantável. Pesos abertos e dados de treinamento permitiriam que as equipes examinassem como a Tencent lida com ambientes barulhentos, fala sobreposta e retenção de contexto. Também facilitariam a comparação com sistemas comerciais como GPT-Realtime, Gemini Live e Grok em condições consistentes.
O primeiro sinal será se a Tencent liberar os pesos e os dados de treinamento prometidos, e se o pacote público incluir código e material de avaliação suficientes para reprodução independente. Os desenvolvedores também devem observar resultados em tarefas mais longas, em que planejamento em segundo plano e interrupções criam mais oportunidades para falhas de gerenciamento de estado.
Um segundo sinal é se o Gander melhora sua compreensão de áudio e vídeo sem perder sua vantagem de timing. Uma percepção melhor determinaria se a arquitetura pode dar suporte a assistentes verdadeiramente multimodais, e não apenas a sistemas de voz com entrada visual.
Por fim, o mercado precisará de benchmarks mais claros para interação contínua. Os resultados do Full-Duplex-Bench v3 são úteis para alternância de turnos, mas os desenvolvedores precisam de avaliações que combinem tratamento de interrupções com precisão de tarefas, segurança, confiabilidade e custo operacional.
A importância do Gander está menos em uma única pontuação de benchmark e mais em tornar explícita a fronteira de controle entre conversa e trabalho. Os usuários esperam que um assistente permaneça disponível enquanto uma ação é executada, mas essa experiência depende de orquestração cuidadosa, e não apenas de um modelo maior.
Os resultados da Tencent também mostram por que as equipes de produto devem resistir à tentação de tratar a conversa fluida como substituta de execução confiável. O Gander parece promissor em timing, enquanto suas fraquezas relatadas em precisão de tarefas e compreensão multimodal deixam aberta a pergunta mais difícil: um assistente pode continuar natural sem se tornar menos confiável quando o trabalho realmente importa?