Gander de Tencent separa la conversación en tiempo real del trabajo de agentes en segundo plano, prometiendo menos interrupciones pero mostrando compromisos en precisión y comprensión multimodal.

Tencent ha presentado Gander, un modelo de investigación diseñado para mantener una conversación en tiempo real mientras realiza trabajos más lentos y complejos en segundo plano. El sistema puede procesar voz, imágenes y texto juntos, responder a interrupciones y ofrecer actualizaciones de progreso mientras un agente busca archivos, escribe código o gestiona otra tarea.
El enfoque apunta a una debilidad persistente de los asistentes de voz: los sistemas a menudo hacen pausas, esperan a que el usuario termine o dejan de responder mientras planifican una acción. Según la cobertura de The Decoder basada en el informe técnico de Tencent, Gander mejora el ritmo conversacional frente a varios competidores, pero sacrifica algo de precisión en tareas y rendimiento multimodal en el proceso.
Gander divide el trabajo entre dos componentes que los investigadores de Tencent describen usando la anatomía humana. Un “cerebelo” gestiona el intercambio inmediato, decidiendo cuándo escuchar, hablar o detenerse si un usuario interrumpe. Un “cerebro” intercambiable realiza el razonamiento más exigente y las tareas de agente.
La separación pretende evitar obligar a un solo modelo a optimizar dos requisitos en conflicto. La conversación necesita baja latencia y un cambio de turno preciso, mientras que tareas como programar o recuperar archivos necesitan más tiempo para planificar. Según el informe técnico descrito por The Decoder, el componente de fondo puede reemplazarse con sistemas de agentes como Codex o Claude Code sin reentrenar el modelo conversacional.
Gander divide la interacción en segmentos de un segundo y utiliza aproximadamente los dos minutos anteriores de conversación como contexto para sus decisiones de temporización. El modelo no depende de un detector separado de inicio y fin de voz, según el informe técnico descrito por The Decoder. Los usuarios pueden interrumpir mientras Gander habla, cambiar la tarea solicitada o responder a preguntas de seguimiento mientras el trabajo avanza.
Esa arquitectura se parece a un movimiento más amplio de la industria hacia agentes de IA orquestados en lugar de un solo modelo que gestione cada etapa de una interacción. OpenAI también ha explorado separar la conversación en vivo del razonamiento en segundo plano, mientras que otros sistemas de investigación delegan trabajo entre varios modelos.
La evidencia más sólida presentada sobre Gander se refiere al cambio de turno y no a la inteligencia general. En Full-Duplex-Bench v3, un benchmark para asistentes de voz en distintos escenarios de tareas, el sistema de Tencent supuestamente empezó a hablar en el momento adecuado en los 100 escenarios probados e interrumpió a los usuarios en el 8 por ciento de los casos.
The Decoder informó cifras comparativas de 13,5 por ciento para GPT-Realtime y casi 48 por ciento para el competidor más débil en la misma evaluación. Estas cifras proceden de los resultados de benchmark reportados por el equipo de investigación, no de una evaluación independiente, y el benchmark no es un estándar dedicado para sistemas que combinan conversación con agentes en segundo plano.
Gander fue más débil en precisión de tareas. Los investigadores atribuyeron parte de esa diferencia a la forma en que se evalúa el sistema completo: los errores de reconocimiento de voz y de salida generada cuentan junto con el rendimiento del modelo de razonamiento. Cuando el “cerebro” subyacente recibe texto directamente, rinde sustancialmente mejor, según el informe.
El modelo también tuvo un rendimiento inferior al de su modelo base en al menos una prueba de comprensión de audio y vídeo. Los investigadores vincularon ese resultado al entrenamiento, que prioriza una conversación fluida sobre la percepción precisa, incluidas tareas como contar objetos o localizarlos en una imagen. Esa limitación importa porque un sistema comercializado para interacción multimodal continua no solo debe gestionar el diálogo, sino también interpretar con precisión lo que los usuarios muestran y dicen.
Según se informa, el equipo de Tencent entrenó Gander con unos 2,7 millones de ejemplos. Algunos ejemplos enseñan al modelo a permanecer en silencio cuando hay ruido de fondo o cuando nadie en un grupo parece dirigirse a él. Ese comportamiento es importante para despliegues prácticos, donde las activaciones falsas pueden ser tan molestas como las respuestas tardías.
Los investigadores caracterizan el trabajo como temprano y reconocen que escalar la arquitectura sigue sin resolverse. Tampoco existe un marco de evaluación ampliamente establecido para juzgar la combinación de conversación de baja latencia, gestión de interrupciones, percepción multimodal y ejecución de tareas prolongadas.
Tencent planea publicar los pesos del modelo y los datos de entrenamiento después de completar lo que llama el proceso de lanzamiento de código abierto. Ya existe un repositorio de GitHub para el código y las demostraciones del proyecto, según The Decoder. Sin embargo, hasta que los pesos y los datos estén disponibles, los desarrolladores externos no pueden reproducir por completo los resultados informados ni evaluar las decisiones de entrenamiento del sistema.
La actividad más amplia de IA de la empresa aporta contexto. Gander sigue al lanzamiento informado de Hy3 por parte de Tencent, un modelo de lenguaje abierto utilizado en productos como WorkBuddy, Yuanbao y WeChat. La empresa también estaría negociando una participación importante en la startup de agentes Manus, un movimiento que encajaría con el interés de Tencent en integrar capacidades de agente en plataformas de consumo existentes.
Para los desarrolladores que crean interfaces de voz, Gander destaca un principio útil de diseño de sistemas: la capacidad de respuesta conversacional y la ejecución de tareas podrían gestionarse mejor mediante componentes separados. Un modelo de interacción ligero puede preservar la sensación de control del usuario mientras un modelo más capaz trabaja de forma asíncrona. Esto podría reducir la necesidad de hacer esperar silenciosamente a los usuarios por una búsqueda, un paso de generación de código o una acción de flujo de trabajo.
La compensación es la complejidad operativa. Un sistema dividido debe coordinar el estado entre la capa conversacional y el agente en segundo plano, decidir qué interrupciones deben cancelar el trabajo y evitar que se entreguen resultados obsoletos después de que un usuario cambie de rumbo. También necesita señales de estado claras para que los usuarios entiendan si el sistema está escuchando, razonando, esperando datos o todavía ejecutando una acción.
La precisión sigue siendo una preocupación central. Los resultados del benchmark sugieren que menos interrupciones no producen automáticamente mejores resultados. Los equipos de producto que despliegan agentes de IA tendrán que probar no solo la latencia y el cambio de turno, sino también la calidad de la transcripción, la vinculación visual, la finalización de tareas, la recuperación tras una interrupción y el coste de ejecutar varios modelos a la vez.
Para los compradores empresariales, el lanzamiento planificado podría hacer que Gander sea más relevante como arquitectura de referencia que como producto desplegable de inmediato. Los pesos abiertos y los datos de entrenamiento permitirían a los equipos examinar cómo gestiona Tencent entornos ruidosos, el habla superpuesta y la retención de contexto. También facilitarían la comparación con sistemas comerciales como GPT-Realtime, Gemini Live y Grok en condiciones consistentes.
La primera señal será si Tencent publica los pesos y los datos de entrenamiento prometidos, y si el paquete público incluye suficiente código y material de evaluación para una reproducción independiente. Los desarrolladores también deberían vigilar los resultados en tareas más largas, donde la planificación en segundo plano y las interrupciones crean más oportunidades de fallos en la gestión de estado.
Una segunda señal es si Gander mejora su comprensión de audio y vídeo sin perder su ventaja en temporización. Una mejor percepción determinaría si la arquitectura puede soportar asistentes verdaderamente multimodales y no solo sistemas de voz con entrada visual.
Por último, el mercado necesitará benchmarks más claros para la interacción continua. Los resultados de Full-Duplex-Bench v3 son útiles para el cambio de turno, pero los desarrolladores necesitan evaluaciones que combinen la gestión de interrupciones con la precisión de las tareas, la seguridad, la fiabilidad y el coste operativo.
La importancia de Gander tiene menos que ver con una sola puntuación de benchmark que con hacer explícito el límite de control entre conversación y trabajo. Los usuarios esperan que un asistente siga disponible mientras se ejecuta una acción, pero esa experiencia depende de una orquestación cuidadosa, no simplemente de un modelo más grande.
Los resultados de Tencent también muestran por qué los equipos de producto deberían resistirse a tratar la conversación fluida como sustituto de una ejecución fiable. Gander parece prometedor en temporización, mientras que sus debilidades informadas en precisión de tareas y comprensión multimodal dejan abierta la pregunta más difícil: ¿puede un asistente seguir siendo natural sin volverse menos fiable cuando el trabajo importa?