Gander de Tencent sépare la conversation en temps réel du travail d’un agent en arrière-plan, promettant moins d’interruptions tout en révélant des compromis sur la précision et la compréhension multimodale.

Tencent a présenté Gander, un modèle de recherche conçu pour maintenir une conversation en temps réel tout en effectuant en arrière-plan un travail plus lent et plus complexe. Le système peut traiter ensemble la voix, les images et le texte, répondre aux interruptions et fournir des mises à jour de progression pendant qu’un agent recherche des fichiers, écrit du code ou s’occupe d’une autre tâche.
Cette approche cible une faiblesse persistante des assistants vocaux : les systèmes font souvent une pause, attendent qu’un utilisateur ait terminé ou cessent de répondre pendant qu’ils planifient une action. Selon un article de The Decoder fondé sur le rapport technique de Tencent, Gander améliore le timing conversationnel par rapport à plusieurs concurrents, mais cède en partie en précision des tâches et en performance multimodale.
Gander répartit le travail entre deux composants que les chercheurs de Tencent décrivent à l’aide de l’anatomie humaine. Un « cervelet » gère l’échange immédiat, en décidant quand écouter, parler ou s’arrêter si un utilisateur interrompt. Un « cerveau » remplaçable exécute le raisonnement plus exigeant et les tâches d’agent.
Cette séparation vise à éviter de forcer un seul modèle à optimiser deux exigences contradictoires. La conversation exige une faible latence et un bon respect des tours de parole, tandis que des tâches comme le codage ou la récupération de fichiers nécessitent plus de temps de planification. D’après le rapport technique décrit par The Decoder, le composant en arrière-plan peut être remplacé par des systèmes d’agents comme Codex ou Claude Code sans réentraîner le modèle conversationnel.
Gander découpe l’interaction en segments d’une seconde et utilise environ les deux minutes de conversation précédentes comme contexte pour ses décisions de timing. Le modèle ne s’appuie pas sur un détecteur séparé de début et de fin de parole, selon le rapport technique décrit par The Decoder. Les utilisateurs peuvent interrompre Gander pendant qu’il parle, modifier la tâche demandée ou répondre à des questions de suivi pendant que le travail se poursuit.
Cette architecture ressemble à un mouvement plus large de l’industrie vers des agents IA orchestrés plutôt qu’un seul modèle gérant chaque étape d’une interaction. OpenAI a également exploré la séparation entre conversation en direct et raisonnement en arrière-plan, tandis que d’autres systèmes de recherche délèguent le travail entre plusieurs modèles.
Les preuves les plus solides présentées pour Gander concernent le respect des tours de parole plutôt que l’intelligence générale. Dans Full-Duplex-Bench v3, un benchmark pour assistants vocaux couvrant différents scénarios de tâches, le système de Tencent aurait commencé à parler au bon moment dans les 100 scénarios testés et interrompu les utilisateurs dans 8 % des cas.
The Decoder a rapporté des chiffres comparatifs de 13,5 % pour GPT-Realtime et de près de 48 % pour le concurrent le plus faible dans la même évaluation. Ces chiffres proviennent des résultats de benchmark rapportés par l’équipe de recherche, et non d’une évaluation indépendante, et le benchmark n’est pas une norme dédiée aux systèmes combinant conversation et agents en arrière-plan.
Gander a été moins performant en précision des tâches. Les chercheurs ont attribué une partie de cet écart à la manière dont le système complet est évalué : les erreurs de reconnaissance vocale et de sortie générée sont comptabilisées en plus de la performance du modèle de raisonnement. Lorsque le « cerveau » sous-jacent reçoit directement du texte, il obtient des résultats nettement meilleurs, selon le rapport.
Le modèle a également été moins performant que son modèle de base dans au moins un test de compréhension audio et vidéo. Les chercheurs ont relié ce résultat à un entraînement qui privilégie une conversation fluide plutôt qu’une perception précise, y compris pour des tâches telles que le comptage d’objets ou leur localisation dans une image. Cette limite est importante, car un système commercialisé pour une interaction multimodale continue doit non seulement gérer le dialogue, mais aussi interpréter correctement ce que les utilisateurs montrent et disent.
L’équipe de Tencent aurait entraîné Gander sur environ 2,7 millions d’exemples. Certains exemples apprennent au modèle à rester silencieux lorsqu’il y a du bruit de fond ou lorsqu’aucune personne dans un groupe ne semble lui parler. Ces comportements sont importants pour des déploiements pratiques, où les fausses activations peuvent être aussi perturbantes que des réponses tardives.
Les chercheurs présentent ce travail comme préliminaire et reconnaissent que la mise à l’échelle de l’architecture reste non résolue. Il n’existe pas non plus de cadre d’évaluation largement établi pour juger la combinaison d’une conversation à faible latence, de la gestion des interruptions, de la perception multimodale et de l’exécution de tâches de longue durée.
Tencent prévoit de publier les poids du modèle et les données d’entraînement après avoir achevé ce qu’il appelle le processus de publication open source. Un dépôt GitHub pour le code et les démonstrations du projet existe déjà, selon The Decoder. Toutefois, tant que les poids et les données ne sont pas disponibles, les développeurs externes ne peuvent pas reproduire pleinement les résultats rapportés ni évaluer les choix d’entraînement du système.
L’activité plus large de Tencent dans l’IA apporte du contexte. Gander fait suite à la publication rapportée de Hy3, un modèle de langage ouvert utilisé dans des produits comme WorkBuddy, Yuanbao et WeChat. L’entreprise négocierait également une prise de participation majeure dans la start-up d’agents Manus, une démarche qui s’inscrirait dans l’intérêt de Tencent pour l’intégration de capacités d’agent dans des plateformes grand public existantes.
Pour les développeurs qui construisent des interfaces vocales, Gander met en évidence un principe utile de conception système : la réactivité conversationnelle et l’exécution des tâches peuvent être mieux gérées par des composants distincts. Un modèle d’interaction léger peut préserver le sentiment de contrôle de l’utilisateur tandis qu’un modèle plus capable travaille de manière asynchrone. Cela pourrait réduire la nécessité de faire attendre silencieusement les utilisateurs pour une recherche, une étape de génération de code ou une action de workflow.
Le compromis est la complexité opérationnelle. Un système séparé doit coordonner l’état entre la couche conversationnelle et l’agent en arrière-plan, décider quelles interruptions doivent annuler le travail et empêcher la livraison de résultats obsolètes après qu’un utilisateur a changé de direction. Il a également besoin de signaux d’état clairs pour que les utilisateurs comprennent si le système écoute, raisonne, attend des données ou exécute encore une action.
La précision reste une préoccupation centrale. Les résultats des benchmarks suggèrent que moins d’interruptions ne produisent pas automatiquement de meilleurs résultats. Les équipes produit qui déploient des agents IA devront tester non seulement la latence et le respect des tours de parole, mais aussi la qualité de la transcription, l’ancrage visuel, l’achèvement des tâches, la reprise après interruption et le coût d’exécution de plusieurs modèles à la fois.
Pour les acheteurs d’entreprise, la publication prévue pourrait rendre Gander plus pertinent comme architecture de référence que comme produit immédiatement déployable. Des poids ouverts et des données d’entraînement permettraient aux équipes d’examiner la manière dont Tencent gère les environnements bruyants, les paroles qui se chevauchent et la rétention du contexte. Ils faciliteraient aussi la comparaison avec des systèmes commerciaux comme GPT-Realtime, Gemini Live et Grok dans des conditions cohérentes.
Le premier signal sera de savoir si Tencent publie les poids et les données d’entraînement promis, et si le paquet public inclut suffisamment de code et de matériel d’évaluation pour une reproduction indépendante. Les développeurs devraient également surveiller les résultats sur des tâches plus longues, où la planification en arrière-plan et les interruptions créent davantage d’occasions d’échecs de gestion d’état.
Un deuxième signal est de savoir si Gander améliore sa compréhension audio et vidéo sans perdre son avantage en timing. Une meilleure perception déterminerait si l’architecture peut prendre en charge de véritables assistants multimodaux plutôt que principalement des systèmes vocaux avec entrée visuelle.
Enfin, le marché aura besoin de benchmarks plus clairs pour l’interaction continue. Les résultats de Full-Duplex-Bench v3 sont utiles pour le respect des tours de parole, mais les développeurs ont besoin d’évaluations combinant la gestion des interruptions avec la précision des tâches, la sécurité, la fiabilité et le coût d’exploitation.
L’importance de Gander tient moins à un seul score de benchmark qu’à la clarification de la frontière de contrôle entre la conversation et le travail. Les utilisateurs attendent d’un assistant qu’il reste disponible pendant l’exécution d’une action, mais cette expérience dépend d’une orchestration soigneuse, et non simplement d’un modèle plus grand.
Les résultats de Tencent montrent aussi pourquoi les équipes produit devraient résister à la tentation de traiter la conversation fluide comme un substitut à une exécution fiable. Gander semble prometteur sur le timing, tandis que ses faiblesses rapportées en précision des tâches et en compréhension multimodale laissent ouverte la question plus difficile : un assistant peut-il rester naturel sans devenir moins fiable lorsque le travail compte vraiment ?