L’ONU construit avec Google une plateforme statistique prête pour l’IA, avec recherche en langage naturel, traçabilité et accès MCP après une faible précision des modèles.

Les Nations Unies travaillent avec Google pour refondre la manière dont leurs données statistiques peuvent être trouvées et utilisées par les humains et par les systèmes d’IA. Le nouveau UN System Data Commons remplace l’ancien portail UNData par une recherche en langage naturel et un accès machine direct via le Model Context Protocol, ou MCP.
Le projet répond à un problème concret : les modèles d’IA généralistes échouent souvent à récupérer des statistiques de développement de base avec précision ou de manière cohérente. Un test de l’UNICEF portant sur six modèles de premier plan a révélé un taux de précision moyen de 21,2 % sur plus de 133 000 réponses, selon João Pedro Azevedo, statisticien en chef de l’UNICEF.
Pour les développeurs d’IA et les équipes data en entreprise, l’initiative est notable parce qu’elle vise la couche située sous le modèle. Plutôt que de demander à un système d’IA de s’appuyer sur des données d’entraînement ou sur une recherche web ouverte, l’ONU crée une source structurée que les agents peuvent interroger, inspecter et citer.
Le UN System Data Commons repose sur la plateforme open source Data Commons de Google, lancée en 2018 pour organiser des jeux de données publics provenant de différents fournisseurs dans un cadre commun. La version de l’ONU rassemble des statistiques de plusieurs agences onusiennes dans un environnement unique et interrogeable.
L’ancien portail UNData obligeait les utilisateurs à parcourir et rechercher via une interface de base de données plus classique. Le nouveau système permet de poser des questions en langage naturel et de trouver des statistiques à travers les agences participantes. Il enregistre aussi l’origine de chaque statistique, ce qui permet à un utilisateur — ou à une application d’IA — de remonter une réponse jusqu’à sa source onusienne sous-jacente.
L’ONU a indiqué que 26 entités se sont engagées à utiliser la plateforme, avec des données provenant de près de 20 disponibles au lancement. Son objectif est de faire migrer 80 % des jeux de données statistiques du système des Nations Unies vers la plateforme d’ici 2027. Ces chiffres décrivent des engagements et des objectifs, pas une migration achevée, et les éléments disponibles ne précisent pas quelle quantité de données est déjà standardisée entre les agences.
Google.org a fourni 2 millions de dollars de financement pour le renforcement des capacités ainsi qu’un soutien technique pour l’infrastructure centrale de la plateforme. L’équipe Data Commons de Google a déclaré à TechCrunch que le système est hébergé sur une instance gouvernée par l’ONU et qu’il est destiné, à terme, à être maintenu, exploité et dimensionné de manière indépendante par l’ONU.
Le partenariat fait suite à un document de travail de l’UNICEF qui a mis en évidence des faiblesses dans l’accès assisté par IA aux données de développement. Le test portait sur GPT-4o et GPT-4o-mini d’OpenAI, Claude Sonnet 4.5 et Haiku 4.5 d’Anthropic, ainsi que Gemini 2.5 Flash et Gemini 2.0 Flash de Google.
Azevedo a déclaré qu’environ trois réponses sur cinq ne fournissaient pas de chiffre exploitable, souvent parce que les modèles se montraient prudents plutôt que de répondre. Lorsque les mêmes questions ont été rejouées sur les mêmes versions de modèles environ deux jours plus tard, les modèles qui donnaient un chiffre dans les deux cas ne renvoyaient le même chiffre qu’environ une fois sur deux.
Ces résultats doivent être traités avec prudence. L’UNICEF n’a pas encore publié la méthodologie, le code ou les données de test, et le document de travail n’a pas été évalué par des pairs. Les conclusions constituent donc un avertissement précoce sur la fiabilité de la récupération d’information par IA, et non un classement définitif des modèles testés.
L’UNICEF a également signalé une forte augmentation du trafic provenant d’assistants d’IA générative. Les redirections depuis les réponses de ChatGPT vers le site de l’UNICEF ont augmenté de 67 % sur un an entre le 1er janvier et le 14 septembre, selon Azevedo. Ces redirections représentaient 6,4 % de l’ensemble des sessions, tandis que l’UNICEF estimait que les assistants IA représentaient environ une visite sur dix au total. Il s’agit de chiffres de trafic communiqués par l’agence, qui ne montrent pas si les visiteurs ont fait confiance aux réponses reçues ou ont agi en conséquence.
Le support du Model Context Protocol est central pour l’usage visé de la plateforme. MCP offre aux applications d’IA un moyen standard de se connecter à des outils et à des sources de données externes. Google a ajouté la prise en charge de MCP à Data Commons l’an dernier, permettant aux agents d’IA d’interroger directement des statistiques et d’en récupérer les sources.
Cela transforme le flux de travail, qui passe d’une simple réponse à une question à l’assemblage de données. Dans une démonstration de Google, un système d’IA relié aux données de l’ONU via MCP a identifié des statistiques liées à l’impact du President’s Emergency Plan for AIDS Relief des États-Unis en Afrique. Il a combiné des indicateurs tels que les infections par le VIH, la mortalité liée au sida et l’espérance de vie pour produire une infographie.
Pour les équipes produit, la distinction importante est celle entre récupérer une valeur vérifiée et générer une analyse à partir de plusieurs valeurs. Un système connecté peut créer des tableaux de bord, des graphiques ou des rapports écrits sans obliger l’utilisateur à localiser et combiner manuellement des jeux de données. Cependant, la qualité du résultat dépend toujours de la capacité de l’agent à choisir les bons indicateurs, à comprendre leurs définitions et à préserver les différences de géographie, de période et de méthodologie.
La démonstration de Google est un exemple fourni par un éditeur, et non une évaluation indépendante des performances en production. L’accès à des données faisant autorité peut réduire une source d’erreur, mais il n’empêche pas un modèle d’IA d’interpréter les données de travers ou d’en tirer une conclusion non fondée.
Le projet de l’ONU va dans le sens d’une architecture plus contrôlée pour les applications d’IA qui répondent à des questions sur les politiques publiques, la santé, le développement et l’économie. Les développeurs peuvent utiliser une source de données gouvernée et traçable plutôt que de traiter un modèle de langage comme s’il était lui-même la base de données. Cela pourrait faciliter l’audit des réponses, la mise à jour des chiffres et l’identification de la source derrière un graphique généré.
Cela accroît aussi les exigences de mise en œuvre. Une interface utile pour agent doit exposer plus qu’un simple nombre : elle doit conserver le jeu de données, l’éditeur, la définition, l’unité, le périmètre géographique et la période de reporting. Sans ce contexte, une statistique techniquement correcte peut tout de même être utilisée de manière incorrecte. La décision de l’ONU de suivre la chaîne de provenance est donc aussi importante que son interface en langage naturel.
Les acheteurs en entreprise ne devraient pas interpréter ce lancement comme la preuve que l’analyse générée par IA est prête à être publiée sans supervision. Prem Ramaswami de Google a déclaré qu’une revue humaine devait rester en place, car les modèles peuvent mal interpréter les nuances. Cet avertissement est particulièrement pertinent pour les statistiques officielles, où de petites différences de définition peuvent modifier substantiellement une conclusion.
Le projet donne aussi à Google un rôle dans l’infrastructure utilisée pour accéder aux données du secteur public, même si la destination affichée est un système gouverné par l’ONU et exploité de manière indépendante. Son importance à long terme dépendra de la capacité de l’ONU à maintenir des schémas cohérents, des calendriers de mise à jour, des contrôles d’accès et une qualité de source homogène à travers des dizaines d’agences.
Le premier signal sera la publication par l’UNICEF de sa méthodologie, de son code et de ses données. Ces éléments devraient clarifier comment le benchmark a défini la précision, quelles questions ont été posées, et si les différences de modèles rapportées résistent à une revue indépendante.
Le second est l’adoption réelle du UN System Data Commons. Les progrès vers l’objectif de 2027, le nombre de jeux de données migrés et la cohérence des métadonnées entre les agences montreront si la plateforme devient une infrastructure opérationnelle ou reste une couche de démonstration.
Les développeurs d’IA devraient aussi surveiller des intégrations MCP au-delà des exemples de Google, y compris des outils indépendants testant la précision des citations, la fraîcheur des mises à jour et le comportement des agents lorsque les sources de données divergent. Pour les institutions, la question clé est de savoir si les résultats générés peuvent être audités avec suffisamment de fiabilité pour la recherche, l’analyse des politiques publiques et la communication publique.
L’initiative de l’ONU s’attaque à une partie négligée de la pile d’IA : l’accès fiable à une information structurée et faisant autorité. De meilleurs modèles seuls ne résoudront probablement pas le problème mis en évidence par le test de l’UNICEF si le chemin de récupération sous-jacent est ambigu ou difficile à vérifier.
Le test le plus difficile sera la gouvernance, pas la démonstration. Si l’ONU parvient à maintenir des définitions, une traçabilité et des mises à jour cohérentes tout en ouvrant ses données aux agents, la plateforme pourrait devenir une architecture de référence pratique pour l’IA du secteur public. Sinon, MCP pourrait simplement rendre plus rapide l’extraction de données incohérentes et leur transformation en analyses soignées mais trompeuses.