Die UN baut gemeinsam mit Google eine KI-fähige Statistikplattform auf und ergänzt sie nach schlechter Modellgenauigkeit um natürliche Sprachsuche, Herkunftsnachweise und MCP-Zugriff.

Die Vereinten Nationen arbeiten mit Google daran, neu zu gestalten, wie ihre statistischen Daten von Menschen und KI-Systemen gefunden und genutzt werden können. Der neue UN System Data Commons ersetzt das ältere UNData-Portal durch eine Suche in natürlicher Sprache und direkten Maschinenzugriff über das Model Context Protocol, kurz MCP.
Das Projekt reagiert auf ein praktisches Problem: Allzweck-KI-Modelle scheitern oft daran, grundlegende Entwicklungsstatistiken genau oder konsistent abzurufen. Ein UNICEF-Test mit sechs führenden Modellen ergab laut João Pedro Azevedo, dem Chefstatistiker von UNICEF, eine durchschnittliche Genauigkeit von 21,2 % über mehr als 133.000 Antworten hinweg.
Für Entwickler von KI und Enterprise-Datenteams ist die Initiative bemerkenswert, weil sie die Schicht unterhalb des Modells adressiert. Anstatt ein KI-System auf Trainingsdaten oder eine offene Websuche zu verlassen, schafft die UN eine strukturierte Quelle, die Agenten abfragen, prüfen und zitieren können.
Der UN System Data Commons basiert auf Googles Open-Source-Plattform Data Commons, die Google 2018 gestartet hat, um öffentliche Datensätze verschiedener Anbieter in einem gemeinsamen Rahmen zu organisieren. Die UN-Version bringt Statistiken mehrerer UN-Organisationen in eine einzige durchsuchbare Umgebung.
Das frühere UNData-Portal erforderte von den Nutzern, durch eine konventionellere Datenbankoberfläche zu browsen und zu suchen. Das neue System ermöglicht es, Fragen in natürlicher Sprache zu stellen und Statistiken über teilnehmende Organisationen hinweg zu finden. Außerdem erfasst es den Ursprung jeder Statistik, sodass ein Nutzer – oder eine KI-Anwendung – eine Antwort bis zu ihrer zugrunde liegenden UN-Quelle zurückverfolgen kann.
Die UN erklärte, dass sich 26 Einheiten zur Plattform verpflichtet haben und zum Start Daten von fast 20 verfügbar seien. Ziel ist es, bis 2027 80 % der statistischen Datensätze des UN-Systems auf die Plattform zu bringen. Diese Zahlen beschreiben Zusagen und Ziele, nicht eine abgeschlossene Migration, und aus den vorliegenden Informationen geht nicht hervor, wie viel Daten bereits zwischen den Organisationen standardisiert ist.
Google.org stellte 2 Millionen US-Dollar an Fördermitteln für Kapazitätsaufbau sowie technische Unterstützung für die Kerninfrastruktur der Plattform bereit. Das Data-Commons-Team von Google teilte TechCrunch mit, dass das System auf einer von der UN verwalteten Instanz gehostet werde und schließlich von der UN unabhängig gewartet, betrieben und skaliert werden solle.
Die Partnerschaft folgt auf ein UNICEF-Arbeitspapier, das Schwächen beim KI-gestützten Zugriff auf Entwicklungsdaten offenlegte. Getestet wurden OpenAIs GPT-4o und GPT-4o-mini, Anthropics Claude Sonnet 4.5 und Haiku 4.5 sowie Googles Gemini 2.5 Flash und Gemini 2.0 Flash.
Azevedo sagte, etwa drei von fünf Antworten hätten keine brauchbare Zahl geliefert, oft weil die Modelle ausweichen statt direkt zu antworten. Als dieselben Fragen etwa zwei Tage später erneut mit denselben Modellversionen gestellt wurden, gaben Modelle, die bei beiden Gelegenheiten eine Zahl lieferten, nur in etwa der Hälfte der Fälle dieselbe Zahl zurück.
Die Ergebnisse sollten mit Vorsicht behandelt werden. UNICEF hat die Methodik, den Code oder die Testdaten noch nicht veröffentlicht, und das Arbeitspapier wurde nicht peer-reviewed. Die Erkenntnisse sind daher eine Frühwarnung zur Zuverlässigkeit von KI-Abfragen, nicht ein endgültiges Ranking der getesteten Modelle.
UNICEF meldete außerdem einen starken Anstieg des Traffics, der von generativen KI-Assistenten kam. Verweise aus ChatGPT-Antworten auf die UNICEF-Website stiegen laut Azevedo zwischen dem 1. Januar und dem 14. September im Jahresvergleich um 67 %. Solche Verweise machten 6,4 % aller Sitzungen aus, während UNICEF schätzte, dass KI-Assistenten insgesamt etwa jede zehnte Besuche ausmachten. Diese Zahlen stammen von der Behörde selbst und zeigen nicht, ob Besucher den erhaltenen Antworten vertrauten oder daraufhin handelten.
Die Unterstützung des Model Context Protocol ist zentral für den vorgesehenen Einsatz der Plattform. MCP gibt KI-Anwendungen eine standardisierte Möglichkeit, sich mit externen Werkzeugen und Datenquellen zu verbinden. Google fügte Data Commons im vergangenen Jahr MCP-Unterstützung hinzu, sodass KI-Agenten Statistiken direkt abfragen und ihre Quellen abrufen können.
Dadurch verändert sich der Workflow von einfacher Fragebeantwortung hin zur Datenzusammenstellung. In einer Google-Demonstration identifizierte ein über MCP mit den UN-Daten verbundenes KI-System Statistiken zum Einfluss des US President’s Emergency Plan for AIDS Relief in Afrika. Es kombinierte Indikatoren wie HIV-Infektionen, AIDS-Sterblichkeit und Lebenserwartung, um eine Infografik zu erstellen.
Für Produktteams ist der wichtige Unterschied der zwischen dem Abruf eines verifizierten Einzelwerts und der Generierung einer Analyse aus mehreren Werten. Ein verbundenes System kann Dashboards, Diagramme oder schriftliche Berichte erstellen, ohne dass ein Nutzer Datensätze manuell finden und zusammenführen muss. Die Qualität des Ergebnisses hängt jedoch weiterhin davon ab, ob der Agent geeignete Indikatoren auswählt, ihre Definitionen versteht und Unterschiede bei Geografie, Zeitraum und Methodik beibehält.
Die Google-Demonstration ist ein Anbieterbeispiel und keine unabhängige Bewertung der Produktionsleistung. Der Zugang zu autoritativen Daten kann eine Fehlerquelle verringern, verhindert aber nicht, dass ein KI-Modell die Daten falsch interpretiert oder daraus eine unbegründete Schlussfolgerung zieht.
Das UN-Projekt weist auf eine stärker kontrollierte Architektur für KI-Anwendungen hin, die Fragen zu öffentlicher Politik, Gesundheit, Entwicklung und Wirtschaft beantworten. Entwickler können eine verwaltete Datenquelle mit Herkunftsnachweisen nutzen, statt ein Sprachmodell selbst als Datenbank zu behandeln. Das könnte es erleichtern, Antworten zu prüfen, Kennzahlen zu aktualisieren und die Quelle hinter einem erzeugten Diagramm zu identifizieren.
Es erhöht auch die Anforderungen an die Umsetzung. Eine nützliche Agentenoberfläche muss mehr als nur eine Zahl offenlegen: Sie sollte Datensatz, Herausgeber, Definition, Einheit, geografischen Geltungsbereich und Berichtszeitraum beibehalten. Ohne diesen Kontext kann eine technisch korrekte Statistik dennoch falsch verwendet werden. Die Entscheidung der UN, die Quellenherkunft zu verfolgen, ist daher ebenso wichtig wie die Schnittstelle in natürlicher Sprache.
Unternehmenskäufer sollten den Start nicht als Beweis dafür interpretieren, dass KI-generierte Analysen bereit für eine unbeaufsichtigte Veröffentlichung sind. Googles Prem Ramaswami sagte, eine menschliche Prüfung müsse bestehen bleiben, weil Modelle Nuancen falsch interpretieren können. Diese Warnung ist besonders relevant für offizielle Statistiken, bei denen kleine Definitionsunterschiede das Fazit erheblich verändern können.
Das Projekt verschafft Google außerdem eine Rolle in der Infrastruktur, die für den Zugriff auf Daten des öffentlichen Sektors genutzt wird, auch wenn das erklärte Ziel ein von der UN verwaltetes und unabhängig betriebenes System ist. Seine langfristige Bedeutung wird davon abhängen, ob die UN konsistente Schemata, Aktualisierungspläne, Zugriffskontrollen und Quellenqualität über Dutzende von Organisationen hinweg aufrechterhalten kann.
Das erste Signal wird die Veröffentlichung von Methodik, Code und Daten durch UNICEF sein. Dieses Material sollte klären, wie der Benchmark Genauigkeit definiert hat, welche Fragen gestellt wurden und ob die gemeldeten Modellunterschiede einer unabhängigen Prüfung standhalten.
Das zweite ist die tatsächliche Nutzung des UN System Data Commons. Fortschritte in Richtung des Ziels für 2027, die Zahl der migrierten Datensätze und die Konsistenz der Metadaten zwischen den Organisationen werden zeigen, ob die Plattform zu operativer Infrastruktur wird oder eine Demonstrationsschicht bleibt.
KI-Entwickler sollten außerdem auf MCP-Integrationen jenseits von Googles Beispielen achten, einschließlich unabhängiger Tools, die Zitiergenauigkeit, Aktualität der Daten und das Verhalten von Agenten testen, wenn Datenquellen widersprüchlich sind. Für Institutionen lautet die Schlüsselfrage, ob erzeugte Ausgaben so zuverlässig geprüft werden können, dass sie sich für Forschung, politische Analyse und öffentliche Kommunikation eignen.
Der Schritt der UN adressiert einen vernachlässigten Teil des KI-Stacks: den zuverlässigen Zugang zu strukturierten, autoritativen Informationen. Bessere Modelle allein werden das von UNICEF getestete Problem wahrscheinlich nicht lösen, wenn der zugrunde liegende Abrufweg unklar oder schwer zu überprüfen ist.
Der schwierigere Test wird die Governance sein, nicht die Demonstration. Wenn die UN Definitionen, Herkunft und Aktualisierungen konsistent halten und ihre Daten gleichzeitig für Agenten öffnen kann, könnte die Plattform zu einer praktischen Referenzarchitektur für KI im öffentlichen Sektor werden. Wenn nicht, könnte MCP es lediglich schneller machen, inkonsistente Daten abzurufen und in eine ausgefeilte, aber irreführende Analyse zu verwandeln.