聯合國正與 Google 建立一個 AI 就緒的統計平台,在模型準確率不佳後,加入自然語言搜尋、來源追溯與 MCP 存取。

聯合國正與 Google 合作,重新打造其統計資料被人類與 AI 系統搜尋與使用的方式。新的 UN System Data Commons 以自然語言搜尋與透過 Model Context Protocol(MCP)的直接機器存取,取代較舊的 UNData 入口網站。
這項專案回應了一個實際問題:通用型 AI 模型常常無法準確或一致地擷取基本的發展統計。根據 UNICEF 首席統計師 João Pedro Azevedo 的說法,UNICEF 對六個領先模型的測試發現,在超過 133,000 筆回應中,平均準確率只有 21.2%。
對 AI 建構者與企業資料團隊而言,這項倡議之所以值得注意,是因為它瞄準的是模型之下的那一層。聯合國不是要 AI 系統依賴訓練資料或開放式網路搜尋,而是在建立一個結構化來源,讓代理可以查詢、檢視並引用。
UN System Data Commons 建立於 Google 的開源 Data Commons 平台之上。Google 於 2018 年推出該平台,用以在共同框架中整理來自不同供應方的公開資料集。聯合國版本則把多個聯合國機構的統計資料整合到一個可搜尋的環境中。
先前的 UNData 入口網站要求使用者透過較傳統的資料庫介面瀏覽與搜尋。新系統讓使用者可以用自然語言提問,並跨參與機構搜尋統計資料。它也會記錄每一筆統計的來源,讓使用者——或 AI 應用程式——能把答案追溯回其底層的聯合國來源。
聯合國表示,已有 26 個實體承諾加入該平台,且在上線時已有近 20 個的資料可用。其目標是在 2027 年前,將聯合國系統 80% 的統計資料集納入平台。這些數字描述的是承諾與目標,而非已完成的遷移;現有證據也未說明有多少資料已在各機構間完成標準化。
Google.org 提供了 200 萬美元的能力建設資金與核心基礎設施技術支援。Google 的 Data Commons 團隊告訴 TechCrunch,該系統託管在由聯合國治理的實例上,並預計最終由聯合國獨立維護、營運與擴充。
這項合作源自 UNICEF 的一份工作論文,該論文揭示了 AI 輔助取得發展資料時的弱點。測試涵蓋了 OpenAI 的 GPT-4o 與 GPT-4o-mini、Anthropic 的 Claude Sonnet 4.5 與 Haiku 4.5,以及 Google 的 Gemini 2.5 Flash 與 Gemini 2.0 Flash。
Azevedo 表示,大約五分之三的回應未能提供可用的數字,原因通常是模型選擇閃躲而不是直接回答。當同樣的問題在約兩天後以相同模型版本再次執行時,兩次都給出數字的模型,只有大約一半的時間回傳相同數字。
這些結果應謹慎看待。UNICEF 尚未公布方法、程式碼或測試資料,而該工作論文也尚未經過同儕審查。因此,這些發現只是對 AI 檢索可靠性的早期警示,而非對受測模型的最終排名。
UNICEF 也回報,來自生成式 AI 助理的流量大幅增加。根據 Azevedo 的說法,從 ChatGPT 回答導向 UNICEF 網站的引用,在 1 月 1 日到 9 月 14 日之間年增 67%。這類引用占所有工作階段的 6.4%,而 UNICEF 估計 AI 助理約占整體造訪的十分之一。這些是該機構回報的流量數據,並未顯示訪客是否信任或據此採取行動。
該平台對 Model Context Protocol 的支援,是其預定用途的核心。MCP 讓 AI 應用程式能以標準方式連接外部工具與資料來源。Google 去年已將 MCP 支援加入 Data Commons,讓 AI 智慧代理可直接查詢統計資料並擷取其來源。
這使工作流程從單純的問答,轉變為資料組裝。在 Google 的示範中,一個透過 MCP 連接聯合國資料的 AI 系統,辨識出與美國總統非洲愛滋病緊急救援計畫在非洲影響相關的統計。它把 HIV 感染、愛滋病死亡率與平均壽命等指標結合起來,產出一張資訊圖表。
對產品團隊而言,重要的區別在於:是擷取一個經過驗證的數值,還是根據多個數值產生分析。連接式系統可以建立儀表板、圖表或書面報告,而不需要使用者手動找出並合併資料集。不過,結果品質仍取決於代理是否選對指標、是否理解其定義,以及是否保留地理範圍、時間區間與方法學上的差異。
Google 的示範是供應商案例,而非對生產環境表現的獨立評估。取得權威資料可以減少一種錯誤來源,但並不能阻止 AI 模型誤解資料或得出沒有根據的結論。
聯合國的專案指向一種更受控的 AI 應用架構,用於回答公共政策、健康、發展與經濟方面的問題。建構者可以使用具備來源追溯的治理型資料來源,而不是把語言模型本身當成資料庫。這可能讓審核答案、更新數字,以及辨識生成圖表背後的來源變得更容易。
它也提高了實作要求。有用的代理介面不能只顯示一個數字:它應保留資料集、發布者、定義、單位、地理範圍與報告期間。若缺少這些脈絡,即便是技術上正確的統計,也仍可能被錯誤使用。因此,聯合國追蹤來源脈絡的決定,和其自然語言介面一樣重要。
企業買家不應把這次上線解讀為 AI 生成分析已準備好無監督發布的證明。Google 的 Prem Ramaswami 表示,仍應保留人工審核,因為模型可能誤解細微差別。這項提醒對官方統計尤其重要,因為定義上的微小差異就可能實質改變結論。
儘管聲稱的最終目的地是由聯合國治理並獨立運作的系統,這項專案也讓 Google 在用於取得公共部門資料的基礎設施中扮演一定角色。其長期意義將取決於聯合國是否能在數十個機構之間維持一致的資料結構、更新排程、存取控制與來源品質。
第一個訊號將是 UNICEF 公布其方法、程式碼與資料。這些材料應能釐清基準測試如何定義準確率、提出了哪些問題,以及報告中的模型差異是否能通過獨立審查。
第二是 UN System Data Commons 的實際採用情況。朝 2027 年目標的進展、已遷移的資料集數量,以及跨機構中繼資料的一致性,都將揭示該平台是正走向營運基礎設施,還是仍停留在展示層。
AI 開發者也應關注超出 Google 範例之外的 MCP 整合,包括測試引註準確性、更新新鮮度,以及當資料來源彼此不一致時代理行為的獨立工具。對機構而言,關鍵問題是:生成的輸出是否能以足夠可靠的方式被稽核,用於研究、政策分析與對外溝通。
聯合國的動作觸及 AI 堆疊中一個常被忽略的部分:對結構化、權威資訊的可靠存取。如果底層檢索路徑含糊不清或難以驗證,即使模型更強,也未必能解決 UNICEF 測試所揭示的問題。
更難的考驗不是示範本身,而是治理。如果聯合國能在向代理開放資料的同時,維持定義、來源追溯與更新的一致性,這個平台有可能成為公共部門 AI 的實用參考架構。若做不到,MCP 可能只是讓人更快取得不一致的資料,並把它轉成表面精緻卻誤導性的分析。