유엔은 Google과 함께 자연어 검색, 출처 추적, MCP 접근을 갖춘 AI 준비형 통계 플랫폼을 구축하고 있으며, 이는 낮은 모델 정확도에 대응하기 위한 것이다.

유엔은 사람과 AI 시스템이 통계 데이터를 더 쉽게 찾고 활용할 수 있도록 하는 방식을 Google과 함께 새로 설계하고 있다. 새 UN System Data Commons는 기존 UNData 포털을 대체하며, 자연어 검색과 Model Context Protocol(MCP)을 통한 직접적인 기계 접근을 제공한다.
이 프로젝트는 실용적인 문제에 대응한다. 범용 AI 모델은 기본적인 개발 통계를 정확하고 일관되게 가져오지 못하는 경우가 많다. 유니세프의 6개 주요 모델 테스트에서 13만 3,000건이 넘는 응답 기준 평균 정확도는 21.2%였다고 유니세프 수석통계관 조앙 페드루 아제베두는 밝혔다.
AI 빌더와 기업 데이터 팀에게 이 이니셔티브가 주목되는 이유는 모델 아래 계층을 겨냥하기 때문이다. AI 시스템이 학습 데이터나 자유형 웹 검색에 의존하도록 하는 대신, 유엔은 에이전트가 질의하고, 검토하고, 인용할 수 있는 구조화된 소스를 만들고 있다.
UN System Data Commons는 Google이 2018년에 출시한 오픈소스 Data Commons 플랫폼을 기반으로 구축됐다. 이는 서로 다른 제공자의 공공 데이터셋을 공통 프레임워크 안에서 정리하기 위한 것이다. 유엔 버전은 여러 유엔 기관의 통계를 하나의 검색 가능한 환경으로 통합한다.
이전 UNData 포털은 사용자가 더 전통적인 데이터베이스 인터페이스를 통해 탐색하고 검색해야 했다. 새 시스템은 자연어로 질문하고 참여 기관 전반에서 통계를 찾을 수 있게 한다. 또한 각 통계의 출처를 기록해, 사용자나 AI 애플리케이션이 답변을 그 근거가 되는 유엔 원천까지 추적할 수 있도록 한다.
유엔은 26개 기관이 플랫폼 참여를 약속했으며, 출시 시점에 약 20개 기관의 데이터가 उपलब्ध했다고 밝혔다. 목표는 2027년까지 유엔 시스템 통계 데이터셋의 80%를 플랫폼으로 옮기는 것이다. 이 수치는 이행 완료가 아니라 약속과 목표를 나타내며, 현재 기관 간 데이터가 얼마나 표준화돼 있는지는 명시되지 않았다.
Google.org는 역량 강화 자금 200만 달러와 플랫폼 핵심 인프라에 대한 기술 지원을 제공했다. Google의 Data Commons 팀은 TechCrunch에 이 시스템이 유엔이 관리하는 인스턴스에서 호스팅되며, 궁극적으로는 유엔이 독립적으로 유지·운영·확장하는 것을 목표로 한다고 말했다.
이번 협력은 AI 지원 개발 데이터 접근의 취약점을 드러낸 유니세프 워킹페이퍼에 따른 것이다. 테스트 대상은 OpenAI의 GPT-4o와 GPT-4o-mini, Anthropic의 Claude Sonnet 4.5와 Haiku 4.5, Google의 Gemini 2.5 Flash와 Gemini 2.0 Flash였다.
아제베두는 약 5개 응답 중 3개가 쓸 수 있는 수치를 제공하지 못했으며, 이는 종종 모델이 답을 회피했기 때문이라고 말했다. 같은 질문을 약 이틀 뒤 같은 모델 버전으로 다시 실행했을 때, 두 번 모두 수치를 제시한 모델도 같은 수치를 반환한 비율은 약 절반에 불과했다.
이 결과는 신중하게 봐야 한다. 유니세프는 아직 방법론, 코드, 테스트 데이터를 공개하지 않았고, 워킹페이퍼도 동료 검토를 거치지 않았다. 따라서 이번 발견은 AI 검색의 신뢰성에 대한 초기 경고일 뿐, 테스트된 모델에 대한 최종 순위가 아니다.
유니세프는 생성형 AI 어시스턴트에서 유입되는 트래픽이 급증했다고도 보고했다. 아제베두에 따르면 1월 1일부터 9월 14일까지 ChatGPT 답변에서 유니세프 웹사이트로의 유입은 전년 대비 67% 증가했다. 이러한 유입은 전체 세션의 6.4%를 차지했으며, 유니세프는 AI 어시스턴트가 전체 방문의 약 10분의 1을 차지한 것으로 추정했다. 이는 기관이 보고한 트래픽 수치이며, 방문자가 받은 답변을 신뢰했는지 또는 행동으로 옮겼는지는 보여주지 않는다.
플랫폼의 MCP 지원은 의도된 활용의 핵심이다. MCP는 AI 애플리케이션이 외부 도구와 데이터 소스에 연결할 수 있는 표준 방법을 제공한다. Google은 지난해 Data Commons에 MCP 지원을 추가해 AI 에이전트가 통계를 직접 조회하고 그 출처를 가져올 수 있게 했다.
이로써 워크플로는 단순한 질의응답에서 데이터 조합으로 바뀐다. Google 데모에서 MCP를 통해 유엔 데이터에 연결된 AI 시스템은 아프리카에서 미국 대통령 에이즈 구호 긴급계획(President’s Emergency Plan for AIDS Relief)의 영향과 관련된 통계를 찾아냈다. HIV 감염, 에이즈 사망률, 기대수명 같은 지표를 결합해 인포그래픽을 만들었다.
제품 팀에게 중요한 차이는 검증된 하나의 값을 가져오는 것과 여러 값을 바탕으로 분석을 생성하는 것 사이에 있다. 연결된 시스템은 사용자가 데이터셋을 직접 찾고 결합하지 않아도 대시보드, 차트, 서면 보고서를 만들 수 있다. 그러나 결과의 품질은 여전히 에이전트가 적절한 지표를 선택하고, 정의를 이해하며, 지역·기간·방법론의 차이를 유지하는지에 달려 있다.
Google의 데모는 벤더 사례일 뿐, 실제 운영 성능에 대한 독립 평가가 아니다. 권위 있는 데이터에 대한 접근은 오류의 한 원인을 줄일 수 있지만, AI 모델이 데이터를 잘못 해석하거나 근거 없는 결론을 내리는 것을 막지는 못한다.
유엔 프로젝트는 공공 정책, 보건, 개발, 경제에 관한 질문에 답하는 AI 애플리케이션을 위한 더 통제된 아키텍처를 시사한다. 빌더는 언어 모델을 데이터베이스 자체처럼 취급하기보다, 출처가 관리되는 데이터 소스를 사용할 수 있다. 이는 답변을 감사하고, 수치를 갱신하고, 생성된 차트 뒤의 출처를 식별하는 데 도움이 될 수 있다.
또한 구현 요건도 높아진다. 유용한 에이전트 인터페이스는 숫자만 제공해서는 안 되며, 데이터셋, 발행자, 정의, 단위, 지리적 범위, 보고 기간을 보존해야 한다. 이런 맥락이 없으면 기술적으로 맞는 통계도 잘못 사용될 수 있다. 따라서 유엔이 출처 계보를 추적하기로 한 결정은 자연어 인터페이스만큼 중요하다.
기업 구매자는 이번 출범을 AI 생성 분석이 무감독으로 바로 공개할 수 있다는 증거로 받아들여서는 안 된다. Google의 프렘 라마스와미는 모델이 뉘앙스를 오해할 수 있으므로 인간 검토는 계속 필요하다고 말했다. 이 경고는 작은 정의 차이가 결론을 크게 바꿀 수 있는 공식 통계에서 특히 중요하다.
이 프로젝트는 또한 Google이 공공 부문 데이터 접근에 쓰이는 인프라에서 역할을 갖게 함을 의미한다. 다만 명시된 최종 목적지는 유엔이 관리하고 독립적으로 운영하는 시스템이다. 장기적 의미는 유엔이 수십 개 기관에 걸쳐 일관된 스키마, 업데이트 일정, 접근 제어, 소스 품질을 유지할 수 있는지에 달려 있다.
첫 번째 신호는 유니세프의 방법론, 코드, 데이터 공개다. 이를 통해 벤치마크가 정확성을 어떻게 정의했는지, 어떤 질문이 사용됐는지, 보고된 모델 간 차이가 독립 검토에서도 유지되는지 알 수 있을 것이다.
두 번째는 UN System Data Commons의 실제 채택이다. 2027년 목표를 향한 진전, 이전된 데이터셋 수, 기관 간 메타데이터의 일관성은 이 플랫폼이 운영 인프라가 되고 있는지, 아니면 시연용 레이어에 머물러 있는지를 보여줄 것이다.
AI 개발자들은 Google의 예시를 넘어선 MCP 통합도 살펴봐야 한다. 여기에는 인용 정확도, 업데이트 최신성, 데이터 소스가 서로 다를 때 에이전트가 어떻게 행동하는지를 테스트하는 독립 도구가 포함된다. 기관 입장에서는 생성된 결과물을 연구, 정책 분석, 대중 커뮤니케이션에 충분할 만큼 신뢰성 있게 감사할 수 있는지가 핵심 질문이다.
유엔의 움직임은 AI 스택에서 간과되기 쉬운 부분, 즉 구조화되고 권위 있는 정보에 대한 신뢰할 수 있는 접근을 다룬다. 하위 검색 경로가 모호하거나 검증하기 어렵다면, 더 나은 모델만으로는 유니세프 테스트가 드러낸 문제를 해결하기 어려울 가능성이 크다.
더 어려운 시험은 데모가 아니라 거버넌스다. 유엔이 정의, 출처, 업데이트를 일관되게 유지하면서 데이터를 에이전트에게 개방할 수 있다면, 이 플랫폼은 공공 부문 AI를 위한 실용적인 기준 아키텍처가 될 수 있다. 그렇지 못하다면 MCP는 단지 일관성 없는 데이터를 더 빨리 가져와 세련되지만 오해를 부르는 분석으로 바꾸는 데 그칠 수 있다.