21.2%:這個數字促使聯合國為 AI 時代重建數據入口
聯合國與 Google 合作推出 System Data Commons——支援自然語言搜尋、MCP 代理存取與來源追溯,橫跨 26 個機構的統計數據平台。起因是 UNICEF 的基準測試發現,前沿 LLM 回答全球發展指標問題的平均正確率僅 21.2%。
2026 年 9 月 17 日(週四),聯合國啟用了迄今為止最接近「AI 時代大門」的系統:UN System Data Commons。這個建立在 Google 開源 Data Commons 框架上的單一平台,支援自然語言搜尋,讓 AI 代理能直接查詢聯合國官方統計數據——而且 AI 引用的每一個數字,都能追溯到產生它的機構。
新平台取代了老舊的 UNData 入口網站——在那裡,使用者得透過傳統資料庫介面逐層瀏覽統計數據。而這次推出的動機,來自一個相當刺眼的數字:UNICEF 對六個前沿大型語言模型進行了超過 133,000 次回應的基準測試,主題是全球發展指標,結果平均正確率只有 21.2%。UNICEF 首席統計學家 João Pedro Azevedo 在一場線上簡報中向記者公布了這個數字。受測模型涵蓋 OpenAI 的 GPT-4o 與 GPT-4o-mini、Anthropic 的 Claude Sonnet 4.5 與 Haiku 4.5,以及 Google 的 Gemini 2.5 Flash 與 Gemini 2.0 Flash。
為什麼 21.2% 說明了一切
這個數字並不是在指控哪一家實驗室——它衡量的是一個結構性問題:當全球最權威的統計數據被困在為「人類瀏覽表格」設計的介面背後,而非為「模型綜合回答」設計時,會發生什麼事。在 UNICEF 的測試中,每五個回應就有三個根本沒有給出可用的數字,常常是因為模型閃爍其詞。更值得注意的是:當同樣的問題在大約兩天後、用相同版本的模型重新提問時,兩次都給出數字的模型中,只有約一半兩次回傳了完全相同的數字。換言之,今天引用 UN 數據的 AI,多半不是拒答,就是在兩個不同的虛構值之間擲硬幣。
這項研究是一份準備投稿期刊的 UNICEF 工作論文,尚未經過同儕審查;該組織表示將隨論文一同公開方法論、程式碼與資料。
與此同時,流量趨勢正朝「不作為後果最嚴重」的方向演變。UNICEF 的數據網站每月超過 600 萬次造訪,是該機構最受歡迎的網站之一。2026 年 1 月 1 日至 9 月 14 日之間,從 ChatGPT 回答中點擊連結而來的造訪量年增 67%;這類轉介佔今年所有工作階段的 6.4%,UNICEF 估計 AI 助理整體已佔約十分之一的造訪量。人們已經在向 AI 詢問兒童死亡率、疫苗覆蓋率與入學率——唯一的問題是,答案究竟錨定在聯合國的數字上,還是錨定在幻覺上。
平台實際上做了什麼
UN System Data Commons 建立在 Google 的 Data Commons 之上——這是 Google 自 2018 年推動的計畫,將不同來源的公開資料集組織進共同框架,用共享的圖譜架構(graph schema)跨來源正規化實體與變數。聯合國的版本保留了這套架構,但運行在 UN 自行治理的實例上;Google.org 提供了 200 萬美元的能力建設資金與技術支援,協助建立核心基礎設施。Google Data Commons 團隊負責人 Prem Ramaswamy 告訴 TechCrunch,這套系統最終目標是由聯合國獨立維護、營運與擴展——目前採取「培訓培訓者」(train-the-trainer)模式,UN 系統團隊上手速度已經相當快。
三項能力定義了這個平台:
- 跨機構自然語言搜尋。 使用者能用日常語言提問,直接取得來自多個 UN 實體的統計數據,不必再逐個入口網站翻找。目前已有 26 個 UN 實體承諾加入 Data Commons,上線時約有 20 個機構的資料可用。聯合國的目標是 2027 年前將全系統 80% 的統計資料集搬上平台。
- MCP 代理支援。 平台支援 Model Context Protocol——這是讓 AI 系統連接外部資料來源的新興標準。Google 去年為 Data Commons 加入了 MCP 支援;透過它連線的代理,查詢 UN 統計數據時能同時拿到數值與出處。在一場示範中,Google 讓一套 AI 系統評估美國「總統愛滋病緊急救援計畫」(PEPFAR)在非洲的影響——系統自動找出 HIV 感染、愛滋病死亡率與預期壽命等相關 UN 統計,並產出一份資訊圖表,全程無需人工組裝資料集。
- 預設來源追溯。 平台追蹤每個統計數字的來源,讓 AI 取用的資料能回溯到原始 UN 出處——這正是針對 UNICEF 基準測試揭露的引用問題,所給出的結構性解答。
「我們在規模、範圍與彈性上都有數量級的躍進,史上頭一次把這麼多聯合國系統內的機構連結起來,」聯合國統計司代理司長 Shantanu Mukherjee 在聲明中表示,「而且我們藉此機會,讓數據變得 AI-ready。」
這次推出背後的脈絡
Data Commons 是 UN80 改革計畫「第 16 號工作套件」(資料)下的旗艦專案,由 UN DESA、UNICEF 與秘書長辦公室共同領導。聯合國與 Google 在 Data Commons 上的合作可追溯到 2023 年——當年 UN Data Commons for the SDGs 首度將永續發展目標資料整合進框架,2024 年再擴及另外十多個機構。本週的新意在於規模(26 個承諾加入的實體)、AI 原生存取層(MCP),以及明確的定位宣示:官方統計從今以後既是人類的基礎設施,也是機器的基礎設施。
但這個定位伴隨著兩個組織都反覆強調的警告:給 AI 權威資料,不代表它的結論就是權威的。「因為模型可能誤解細微之處,在引用或發布之前,人類應該永遠先審視輸出內容,」Ramaswamy 說。
意義所在
對 AI 開發者而言,這份禮物是有來源標記、有出處追蹤的接地(grounded)資料,涵蓋前沿模型明顯處理不佳的發展指標領域。對聯合國而言,這等於承認:全球統計數據的介面已經不再是網頁,而是模型——而掌控出處追溯的組織,就掌控了 AI 中介資訊生態裡「權威」一詞的定義權。對關注 MCP 生態系的人來說,這是該協議迄今在大型 AI 實驗室之外最高調的正式部署之一:一個由聯合國治理的實例,任何講這套標準的代理都能查詢。
21.2% 這個數字值得繼續讓人不自在。它衡量的,是全球最先進的模型對全球最弱勢群體的描述,與真實數據之間的落差——而聯合國的新平台押注的是:解方不在更好的模型,而在更好的管道。
Sources
- [1] https://techcrunch.com/2026/09/17/un-turns-to-google-to-make-its-global-data-ready-for-ai-agents/
- [2] https://webtv.un.org/en/asset/k1d/k1dzd1svin
- [3] https://blog.datacommons.org/2025/10/02/announcing-the-data-commons-model-context-protocol-server/
- [4] https://blog.google/company-news/outreach-and-initiatives/public-policy/un-data-commons-expansion/