联合国系统推出了开源平台 UN System Data Commons,旨在将其不同实体发布的统计数据汇集到一个可搜索、可分析的资源中。该平台基于 Google 开发的 Data Commons,将分散的数据转化为相互连接的知识图谱,供基于人工智能的工具和系统处理。
该平台旨在解决研究人员和分析师面临的一个实际问题:有关健康、贫困、教育、能源等方面的统计数据分散在多个机构中,且格式、编排方式和地理边界并不一致。根据已发布的文章,在开始实际分析之前,收集并关联这些数字过去需要数月的人工工作。
在统一环境中关联指标和数据
该平台将指标、时间序列和地理边界整合到一个相互连接的环境中,使用户能够考察多个数据集之间的关系,而不是孤立地处理每个来源。Google 表示,这种方法可以让数据分析师有更多时间寻找趋势和构建基于证据的解决方案,而不是整理和重新协调电子表格。
该项目获得了从 Google.org 到 UN Foundation 的支持。文章还确认,数据集经过联合国系统统计学家和技术专家的共同核验。这一点很重要,因为数据标准化并不能消除对指标定义、来源和背景进行核验的必要性。
自然语言搜索和研究助手
该平台允许用户以日常语言提出问题,例如农村地区获得清洁水对入学率的影响,或世界各地区预期寿命的变化。用户还可以使用 Explore 部分按地点或主题筛选数据,包括健康和教育;Blog 部分则提供有关特定趋势的简明报告,例如分析 UNICEF 关于减少儿童贫困的数据。
此次发布还为研究工作流程中的人工智能助手增加了相关能力。基于 Model Context Protocol (MCP) 等开放标准,智能体可以访问平台中的可靠数字,关联不同领域的数据,然后制作图表、示意图或初步书面材料。不过,Google 提醒,即使所使用的数据已记录并经过核验,在引用重要数字之前仍有必要查阅原始来源。
为什么这条消息重要?
核心变化并不只是增加了一个新的搜索界面,而是试图在原本各自独立运行的统计数据之上建立一个共享层。这可能降低研究人员、记者和项目管理人员获取数据的成本,并使不同指标之间的比较更加直接。但结果的价值仍将取决于数据定义的质量、数据之间的兼容性以及其地理和时间范围;同样,使用智能助手也不能免除人工核查。
联合国系统计划在明年加入其他实体的数据集,目标是到 2027 年纳入其 80% 的统计数据集。该平台可通过 data.un.org 访问。