发布于2026-08-16 阅读(0)
扫一扫,手机访问
联合国贸易和发展会议(UNCTAD)最近发出一个很明确的信号:当人工智能开始渗透经济的每个角落,数据已经不再是普通的资源,而是一种战略资源。问题在于,这些数据产生的收益,该怎么分才公平?尤其是那些发展中国家——它们每天都在产出大量有价值的数字数据,却几乎对数据的使用规则说不上话。
换句话说,数据的价值和收益到底归谁,最终还是看规则由谁来写。数据治理的焦点早就不是“谁拥有数据”那么简单了,而是“谁有资格决定什么样的数据能用,以及用什么规则来用”。UNCTAD的态度很务实:不试图搞一个全球统一的监管框架,而是主张基于共同原则、保障机制和国际合作,逐步推进。
Senscience的联合创始人兼CEO、多伦多大学教授希尔(Sean Hill)也持类似看法。他认为,数据治理中真正关键的,是标准和规则的制定权——这东西本身就在决定价值和收益的分配。眼下,围绕“AI就绪数据”(即经过整理、可以直接用于训练和分析的数据)的标准之争,正在全球沿着几条不同的路径展开。

希尔把当前的格局归纳为三个各有侧重的中心:欧洲在强制要求和标准制定上领先,美国在投资和采纳上领先,而亚洲部分地区——尤其中国——则在基础设施上快速推进,并且存着制定标准、而不是被动继承标准的雄心。
欧美两条路截然不同。欧洲把开放数据写进了研究资助的基因里:“地平线欧洲”计划默认要求开放数据,推行FAIR原则(可发现、可访问、可互操作、可重用),还有Plan S和欧洲开放科学云,让论文一发表就能免费阅读下载。欧盟还成立了研究评估改革联盟(CoARA),改革对研究者的评价方式。再加上GDPR和《人工智能法案》作为合规背景,整套体系相当完整。
美国则是市场导向,靠机构政策一步步推进。比如NIH从2024年开始要求新项目提交数据管理与共享计划。值得注意的是,白宫科技政策办公室(OSTP)2024年发布的“纳尔逊备忘录”,要求所有联邦机构在2025年底前让联邦资助的研究成果及其数据免费、即时、无禁令期地向公众开放——但这道指令已经陷入停滞。到了2026年,特朗普政府领导下的OSTP正在着手废止它。
在希尔看来,两种路径导向不同结果:更多资本流向了美国的AI就绪数据,而欧洲则筑起更持久、更可复用的基础。它们不是对立关系,但各有缺口。没有基础设施的规则只会加重研究者的负担,而没有溯源的规模则会产出没人能复用的数据。
他说得挺直白:“只有当标准可以被机器执行、整理又足够简便,以至于合规成为良好研究实践的副产品,而不是一项额外的杂务时,科学才能进步——这正是我们用FAIR²想要弥合的那道缝隙。”Senscience开发的FAIR²数据管理体系,就是为科研数据建立一套可核验的质量与溯源标准。
希尔提醒,真正值得担忧的鸿沟,不在不同路径之间,而在于“有没有AI就绪基础设施”这条分界线。他拿基因组学举例:多年以来,非洲人群的DNA样本被采集后运往境外分析,相关的科学和工具也在别处建立。这正是非洲人类遗传与健康计划(H3Africa)当初想要弥合的那种落差。
这才是AI时代的真正风险:那些缺乏AI就绪基础设施的机构,被降格为向别处所建系统供应原料的角色。既参与不了标准制定,也分享不到由此而来的发现。
UNCTAD也表达了同样的担忧——发展中国家可能沦为宝贵数据的供应方,但在规则制定中缺乏实质话语权。这也正是贸发会议主张用共同原则、而不是单一全球模式来构建合作的用意:在保留各国政策灵活性的同时,避免决策权集中到少数国家和科技公司手里。
标准一旦彼此割裂,代价会随之而来。希尔把这称为对科学的“直接课税”。在数据密集型领域,进步来自把数据跨越国界地汇集起来,直到达到某个规模,规律才会显现。互不兼容的标准会打断这一过程:同一套数据得准备两遍,而在一套体系下整理的数据,可能根本没法跟另一套合并。
他拿罕见病研究举例:“任何一个国家大概都只有区区几百个病例,少到不足以查明病因;答案只有在欧洲、亚洲及其他地区的病例队列合并在一起时才会浮现。如果它们没法合并,那项发现就不会发生,或者要迟上很多年。”
代价首先落在研究者身上,然后是科学本身,但最深的代价落在社会——治愈手段来得更慢,发现被延误,努力被重复。公众要付两次钱:一次为研究买单,另一次体现在那些迟到、甚至永远不会兑现的收益上。出路不在于统一,而在于兼容:“标准不必完全一致,但必须能够互操作。”
标准之争的另一端,落在使用数据训练模型的企业身上。希尔认为,当前真正能做到规范获取科研数据的AI公司寥寥无几,普遍做法是“先大规模抓取,来源问题事后再说,甚至根本不管”。
在他看来,AI公司使用他人数据,应该承担跟任何研究者相同的责任:清楚数据来源、予以署名、尊重使用条款,并对数据背后的人表示感谢。数据溯源是可信度的根基,不是一种礼节。
针对这个现状,希尔给出的解法落在数据被处理和认证的具体方式上。他主张,当一套数据被整理成可直接用于训练的“AI就绪成品包”时,溯源与署名信息应当随包保留,而不是在打包过程中被剥离。来源清晰的数据,本身就是“更好、更可信的数据”。
由谁为数据质量背书,也有讲究。认证要真正有意义,前提是质量判断与商业动机相互隔离——交由与结果没有利害关系的独立同行评审来完成。更关键的是评审的形式:与其给出一个凭印象得来的不透明评分,不如把标准写成一条条“离散、可核验的陈述”,由评审人逐条勾验。认证所记录的不是一个分数,而是一套数据满足了哪些具体条款。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9