发布于2026-06-06 阅读(0)
扫一扫,手机访问
微软最近推出的MAI系列AI模型,宣传口径一直挺明确:号称“完全基于干净数据从零开始训练,没有使用来自第三方模型的蒸馏数据”,并且反复强调只用了“企业级、干净且商业授权数据”。但最新披露的技术论文,给这套说法撕开了一道口子。
事情是这样的——科技媒体The Decoder昨天(6月5日)发了一篇报道,指出MAI模型的部分训练数据,其实来自未获授权的开放网络数据集。说白了,微软在训练过程中,并没有只依赖商业授权的“温室数据”,而是悄悄混进了Common Crawl这类互联网公开抓取的内容。这和之前对外强调的“企业级、干净且商业授权数据”之间,落差确实不小。

翻看论文的具体描述,微软采取的是“公开可得数据”与“授权的人类生成数据”混合方案——既要了授权语料库,也没放过互联网公开资源。至于这些网络数据怎么拿的,微软声称用的是自家爬虫,并且遵守了Robots Exclusion Protocol(也就是robots.txt),以及相关的元标签和HTML控制项。
不过争议点就在这里。对于没有被robots.txt明确屏蔽的内容,平台默认视为“可抓取”,内容保护的责任实际上被推到了数据所有者身上。这种逻辑,说白了有点像“你没有锁门,就等于你同意我进去”——在法律和伦理的灰色地带里,到底算不算合规,恐怕不是一句“遵守了协议”就能盖棺定论的。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9