发布于2026-05-29 阅读(0)
扫一扫,手机访问
5月29日,面壁智能联合清华大学、OpenBMB开源社区,一口气开源了两大最新数据集:Ultra-FineWeb-L3与UltraData-SFT-2605。这可不是一般的更新——Ultra-FineWeb-L3包含了高质量的中文+英文网页合成数据,总量突破600B Tokens,其中中文数据就占了200B+ Tokens,是目前开源社区规模最大的中文预训练合成数据集。而UltraData-SFT-2605,则是国内首次开源的千万级、同时包含深思考与非思考标注的SFT数据集。
如果你关注过MiniCPM5-1B的训练过程,就会发现这正是UltraData分级治理体系的一次完整实践。这次上新的两大数据集,其实已经在MiniCPM5-1B的训练流程中得到了完全验证,覆盖了从预训练退火到后训练SFT的全链路。换句话说,这不是纸上谈兵的理论成果,而是实打实地跑通了整个流程。

售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9