发布于2026-08-25 阅读(0)
扫一扫,手机访问
格灵深瞳最近放出了一个重磅消息:他们正式推出了一个名为“丹青”(DanQing)的超大规模中文视觉-语言预训练数据集。这个数据集的规模有多大?足足1亿条高质量的图文匹配样本,数据采集时间覆盖了2024到2025年的全网公开资源。更关键的是,它引入了一套更精细的数据清洗与质量评估机制。
从实际测试结果来看,“丹青”的表现确实亮眼。基于SigLIP2模型开展的基准测试显示,它在零样本图像分类、跨模态图文检索以及大型多模态模型综合能力评估等多项关键任务中,都展现出了相当突出的性能。

那么,这个数据集是怎么构建出来的?项目团队透露,他们搭建了一套融合BERTopic算法的主题建模pipeline。具体流程是这样的:先从全量数据中随机采样1000万组图像-文本对,然后用Chinese-CLIP-L/14模型提取文本侧的语义嵌入向量。这里有个技术难点——高维空间聚类容易受到噪声干扰,所以团队先通过UMAP做了非线性降维,再用HDBSCAN算法来识别语义密集的簇,并且把最小簇规模设定为1000,这样既能增强聚类的鲁棒性,又能有效抑制离群噪声。最后,基于各个主题内部的词频分布,采用类别加权TF-IDF策略,提取出最具代表性的关键词集合。

售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9