发布于2026-07-28 阅读(0)
扫一扫,手机访问
月之暗面放了个大招——Kimi K3大模型的权重和技术资源正式开放了,同时还一口气开源了三项支撑模型训练的核心基础设施。说白了,这套动作的目标很明确:让前沿AI技术更快落地,给全球开发者提供一套更高效的模型开发工具链。

先说说Kimi K3本身。作为月之暗面目前最强的语言模型,它采用了混合专家架构(MoE),参数规模达到2.8万亿——比前代Kimi K2.5大了将近3倍。更关键的是,它原生集成了视觉理解能力,能处理长达100万token的上下文窗口。算力优化方面也有突破,研发团队通过创新算法把规模化效率提升了2.5倍。翻译一下:同样的算力条件下,它能产出更高质量的输出。
技术层面,Kimi K3的架构设计相当有看头。注意力机制上,用3:1的比例混合了KDA和Gated MLA,专门用来高效处理长文本。视觉编码器叫MoonViT-V2,采用next-token prediction方式进行训练,在保持SigLIP基线效果的同时,训练稳定性也上了一个台阶。至于MoE部分,Stable LatentMoE架构通过动态路由机制,从896个专家模块中智能激活16个参与计算,配合SiTU-GLU和Quantile Balancing技术,确保训练过程不跑偏。后训练阶段更是下了血本——在通用推理、智能体和编程三大领域构建了百万级token的强化学习环境,还用近20个专业评测集做了全面验证。
这次同步开源的三项基础设施技术,构成了模型训练的底层支撑。高性能通信库MoonEP专门为超大规模MoE架构设计,能有效处理专家并行计算中的负载不均衡问题。FlashKDA是Kimi Delta Attention的高性能算子,在英伟达H20芯片上实现了1.72到2.22倍的预填充速度提升。还有与KVCache.ai联合开发的AgentEnv沙箱系统,通过强隔离环境支持大规模智能体训练,具备快速快照、任务分叉这些分布式训练必需的“硬核”功能。
开发者现在就能拿到Kimi K3的模型权重和完整技术文档,相关代码库也遵循开源协议开放。这次开源覆盖了从模型架构到训练基础设施的全链路技术,等于给行业提供了一套可复用的技术方案——特别适合需要处理超长上下文或复杂多模态任务的场景。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9