您的位置:首页 >月之暗面回应K3:做难而正确的事,不惧马斯克挑战
发布于2026-07-30 阅读(0)
扫一扫,手机访问
7月21日下午,北京海淀知春路,月之暗面的总部会议室里,摇滚风格的装修透着一股硬核劲儿。就在这儿,Kimi K3发布后,企业业务负责人黄震昕首次公开接受了媒体采访。

月之暗面企业业务负责人黄震昕回答记者问题。罗亦丹 摄
K3的参数量达到了2.8万亿,什么概念?目前全球开源权重模型里,它排第一,没有之一。多个权威榜单拿下第一,连马斯克都在评测报道的评论区留言,说“令人印象深刻”,还放话后续要推出2万亿参数的模型,“可能超越Kimi”。结果呢?K3太火了,火到7月19日月之暗面不得不暂停C端新用户订阅——需求直接冲垮了预期。
面对算力告急的现状,黄震昕坦言:“K3过于火爆,我们其实已经做了预案,但挡不住用户热情。有人说这和去年的‘DeepSeek时刻’一样,最后我们选择优先保证老客户的体验。”至于马斯克发起的“挑战”,他笑着回应:“可能这次的表现让他们感受到了一点震撼。现在拭目以待,希望他们出来跟我们掰一掰手腕。我们的技术有很多都开源给了全世界,我们也不担心技术会马上被别人学走。有这样的胸襟和气度,希望马斯克也能做出2万亿的模型,我们一起共同进步。”
7月17日凌晨,Kimi K3正式发布。消息传开后的48小时内,全球开发者的请求蜂拥而至,用户量迅速逼近现有算力集群的承载极限。7月19日晚间,Kimi发布说明,直言“收获了远超预期的支持,但也面临始料未及的算力挑战”,随即暂停C端新用户订阅。
“我们提前做了充分的算力储备预案,但用户和客户的热情还是超出了预估。”黄震昕在采访中坦言。目前公司的优先级是保障存量付费用户的使用体验,“不愿为了扩大用户规模牺牲存量用户体验”。与此同时,团队正通过两条路径缓解矛盾——模型效能持续优化,算力供给快速扩容。
这种“幸福的烦恼”其实早有征兆。K3的核心支撑技术之一“Attention Residuals”(注意力残差),早在2026年3月就以技术报告形式开源,能让模型训练与推理效率提升25%。马斯克当时就在社交媒体上公开称赞,评价其为“非常令人印象深刻的工作”。
当K3的完整性能数据在发布后揭晓,行业反应相当剧烈。在业内视为最贴近真实工程开发的编程“金标准”Frontend Code Arena榜单上,K3以1679分登顶。而上一代K2.6在同一榜单上排第18位——一代之间,跃升17个位次。Vercel的CEO Guillermo Rauch发帖称,K3在Next.js最新综合Web工程基准评测中领先Fable,“这是开源模型首次在该综合Web工程评测上全面超过闭源模型。”
和DeepSeek-R1推出后英伟达一度大跌类似,K3也影响到了美股表现。美东时间7月17日,CNBC报道美股半导体板块走出今年以来最差单周行情,跌幅创下2025年4月之后新低,而导火索正是“中国月之暗面发布全新AI大模型”。
对于K3在全球的影响,黄震昕表示:“我们在全球市场上真正做出了SOTA级别的模型,定价也不是朝便宜去定的。我们摆脱了‘开源模型就是要做便宜的、低价的’这种印象。”
面对用户的热情与海外的广泛关注,Kimi反而显得颇为低调。
“不做高性价比的标准化业务,而是聚焦‘难而正确’的前沿探索。”黄震昕这样解释公司的核心理念。如同登月一般,一旦实现突破,将为全人类创造巨大价值——这并非口号,而是贯穿在月之暗面从技术研发到商业布局的每一个决策中。
当前,越来越多的AI企业开始聚焦落地和Agent,月之暗面却一直保有对基础模型的执念。“模型公司一定要做模型。”黄震昕说。
基础模型的强度是所有上层应用的前提。Agent、C端产品、行业解决方案,都是模型能力提升到一定阶段后的自然产物。只有持续打磨最强模型,才能构建长期竞争壁垒。
这种执念在K3身上得到了集中体现。根据月之暗面公布的技术文档,K3基于自研的KDA混合线性注意力机制和Attention Residuals技术构建,采用MoE(混合专家)架构,在896个专家中高效激活16个,扩展效率较前代K2提升约2.5倍。更关键的是,月之暗面是Scaling Law(缩放定律)的坚定信仰者——模型参数量、训练数据量、计算量三者同步提升,模型性能就会持续增强——但传统Scaling Law面临指数级成本的硬约束:算力投入扩大100倍,模型性能仅提升10倍。
月之暗面的解法不是简单的工程效率优化,而是底层架构创新。黄震昕透露,过去8到11年间,大模型领域的三大核心基础技术从未出现本质迭代,而公司在2025至2026年完成了对这三项底层技术的突破,这也是K3能够实现SOTA性能的核心支撑。其中,Moon Clip二阶优化器是行业首次在万亿级大模型训练中应用该新型优化器,大幅提升Token效率,可让20TB训练数据发挥出相当于40TB的效果。K2系列曾在过去12个月中保持9个月的参数量领先,K3也将在参数量与性能上保持一段时间的领先优势。
黄震昕告诉记者,Kimi现阶段暂不提供私有化部署服务,商业模式对标海外成熟头部AI企业,核心发力打磨模型基础能力。他也明确了行业参数规模趋势:Kimi的大模型参数规模会持续向上拓展,不会止步于当前2.8万亿。
技术突破只是起点,商业化落地才是检验模型价值的关键。
K3在编程能力上的表现已经为它赢得了开发者生态的初步认可。在多项评测中,它展现出与顶级闭源模型抗衡的实力。Program Bench评测中,K3得分77.8,以0.2分的微弱优势超过GPT-5.6 Sol的77.6;FrontierSWE上得分81.2,大幅领先GPT-5.6 Sol的71.3,但次于Fable 5的86.6。在实际应用中,K3展示了长程工程能力——在计算天体物理“I-Love-Q”普适关系复现任务中,K3用约两小时完成了通常需要资深研究人员一到两周才能完成的工作。
但月之暗面的商业化视野不止于此。黄震昕在采访中透露,公司即将推出Kimi Hosted Agent企业级服务,开放Agent编排调度(Harness)能力,将沙箱环境与智能体调度框架整合为标准化平台,向企业客户提供PPT生成等场景的API接口,支持嵌入企业内部系统,可自定义内容风格,适配投研分析、内容生产、办公自动化等多元场景。
谈及与海外头部模型公司的竞争,黄震昕表示,全球模型公司在商业化方面已找到一条可行路径,Kimi在产品创新上持续投入,包括AgentSwarm路由在行业做Agent之前就已经做出来。“我们还是希望从产品驱动,然后设计不同的商业模式,打造出非常有竞争力的产品。”
黄震昕在采访中强调了Kimi一向的“产品审美”:“我们不会做娱乐性的场景,也不做生图、生视频。我们一直的定位就是生产力场景,包括编程、金融、法律、科学研究等领域。这就是我们的审美,我们会一直按照这个价值观去努力奋斗。”
在北京,从海淀知春路到清华校门口,短短一段路程聚集了智谱、Kimi等多家国内头部AI企业。黄震昕说,这里的产业集聚并非偶然——“人才密度高、政策支持完善,端一杯咖啡就能找到对应领域的专业人才”。这片被业内称为中国AI“卧龙池”的土地上,蛰伏的故事远不止一个。而K3的全球爆火和随之而来的算力告急,或许只是月之暗面“登月计划”的一个阶段性注脚。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9