商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > Kimi K3引爆全网的秘密:2.8万亿参数之外,杨植麟和他的天才团队,最小成员仅17岁!

Kimi K3引爆全网的秘密:2.8万亿参数之外,杨植麟和他的天才团队,最小成员仅17岁!

  发布于2026-07-23 阅读(0)

扫一扫,手机访问

一款AI模型发布不到72小时,不得不紧急踩下刹车,暂停了会员充值服务。

7月17日,北京月之暗面科技有限公司(Moonshot AI)正式发布新一代开源大模型Kimi K3。仅仅两天后的7月19日晚,月之暗面通过官方公众号发布说明,直言“过去48小时,用户请求量如潮水般涌来,已大幅超出我们的预估,并且逼近现有集群的承载极限”。为了保障已订阅用户的体验,公司决定立即暂停面向C端新用户的订阅入口,将现有算力优先服务老用户;同时,随着新增算力陆续到位,将逐步开放更多订阅名额,直至全面恢复正常。


WAIC2026 Kimi展台 顾群生/摄

月之暗面还计划调整会员权益结构,将Kimi Web、App和Work等主要产品权益与Kimi Code权益进行拆分,以期更精细地匹配不同业务的算力需求。

对于一家仍处于高速增长期的大模型公司而言,主动关掉付费入口,这在大模型行业里并不常见。棱镜咨询创始人况玉清向财闻分析,这种选择在经营层面有其合理性。目前国内C端用户整体的付费意愿依然有限,难以形成规模化盈利,真正具有长期价值的,恐怕还是企业客户。

7月21日,月之暗面B端企业业务负责人黄震昕在接受《科创板日报》采访时进一步透露,公司正在通过模型效能优化和增加算力供给,双管齐下解决当前的服务能力不足问题。

从长上下文到Agent,杨植麟没有改变方向

K3的出现,并非一时心血来潮,而是杨植麟和月之暗面多年研究方向的自然延续。

公开资料显示,杨植麟本科毕业于清华大学,随后赴美国卡内基梅隆大学攻读博士,师从自然语言处理领域知名学者William Cohen。他的研究方向长期聚焦于自然语言处理、大模型及长上下文理解,并先后在Google Brain、Meta AI等机构参与前沿研究。

2024年,ChatGPT引发全球AI浪潮后,杨植麟创办了月之暗面。同年10月,公司推出Kimi智能助手,凭借超长文本处理能力一炮而红,进入公众视野。

从他后来的公开访谈中可以看出,与外界普遍期待创业公司“快速做应用、抢市场”不同,杨植麟更关心模型能力本身。他曾表示,AI创业不是寻找一两年的产品机会,而是未来十至二十年的技术革命。

过去几年,无论是凭借超长上下文能力让Kimi出圈,还是后来持续投入推理能力、Agent能力建设,Kimi的技术路线几乎没有发生过根本性的变化。

在海外一次长篇访谈中,杨植麟反复强调一句话:“Lossless long context is everything(无损长上下文能力至关重要)。”在他看来,人类信息处理能力的提升,本质上是能够处理越来越长的上下文,大模型同样如此。

这种技术导向,也体现在Kimi对产品路线的判断上。黄震昕近日再次强调,“模型公司一定要做模型。模型是最重要的基础,Agent能力是模型强到一定程度后自然而然产生的能力。”

一家研究型公司的“天才密度”

月之暗面始终保持着浓厚的研究型色彩。

支撑K3的重要技术Attention Residuals(注意力残差),今年3月便以论文形式率先向全球公开。


Kimi团队Attention Residuals论文 图源: 截图

这篇论文的共同第一作者包括陈广宇、张宇和苏剑林。其中,陈广宇只有17岁,是一名来自深圳的高中生,也是月之暗面的实习生。

论文发布后,很快引发了国际AI社区的关注,连马斯克都在社交平台上评价:“Very impressive work from Kimi。”

据相关报道,陈广宇深入接触人工智能研究的时间还不到一年。他主要通过阅读论文、追踪GitHub开源项目和参与技术社区来积累基础。2025年暑假,他前往旧金山一家人工智能初创公司实习了七周,回国后于当年11月加入月之暗面实习。

论文共同第一作者苏剑林后来在《Attention Residuals回忆录》中写道,张宇和陈广宇共同提出了论文中的Block AttnRes设计。该方案将层划分为多个区块,并对区块信息进行压缩,在尽量保留完整Attention Residuals效果的同时,降低了计算和通信成本。

陈广宇的经历提供了一个容易传播的年轻“天才”故事,但K3显然不是少数人独立完成的成果。Attention Residuals论文的署名作者达到数十人,K3背后还涉及模型架构、训练数据、分布式系统、推理部署和产品工程等多个环节。

根据此前报道,Kimi员工仅有300余人,平均年龄不到30岁。其内部保持着高度扁平化的组织结构,没有传统意义上的部门、职级、Title、OKR和KPI。公司没有明显的职级壁垒,实习生也可以直接与创始人沟通,研发团队更强调科研贡献、技术品味(Taste)以及跨领域学习能力。

近年来,无论OpenAI、Anthropic还是Google DeepMind,都越来越强调研究驱动(Research-driven)的研发模式。月之暗面的发展路径,与这一趋势颇为相似。

当然,这种组织方式也并非没有挑战。随着公司人数和业务线增加,这种高度依赖个人主动性和核心创始人的组织方式能否继续维持效率,仍需时间验证。

2.8万亿参数之外

Kimi K3的参数规模达到了2.8万亿,是迄今为止参数量最大的开源权重模型,超越了参数规模1.6万亿的DeepSeek-V4-Pro。

在模型能力上,第三方测评平台Artificial Analysis显示,Kimi K3排名全球第三,落后于Claude Fable 5和GPT-5.6 Sol,但强于Anthropic上一代旗舰级模型Claude Opus 4.8和OpenAI上一代旗舰模型GPT-5.5。

月之暗面对此保持了相对克制的态度,在公告中坦言,Kimi K3的整体表现仍落后于最强的闭源模型Claude Fable 5和GPT-5.6 Sol。

不少人把关注点放在2.8万亿参数这个数字上,但在月之暗面看来,真正带来性能跃升的,是底层架构创新。

黄震昕近日接受《科创板日报》采访时表示,“Kimi和其他模型厂商最大的不同,是我们一直坚持底层架构技术创新,这一轮性能提升主要来自于此。”

他进一步指出,支撑K3的核心创新主要来自三个方向。

第一,是今年3月公开发布在论文里的Attention Residuals,这是K3训练过程中的核心技术之一,可将模型训练效率和推理效率提升约25%。

第二,是MoonClip优化器。黄震昕将MoonClip描述为一种基于Muon的优化技术,并称其可以让20T训练数据取得接近40T数据的训练效果。

第三,是Kimi Linear Attention(线性注意力机制)。在实验模型中,这套架构可以显著减少长上下文推理所需的KV Cache,并提高百万Token上下文下的解码效率。K3沿用了Kimi Delta Attention,并将其扩展至2.8万亿参数规模。

目前,K3已支持最高100万Token上下文长度,一次可以处理数十万行代码、多个大型项目或二十余篇研究报告。

更重要的是,它针对代码生成、复杂推理以及Agent任务进行了重点优化,而这些恰恰是当前企业AI应用最迫切的需求。

“甜蜜的烦恼”

K3发布后的算力告急,是一场“甜蜜的烦恼”,却也折射出中国AI产业下一阶段的重点。

近年来,包括Kimi、DeepSeek等中国AI公司都在积极融资扩充算力,美国对高端GPU出口的限制,也使算力资源成为中国AI企业共同面对的挑战。

不过,况玉清认为,“算力虽然紧张,但主要还是性能决定竞争力。”他表示,对于头部模型企业而言,融资能力普遍较强,既可以采购GPU,也可以借助云计算资源扩充推理能力,算力更多是资本投入问题;相比之下,模型性能能否持续领先,才真正决定用户规模和商业价值。

在他看来,目前国内模型已经事实上进入了“各领风骚数十天”的阶段。K3的发布,再次改变了国内基础模型竞争格局,但这种领先未必能够持久。过去一年,千问、DeepSeek、智谱、Kimi等模型都曾在不同时间段占据领先位置,但没有一家企业能够长期保持绝对优势。

“大家都很强,也都在快速迭代。真正的风险不是竞争对手,而是谁先在下一轮技术迭代中掉队。”况玉清分析道。

据相关报道,Kimi计划于8月启动上市前最后一轮融资谈判,目标估值高达500亿美元。融资完成后,Kimi将立即启动新一轮融资洽谈,最快于今年内登陆香港资本市场。

本文转载于:https://www.163.com/dy/article/L2HUG9GT0550WHYR.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注