当前位置:

首页 > 硬件相关 > 这一次,梁文锋和杨植麟隔空握手

这一次,梁文锋和杨植麟隔空握手

真是热闹的一周 周一,Kimi刚发完K2.6;周五,万众瞩目的DeepSeek V4就来了。 这种感觉是不是很熟悉?过去一年里,这两家公司的节奏总是如此:不是前后脚发布模型,就是先后抛出重磅技术论文。市场热度刚被一方点燃,技术讨论的接力棒立刻就被另一方接了过去。 回想更早时候,提起中国开源模型,几乎

真是热闹的一周

周一,Kimi刚发完K2.6;周五,万众瞩目的DeepSeek V4就来了。

这种感觉是不是很熟悉?过去一年里,这两家公司的节奏总是如此:不是前后脚发布模型,就是先后抛出重磅技术论文。市场热度刚被一方点燃,技术讨论的接力棒立刻就被另一方接了过去。

回想更早时候,提起中国开源模型,几乎所有人的第一反应都是DeepSeek。尤其是其R1模型发布后,这家公司几乎以一己之力,刷新了全球市场对中国AI技术实力的认知,更重要的是,它点燃了整个中国AI创业圈的信心。

一个明显的信号是,此后越来越多的中国团队开始推出具备强劲竞争力的模型,并贡献出具有全球影响力的研究成果。

技术上的互相借鉴与追赶,成了这场竞赛中最有趣的看点。2025年7月,被《自然》杂志称为“又一个DeepSeek时刻”的Kimi K2模型,在底层架构上首次大规模验证了二阶优化器Muon,同时采用了由DeepSeek验证过的MLA注意力机制。不到一年,2026年4月,DeepSeek V4也在架构上跟进,用Muon优化器取代了沿用十年的Adam。

这或许正是开源最大的魅力所在:它让顶尖技术得以共享,成为中国公司加速追赶美国闭源巨头的共同燃料。

如今,它们是中国目前唯二总参数超过万亿且已公开权重的模型,也是最具国际影响力的中国AI代表。就连全球芯片巨头英伟达,在展示其下一代芯片性能时,选用的标杆模型也来自DeepSeek和Kimi。

不仅如此,两家公司都在向深度学习的底层架构发起挑战。DeepSeek有mHC残差连接,Kimi则提出了引发硅谷技术圈热议的“注意力残差”。这场竞赛,早已超越了单纯的性能比拼。

01 技术路径:一个降本,一个增效

虽说DeepSeek V4和Kimi K2.6在同一周发布,但两者的技术侧重点其实泾渭分明。

V4的核心突破在于对“百万上下文”的成本进行了重构。它通过一套全新的混合注意力机制,将单token推理的计算量压缩到V3.2的27%,KV Cache更是降至10%。这套结合了压缩稀疏注意力和重度压缩注意力的方案,让百万级上下文从昂贵的技术演示,变成了可大规模普及的基础设施。

同时,V4针对智能体(Agent)场景做了专项优化。在后训练阶段,它将Agent能力作为独立方向进行单独训练;工具调用格式从JSON换成了带特殊token的XML结构,确保了跨轮次推理痕迹在工具调用场景下的完整保留。为了支撑Agent的强化学习训练与评测,DeepSeek还自建了名为DSec的沙箱平台,单集群即可并发管理数十万个沙箱实例。

K2.6的方向则更偏向长程编码与Agent集群协作。它在内部的Kimi Code Bench评测中得分68.2,较K2.5的57.4提升了约20%。其设计最高可支持300个子Agent并行协作,完成长达4000个步骤的复杂任务。

02 Kimi的进化:从聊天窗口到生产力引擎

回顾Kimi过去一年的技术路线图,能清晰地看到其战略重心的转移。

2025年2月,Kimi发布Moonlight系列模型,首次将二阶优化器Muon应用于480亿参数的大模型,验证了新一代优化器的可行性。4月,Kimi-VL模型发布,在Moonlight基础上引入MoonViT视觉编码器,为多模态理解打下基础。7月,Kimi首次将Muon优化器扩展到万亿参数规模,推出K2开源模型。

到了10月,Kimi发布Kimi Linear线性注意力架构,核心目标是在保住长上下文能力的同时,大幅降低处理超长文本的计算和显存成本。这一举动释放了一个明确信号:创始人杨植麟的野心,已不止于训练更好的模型,而是要对模型的底层架构“动手术”。

随后,Kimi发布并开源了支持图片和视频理解的万亿参数模型K2.5。2026年3月,其关于“注意力残差”的论文再次对Transformer底层结构发起挑战,甚至收获了马斯克本人在X平台上的称赞。紧接着便是前几天的K2.6,一个围绕长周期编码、Agent执行和工程任务能力构建的模型。

这一系列动作表明,Kimi正坚定地从消费级对话产品,向生产力工具转型。

2026年3月,杨植麟在英伟达GTC大会的演讲中,用三个关键词概括了Kimi的规模化(Scaling)策略:Token效率、长上下文、Agent集群。他指出,要推动大模型智能上限的持续突破,必须对优化器、注意力机制及残差连接等底层基石进行重构。当下的规模化竞争,早已不是简单的资源堆砌,而是在计算效率、长程记忆和自动化协作上同时寻找规模效应。

市场给出了最真实的反馈。一家公司最怕的莫过于只有媒体声量,却没有开发者采用。但Kimi显然跨过了这道坎。无论是在OpenRouter平台,还是在多数Agent工具的默认接口里,K2.5和K2.6都是主流选项。截至发稿,Kimi和DeepSeek都位列OpenRouter的TOP3模型,在部分评测榜单上,K2.6甚至暂时领先。

K2.6持续强化Agent、长任务和编码能力,正是这一战略的延续。杨植麟真正押注的,是生产力场景。这构成了Kimi过去一年最关键的变化:它不再仅仅满足于告诉用户“我能帮你读更长的文件”,而是在试图回答一个更底层的问题——模型怎样才能在更长时间、更复杂任务、更高频的工具调用下保持稳定输出?

长上下文解决记忆和信息承载,线性注意力解决成本和扩展性,Agent集群解决复杂任务拆解,编程能力则解决模型的理解与执行。这几条产品线看似独立,实则共同指向一个目标:将Kimi从一个好用的聊天窗口,转变为能够承接真实工作的基础模型。

这种转变也获得了更高层面的认可。4月,杨植麟受邀作为唯一的大模型创业者代表,参加了总理主持的经济形势专家和企业家座谈会。这位1993年出生的年轻人,成为座谈会上最年轻的参会者。而就在一个月前,他刚在2026中关村论坛年会全体会议上发表演讲,系统阐述了中国AI团队如何通过底层架构的“推倒重建”,来打破沿用十年的行业技术标准。

显然,Kimi已经从一家创业公司,成长为代表中国AI某条重要技术路线的符号。其成长路径与DeepSeek存在明显差异,但正是这种技术选择上的不同,让中国开源模型的生态呈现出更多可能性。

03 双星并耀:中国开源模型的两条腿

过去在讨论这两家公司时,很容易陷入一种误区:总想比出个“谁的模型更好”、“谁才是中国的OpenAI”。

但事实上,将DeepSeek和Kimi简单理解为“谁赢谁输”的零和博弈,本身就偏离了重点。它们更像中国开源模型对外竞争的两条腿,不存在谁取代谁,而应该是一种互相刺激、彼此促进的共生关系。

两家公司相继证明了一件事:做前沿模型未必需要无限的资源,关键在于算法创新与工程优化的深度结合。它们在模型算法、工程效率、开源路线和降低推理成本上的贡献,无疑是中国AI过去一年最重要的技术事件之一。它们彼此竞争,但也共同抬升了中国开源模型的技术上限。

真正重要的不是谁先到达终点,而是它们共同把中国模型的竞争维度给拆解开了。过去评价一家模型公司,往往只看榜单分数、参数规模、API价格和发布会声量。但现在,模型公司真正的护城河,已经超越了“模型聪不聪明”的层面,转而围绕能否形成一整套自洽且领先的技术路线。

在这个框架下看,DeepSeek把第一件事做到了极致。它让外界看到,中国公司可以用更高的工程效率,把模型训练和推理成本打下来;可以把技术报告写到足够透明;可以把权重开放得足够激进。它建立的是一种“开源信任”。开发者愿意研究、复现、部署它的模型,不仅仅是因为它提供了一个API,更是因为它把背后的方法论也毫无保留地拿了出来。

Kimi则补上了另一块关键拼图。它最早被用户记住是因为长文本和聊天产品,但到了K2.6,它讲述的故事已经不是一个更会聊天的助手,而是模型如何深度融入真实工作流。长程编码、Agent集群、工具调用、长周期任务——这些能力没有“霸榜”那么直观,却直接决定了模型能否从“被试用”走向“被依赖”。如果说DeepSeek解决的是模型够不够强、够不够便宜、够不够开放的问题,那么Kimi更关心的是模型能不能真的替人完成复杂任务。

所以,将这两家公司放在一起看,意义反而更加凸显。作为观察者和用户,我们乐见其成,因为产业的健康发展正需要这样的多元繁荣。

中国AI真正值得兴奋的,并非仅仅出了一个DeepSeek。而是在DeepSeek的带动下,像Kimi这样的公司依然能凭借自身探索,成长为另一座技术高峰。这说明中国AI公司已经开始在不同维度上找到自己的独特位置,不再是简单的模仿者,而是真正在探索属于自己的那条技术路线。

DeepSeek与Kimi在技术上的互相借鉴与赋能,也印证了开源生态的核心价值在于协作。现在的问题早已不是“DeepSeek和Kimi谁更强”,而是它们能否继续保持这种良性的竞争关系,在技术上持续互相刺激、共同进步。

中国开源模型要真正在全球舞台站稳脚跟,需要的不是一家独大,而是多家公司在不同的技术方向上都能达到世界级水平。DeepSeek和Kimi的存在,让这种可能性变得前所未有的清晰和真实。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。