AI落地,还差一口气
AI服务器实际算力利用率不足30%,推理需求已超越训练成为产业主轴。芯片竞争从性能参数转向算力效率与综合成本,专用化趋势加速。具身智能进入落地阶段,但软件生态和产业协同仍是AI大规模落地的关键瓶颈。
纸面算力与实际产出之间,到底隔着一道多宽的沟?在WAIC 2026现场,不少行业人士给出了一个令人坐不住的数字:不到30%。换句话说,一台AI服务器交付到用户手里后,真正被有效利用的算力,可能连规格表上标称的三成都不到。
这不是某个人的一家之言。来自不同领域的芯片企业,不约而同地把话题从“算力有多大”转向了“算力用得好不好”。这种叙事方式的转变本身就是一个明确的信号:AI产业已经跨过了“能不能”的第一道门槛,正在大步迈向“好不好用”的阶段。
而这个阶段的核心矛盾,正在从芯片本身,向上游迁移。
01 推理超越训练:不是预测,是既成事实
回想2024年,行业热钱几乎是清一色地涌向训练侧。到了2026年,情况已经反转:推理对算力的调用量,已经稳稳超过了训练。
训练芯片追求的是“学得更好”,推理芯片则追求“用得更省”。曦望智能商业产品与解决方案高级总监付庆平指出,这两种截然不同的设计哲学,对应着完全不同的商业逻辑。推理调度的颗粒度,正在从任务级细化到算子级——越细,越高效;越高效,token成本就降得越低。这意味着,推理芯片的竞争已经深入到模型层的调度效率,一个看似属于软件范畴的维度,正在成为芯片产品的核心卖点。
从视频处理的视角来看,推理需求的爆发更直观。有VPU厂商判断,未来80%的视频将由AI生成。而据测算,视频生成的token消耗,是文字生成的1000倍。通过将视频相关计算从GPU中剥离出来,交给专用芯片处理,VPU+GPU协同方案有望将视频生成成本降低八成。
后摩智能战略生态VP杨大卫的观点很直白:“训练决定模型能力上限,推理决定AI能不能大范围落地。”当推理成为产业主轴,芯片行业的需求结构必然随之改变。云端需要规模化推理芯片,视频场景需要VPU,端侧快思考需要NPU,低功耗端侧推理需要存算一体架构。通用GPU不再是唯一答案,专用化正从理论讨论变成实实在在的商业现实。
02 算力经济学,成为行业共识
镕铭微电子联合创始人兼CEO朱照远用一个形象的类比解释了算力成本降低的根本原因:效率提升。从马车到汽车再到火车,同样是从A点到B点,成本降低了,但根本原因不在于“省”,而在于效率的“升”。
这就能解释,为什么在WAIC 2026上,多家企业不再把TOPS数字挂在嘴边,转而开始谈“综合成本”了。数据中心客户在评估芯片方案时,关注的是至少六个维度:稳定性、性能、延时、功耗、画质和TCO。有句话很直白:“客户不关注你叫什么PU。”背后的逻辑是:当AI从实验室进入生产环境,评价标准就不再是你的考试分数,而是你的工作结果。
推理芯片通过硬件裁剪掉训练相关的冗余功能来降低成本,这体现了从通用到专用的趋势。从最早的CPU,到GPU,再到DPU、VPU,每一次专用化都对应着某一类计算需求从通用平台中剥离出来。VPU+GPU协同降低成本的案例,已经为这一趋势提供了商业验证。现阶段,国产芯片选择GPU路线,更多是市场选择。硬件厂家要面对市场,产品要一代接一代不能断,风险最可控的自然是通用GPU。但再往后发展,各种各样的算力芯片会向细分领域发展,在局部形成独角兽。
边缘芯片的降本方案,则依赖于算法合作伙伴在不同场景上做适配。如果品类足够大,比如手机、汽车,可以承担定制化成本;其他场景则靠通用底座来覆盖,这样才能让底层降本的红利惠及更多行业。从端侧角度看,问题更为复杂。端侧推理的三大刚需是隐私、成本和物理世界交互的延时,这三个维度决定了端侧芯片的设计逻辑与云端截然不同。爱芯元智联合创始人、副总裁刘建伟指出了端云之间的逻辑差异:云端先看体验再降成本,端边先看成本再提体验。这个顺序差异直接影响芯片设计的取舍。端侧AI的商业模式也因此开始变化,当用户发现订阅费可能比硬件本身还贵时,从订阅制转向一次性买断的诉求开始出现。
AI芯片行业正进入一个以TCO为核心考量的成熟期。在这个阶段,软件优化能力和系统工程能力的价值,可能超过硬件参数本身。
与此交织的另一个分歧是:下一场AI革命会爆发在哪里?有人认为云端(AI视频生成)和端侧(具身智能)都会发生革命;有人把2026年定义为“物理AI元年”,最看好机器人;也有人认为全行业都会爆发,但落地最快的一定是最懂AI的行业。
03 物理AI元年:具身智能走到哪了
具身智能被多家企业提及为下一个爆发点。WAIC现场的机器人展区提供了有力的佐证:不同于往年那些表演型机器人——拿个水、打套拳击——今年已经能看到机器人能长时间连续完成细致性工作,从展台秀真正走进了工厂产线。
但具身智能的产业形态还远未收敛。有观点主张广义的机器人定义,认为扫地机、割草机这类能自主干活的机器就可以被称为“机器人”;也有观点倾向人形路线,理由是,人类所有基础设施都为人形设计,人形机器人适用性最广,是最通用的硬件载体,规模化后成本可以降下来。但现阶段,人形机器人的制造成本仍然很高,最终取决于哪种形态先做到成本可行。
机器人对AI的依赖程度,与其他终端有本质区别。有存算一体路线的企业给出了一个尖锐的对比:PC离开AI还是PC,汽车离开AI还是汽车,但机器人离开AI,就是一块铁。这意味着,机器人对端侧AI的刚需最为迫切,体现在三个维度:隐私(数据不能上云)、Token成本(频繁调用云端太贵)、物理交互的实时性和安全性(隧道里没信号时不能失控,机器人指令不能依赖云端)。在这三个维度上,端侧芯片的低功耗和高能效比成为关键变量,而存算一体架构可将功耗能效比提升一到两个数量级。
对于具身智能行业来说,数据瓶颈已经有所缓解。行业巨头已经收集了大量视频和操作数据;算法基本可用,WAIC上多家机器人公司的展示已经证明了这一点。真正的挑战,在于算法如何高效地跑在算力上:模型剪枝、低功耗、低延时,这些必须协同优化,本质上还是一个系统工程问题。
数百家具身智能创业公司正在不同场景试水——物流、装配、陪伴——但尚未出现公认的杀手级应用。底层的芯片行业对此保持乐观:给客户打开一道通往万物智能的大门,自然会涌现出很多应用。
04 软件生态:比芯片更厚的壁垒
如果说成本效率是竞争的终点,那么软件生态就是通往终点的关键路障。回到开篇提到的纸面算力与实际产出的巨大差距,其根源在于模型选型、微调、知识库建设、中底层软件栈优化和机房配置等环节。交付一台AI服务器和实施一个AI项目,就像买了一口锅和炒出一盘菜,中间还有着相当大的工作量。
芯片的生态壁垒,核心不仅是技术问题,更是开发者习惯的问题。存算一体等新架构面临的核心挑战,不是芯片做不出来,而是软件生态跟不上。即便芯片参数已经很漂亮,但系统工程——适配、调优、客户场景打磨——还需要大量工作。
在端侧AI场景中,模型迭代速度极快。云侧大模型已经从半年一个版本加速到两个月一个版本,端侧模型同样在快速演进。每一次模型迭代都需要与芯片重新适配,工程落地的速度直接决定商业化速度。一句话很形象:“一项技术从能用到好用,需要很多脏活累活。”
有观点指出,中底层软件栈可以把同样硬件的算力输出提高2到5倍,但这次WAIC上深入讨论这个方向的并不多。全栈落地需要多方面专业人才协同——智能体、模型优化、知识库、底层算力调度和运维,把这些角色凑齐,才有可能实施一个真正高效的全栈。
当被问及国产AI芯片最需要发展的是性能还是生态时,一家推理芯片企业的回答是:两者都不构成当前瓶颈,最缺的是产业协同。
从存算一体到端侧NPU,从VPU到全栈集成,不同技术路线的企业,全部指向了软件生态,而非硬件性能。芯片架构的专用化方向已有行业共识,但各企业对专用化的速度、深度和最终形态,存在实质性的分歧。分歧的底层逻辑是:AI应用场景的碎片化程度,是否足以支撑多种专用架构共存?还是最终会收敛到少数几个通用平台?
当硬件参数竞赛接近边际收益递减的拐点,竞争主阵地必然上移到软件层。而这个上移的过程,恰恰是国产芯片从“追赶性能”转向“追赶体系”的关键窗口期。行业人士进一步指出,国产生态的普及率已经非常高,高校直接在国产生态上教学,关键领域客户选用国产生态,这种自上而下的生态建设路径,是中国独有的优势。
更进一步的判断是:国产AI芯片在性能和生态上都不构成当前瓶颈。这个判断如果放在三年前,几乎不可想象。但芯片参数已经很漂亮,系统工程还需要大量工作。差距不在“能不能”,而在“好不好”。一个考了70分、80分的模型已经可以干活了,但要干好活,不是一个模型、一颗芯片单独能解决的问题,需要工具链、编译器、调度系统、行业适配的全面跟进。从AI推理芯片到真正落地,需要大量的产业协作:解决方案合作、用户场景合作、超节点网络合作,每一个环节都需要有人去做。
全栈整合的样本确实存在,从CPU到软件集成公司再到硬件制造,集团化的体系在关键领域的大型全栈工程上具备优势。但这种能力在行业中并不普遍,更多企业仍在各自为战。
从客户侧看,据行业反映,数据中心芯片从接触到大规模上线,通常需要6到24个月,测试周期长、导入门槛高。这意味着,即使芯片技术达标,商业化落地仍需要漫长的验证周期。这个周期不是单点技术能压缩的,需要芯片厂商、软件供应商和客户方的深度协同。
2026年的AI芯片行业,正在经历一个微妙的转向:竞争的主阵地,从晶圆厂和流片车间,迁移到了编译器、工具链和系统调度层。当多家企业从不同技术路线出发,却不约而同地指向同一道鸿沟时,这已经不再是某一个人的判断,而是一种行业集体认知。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。














