当前位置:

首页 > 硬件相关 > AI开始给自己写代码了,GPT-5.6重写内核,服务成本直降20%

AI开始给自己写代码了,GPT-5.6重写内核,服务成本直降20%

GPT-5.6一上线,接到的第一个大活儿,就是给自己的运行环境来了一次大翻修。 它自主重写、优化了OpenAI线上那套底层代码,也就是真正负责跑模型的生产GPU内核。 7月29日,OpenAI官方甩出一组数字: GPT-5.6 Sol参与的内核优化,让OpenAI对外的服务成本降了20%;推测解码的

GPT-5.6一上线,接到的第一个大活儿,就是给自己的运行环境来了一次大翻修。

它自主重写、优化了OpenAI线上那套底层代码,也就是真正负责跑模型的生产GPU内核。

7月29日,OpenAI官方甩出一组数字:

GPT-5.6 Sol参与的内核优化,让OpenAI对外的服务成本降了20%;推测解码的改进,让模型生成token的效率提升超过15%。

这次GPT-5.6动的不是一个跑在演示环境里的Demo,而是OpenAI正在线上跑的,每天承载十亿级用户请求的那套生产系统。

用OpenAI总裁Greg Brockman的话说:让GPT-5.6 Sol去提升生产服务效率,正是它又强又便宜的原因之一。

而OpenAI内部,早已形成一套完整的打法,Codex掌门人Tibo(Thibault Sottiaux)把它概括成两步:

第一步,训出一个足够强的模型;

第二步,用这个模型去把一切变得更好,包括运行它自己的基础设施、推理栈和内核。

20%是怎么省出来的?

这20%的服务成本,到底是怎么省出来的?

GPT-5.6 Sol通过Codex,接进了OpenAI的生产推理栈,碰的全是推理栈里最核心的几块:GPU内核、负载均衡、推测解码、KV缓存。

GPT-5.6在智能体框架、API编排、模型推理三层做优化,换来更少网络传输、更少CPU开销、更多GPU产出。

负载均衡,翻译成人话就是别让某几张卡忙到冒烟,而另外几张卡却只是闲着;

KV缓存,是把算过的中间结果存下来重复用,不做无用功;

推测解码,是让一个小模型先抢答、大模型只负责验收。答对了,一次就能多输出好几个字,不用像平常那样一个字一个字慢慢挤。

然后再看GPT-5.6 Sol干了什么。

它分析真实的生产流量,揪出以前被忽略的负载不均,测试新的路由策略;

它自主重写了用Triton和Gluon这两种GPU编程语言写成的生产内核,专门去找那些能预先算好、能跳过、能并行的活儿;

在推测解码环节,它针对配套的draft模型,设计并跑了数百次架构实验,还自己启动、盯着训练流程,遇到硬件故障和训练不稳定,自己主动介入。

这些环节一个个抠下来,最后就换来了开头那两个数字:服务成本降20%,token生成效率涨15%+。

其实早在7月9日GPT-5.6发布时,OpenAI就已透露端倪。

内部研究员已经在用它排查故障、优化训练系统、跑实验、解释结果,还专门给它设了KernelGen、NanoGPT、RSI Index这几项「自我改进」评测。

这次降本20%,意味着这些布局,第一次变成账单上实打实的数字。

比节省20%更重要的是一个闭环

真正重要的变化,是一个闭环跑通了。

分析流量、提出优化、写出代码、跑完实验、处理掉故障,再拿生产指标回来验证结果,现在这条回路的每一环,模型几乎都能参与。

一次任务里,模型不断「决策→调用工具→读取结果→再决策」,循环往复直到交付。

拿推测解码举例。

这个技术要配一个更小的draft模型,GPT-5.6 Sol针对这个draft模型,设计并跑了数百次架构实验,改尺寸、改结构、改特性。

数百次实验,过去这要靠一个稀缺的GPU工程师,凭着经验和直觉,一个配置一个配置地手工试,试上几个月。

配置空间太大,大到人根本试不完,只能靠粗糙的经验法则拍脑袋。

现在,模型能把这个「测量、优化、验证」的循环压到极短。于是,团队能探索更多想法,更快跟上不断变化的负载。

更关键的是,这个闭环,还会自己滚起来。

模型越强,越能把推理栈优化得越省;越省,同样的硬件就能服务越多请求;服务的人越多,OpenAI就能把更强的模型铺给更多的人用。

OpenAI的内部数据能佐证这个环转得有多快:

GPT-5.6内测阶段,每位活跃研究员的日均token输出,是GPT-5.5时代最高值的两倍以上;过去半年,用于内部代码推理的研究算力占比涨了100倍,内部智能体token用量涨了约22倍。

省下的每一分算力,最后都变成了让更多人能用上的智能。

AI开始自进化了吗?

那么,这到底算不算「AI开始自我进化」?

至少现在,还不算。

GPT-5.6 Sol优化的,是运行自己的软件、服务配置,还有辅助的draft模型。

没有证据表明它在线改动了自己的主体权重,也没有证据表明它能脱离工程团队,自己升级出下一代模型。

如果把权重比作模型智能的「货物」,内核和配置就是运货的卡车和路线。它这次优化的是运输,还没碰到货物。

因此,更准确地说这是「自优化飞轮」的早期形态,不是递归自我改进。

还有一点要注意。

官方这次用了「自主(autonomously)」来形容内核重写和部分实验,但不等于「完全无人参与」,目标由谁定、接进哪套生产系统、拿什么工具验证、怎么部署上线,这些环节都还牢牢攥在OpenAI的工程体系手里。

比如验证环节:模型写完的生产内核,要经过审核才能上线。

OpenAI专门搬出一个叫FpSan(浮点消毒器)的开源工具,检查这些内核的结构和数据流对不对。

自动验证体系跟不跟得上,才是「敢让AI写底层代码」的真正瓶颈。

往前看,OpenAI也一直在为RSI(Recursive Self-Improvement,递归式自我改进)铺路。

早在2月,GPT-5.3-Codex就被官方形容为「参与了自己的创造」;这一次,GPT-5.6 Sol又自主后训练了更小的Luna;在内部专门衡量自我改进能力的RSI Index上,它比GPT-5.5高出16.2分。

OpenAI内部RSI Index成本-得分曲线:GPT-5.6三档全面压过5.5、5.4,同等得分更省钱。

老对手Anthropic的一个判断更激进:

人类如今只对个位数百分比的方向性决策负责。

其联创Jack Clark更是称2028年底前出现完整的递归自我改进,概率超过60%。

飞轮是转起来了,但真正的「AI自己造AI自己」还在路上。

竞争轴变了:从谁GPU多到谁榨出更多token

这20%,意味着同样一批卡,OpenAI现在能多接两成的活。

它指向一个更大的变化。

过去几年,AI公司比的是谁买得起更多GPU。这套逻辑简单粗暴,也砸钱如流水。

但在一个算力永远不够、需求涨得比产能快的世界里,另一个关键变量已经浮出水面:同样一批卡,谁能榨出更多token?

推理效率,正在变成和芯片数量同样重要的筹码。

OpenAI自己已经用产品线投了票。

GPT-5.6这次一口气分成Sol、Terra、Luna三档,就是要主打一个卖点:同等智力,更少token。

效率,被摆到了和智能同样重要的位置。

而这一次,帮OpenAI的模型提升推理效率的,正是模型自己。

模型越强,越能优化推理栈;推理栈越高效,同样硬件就能服务更多token;成本一降,更强的模型又能铺给更多人用。

这个飞轮,OpenAI已经让它转起来了。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关 AI
上一篇: OpenAI,开源了
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。