商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > Anthropic示警:AI执行力逼近甚至超过人类

Anthropic示警:AI执行力逼近甚至超过人类

  发布于2026-06-10 阅读(0)

扫一扫,手机访问

Anthropic 在6月5日发布了一篇相当有分量的博文,直指一个关键趋势:AI 正在加速 AI 本身的研发。说得更直白些,我们可能正站在“递归自我改进”这个概念的门口。

所谓递归自我改进,简单理解就是 AI 系统能自己设计、训练、评估、迭代下一代版本——形成一套“自己改进自己”的闭环。这个概念之所以被看作分水岭,原因很简单:一旦这个闭环真正成立,技术进步的速度将更多取决于算力、基础设施和验证机制,而非人类的研发节奏。

不过别急着下结论。Anthropic 自己也说得很清楚:这一阶段尚未真正到来,也并非一定是必然路径。但值得警惕的是——相关信号已经比多数机构预期的更早、更强。


能力加速

第一个信号来自能力加速。Anthropic 援引公开基准数据指出,AI 能稳定独立完成任务的时长,大约每4个月翻一番。来看看这组数据:

2024年3月,Claude Opus 3 能稳定处理约4分钟的软件任务;一年后,Claude Sonnet 3.7 提升到1.5小时;而到了2026年3月,Claude Opus 4.6 已经能持续处理12小时的任务。进步速度肉眼可见。

基准测试上的表现也同样惊人。以 SWE-bench 为例,这个基准专门衡量真实软件工程修复能力,模型在2年内从个位数成绩一路逼近饱和。再看 CORE-Bench,它测试的是复现实验论文结果的能力,AI 在2024年还只有约20%的成功率,15个月后同样接近饱和。还有 METR 的发现:Claude Mythos Preview 连续工作能力至少达到16小时,已逼近现有任务集的可测上限。


Anthropic 内部的情况更具说服力。截至2026年5月,超过80%的合入代码由Claude编写——而在Claude Code于2025年2月进入研究预览阶段之前,这个比例还是个位数。随着模型从代码建议走向自主运行与长时任务处理,工程师人均日合入代码量显著提升:2026年Q2的典型工程师,较2024年达到8倍。当然,文中也诚实地提醒了一句:代码行数毕竟偏重数量,不能完全等同于真实生产率。

除了代码产出,Claude 在执行复杂任务上的效果也在加强。2026年3月,Anthropic内部一项覆盖130人的调查显示,受访者估计在 Mythos Preview 的帮助下,产出中位数为无AI时的4倍。更具体的事例是:2026年4月,Claude 完成了超过800项修复,将一类API错误压低到原来的1/1000——负责监督的工程师估计,若纯靠人工,可能要花4年时间。

不过,Anthropic 的文章反复强调一个观点:当前人类优势仍集中在研究判断、问题选择、结果信任与方向把控上。换句话说,AI 在“执行”层面正在逼近甚至超越人类,但在“决定做什么”这件事上,差距依然明显。这才是目前最微妙的平衡点。

文章还透露了一个现实问题:AI 的自我改进并不会凭空爆发。即便 Claude 能写更多代码,企业若想把这种闭环推向更高强度,仍需要更大规模的计算资源。加速是真实的,但天花板也同样真实。

本文转载于:https://www.163.com/dy/article/KV2M3SB10511B8LM.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

产品推荐

热门关注