商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > Claude Opus 4.8上线:提升AI编程可靠性,减少无依据结论

Claude Opus 4.8上线:提升AI编程可靠性,减少无依据结论

  发布于2026-05-29 阅读(0)

扫一扫,手机访问

5月29日,Anthropic正式发布了旗舰级新模型Claude Opus 4.8。这次更新的主打方向很明确:智能体编程、多领域推理和知识工作——换句话说,就是让模型在真正“干活”的时候更靠谱。

相比一个月前发布的Opus 4.7,这次迭代幅度不算大,定价也保持不变。但核心优化都落在了用户最敏感的环节上:编程、智能体任务、推理,以及知识密集型工作。说白了,就是那些能让你实际感受到“这模型变聪明了”的地方。


从多家早期测试方的反馈来看,Opus 4.8给人的印象是“更可靠,判断也更敏锐”。在复杂多步骤任务中,它的判断更稳了——不仅能主动提问,还能识别出自己犯的错误,甚至在计划不合理的时候提出异议。这种自主纠偏的意识,在之前的模型里并不常见。

一个很直观的数据:和Opus 4.7相比,Opus 4.8放任自己所写代码中存在缺陷、却不加说明的概率,下降了大约4倍。它更愿意主动标出不确定性,那些缺乏依据的结论也明显减少了。这意味着什么?模型不再是“闷头写代码、有错也不说”的状态,而是开始学着透明化自己的输出。

在对齐表现上,Opus 4.8同样有看点。它在支持用户自主性、按用户最佳利益行动等亲社会指标上创下了新高。与此同时,欺骗等失配行为的出现率低于Opus 4.7,与Claude Mythos Preview的水平接近。可以说,模型在“更听话”和“更诚实”之间找到了一个不错的平衡点。


配套功能也有更新。claude.ai上新增了effort程度控制,用户可以在更高质量和更快响应之间自由权衡。默认档位是high,在编码任务中,token消耗和Opus 4.7默认档接近,但效果更好。如果你选了extra或max(在Claude Code里对应xhigh),模型会消耗更多token来换取更优结果——这相当于给了你一个“拉满性能”的选项。

基准测试方面,Anthropic给出的成绩单很亮眼:Opus 4.8在SWE-Bench Pro上拿到了69.2%,并在该测试和其他多项基准中超过了GPT‑5.5与Gemini 3.1 Pro。不过有一点需要留意:在终端编程基准上,GPT‑5.5目前仍然领先。所以“全面超越”的说法还不成立,但至少在某些关键维度上,Anthropic确实追上了一步。


性能与价格方面也有调整。Opus 4.8的快速模式运行速度提升到了2.5倍,而成本则降到了此前模型的1/3。定价方案如下:常规模式每100万输入令牌5美元、每100万输出令牌25美元;快速模式则为每100万输入令牌10美元、每100万输出令牌50美元。速度更快、成本更低,这显然是冲着让用户“多用、用得爽”去的。

本文转载于:https://www.163.com/dy/article/KU31EVDI0511B8LM.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注