商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级

KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级

  发布于2026-08-03 阅读(0)

扫一扫,手机访问

KwaiKAT 团队最近放出了一个大招——旗舰级 Agentic 编程模型 KAT-Coder-Pro V2.5 正式发布。从 V2 版本上线到现在,他们一直在收集一线开发者的真实反馈。大家最关心的问题非常集中:能不能把整个 issue 直接扔给模型,让它自己在仓库里定位、修改、跑通测试?能不能把一整段业务工作流交给它,而不是只帮忙做其中一小步?

这次升级的核心目标很明确:更长的任务链路、更复杂的业务工作流。围绕这个目标,KwaiKAT 团队在长程工程能力、通用 Agentic 能力和大规模 Agentic 强化学习体系三个维度上,都做了系统性升级。

长程工程能力:从“补代码”到“跑项目”

真实的软件工程场景,从来不是“补一段函数”这么简单。开发者需要模型能读懂模糊的自然语言需求,在动辄几十上百个文件的仓库里准确定位改动位置,严格遵循项目既有规范给出最小改动,最后还要能通过测试验证。为了实现这个目标,KwaiKAT 团队构建了一套名为 AutoBuilder 的自动化环境构建流水线。根据最新披露的数据,这套流水线把可运行仓库环境的构建成功率,从业界普遍的 16.5% 左右,直接拉到了 57.2%。目前已经累计沉淀出覆盖 12 种编程语言、超过 10 万个可运行、可验证的真实“训练车间”,让模型可以在真实项目环境中完成迭代训练。

评测成绩亮眼,真实场景稳定交付

最新公布的评测结果显示,KAT-Coder-Pro V2.5 在多项 Coding 与 Agentic 评测中表现相当稳定:

长程工程能力方面,SWE-Bench Pro 上拿到了 65.2 分,快手内部真实工程任务评测集 KAT Code Bench 上则是 53.1 分。这意味着开发者现在可以直接把整个 issue 交给模型,而不用自己先拆解成一个个小改动。

通用 Agentic 能力方面,在多轮 Agentic 任务评测 PinchBench 上取得了 94.9 分,快手内部 Agentic 评测集 KAT Claw Bench 上也有 85.5 分。从工具选择、上下文管理到最终交付物生成,整个流程的稳定表现都得到了印证。

目前,KAT-Coder-Pro V2.5 已经在 StreamLake 平台全量上线,开发者可以通过 StreamLake.com 直接调用模型 API,并集成到自己的工作流中。完整的技术细节,可以在 KAT-Coder-Pro V2.5 技术报告中查阅。

本文转载于:https://www.itbear.com.cn/html/2026-07/1443780.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注