商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 硬件相关 > 美团开源 LongCat-Flash-Thinking-2601

美团开源 LongCat-Flash-Thinking-2601

  发布于2026-06-09 阅读(0)

扫一扫,手机访问

如果关注开源大模型领域的进展,最近有个消息值得停下来看看——美团 LongCat 团队正式发布了新模型 LongCat-Flash-Thinking-2601,并且一上来就把模型权重、推理代码和在线体验全给开源了。这种程度的透明度,在行业里并不常见。

用官方自己的话说,这不仅是此前 LongCat-Flash-Thinking 的全面升级版,更是在几个关键维度上直接把开源模型的成绩天花板给抬了一截。具体来说,在智能体驱动的搜索、智能体化的工具调用,以及工具交互推理这类评测任务上,全都刷新了开源模型的 SOTA 记录。

一个真正值得注意的点是它在工具调用任务中的表现。面对那些高度随机、结构又复杂的工具依赖型任务时,它的泛化能力强到什么程度?——已经超过了 Claude。这直接带来了一个很实际的好处:以后在真业务场景里接入一个新工具,所需要做的定制化训练成本会大大降低。换句话讲,它变得聪明了,但更重要的是,它变得“好用”了。

这还没完。LongCat-Flash-Thinking-2601 还是行业内第一个完全开源、且支持在线免费体验“重思考模式”的模型。所谓“重思考模式”,可以理解为把 8 个独立推理单元同时拉出来并行运转。听着有点抽象?简单说就是,面对一个问题,模型不再是“想一条路走到黑”,而是多条路同时试,最后再整合出最靠谱的那个答案。

这个核心推理机制分为两个明显的阶段:

  • 并行思考阶段:模型会同步生成多条逻辑独立、视角各异的推理路径,模拟人类面对复杂问题时那种“多角度试错”的习惯,并且有意地增强路径的多样性,避免陷入局部最优的思维陷阱;
  • 总结归纳阶段:把前面跑出来的多条结果拿出来交叉验证、提炼逻辑、整合结构,然后把优化后的中间结论重新注入推理流程里。相当于形成了一种闭环迭代,不断自我修正并逼近最优解。

为了实现这种多轮思考的质量,团队还专门针对“归纳总结能力”引入了强化学习训练策略。不是在堆参数,而是在训练它怎么把信息整合好、抽象出来、最终生成一个靠谱的策略——真正意义上的“先想清楚再动手”。

综合评测数据:四个维度全面领跑

聊了这么多技术细节,最终还是得拿数字说话。从公开的综合评测来看,LongCat-Flash-Thinking-2601 在编程理解、数学推演、智能体工具调用与智能体搜索四个大方向上,都稳稳占据了第一梯队的位置。

编程能力

代码这块,它在 LCB 基准测试里拿下了 82.8 分,OIBench EN 测试也达到了 47.7 分。这不仅仅是数字好看,背后是代码生成质量和逻辑严谨性的双重印证,在这个排行榜上,它已经是开源模型里最能打的之一了。

数学推理能力

重思考模式一旦开启,数学优势立刻显现出来。在 AIME-25 测评里直接拿了个满分 100.0 分,在 IMO-AnswerBench 中也以 86.8 分再次刷新开源模型的成绩。这两个含金量极高的数学推理测试说明了同一个问题:它的逻辑链条经得起高压检验。

智能体工具调用能力

这也是它最强、最独特的一个领域。τ²-Bench 得分 88.2,VitaBench 达 29.3,两项指标都是目前开源模型里的最佳成绩。更重要的是,这覆盖了金融、医疗、运维等多个领域的工具链,不是实验室里的玩具数据,而是真正跑得起来的实用能力。

智能体搜索能力

在 BrowseComp 任务中得分 73.1,这已经是全模型中的最高分;RW Search 评测也收获了 79.5 分。它展现出来的信息定位精度和跨场景泛化能力,在开源领域可以说是遥遥领先

本文转载于:https://www.php.cn/faq/1990424.html?uid=1246273 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

产品推荐

热门关注