发布于2026-06-09 阅读(0)
扫一扫,手机访问
如果关注开源大模型领域的进展,最近有个消息值得停下来看看——美团 LongCat 团队正式发布了新模型 LongCat-Flash-Thinking-2601,并且一上来就把模型权重、推理代码和在线体验全给开源了。这种程度的透明度,在行业里并不常见。
用官方自己的话说,这不仅是此前 LongCat-Flash-Thinking 的全面升级版,更是在几个关键维度上直接把开源模型的成绩天花板给抬了一截。具体来说,在智能体驱动的搜索、智能体化的工具调用,以及工具交互推理这类评测任务上,全都刷新了开源模型的 SOTA 记录。
一个真正值得注意的点是它在工具调用任务中的表现。面对那些高度随机、结构又复杂的工具依赖型任务时,它的泛化能力强到什么程度?——已经超过了 Claude。这直接带来了一个很实际的好处:以后在真业务场景里接入一个新工具,所需要做的定制化训练成本会大大降低。换句话讲,它变得聪明了,但更重要的是,它变得“好用”了。
这还没完。LongCat-Flash-Thinking-2601 还是行业内第一个完全开源、且支持在线免费体验“重思考模式”的模型。所谓“重思考模式”,可以理解为把 8 个独立推理单元同时拉出来并行运转。听着有点抽象?简单说就是,面对一个问题,模型不再是“想一条路走到黑”,而是多条路同时试,最后再整合出最靠谱的那个答案。
这个核心推理机制分为两个明显的阶段:
为了实现这种多轮思考的质量,团队还专门针对“归纳总结能力”引入了强化学习训练策略。不是在堆参数,而是在训练它怎么把信息整合好、抽象出来、最终生成一个靠谱的策略——真正意义上的“先想清楚再动手”。
聊了这么多技术细节,最终还是得拿数字说话。从公开的综合评测来看,LongCat-Flash-Thinking-2601 在编程理解、数学推演、智能体工具调用与智能体搜索四个大方向上,都稳稳占据了第一梯队的位置。

代码这块,它在 LCB 基准测试里拿下了 82.8 分,OIBench EN 测试也达到了 47.7 分。这不仅仅是数字好看,背后是代码生成质量和逻辑严谨性的双重印证,在这个排行榜上,它已经是开源模型里最能打的之一了。
重思考模式一旦开启,数学优势立刻显现出来。在 AIME-25 测评里直接拿了个满分 100.0 分,在 IMO-AnswerBench 中也以 86.8 分再次刷新开源模型的成绩。这两个含金量极高的数学推理测试说明了同一个问题:它的逻辑链条经得起高压检验。
这也是它最强、最独特的一个领域。τ²-Bench 得分 88.2,VitaBench 达 29.3,两项指标都是目前开源模型里的最佳成绩。更重要的是,这覆盖了金融、医疗、运维等多个领域的工具链,不是实验室里的玩具数据,而是真正跑得起来的实用能力。
在 BrowseComp 任务中得分 73.1,这已经是全模型中的最高分;RW Search 评测也收获了 79.5 分。它展现出来的信息定位精度和跨场景泛化能力,在开源领域可以说是遥遥领先。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9