阿里发布新一代千问旗舰模型Qwen3.7-Max,登顶最佳国产模型
阿里巴巴发布新一代千问旗舰模型Qwen3.7-Max,在全球盲测中超越国内外顶尖模型,位列国产模型第一。该模型专为智能体时代设计,在编程、推理等核心能力上实现突破,可自主执行长达35小时的复杂任务,并通过自主编程将新芯片平台推理速度提升10倍,展现出强大的智能体底座潜力。
国产大模型的性能天花板,又被刷新了。
5月20日,阿里巴巴正式发布了全新一代千问旗舰模型Qwen3.7-Max。这款模型一经亮相,便在三方机构Arena的全球大模型盲测总榜中取得了亮眼成绩:它不仅超越了Kimi-K2.6、DeepSeek-v4-pro、GLM-5.1等国内强劲对手,其综合表现更是与GPT、Claude、Gemini等国际顶尖模型的最强版本接近,稳居国产模型榜首位置。
更值得关注的是,Qwen3.7-Max是面向“智能体(Agent)”时代全新设计的。它在编程、推理等核心能力上实现了持续突破,甚至展示了一项令人惊叹的极限能力——全自主完成长达35小时的超长程复杂任务。在一个全新的芯片平台上,Qwen3.7-Max通过自主编程和超过1000次的工具调用,成功实现了一个关键内核的自我进化,最终将推理速度较原版本提升了整整10倍。
迭代加速,性能全面领先
阿里在大模型研发上的节奏明显在加快。近三个月内,千问旗舰大模型已经稳定迭代了3.5、3.6、3.7三个版本,不断推高国产模型的性能上限。Qwen3.7-Max在多项权威评测中均位居前列,展现出了全方位的竞争力。
在编程智能体方面,Qwen3.7-Max在SWE-Pro、SWE-Multilingual等测评中均取得领先表现。在Terminal Bench 2.0-Terminus测试中,它以69.7的得分,超过了DeepSeek-v4-pro-Max、Claude-Opus4.6等一众模型。
在通用智能体能力上,Qwen3.7-Max同样提升显著。在MCP-Atlas、MCP-Mark、Skillbench等贴近现实应用的测试中表现优异,超越了GLM5.1、Kimi-K2.6等模型,创下国产新高。同时,它在Kernel Bench L3测试中也展示了强大的GPU内核优化能力。
至于核心的推理能力,Qwen3.7-Max在GPQA Diamond、HLE、HMMT 2026 Feb、IMOAnswerBench等硬核推理测评中,均超越了Claude-Opus4.6及所有国产模型。
此外,在通用能力与多语言方面,Qwen3.7-Max同样表现不俗。它在指令遵循IFBench评测中拿下79.1分,创下新高;在多语言理解和翻译的WMT24++、MAXIFE评测中也处于领先地位。
编程能力:从原型到工程的跨越
如今,编程能力已成为衡量大语言模型实力的核心指标。Qwen3.7-Max在这方面较上代模型实现了大幅提升,从前端原型开发到复杂的多文件工程项目均能驾驭。
在评估AI解决真实世界编程任务的SWE-bench系列测评,以及面向真实科学问题的SciCode测评中,Qwen3.7-Max不仅较Qwen3.6-Plus有大幅提升,更超越了Claude Opus 4.6-Max、Kimi-K2.6、DeepSeek-v4-Pro-Max等强劲对手。
可以说,千问3.7是一个出色的编程智能体。它能够自主编写代码创造工具,精准执行任务,并完成复杂编程中的自我纠错与迭代。整个过程,就像一个资深工程师跑完了从需求分析到测试迭代的全流程,最终自主产出可用的工业级成果。
智能体底座:长程任务与工作流自动化
不断提升的编程能力,为智能体完成更复杂、更长周期的任务打下了坚实基础。千问3.7本身就具备极强的Agent能力,并且涌现出跨多种智能体框架的泛化能力。无论是在Claude Code、OpenClaw还是Qwen Code等框架下,它都能稳定发挥,有望成为各类智能体系统的可靠底座。
通过MCP集成和多智能体协作,Qwen3.7-Max能够在企业级办公场景中实现工作流自动化。在办公自动化基准SpreadSheetBench-v1上,它斩获87分的高分,处于顶尖水平,堪称可靠的办公与生产力助手。以往需要专业团队耗时一至两周的复杂项目,如今由Qwen3.7-Max驱动的智能体,可以在数小时内完成端到端的交付闭环。
35小时极限挑战:自主内核优化
在实战任务测试中,Qwen3.7-Max展示了当前智能体所能达到的长程任务极限。对于大模型而言,推理速度与推理框架息息相关,而AI基础设施工程师最重要的工作之一,就是进行推理框架中的算子优化。这项工作需要极强的经验、知识、算法能力以及反复的调试与纠错迭代。
如今,千问3.7尝试自主解决了这一难题。测试设置在一个模型训练时从未接触过的全新硬件平台——平头哥真武M890芯片上。任务目标是优化一个复杂的推理内核。在没有任何性能分析数据、硬件文档或新架构示例内核的情况下,千问3.7仅从一个包含任务描述、SGLang Triton参考实现和评测脚本的空白工作空间出发。
从“零”开始,它持续编程了35小时,独立进行了432次内核评估、1158次工具调用,完全自主地完成了编写、编译、性能分析与迭代改进的全流程。
最终的结果令人振奋:在平头哥新AI芯片上,经过千问优化后的推理内核,比SGLang Triton的最新参考实现取得了10倍的加速。测试轨迹还显示,模型在独立运行超过30小时后,依然发现了有效的优化点,甚至主动发起了一次关键的架构重设计。这充分体现了千问在复杂任务中长周期自主迭代的能力,为未来模型与智能体的自我演进打开了全新的想象空间。
面向Agentic时代的全面升级
在2026阿里云峰会现场,阿里云宣布面向Agentic(智能体)时代进行全面升级,重磅发布了全新的“芯-云-模型-推理”技术体系。据了解,Qwen3.7-Max模型的API即将上线阿里云百炼平台。
同时,千问3.7系列还将推出Qwen3.7-Plus等不同版本模型,它们将拥有极强的多模态推理与视觉理解能力,实现从编程智能体到视觉智能体的全覆盖,旨在为下一代AI提供全能的智能体新基座。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















