当前位置:

首页 > 硬件相关 > 阿里发布新一代千问旗舰模型Qwen3.7-Max,登顶最佳国产模型

阿里发布新一代千问旗舰模型Qwen3.7-Max,登顶最佳国产模型

阿里巴巴发布新一代千问旗舰模型Qwen3.7-Max,在全球盲测中超越国内外顶尖模型,位列国产模型第一。该模型专为智能体时代设计,在编程、推理等核心能力上实现突破,可自主执行长达35小时的复杂任务,并通过自主编程将新芯片平台推理速度提升10倍,展现出强大的智能体底座潜力。

国产大模型的性能天花板,又被刷新了。

5月20日,阿里巴巴正式发布了全新一代千问旗舰模型Qwen3.7-Max。这款模型一经亮相,便在三方机构Arena的全球大模型盲测总榜中取得了亮眼成绩:它不仅超越了Kimi-K2.6、DeepSeek-v4-pro、GLM-5.1等国内强劲对手,其综合表现更是与GPT、Claude、Gemini等国际顶尖模型的最强版本接近,稳居国产模型榜首位置。

更值得关注的是,Qwen3.7-Max是面向“智能体(Agent)”时代全新设计的。它在编程、推理等核心能力上实现了持续突破,甚至展示了一项令人惊叹的极限能力——全自主完成长达35小时的超长程复杂任务。在一个全新的芯片平台上,Qwen3.7-Max通过自主编程和超过1000次的工具调用,成功实现了一个关键内核的自我进化,最终将推理速度较原版本提升了整整10倍。

迭代加速,性能全面领先

阿里在大模型研发上的节奏明显在加快。近三个月内,千问旗舰大模型已经稳定迭代了3.5、3.6、3.7三个版本,不断推高国产模型的性能上限。Qwen3.7-Max在多项权威评测中均位居前列,展现出了全方位的竞争力。

在编程智能体方面,Qwen3.7-Max在SWE-Pro、SWE-Multilingual等测评中均取得领先表现。在Terminal Bench 2.0-Terminus测试中,它以69.7的得分,超过了DeepSeek-v4-pro-Max、Claude-Opus4.6等一众模型。

在通用智能体能力上,Qwen3.7-Max同样提升显著。在MCP-Atlas、MCP-Mark、Skillbench等贴近现实应用的测试中表现优异,超越了GLM5.1、Kimi-K2.6等模型,创下国产新高。同时,它在Kernel Bench L3测试中也展示了强大的GPU内核优化能力。

至于核心的推理能力,Qwen3.7-Max在GPQA Diamond、HLE、HMMT 2026 Feb、IMOAnswerBench等硬核推理测评中,均超越了Claude-Opus4.6及所有国产模型。

此外,在通用能力与多语言方面,Qwen3.7-Max同样表现不俗。它在指令遵循IFBench评测中拿下79.1分,创下新高;在多语言理解和翻译的WMT24++、MAXIFE评测中也处于领先地位。

编程能力:从原型到工程的跨越

如今,编程能力已成为衡量大语言模型实力的核心指标。Qwen3.7-Max在这方面较上代模型实现了大幅提升,从前端原型开发到复杂的多文件工程项目均能驾驭。

在评估AI解决真实世界编程任务的SWE-bench系列测评,以及面向真实科学问题的SciCode测评中,Qwen3.7-Max不仅较Qwen3.6-Plus有大幅提升,更超越了Claude Opus 4.6-Max、Kimi-K2.6、DeepSeek-v4-Pro-Max等强劲对手。

可以说,千问3.7是一个出色的编程智能体。它能够自主编写代码创造工具,精准执行任务,并完成复杂编程中的自我纠错与迭代。整个过程,就像一个资深工程师跑完了从需求分析到测试迭代的全流程,最终自主产出可用的工业级成果。

智能体底座:长程任务与工作流自动化

不断提升的编程能力,为智能体完成更复杂、更长周期的任务打下了坚实基础。千问3.7本身就具备极强的Agent能力,并且涌现出跨多种智能体框架的泛化能力。无论是在Claude Code、OpenClaw还是Qwen Code等框架下,它都能稳定发挥,有望成为各类智能体系统的可靠底座。

通过MCP集成和多智能体协作,Qwen3.7-Max能够在企业级办公场景中实现工作流自动化。在办公自动化基准SpreadSheetBench-v1上,它斩获87分的高分,处于顶尖水平,堪称可靠的办公与生产力助手。以往需要专业团队耗时一至两周的复杂项目,如今由Qwen3.7-Max驱动的智能体,可以在数小时内完成端到端的交付闭环。

35小时极限挑战:自主内核优化

在实战任务测试中,Qwen3.7-Max展示了当前智能体所能达到的长程任务极限。对于大模型而言,推理速度与推理框架息息相关,而AI基础设施工程师最重要的工作之一,就是进行推理框架中的算子优化。这项工作需要极强的经验、知识、算法能力以及反复的调试与纠错迭代。

如今,千问3.7尝试自主解决了这一难题。测试设置在一个模型训练时从未接触过的全新硬件平台——平头哥真武M890芯片上。任务目标是优化一个复杂的推理内核。在没有任何性能分析数据、硬件文档或新架构示例内核的情况下,千问3.7仅从一个包含任务描述、SGLang Triton参考实现和评测脚本的空白工作空间出发。

从“零”开始,它持续编程了35小时,独立进行了432次内核评估、1158次工具调用,完全自主地完成了编写、编译、性能分析与迭代改进的全流程。

最终的结果令人振奋:在平头哥新AI芯片上,经过千问优化后的推理内核,比SGLang Triton的最新参考实现取得了10倍的加速。测试轨迹还显示,模型在独立运行超过30小时后,依然发现了有效的优化点,甚至主动发起了一次关键的架构重设计。这充分体现了千问在复杂任务中长周期自主迭代的能力,为未来模型与智能体的自我演进打开了全新的想象空间。

面向Agentic时代的全面升级

在2026阿里云峰会现场,阿里云宣布面向Agentic(智能体)时代进行全面升级,重磅发布了全新的“芯-云-模型-推理”技术体系。据了解,Qwen3.7-Max模型的API即将上线阿里云百炼平台。

同时,千问3.7系列还将推出Qwen3.7-Plus等不同版本模型,它们将拥有极强的多模态推理与视觉理解能力,实现从编程智能体到视觉智能体的全覆盖,旨在为下一代AI提供全能的智能体新基座。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
荣耀MagicOS 11发布计划与Agent Harness架构解析
荣耀MagicOS 11发布计划与Agent Harness架构解析

荣耀MagicOS 11定于9月15日发布,作为行业首个商用系统级Agent Harness架构的操作系统,Magic 9系列将首发搭载。新版YOYO支持最长上百步长程任务及40余项条件触发,10月开启Beta预览版招募。

华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价

华强北销售商反馈,年初以来主流手机品牌基本全线涨价,涨幅最低400元,最高达1000-1500元。涨价主因是全球存储芯片及电容等元器件成本上升,运行内存与机身存储价格涨幅超100%。尽管整体市场承压,国产折叠屏手机1-8月销量约450万台(新形态超135万台,同比增29%),AI手机成为厂商发力重点。

索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口
索尼WH-1000XM4C发布:复刻经典折叠设计并升级现代接口

索尼发布WH-1000XM4C头戴式降噪耳机,复刻了XM4的经典四向折叠便携设计。该机型在保留QN1处理器和30小时续航的基础上,全面升级了USB-C高速充电、无损音频直连、蓝牙多点连接及AI降噪通话功能,旨在满足对便携性有极高要求的用户群体。

OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析
OpenAI GPT-6 Astra 自主通关《传送门》:技术原理与实验成本解析

OpenAI GPT-6 Astra 模型通过 MCP 协议与 SourcePauseTool 控制《传送门》游戏,完成 3336 次工具调用并自主通关。实验耗时约 24 小时,API 成本约 571 美元,展示了多模态 AI 在 3D 解谜领域的突破性进展。

AI重构企业业务架构:超聚变“智企”范式核心解析
AI重构企业业务架构:超聚变“智企”范式核心解析

本文解析超聚变在2026数博会发布的“智企”范式,重点阐述如何通过Token生产平台(Token Factory)与企业业务本体建模,实现从简单AI工具调用到企业应用架构系统性重构的演进。文章详细拆解了智能体编排、数字孪生及生态协同等关键技术路径,为AI时代企业数字化转型提供可落地的参考方案。

南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破
南邮光擎智算团队:GaN基Micro-LED光计算芯片从理论到流片的突破

南京邮电大学“光擎智算”团队联合南京大学,攻克GaN基Micro-LED器件技术,成功搭建实验室级光计算验证系统。团队自主研发的5×5 Micro-LED光电计算阵列芯片已进入流片封装阶段,实现了图像识别等算力任务验证,推动光计算技术从理论走向工程落地。

微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案
微软推出Project Zenith:面向Windows 11开发者的AI硬件加速方案

微软于9月5日推出Project Zenith,旨在为Windows 11开发者提供更高效的AI开发体验。该项目目前仅支持配备超过64GB统一内存及250GB/s内存带宽的特定硬件,首发适配AMD Ryzen AI Halo设备。通过此项目,开发者可在本地运行参数超过300亿的AI模型,后续将分阶段扩展至更多合作伙伴设备。

贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析
贵州省住建厅与贝壳集团签署旅居战略合作:五大维度落地方案解析

9月3日,贵州省住建厅与贝壳集团在贵阳签署《旅居产业发展战略合作框架协议》,旨在打造全国旅居样板。合作涵盖平台建设、标准共建、人才培育、存量资产盘活及品牌推广五大维度,依托贝壳近600家门店及4000余名经纪人资源,强化贵州旅居服务供给,促进房地产市场平稳健康发展。

上海链家安住APP:业主主动卖房功能与成交数据解析
上海链家安住APP:业主主动卖房功能与成交数据解析

本文解析上海链家推出的“安住APP”功能,该工具允许业主在贝壳/链家挂牌后主动管理房源。通过实时查看销售进展、发送看房邀约及获取AI策略,业主可缩短成交周期。数据显示试点期间平均成交7天,最短1天。适用于希望提高信息透明度、主动参与卖房过程的业主。

打破流量垄断,让平台经济释放普惠红利
打破流量垄断,让平台经济释放普惠红利

2026年6月工信部等七部门印发《促进平台经济大中小企业协同发展行动方案》,明确平台经济是数字技术赋能的实体经济。针对流量垄断与“数字租金”问题,专家主张治理重心应从静态整改转向推动平台能力向中小企业外溢,通过算法透明、接口开放及数据可迁移,打破封闭生态,实现创新与规范并重的高质量发展。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。