发布于2026-06-01 阅读(0)
扫一扫,手机访问
继启动A股上市辅导之后,MiniMax又有了新动作。6月1日,这家公司正式发布了新一代通用模型——MiniMax M3。M3采用自研的稀疏注意力架构MSA(MiniMax Sparse Attention),在编程与智能体能力、超长上下文以及原生多模态等多个关键方向上,都实现了代际级别的突破。就在两天前,MiniMax Group Inc.已在上海证监局完成辅导备案登记,拟首次公开发行股票并上市,行业分类为I65软件和信息技术服务业,辅导券商为中信证券。这也意味着,继智谱之后,MiniMax成为又一家启动“A+H”双平台布局的AI公司。

具体来看,M3同时具备三大核心能力:前沿的Coding能力、1M超长上下文、以及原生多模态。MiniMax自己说,它是目前开源模型中唯一能同时做到这三点的那一个。这个定位本身就很说明问题——行业内卷到今天,能守住“全能”标签的模型已经不多了。
架构层面,M3的自研稀疏注意力机制MSA是个重要看点。相比传统的全注意力机制,MSA能把长上下文下的计算成本大幅压降,同时将上下文窗口拉升到100万token。这意味着什么?简单说,在处理长文档、复杂代码仓库、或者多轮任务协作这类场景时,模型可以在一次推理中保留更完整的信息链路,不会因为上下文太长而“断片”。根据MiniMax披露的数据,在100万上下文规模下,M3单token的计算量只有上一代模型的约1/20,推理效率的提升相当显著。
事实上,采用新的注意力机制来减少token消耗,已经成为新模型发布时的标准操作。比如DeepSeek新推出的V4模型,就用了一种混合压缩注意力机制,能在处理超长上下文时更高效地组织和检索信息,相比上一代模型只需要约27%的计算量和10%的缓存空间。换句话说,同样的任务,消耗的Token和算力都更少。行业的方向已经非常清晰了:谁的推理成本更低,谁就能在落地场景中占得先机。
除了架构升级,MiniMax还在底层推理算子层面做了进一步优化。通过重新设计数据读取与计算路径,相关性能相比主流开源方案提升了4倍以上。这背后反映出一个行业共识:随着Agent任务的复杂度不断提高,“更长上下文、更稳定记忆、更低成本推理”正在成为决定产品可用性的关键能力。说白了,光有模型还不够,工程上的软实力同样决定上限。
在大模型目前消耗Token最多的两大领地——编程和Agentic任务上,M3也拿出了亮眼表现。在衡量Coding能力的SWE-Bench Pro上,M3直接超过了4月发布、主打编程能力的OpenAI新一代模型GPT-5.5,以及Gemini 3.1 Pro,距离Opus 4.7也只有一步之遥。而在综合评估SVG生成性能的SVG-Bench基准上,M3甚至超过了Opus 4.7。此外,在面向自主Agent的端到端评测框架Claw-Eval上,M3拿到了最高分。这些成绩如果放在一年前,几乎不敢想象。
为了验证最新模型的超长上下文、编程和Agent能力,MiniMax还做了一个相当硬核的测试:直接把一篇ICLR 2025 Outstanding Paper Award获奖论文丢给M3,让它独立复现。结果M3自主运行了近12小时,全程自主产出18次commit和23张实验图表,成功跑通了核心实验,验证了论文中提出的方法。这个案例本身就很能说明模型的自主执行能力已经达到了什么水平。
多模态一直是MiniMax的核心战略方向,在M3上也得到了充分落地。据介绍,M3是一个从Step 0就开始进行多模态混合训练的模型。在重构了整套数据管线之后,MiniMax已经把训练数据Token规模提升到了100万亿的量级。这意味着模型能力正从语言理解进一步向真实的数字环境延伸。无论是办公自动化、企业软件操作,还是更复杂的生产力场景,AI进入实际执行层的速度都在明显加快。一句话总结:M3不是简单的“改参数”,而是从底层架构到工程优化再到场景能力的全面跃迁。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9