百万token不失忆,MiniMax刚启上市辅导又发M3,自研架构曝光
在宣布启动A股上市辅导后没几天,这家港交所上市公司的上海AI公司MiniMax,又在昨天(6月1日)放了个大招——全新一代通用模型MiniMax M3正式亮相。 先来看看M3具体解决了什么痛点。你家大模型在读取长文档、啃大段代码时,是不是越往后越健忘,算起来呢,又慢又贵?M3这次就是冲着这几个痛点来
在宣布启动A股上市辅导后没几天,这家港交所上市公司的上海AI公司MiniMax,又在昨天(6月1日)放了个大招——全新一代通用模型MiniMax M3正式亮相。
先来看看M3具体解决了什么痛点。你家大模型在读取长文档、啃大段代码时,是不是越往后越健忘,算起来呢,又慢又贵?M3这次就是冲着这几个痛点来的。它是国内首个能同时把前沿编程能力、1M超长上下文、原生多模态这三项核心能力“打包”在一起的大模型。这波操作下来,业内不少人在猜测——M3是不是直接对标美国Anthropic公司在今年4月发布的Claude Opus 4.7?后者主打的是极致指令遵循、高清视觉、深度推理和专业代码。说实话,目前M3的能力很难说完全超越了Opus 4.7,但它的打法是另一套:开源策略加超高性价比。

从实际表现来看,开源的M3在能力上已经非常逼近Claude Opus 4.7了。举个例子,在SWE-Bench Pro这个专门衡量编程能力的评测基准中,MiniMax M3直接超过了OpenAI的GPT-5.5和谷歌的Gemini 3.1 Pro,离Opus 4.7也就差那么一丢丢。
另外值得注意的一点是,M3的“原生多模态”属性。很多模型是训练到后期才硬加上看图、看视频的能力,但M3从训练的一开始,就把文字、图片、视频等多种模态混合在一起训练。这就好比从一开始就是双语环境下长大的孩子,语感天然就比别人好。
技术底牌:自研稀疏注意力架构MSA
全球大模型竞争已经鱼死网破了,各家想保持住优势,核心在于Agent(智能体)的任务复杂度不断攀升时,模型怎么做到更长上下文、更稳定记忆,同时还得把推理成本打下来。M3的底气来自哪里?答案很简单——MiniMax自己研发的稀疏注意力架构MSA(MiniMax Sparse Attention)。
相比于传统的“全注意力机制”,MSA能显著降低长上下文场景下的计算成本,并且把上下文窗口直接拉到100万token,什么概念?相当于2本中文长篇小说。这意味着,当模型在面对长文档分析、复杂代码仓库、多轮任务协作这些场景时,可以保留更完整的信息链路,不会读着读着就忘了开头说过的话。更关键的是,MiniMax的性价比优势依然能打,M3的单token计算量只有上一代模型的……大约二十分之一。听着差不多的活儿,计算量差了一个数量级。

说到这家公司的研发节奏,也值得一提。去年6月刚发M1,四季度就密集发布了M2和M2.1,今年2月又放出了M2.5,现在M3已经上桌。AI行业的终极竞争,拼的就是智能进步的加速度,从这个节奏看,上海这家人工智能公司的研发效率确实没什么可挑剔的。
Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。
极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。
















