当前位置:

首页 > 软件教程 > MiniMax开源M1模型,AI竞赛再升级

MiniMax开源M1模型,AI竞赛再升级

不知道还有多少人记得,AI行业的六小虎。行业内都在说,他们已经寂静好久了。上一次相关的项目发布,还是前一段时间我写的MiniMax声音模型的更新,Speech-02。而昨晚凌晨将近12点的时候,又是MiniMax,居然在X上,预告了他们一整周的发布计划。给我整不会了,不是,为什么总是选择这么阴间的时间点发布啊。。。而第一天(也就是昨天),发布了他们MiniMaxWeek的第一个项目:开源MiniMax首个推理模型M1。图片出手就开源,还是秀的,看看跑分。图片我先说结论:“MiniMaxM1的上下文能力

不知道还有多少人记得,AI行业的六小虎。

行业内都在说,他们已经寂静好久了。

上一次相关的项目发布,还是前一段时间我写的MiniMax声音模型的更新,Speech-02。

而昨晚凌晨将近12点的时候,又是MiniMax,居然在X上,预告了他们一整周的发布计划。

给我整不会了,不是,为什么总是选择这么阴间的时间点发布啊。。。

而第一天(也就是昨天),发布了他们MiniMax Week的第一个项目:开源MiniMax首个推理模型M1。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

出手就开源,还是秀的,看看跑分。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

我先说结论:“MiniMax M1的上下文能力,就现在全球最屌、最牛逼的、足以媲美Gemini 2.5 Pro的开源模型。”

我愿敬称为新一代源神。

在AIME 2024逻辑数学题目上(偏奥数思维)和LiveCodeBench编程题上、还有SWE-bench Verified(真实世界代码补全+修改),MiniMax M1的表现只能说中规中矩,有弱的、有强的。

而TAU-bench(需要理解任务目标、推理动机的场景),M1 准确率62.8%,开始媲美开源模型

但是,最离谱的来了,最后一个,MRCR(4-needle)。

这个直接,屠榜了,真的就一瞬间,一柱擎天,直接跟Gemini2.5Pro肩并肩,我相信用过Gemini 2.5 pro的伙伴,都知道,这玩意的上下文有多离谱,而现在,MiniMax M1作为一个开源的大模型,首次,在这个评测集上,能跟Gemini 2.5 Pro并驾齐驱了。

我特么。。。

很多人不知道MRCR(4-needle)是个啥,我简单解释一下。

AI圈之前一直有一个测上下文能力的测试,叫做“大海捞针”。

我23年的这个测试刚出来的时候我就写过:花7000块实测Claude2.1 - 200K Token的超大杯效果究竟怎么样?

X上一个大佬Greg Kamradt,为了弄明白当年Claude2.1的200K Token,究竟实测效果怎么样,就调用Claude 的API做了个压力测试,从一段不同长度的文本中,捞出特定的信息,而这个测试,花了他1000美金。

这图我现在还有。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

Claude-2.1当时红了一片,200K几乎没有蛋用,巨水无比。

而那一次,Kimi在我的文章下留言,说自己内部测了一下,全绿。

后面的故事,大家也就都知道了。

后来呢,Gemini觉得这个大海捞针测试太初级了,于是自己搓了一个新的测试方法,叫做Michelangelo。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

在这个论文里,他们提出了Michelangelo的几个评估任务,有Latent List、IDK,而第三个,就是MRCR。

全称叫Multi-Round Co-reference Resolution,译成中文叫多轮共指消解,反正非常拗口。

它主要考察一个模型在处理较长的、多轮对话时,能否准确地理解和区分用户要求中具体指的是哪一次对话、哪一个内容。

比如用户和AI进行了一系列对话,用户要求AI写一些东西,比如诗、谜语、文章。在这些对话中,会刻意插入多个看起来类似的话题(比如多首关于企鹅的诗)。

然后再让AI回头去重新找到某一次特定的话,比如用户要求“再重复一遍第二首写企鹅的诗”,此时模型必须精准识别这个“第二首”指的具体是哪一次回答的内容。

这个事其实不简单,因为对话很长,涉及多个话题和文体,非常考验模型的上下文理解力。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。已上传的图片

有些内容在主题和格式上极其相似,比如“关于企鹅的第一首诗”和“关于企鹅的第二首诗”。模型必须能清晰区分、精准回溯。

后面OpenAI在发GPT-4.1的时候,也在blog里面提到,自己魔改了一个难度更高的MRCR的评测集,用来评估模型的上下文性能。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

而“4-needle” 指的是,在同一段超长上下文里同时埋下 4 个“针”(关键信息片段),然后在后续对话里以交错的方式把这 4 根针全部出来。

在这个任务下,MiniMax-M1,吊打了一切,只跟Gemini 2.5 pro,差了那一点点的距离。

了下技术报告,M1之所以在上下文有这个性能,核心点还是在于他们之前开源的基座模型MiniMax-01。

得益于MiniMax-01 Lightning Attention线性注意力机制的应用,M1的时间和空间复杂度随序列长度增加近似线性增长,不像传统Transformer那样呈平方级膨胀。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

因为Lightning Attention机制,在推理生成长度64K token时,FLOPs消耗不到DeepSeek R1的一半。

当生成长度达到100K token时,M1仅消耗其约25%的FLOPs。

非常的离谱。

而这个MiniMax-M1,跟之前开源的基座模型MiniMax-01一样,也是456B参数,MoE架构,实际激活45.9B。

最长上下文长度为100万字,也就是1M,是DeepSeek-R1的8倍。

这次开源了两个上下文长度的推理模型,40K和80K。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

80K版本是在40K版本基础上进一步训练得到的增强版本。

这里注意一下,80K和40K指的不是上下文长度,上下文长度是1M,80K和40K指的是Extended Thinking的上限。

GitHub: https://github.com/MiniMax-AI/MiniMax-M1

Hugging Face:https://huggingface.co/spaces/MiniMaxAI/MiniMax-M1

目前在MiniMax的官网上也上线了。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

网址在此,可以直接用。

https://chat.minimaxi.com/

我也第一时间,上去测了一下。

我的第一个任务,就让我开了眼,因为我只是,小小的尝试一下,没想到效果,比我预期的还要好,我直接把MiniMax-M1的技术报告扔了进去,让它,给我逐字译。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

现在看着还比较正常对吧。

但是,马上,离谱的事情来了。

他居然把图,也给我...带出来了。。。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

甚至不仅有图,还有,公式。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

还把表格,直接拎出来译了。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

这效果,这体验,真的无敌。

虽然中间,有部分的图表丢失,还没有达到100%的完整度,但是这个效果,也已经非常非常好了,关键的是文字,一个不落,全部都整整齐齐的给我译出来了。

最搞笑的是,他还自作主张,在最后,可能觉得参考文献译出来没什么用,直接自己给省略了。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

我说实话,这个参考文献,占了5页,对我来说,确实没啥用。。。

译上,我又试了一个更有趣的场景,我扔了一个文档过去,然后说:

译成中文,在括号里标注一些符合我英语水平的原文英文词汇或短语。我英语水平是大学六级。”

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

太有意思了,这个上下文准确性,是真的牛逼。

然后我又做了一个测试,把我群里这一周的聊天记录,导出出去也扔给了MiniMax-M1,让他把绛烨的聊天记录都找出来。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

他准确的识别除了绛烨的微信ID,然后找到了他的微信号,扒出了他的所有聊天记录。。。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

这些链接,是真的能点的,我惊了,他还做了样式重构。。。

因为超长超准的上下文,你还可以,跟大模型玩一局,真正的文字冒险游戏,因为他不会忘记你的出身,他会记得,一切。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片
MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

推理模型+超长且精准上下文的扩充,确实会带来,很多不一样的花活玩法。

比如我还有一个特别狠的测试。

就是我手上有一个34个刘慈欣老师的小说的合集,因为大刘除了世人皆知的三体之外,他其实还写过特别多的科幻中短篇小说,也特别好看。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

比如我最爱的《山》。

我现在,想把这些故事,安利给我的朋友们,我想,让AI根据这34个故事,每一个故事都写一段故事总结+推荐语。

这个任务,你要是扔给DeepSeek

你就会得到一个非常离谱的提示,DeepSeek只阅读了8%。。。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

而MiniMax-M1,出色的完成了任务。

超长上下文的魅力,此时体现的淋漓尽致。

不过我有一个更变态的任务,还是给MiniMax-M1干宕机了。

就是...我让它数本草纲目里一共有多少药材= =

数了8分钟,最后跟我说,有400中种,但其实答案是1892种= =

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

不过我也能理解,这个任务,确实实在是太变态了。。。

除了上下文之外,我也测了些写作、编程、数学。

写作和数学就不详细提了,写作这块中规中矩,数学的高考题实在没空完整做了,我觉得我需要抽空写一个脚本

不过测了两道大题,目前是都对的。

最后稍微吐槽一下编程这块,就是前端审美,感觉还是有一些进步空间的。

就...有一点,不好看啊。

比如我昨天下午去参加了飞书多维表格的闭门会,会议特别有价值,我想做个可视化网页。

这是Gemini生成的。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

这是M1生成的。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

咱就是说,可以不这么直男审美的= =

总体来说,M1模型,还是让我有一点惊喜的,他们自己的新研究,确实卷出了一些很有意思的特性,也把开源领域的模型水平,又拔高了一个层级。

还有4天时间,我现在有点期待MiniMax会继续掏出什么有意思的大货了。

以我对MiniMax的了解,视频模型总归要来一个的吧,已经有一段时间没更新了,Video 01-Director已经是几个月前的事了。

你Hailuo 02(0616)都去打榜了,那你这5天里,得掏一下吧。

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。图片

海螺的人物情绪表演、动作表演,至今依然是我心中的白月光。

极度期待Hailuo 02,在人物表演上,会带给我什么样的震撼。

声音模型估计不发新的了,因为一个月前Speech-02才发。

图片和3DMiniMax不做,那在掏个音乐模型?这个符合MiniMax的气质。

这一周,希望MiniMax尽情撒货吧。

让AI的这一把火。

烧的更热烈些。

>/ 作者:卡兹克

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
软件教程
相关文章 更多
AE基础教程:如何创建合成并制作关键帧动画
AE基础教程:如何创建合成并制作关键帧动画

本文指导After Effects新手完成从打开软件到制作简单动画的完整流程。内容涵盖新建合成、导入素材、添加关键帧及预览验证,适用于AE基础学习。读者可依据步骤快速完成首个可播放的动效项目。

电影剪辑实战:镜头组织、节奏控制与声音衔接技巧
电影剪辑实战:镜头组织、节奏控制与声音衔接技巧

本文详解电影剪辑核心流程,从素材整理、镜头空间组织到叙事节奏压缩,再到J-cut/L-cut声音衔接技巧。通过粗剪保逻辑、精剪压停顿、反应镜头缓冲及电平统一检查,帮助创作者打造空间清晰、情绪连贯且听感自然的成片。

转场剪辑实战指南:硬切、遮挡与运镜的精准选择与操作技巧
转场剪辑实战指南:硬切、遮挡与运镜的精准选择与操作技巧

本文详解硬切、遮挡转场和运镜转场的适用场景与操作逻辑。通过对比三种转场的核心区别,提供基于素材条件和叙事目的的判断标准,帮助剪辑师避免滥用特效,掌握自然衔接画面的实战技巧。

GitLab新手创建项目并推送第一次提交的操作指南
GitLab新手创建项目并推送第一次提交的操作指南

本文指导GitLab新手完成创建项目并推送第一次提交的最小闭环。涵盖远程项目创建、本地仓库初始化、添加远程地址及执行git push。重点说明HTTPS与SSH认证差异、分支名(master/main)核对及提交验证标准,确保远程仓库真正建立。

抖音拍摄剪辑教程:从竖屏运镜到卡点成片
抖音拍摄剪辑教程:从竖屏运镜到卡点成片

本教程针对抖音竖屏视频制作,涵盖拍摄前构思、稳定运镜、粗剪筛选、音乐卡点及导出检查全流程。重点在于拍摄时预留字幕空间、利用动作节点辅助剪辑,以及通过鼓点对齐画面。适用于新手快速完成第一条完整成片,强调素材质量与节奏自然,避免过度特效与版权风险。

饭圈舞台照修图:降噪、调色与人物突出技巧
饭圈舞台照修图:降噪、调色与人物突出技巧

针对饭圈舞台照光线乱、噪点多、背景抢眼的痛点,本文提供“保脸、控光、突出主体”的修图方案。核心步骤包括:利用Lightroom降噪面板处理高ISO颗粒,控制曝光避免高光死白或脸部死黑;通过压低背景色彩、提升人物亮度与对比度来修正舞台灯光导致的肤色偏差;最后通过裁剪去除杂乱元素,确保人物主体清晰且肤色自然。

Photoshop安装失败或启动异常:系统要求、安装流程与故障排查指南
Photoshop安装失败或启动异常:系统要求、安装流程与故障排查指南

本文提供Photoshop完整安装指南,涵盖Windows/macOS系统要求、Creative Cloud客户端部署及常见启动故障排查。通过安装前磁盘与账号检查、安装中网络监控、安装后功能测试三步法,解决安装中断、登录失败及启动卡顿问题,确保软件稳定可用。

创维电视通过U盘安装第三方软件完整教程:权限设置与故障排查
创维电视通过U盘安装第三方软件完整教程:权限设置与故障排查

本文提供创维电视通过U盘安装第三方APK的完整操作指南。核心步骤包括:准备格式化的U盘与正规APK文件,在酷开系统“应用管理”中找到安装入口,临时开启“允许安装未知来源应用”权限,以及安装后的功能测试与权限关闭。适用于解决电视无法识别U盘、提示解析失败或权限受限等问题,确保安装安全且不影响系统稳定。

Excel筛选大于指定数值:操作步骤与结果验证
Excel筛选大于指定数值:操作步骤与结果验证

本教程演示如何在Excel中筛选大于指定数值的数据。核心步骤包括:确保数据连续、选中表头、通过“开始→排序和筛选”开启筛选,并在“数字筛选”中选择“大于”输入阈值。筛选仅隐藏不符合条件的行,不删除数据。完成后需逐行验证可见数据是否均大于阈值,并可通过取消筛选恢复全部数据。

Creo零基础入门:新建零件与第一次拉伸建模完整指南
Creo零基础入门:新建零件与第一次拉伸建模完整指南

本教程指导Creo初学者完成首个拉伸实体建模。通过新建零件、选择mmns_part_solid模板、定义草绘平面及绘制封闭轮廓,生成三维实体。内容涵盖操作路径、参数设置及常见错误排查,帮助新手建立正确的建模逻辑与单位概念。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。