M2.7是MiniMax首个深度参与自身进化的模型,具备智能体集群构建、复杂技能执行、动态工具搜索及自我优化能力,已在软件工程、办公自动化和交互娱乐等领域实现突破性应用。

在M2系列模型首次发布后的几个月里,我们收到了来自热情用户和开发者的海量反馈和建议,这促使我们进一步加快模型迭代的效率。随着人类生产力的充分释放,下一步自然而然地便是启动模型和组织的自我进化。M2.7是我们首个深度参与自身进化的模型。
M2.7 能够构建复杂的智能体集群并完成高度复杂的生产力任务,这得益于其智能体团队、复杂技能和动态工具搜索等功能。例如,在开发 M2.7 时,我们让模型更新自身记忆,并在其集群中构建数十种复杂技能,以辅助强化学习实验。我们还让模型根据实验结果改进其学习过程和集群。这一过程启动了模型自我进化的循环。
1. M2.7 在实际软件工程中表现出色,包括端到端项目交付、日志分析、缺陷排查、代码安全、机器学习等。在 SWE-Pro 基准测试中,M2.7 的得分为 56.22%,几乎达到 Opus 的最佳水平。这种能力也体现在端到端项目交付场景(VIBE-Pro 55.6%)以及对复杂工程系统的深入理解(Terminal Bench 2 57.0%)。
2. 我们还提升了该模型在专业办公软件领域各个方面的专业知识和任务交付能力。其在GDPval-AA上的ELO评分高达1495分,在开源模型中位列第一。M2.7在Office套件(Excel、PPT和Word)中的复杂编辑能力显著提升,能够更好地处理多轮修改和高保真编辑。M2.7能够与复杂的环境进行交互:在处理超过40项复杂技能(每项技能的词元数均超过2000)时,其技能符合率仍高达97%。
3. M2.7 展现出优秀的性格一致性和情商,为产品创新开辟了更多空间。
基于这些能力,M2.7 也显著加快了我们自身向人工智能原生组织的演进。

构建用于模型自我进化的代理
我们首先分享一个内部工作流程,该工作流程使M2系列模型能够自我演化。该工作流程也用于探索模型智能能力的边界。
现代智能体框架利用复杂的技能、记忆和其他外部模块的组合,以提高其对各种工作环境的适应性。在 MiniMax 中,我们的智能体经常面临跨多个部门的极其复杂且迥异的工作环境。因此,为了提高智能体在这些异构环境中的鲁棒性,我们委托内部版本的 M2.7 构建了一个研究智能体框架,该框架能够与不同的研究项目组进行交互和协作。该框架支持数据管道、训练环境、基础设施、跨团队协作和持久记忆,使研究人员能够驱动它来交付更优秀的模型。在研究人员的指导下,研究智能体框架驱动着迭代周期,从而生成下一代模型。
我们强化学习团队的日常工作流程堪称典范。研究人员首先与智能体讨论实验构想,智能体协助进行文献综述、跟踪预设的实验规范、处理数据和其他工件,并启动实验。实验过程中,智能体监控并分析实验进展,自动触发日志读取、调试、指标分析、代码修复、合并请求和冒烟测试,识别并配置细微但关键的变更。这些工作以前可能需要来自不同团队的多位研究人员协作完成,而现在,研究人员只需在关键决策和讨论时进行交互。这加快了问题发现和实验速度,从而更快地交付模型。在此流程中,M2.7 能够处理 30%-50% 的工作量。

在迭代过程中,我们意识到模型递归演化自身框架的能力也至关重要。我们的内部框架能够自主收集反馈,构建内部任务的评估集,并在此基础上不断迭代自身的架构、技能/MCP实现以及记忆机制,从而更高效、更出色地完成任务。
例如,我们让 M2.7 在内部框架上优化模型的编程性能。M2.7 完全自主运行,执行超过 100 轮的迭代循环:“分析故障轨迹 → 规划变更 → 修改框架代码 → 运行评估 → 比较结果 → 决定保留或撤销变更”。在此过程中,M2.7 发现了有效的模型优化方法:系统地搜索采样参数(例如温度、频率惩罚和存在惩罚)的最佳组合;为模型设计更具体的工作流程指南(例如,修复错误后自动在其他文件中搜索相同的错误模式);以及在框架的代理循环中添加循环检测和其他优化。最终,这些优化在内部评估集上实现了 30% 的性能提升。
我们相信,未来的人工智能自我进化将逐步过渡到完全自主,在无需人类干预的情况下协调数据构建、模型训练、推理架构、评估等阶段。
为此,我们在资源匮乏的场景下进行了初步探索性测试。我们让 M2.7 参加了 OpenAI 开源的 22 项 MLE Bench Lite 级别的机器学习竞赛。这些竞赛可以在单个 A30 GPU 上运行,却几乎涵盖了机器学习工作流程的所有阶段。
我们设计并实现了一个简单的框架来引导智能体进行自主优化。其核心模块包含三个组件:短期记忆、自我反馈和自我优化。具体来说,在每一轮迭代之后,智能体都会生成一个短期记忆 Markdown 文件,并同时对当前轮次的结果进行自我评估,从而为下一轮提供潜在的优化方向。下一轮迭代则基于之前所有轮次的记忆和自我反馈链进行进一步的自我优化。我们总共进行了三次试验,每次迭代演化时间为 24 小时。从下图可以看出,由 M2.7 训练的机器学习模型随着时间的推移不断获得更高的奖牌率。最终,最佳成绩获得了 9 枚金牌、5 枚银牌和 1 枚铜牌。三次运行的平均奖牌率为 66.6%,仅次于 Opus-4.6 (75.7%) 和 GPT-5.4 (71.2%),与 Gemini-3.1 (66.6%) 并列。

专业软件工程
在软件工程任务方面,M2.7 更深入地探索了现实世界的编程能力,包括用于查找错误、重构、代码安全、机器学习、Android 开发等等。
以常见的生产场景为例:在生产环境中进行调试。这不仅需要代码生成,更需要强大的综合推理能力。当生产环境中出现告警时,M2.7 可以将监控指标与部署时间线关联起来进行因果推理,对跟踪采样进行统计分析并提出精确的假设,主动连接数据库验证根本原因,精确定位代码库中缺失的索引迁移文件,甚至能够先使用非阻塞索引创建来止损,然后再提交合并请求。从可观测性分析和数据库专业知识到 SRE 级别的决策——这不仅仅是一个能够编写代码的模型,更是一个真正理解生产系统的模型。与传统的手动故障排除流程相比,使用 M2.7,我们多次将生产系统故障的恢复时间缩短到三分钟以内。
实时生产环境调试
在编程能力方面,M2.7 已达到目前最先进的模型水平。在涵盖多种编程语言的 SWE-Pro 测试中,M2.7 的准确率达到 56.22%,与 GPT-5.3-Codex 相当。在更接近真实工程场景的基准测试中,例如 SWE Multilingual(76.5%)和 Multi SWE Bench(52.7%),M2.7 的表现更为显著。
这项能力也延伸至端到端的完整项目交付场景。在代码库级代码生成基准测试 VIBE-Pro 中,M2.7 的得分为 55.6%,几乎与 Opus 4.6 持平——这意味着无论需求涉及 Web、Android、iOS 还是仿真任务,都可以直接交给 M2.7 来完成。
更值得关注的是它对复杂工程系统的深刻理解。在Terminal Bench 2(57.0%)和NL2Repo(39.8%)这两项对系统级理解能力要求极高的测试中,M2.7也表现出色。这进一步证实,它不仅擅长代码生成,还能深刻理解软件系统的运行逻辑和协作动态。
WildGuard演示网页由M2.7生成
为了提高开发效率,一个尤为重要的特性是原生智能体团队(多智能体协作)。智能体团队对模型提出了范式层面的要求:角色边界、对抗推理、协议遵守和行为区分——这些仅靠提示无法实现,必须作为模型的原生能力内化。在智能体团队场景中,模型需要稳定地锚定其角色身份,主动挑战队友的逻辑和伦理盲点,并在复杂的状态机中做出自主决策。以下是我们内部用于产品原型开发的智能体团队设置,其中包含构建产品原型所需的最简组织结构。

代理团队多代理协作演示
业务
除了软件工程之外,智能体在办公场景中也变得越来越有用。我们认为这主要归功于其两项核心能力:
领域专业知识和任务交付能力。该模型需要具备跨领域的专业知识,并理解用户需求。在衡量此能力的 GDPval-AA 评估中,M2.7 在 45 个模型中获得了 1495 分的 ELO 分数,仅次于 Opus 4.6、Sonnet 4.6 和 GPT 5.4,并超越了 GPT 5.3。针对最常见的办公文档处理任务,我们系统地优化了模型处理 Word、Excel 和 PPT 的能力。在各种代理平台上,M2.7 既可以基于模板和技能直接生成文件,也可以遵循用户的交互式指令,对现有文件进行多轮高保真编辑,最终生成可编辑的交付物。
能够与复杂环境交互。通用的日常场景意味着模型必须能够灵活适应各种环境,调用多种技能和工具,并在长时间交互过程中保持稳定的指令执行率。M2.7 在这些方面取得了显著进步。在 Toolathon 测试中,M2.7 的准确率达到了 46.3%,跻身全球顶尖行列。在实际工作场景中,智能体通常也需要理解和调用大量复杂技能。在 MM Claw 测试中,M2.7 在 40 项复杂技能(每项技能超过 2000 个令牌)中保持了 97% 的技能执行率。
我们测试了该模型在金融领域的专业能力,与上一代产品相比,其能力提升显著。例如,在阅读研究报告并构建公司未来营收模型的场景中,M2.7 可以自主阅读公司的年度报告和财报电话会议纪要,交叉引用多份研究报告,独立设计假设并构建营收预测模型,然后基于模板生成 PPT 和研究报告——其理解、判断和输出能力堪比初级分析师,并通过多轮交互进行自我纠错。实践者反馈,输出结果可以直接作为初稿,并直接用于后续工作流程。以下是台积电 (TSMC) 的示例。
| 任务:根据台积电的年度报告和财报电话会议信息,构建台积电的收入模型。阅读多份研究报告,设计相应的假设,根据最新信息建立台积电的收入模型,然后根据PPT模板制作PPT,并撰写一份Word文档形式的研究报告。 |
OpenClaw 近期的流行度激增,体现了其智能体生态系统的蓬勃发展,我们很高兴 M2 系列模型为社区的繁荣做出了贡献。基于 OpenClaw 中常用的任务,我们构建了一个名为 MM Claw 的评估数据集,涵盖了工作和生活中广泛的实际需求——从个人学习规划到办公文档处理和交付,再到定期进行的专业研究和投资建议,以及代码开发和维护。M2.7 在此测试中达到了接近 Sonnet 4.6 的水平,准确率达到 62.7%。
娱乐
在使用 OpenClaw 和类似的个人智能体时,我们注意到,除了完成工作之外,许多用户还希望智能体拥有较高的情商和角色一致性。一旦设定了角色,用户就会像与朋友互动一样与 OpenClaw 交流。我们认为这为将智能体的应用范围从纯粹的生产力工具扩展到互动娱乐领域提供了契机。为此,我们在 M2.7 版本中增强了角色一致性和对话能力。
基于此,我们构建了一个初步演示:OpenRoom,这是一个基于代理框架的交互系统,它将人工智能交互从纯文本流中解放出来,并将其置于一个完全可交互的Web图形用户界面空间中。在这里,角色设置不再是冰冷的提示信息;对话驱动着体验,生成实时视觉反馈和场景交互,角色能够主动与环境互动。我们相信,该框架具有高度可扩展性,能够随着代理能力的提升和社区的发展而不断演进,探索人类与代理交互的全新方式。
为了鼓励对该领域进行探索,我们已将初始演示程序开源(其中大部分代码由人工智能编写):
• 项目仓库:https://www.php.cn/link/5328c8721bf63d50f836beb8da7329b1
• 立即体验:https://www.php.cn/link/5994c49e2b3dfb26cdaa4c2098913623
MiniMax M2.7 现已在 MiniMax Agent 和 MiniMax API 平台上全面发布。我们期待用户和开发者探索 M2.7 的更多精彩应用场景。
MiniMax 代理:agent.minimax.io
编码计划:platform.minimax.io/subscribe/coding-plan
人人皆可拥有智慧。

















