讲师中心 微信公众号
AI工具推荐 视频效率加速

MiniMax M2.7:自我进化的早期回响

胖涛吖_6275

胖涛吖_6275

发布时间:2026-04-07 17:53:44

|

372人浏览过

|

来源于php中文网

原创

M2.7是MiniMax首个深度参与自身进化的模型,具备智能体集群构建、复杂技能执行、动态工具搜索及自我优化能力,已在软件工程、办公自动化和交互娱乐等领域实现突破性应用。

minimax m2.7:自我进化的早期回响 - php中文网

在M2系列模型首次发布后的几个月里,我们收到了来自热情用户和开发者的海量反馈和建议,这促使我们进一步加快模型迭代的效率。随着人类生产力的充分释放,下一步自然而然地便是启动模型和组织的自我进化。M2.7是我们首个深度参与自身进化的模型。

M2.7 能够构建复杂的智能体集群并完成高度复杂的生产力任务,这得益于其智能体团队、复杂技能和动态工具搜索等功能。例如,在开发 M2.7 时,我们让模型更新自身记忆,并在其集群中构建数十种复杂技能,以辅助强化学习实验。我们还让模型根据实验结果改进其学习过程和集群。这一过程启动了模型自我进化的循环。

1. M2.7 在实际软件工程中表现出色,包括端到端项目交付、日志分析、缺陷排查、代码安全、机器学习等。在 SWE-Pro 基准测试中,M2.7 的得分为 56.22%,几乎达到 Opus 的最佳水平。这种能力也体现在端到端项目交付场景(VIBE-Pro 55.6%)以及对复杂工程系统的深入理解(Terminal Bench 2 57.0%)。

2. 我们还提升了该模型在专业办公软件领域各个方面的专业知识和任务交付能力。其在GDPval-AA上的ELO评分高达1495分,在开源模型中位列第一。M2.7在Office套件(Excel、PPT和Word)中的复杂编辑能力显著提升,能够更好地处理多轮修改和高保真编辑。M2.7能够与复杂的环境进行交互:在处理超过40项复杂技能(每项技能的词元数均超过2000)时,其技能符合率仍高达97%。

3. M2.7 展现出优秀的性格一致性和情商,为产品创新开辟了更多空间。

基于这些能力,M2.7 也显著加快了我们自身向人工智能原生组织的演进。

MiniMax M2.7:自我进化的早期回响 - php中文网

构建用于模型自我进化的代理

我们首先分享一个内部工作流程,该工作流程使M2系列模型能够自我演化。该工作流程也用于探索模型智能能力的边界。

现代智能体框架利用复杂的技能、记忆和其他外部模块的组合,以提高其对各种工作环境的适应性。在 MiniMax 中,我们的智能体经常面临跨多个部门的极其复杂且迥异的工作环境。因此,为了提高智能体在这些异构环境中的鲁棒性,我们委托内部版本的 M2.7 构建了一个研究智能体框架,该框架能够与不同的研究项目组进行交互和协作。该框架支持数据管道、训练环境、基础设施、跨团队协作和持久记忆,使研究人员能够驱动它来交付更优秀的模型。在研究人员的指导下,研究智能体框架驱动着迭代周期,从而生成下一代模型。

我们强化学习团队的日常工作流程堪称典范。研究人员首先与智能体讨论实验构想,智能体协助进行文献综述、跟踪预设的实验规范、处理数据和其他工件,并启动实验。实验过程中,智能体监控并分析实验进展,自动触发日志读取、调试、指标分析、代码修复、合并请求和冒烟测试,识别并配置细微但关键的变更。这些工作以前可能需要来自不同团队的多位研究人员协作完成,而现在,研究人员只需在关键决策和讨论时进行交互。这加快了问题发现和实验速度,从而更快地交付模型。在此流程中,M2.7 能够处理 30%-50% 的工作量。

MiniMax M2.7:自我进化的早期回响 - php中文网

在迭代过程中,我们意识到模型递归演化自身框架的能力也至关重要。我们的内部框架能够自主收集反馈,构建内部任务的评估集,并在此基础上不断迭代自身的架构、技能/MCP实现以及记忆机制,从而更高效、更出色地完成任务。

例如,我们让 M2.7 在内部框架上优化模型的编程性能。M2.7 完全自主运行,执行超过 100 轮的迭代循环:“分析故障轨迹 → 规划变更 → 修改框架代码 → 运行评估 → 比较结果 → 决定保留或撤销变更”。在此过程中,M2.7 发现了有效的模型优化方法:系统地搜索采样参数(例如温度、频率惩罚和存在惩罚)的最佳组合;为模型设计更具体的工作流程指南(例如,修复错误后自动在其他文件中搜索相同的错误模式);以及在框架的代理循环中添加循环检测和其他优化。最终,这些优化在内部评估集上实现了 30% 的性能提升。

我们相信,未来的人工智能自我进化将逐步过渡到完全自主,在无需人类干预的情况下协调数据构建、模型训练、推理架构、评估等阶段。

为此,我们在资源匮乏的场景下进行了初步探索性测试。我们让 M2.7 参加了 OpenAI 开源的 22 项 MLE Bench Lite 级别的机器学习竞赛。这些竞赛可以在单个 A30 GPU 上运行,却几乎涵盖了机器学习工作流程的所有阶段。

我们设计并实现了一个简单的框架来引导智能体进行自主优化。其核心模块包含三个组件:短期记忆、自我反馈和自我优化。具体来说,在每一轮迭代之后,智能体都会生成一个短期记忆 Markdown 文件,并同时对当前轮次的结果进行自我评估,从而为下一轮提供潜在的优化方向。下一轮迭代则基于之前所有轮次的记忆和自我反馈链进行进一步的自我优化。我们总共进行了三次试验,每次迭代演化时间为 24 小时。从下图可以看出,由 M2.7 训练的机器学习模型随着时间的推移不断获得更高的奖牌率。最终,最佳成绩获得了 9 枚金牌、5 枚银牌和 1 枚铜牌。三次运行的平均奖牌率为 66.6%,仅次于 Opus-4.6 (75.7%) 和 GPT-5.4 (71.2%),与 Gemini-3.1 (66.6%) 并列。

MiniMax M2.7:自我进化的早期回响 - php中文网

专业软件工程

在软件工程任务方面,M2.7 更深入地探索了现实世界的编程能力,包括用于查找错误、重构、代码安全、机器学习、Android 开发等等。

以常见的生产场景为例:在生产环境中进行调试。这不仅需要代码生成,更需要强大的综合推理能力。当生产环境中出现告警时,M2.7 可以将监控指标与部署时间线关联起来进行因果推理,对跟踪采样进行统计分析并提出精确的假设,主动连接数据库验证根本原因,精确定位代码库中缺失的索引迁移文件,甚至能够先使用非阻塞索引创建来止损,然后再提交合并请求。从可观测性分析和数据库专业知识到 SRE 级别的决策——这不仅仅是一个能够编写代码的模型,更是一个真正理解生产系统的模型。与传统的手动故障排除流程相比,使用 M2.7,我们多次将生产系统故障的恢复时间缩短到三分钟以内。

实时生产环境调试

在编程能力方面,M2.7 已达到目前最先进的模型水平。在涵盖多种编程语言的 SWE-Pro 测试中,M2.7 的准确率达到 56.22%,与 GPT-5.3-Codex 相当。在更接近真实工程场景的基准测试中,例如 SWE Multilingual(76.5%)和 Multi SWE Bench(52.7%),M2.7 的表现更为显著。

这项能力也延伸至端到端的完整项目交付场景。在代码库级代码生成基准测试 VIBE-Pro 中,M2.7 的得分为 55.6%,几乎与 Opus 4.6 持平——这意味着无论需求涉及 Web、Android、iOS 还是仿真任务,都可以直接交给 M2.7 来完成。

更值得关注的是它对复杂工程系统的深刻理解。在Terminal Bench 2(57.0%)和NL2Repo(39.8%)这两项对系统级理解能力要求极高的测试中,M2.7也表现出色。这进一步证实,它不仅擅长代码生成,还能深刻理解软件系统的运行逻辑和协作动态。

WildGuard演示网页由M2.7生成

为了提高开发效率,一个尤为重要的特性是原生智能体团队(多智能体协作)。智能体团队对模型提出了范式层面的要求:角色边界、对抗推理、协议遵守和行为区分——这些仅靠提示无法实现,必须作为模型的原生能力内化。在智能体团队场景中,模型需要稳定地锚定其角色身份,主动挑战队友的逻辑和伦理盲点,并在复杂的状态机中做出自主决策。以下是我们内部用于产品原型开发的智能体团队设置,其中包含构建产品原型所需的最简组织结构。

MiniMax M2.7:自我进化的早期回响 - php中文网

代理团队多代理协作演示

业务

除了软件工程之外,智能体在办公场景中也变得越来越有用。我们认为这主要归功于其两项核心能力:

领域专业知识和任务交付能力。该模型需要具备跨领域的专业知识,并理解用户需求。在衡量此能力的 GDPval-AA 评估中,M2.7 在 45 个模型中获得了 1495 分的 ELO 分数,仅次于 Opus 4.6、Sonnet 4.6 和 GPT 5.4,并超越了 GPT 5.3。针对最常见的办公文档处理任务,我们系统地优化了模型处理 Word、Excel 和 PPT 的能力。在各种代理平台上,M2.7 既可以基于模板和技能直接生成文件,也可以遵循用户的交互式指令,对现有文件进行多轮高保真编辑,最终生成可编辑的交付物。

能够与复杂环境交互。通用的日常场景意味着模型必须能够灵活适应各种环境,调用多种技能和工具,并在长时间交互过程中保持稳定的指令执行率。M2.7 在这些方面取得了显著进步。在 Toolathon 测试中,M2.7 的准确率达到了 46.3%,跻身全球顶尖行列。在实际工作场景中,智能体通常也需要理解和调用大量复杂技能。在 MM Claw 测试中,M2.7 在 40 项复杂技能(每项技能超过 2000 个令牌)中保持了 97% 的技能执行率。

我们测试了该模型在金融领域的专业能力,与上一代产品相比,其能力提升显著。例如,在阅读研究报告并构建公司未来营收模型的场景中,M2.7 可以自主阅读公司的年度报告和财报电话会议纪要,交叉引用多份研究报告,独立设计假设并构建营收预测模型,然后基于模板生成 PPT 和研究报告——其理解、判断和输出能力堪比初级分析师,并通过多轮交互进行自我纠错。实践者反馈,输出结果可以直接作为初稿,并直接用于后续工作流程。以下是台积电 (TSMC) 的示例。

任务:根据台积电的年度报告和财报电话会议信息,构建台积电的收入模型。阅读多份研究报告,设计相应的假设,根据最新信息建立台积电的收入模型,然后根据PPT模板制作PPT,并撰写一份Word文档形式的研究报告。

OpenClaw 近期的流行度激增,体现了其智能体生态系统的蓬勃发展,我们很高兴 M2 系列模型为社区的繁荣做出了贡献。基于 OpenClaw 中常用的任务,我们构建了一个名为 MM Claw 的评估数据集,涵盖了工作和生活中广泛的实际需求——从个人学习规划到办公文档处理和交付,再到定期进行的专业研究和投资建议,以及代码开发和维护。M2.7 在此测试中达到了接近 Sonnet 4.6 的水平,准确率达到 62.7%。

娱乐

在使用 OpenClaw 和类似的个人智能体时,我们注意到,除了完成工作之外,许多用户还希望智能体拥有较高的情商和角色一致性。一旦设定了角色,用户就会像与朋友互动一样与 OpenClaw 交流。我们认为这为将智能体的应用范围从纯粹的生产力工具扩展到互动娱乐领域提供了契机。为此,我们在 M2.7 版本中增强了角色一致性和对话能力。

基于此,我们构建了一个初步演示:OpenRoom,这是一个基于代理框架的交互系统,它将人工智能交互从纯文本流中解放出来,并将其置于一个完全可交互的Web图形用户界面空间中。在这里,角色设置不再是冰冷的提示信息;对话驱动着体验,生成实时视觉反馈和场景交互,角色能够主动与环境互动。我们相信,该框架具有高度可扩展性,能够随着代理能力的提升和社区的发展而不断演进,探索人类与代理交互的全新方式。

为了鼓励对该领域进行探索,我们已将初始演示程序开源(其中大部分代码由人工智能编写):

MiniMax M2.7 现已在 MiniMax Agent 和 MiniMax API 平台上全面发布。我们期待用户和开发者探索 M2.7 的更多精彩应用场景。

MiniMax 代理:agent.minimax.io

API:platform.minimax.io

编码计划:platform.minimax.io/subscribe/coding-plan

人人皆可拥有智慧。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

相关专题

更多
github中文官网入口 github中文版官网网页进入
github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started,GitHub 是一种基于云的平台,可在其中存储、共享并与他人一起编写代码。 通过将代码存储在GitHub 上的“存储库”中,你可以: “展示或共享”你的工作。 持续“跟踪和管理”对代码的更改。

8385

2026.01.21

GitHub官网入口版本汇总
GitHub官网入口版本汇总

本专题整合了GitHub入口版本地址汇总,阅读专题下面的文章了解更多详细内容。

818

2026.04.02

数据库三范式
数据库三范式

数据库三范式是一种设计规范,用于规范化关系型数据库中的数据结构,它通过消除冗余数据、提高数据库性能和数据一致性,提供了一种有效的数据库设计方法。本专题提供数据库三范式相关的文章、下载和课程。

2505

2023.06.29

如何删除数据库
如何删除数据库

删除数据库是指在MySQL中完全移除一个数据库及其所包含的所有数据和结构,作用包括:1、释放存储空间;2、确保数据的安全性;3、提高数据库的整体性能,加速查询和操作的执行速度。尽管删除数据库具有一些好处,但在执行任何删除操作之前,务必谨慎操作,并备份重要的数据。删除数据库将永久性地删除所有相关数据和结构,无法回滚。

3781

2023.08.14

vb怎么连接数据库
vb怎么连接数据库

在VB中,连接数据库通常使用ADO(ActiveX 数据对象)或 DAO(Data Access Objects)这两个技术来实现:1、引入ADO库;2、创建ADO连接对象;3、配置连接字符串;4、打开连接;5、执行SQL语句;6、处理查询结果;7、关闭连接即可。

2731

2023.08.31

MySQL恢复数据库
MySQL恢复数据库

MySQL恢复数据库的方法有使用物理备份恢复、使用逻辑备份恢复、使用二进制日志恢复和使用数据库复制进行恢复等。本专题为大家提供MySQL数据库相关的文章、下载、课程内容,供大家免费下载体验。

907

2023.09.05

vb中怎么连接access数据库
vb中怎么连接access数据库

vb中连接access数据库的步骤包括引用必要的命名空间、创建连接字符串、创建连接对象、打开连接、执行SQL语句和关闭连接。本专题为大家提供连接access数据库相关的文章、下载、课程内容,供大家免费下载体验。

2447

2023.10.09

数据库对象名无效怎么解决
数据库对象名无效怎么解决

数据库对象名无效解决办法:1、检查使用的对象名是否正确,确保没有拼写错误;2、检查数据库中是否已存在具有相同名称的对象,如果是,请更改对象名为一个不同的名称,然后重新创建;3、确保在连接数据库时使用了正确的用户名、密码和数据库名称;4、尝试重启数据库服务,然后再次尝试创建或使用对象;5、尝试更新驱动程序,然后再次尝试创建或使用对象。

2447

2023.10.16

FrankenPHP集成Laravel详细教程
FrankenPHP集成Laravel详细教程

本专题提供FrankenPHP集成Laravel的详细配置指南,全面解析运行原理、开发环境搭建、Caddyfile配置、Octane工作模式、数据库连接、队列任务、定时任务和生产环境优化,解决部署过程中常见的报错与兼容性问题。

0

2026.10.08

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn