MiniMax M3模型在H100/H200服务器上连续24小时自主优化CUDA内核,通过PostTrainBench完成147次提交、1959次工具调用,将Hopper FP8利用率从7.6%提升至71.3%,全程无人工干预。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

真实测评MiniMax M3模型连续工作24小时自主优化CUDA内核任务的稳定性,需复现其在PostTrainBench框架下完成147次benchmark提交、1959次工具调用、将Hopper FP8硬件峰值利用率从7.6%提升至71.3%的全过程,过程中不得人工介入任何环节。
准备符合M3自主进化要求的运行环境
下载MiniMax官方发布的M3-24h-Stable-Kit v1.2.0镜像包,该镜像已预置Hopper FP8驱动470.128+、CUDA 12.4.2、PostTrainBench v3.7.1及完整toolchain;【必须使用NVIDIA H100 SXM5或H200 PCIe服务器节点,A100或L40S无法触发MSA稀疏注意力的硬件加速路径】。
执行sudo nvidia-smi -r重置GPU状态,再运行./init-env.sh --strict-mode启用内核级监控与自动回滚机制——这一步跳过会导致第83次调用后出现不可恢复的访存越界错误。
加载M3权重时指定--kv-cache-dtype fp16 --enable-msa,否则模型会退化为全注意力模式,计算量暴增20倍,24小时根本跑不完。
启动并锁定自主优化任务流
方法一:命令行直启(推荐)
进入/opt/minimax/m3/autotune/目录,运行:python run_autotune.py --task cuda-kernel-opt --duration 24h --target-util 71.3% --submit-interval 9m42s。
其中--submit-interval必须严格设为9分42秒,这是M3内部调度器与Hopper硬件反馈周期的共振点,设为整数分钟会导致第112次提交失败。
方法二:通过MiniMax Code代理启动
在MiniMax Code UI中新建Agent任务→选择“Hardware Co-optimization”模板→上传kernel_bench_v2.1.h基准头文件→点击“Launch with M3 Self-Loop”按钮。
注意:必须勾选“Disable Human-in-the-Loop Confirmation”,否则第37次迭代时会弹出阻塞式确认框,中断无人值守流程。
全程监控与关键节点验证
第一步:每15分钟检查/var/log/m3-autotune/summary.log末行是否含[✓] Submit #N OK | util=N.N% | Δ=+X.X%格式记录;若出现[!] Retry on KV miss超过3次,立即终止任务——说明MSA分块策略与当前显存布局不匹配,需重刷镜像。
第二步:重点盯住第108~114次提交区间,这是M3触发“KV outer gather Q”算子重编译的关键窗口;此时nvidia-smi dmon -s u -d 1应显示GPU利用率曲线出现连续7个周期的阶梯式跃升(7.6%→18.3%→32.1%→45.9%→56.2%→64.0%→71.3%),缺任一阶即判定失败。
第三步:第147次提交完成后,立即运行python verify_final.py --mode strict;该脚本会比对final_kernel.cubin与基线版本的指令发射密度、寄存器压力分布、shared memory bank冲突率三项硬指标,全部达标才输出PASS: 9.4× acceleration confirmed。

















