讲师中心 微信公众号
AI工具推荐 视频效率加速

32B超越671B,M-A-P全开源数学定理证明模型OProver,五项评测三项第一

风杰大大_9043

风杰大大_9043

发布时间:2026-06-12 19:54:21

|

460人浏览过

|

来源于php中文网

原创

形式化定理证明,被公认为大语言模型(llm)最具挑战性的推理能力试金石——每一步推导都必须经由lean 4内核进行严格机器验证。

过去两年间,开源社区在MiniF2F、PutnamBench等主流评测基准上的表现持续攀升,但技术演进路径日益趋同:堆叠更大模型、扩充更多数据,并在部署阶段叠加检索增强与多轮自我修正机制。

一个根本性瓶颈始终未解:检索信号、编译器诊断反馈及失败修复逻辑,大多仅作为部署时的外围插件接入,而模型在训练过程中并未系统性习得如何感知、理解并利用这些关键信息。由此催生了训练目标与实际部署行为之间的“策略割裂”。

为突破这一瓶颈,M-A-P开源社区联合南京大学等研究团队正式推出OProver——

首个将检索增强、编译器反馈解析与多轮修复闭环深度内嵌至训练范式中的Lean 4定理证明框架。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

32B超越671B,M-A-P全开源数学定理证明模型OProver,五项评测三项第一

在涵盖MiniF2F、MathOlympiad、ProofNet、ProverBench、PutnamBench在内的五项Lean 4全证明(whole-proof)评测中,OProver-32B斩获三项第一、两项第二:

MiniF2F(93.3)、ProverBench(58.2)、PutnamBench(11.3)均超越LongCat-Flash-Prover w/ TIR;且在全部五项评测中全面领先参数量达671B的DeepSeek-Prover-V2。

项目同步开源包含176万条形式化命题、680万条经编译器验证的证明链的OProofs语料库,以及8B/32B共7个版本的模型权重。

代码、权重与完整训练脚本均已开放获取。

策略割裂:训练与部署的核心鸿沟

当前主流Lean 4定理证明系统(如Goedel-Prover-V2、DeepSeek-Prover-V2、Kimina-Prover等)已在MiniF2F上将Pass@32指标推至高位,部分工作亦尝试引入检索、编译器反馈或自修正模块。

但其共性局限在于:上述增强能力基本以“黑盒式后处理流程”形式加装于已训练完成的prover之上,而非从训练源头就被建模为学习目标。

由此造成显著错配:

  • 训练阶段,模型仅接触结构清晰的“定理→已验证证明”监督样本;
  • 部署阶段,系统却向模型实时注入检索所得相关证明、前序失败尝试记录及Lean 4返回的详细编译错误,驱动其开展多轮迭代修复。

OProver的核心思想,是实现训练目标与真实部署证明流程的对齐:让模型在训练初期即习得执行智能体式精炼循环(agentic refinement loop) 的能力——将多轮修复、上下文检索与编译器反馈解析,统一纳入模型需主动建模与优化的策略空间,而非视作部署层的附加包装。

轻量化、端到端可训架构

32B超越671B,M-A-P全开源数学定理证明模型OProver,五项评测三项第一

部署阶段:可控轮次修复机制

OProver将定理证明任务建模为有限步数的修复循环。

每一轮输入包含:目标形式化命题、从记忆库中检索出的top-k条已验证证明、上一轮生成的未通过证明、以及Lean 4编译器返回的结构化诊断信息;模型据此生成新一轮证明尝试。任意一轮成功通过验证,整条推理轨迹即判定为有效。

训练阶段:双阶段协同优化

  • 持续预训练(CPT):基于约65B token混合语料开展,其中Lean 4数据(来自OProofs)占比约30%,代码数据(OpenCoder)占20%,数学语料(Nemotron-Math-4-Plus)占40%,长思维链(CoT)数据占10%;
  • 迭代式后训练:交替执行agentic proving rollout、基于轮次级修复样本的监督微调(SFT),以及面向难题集的强化学习(RL,采用GSPO算法)。

关键创新在于:检索结果、失败尝试痕迹与编译器反馈不再作为部署期临时拼接的外部信号,而是被显式编码为模型必须学习和响应的核心策略要素。

数据与模型的双向进化闭环

OProofs语料库与prover策略在迭代中相互驱动、共同演进。

每轮迭代中,当前模型在测试集上新生成并通过验证的证明,将自动加入OProofs并构建索引供后续检索使用;
修复过程中的完整轨迹成为下一轮SFT训练的关键样本;尚未攻克的“高难度题组”,则构成下一轮RL训练的核心奖励信号。

数据构建、模型训练与策略设计,由此形成持续正向反馈的演化闭环。

OProofs:专为agentic prover打造的Lean 4高质量语料

研究团队同步构建并开源OProofs语料库,涵盖约176万条形式化命题、680万条经Lean 4编译器验证的证明。

其中429万条证明附带检索所得的相关证明上下文,85.9万条样本整合了此前失败尝试所触发的编译器诊断反馈。模型不仅学习“什么是正确证明”,更系统掌握“当证明失败时,如何结合检索线索与编译器提示进行定向修复”。

One API key for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more
One API key for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more

统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。

下载

32B超越671B,M-A-P全开源数学定理证明模型OProver,五项评测三项第一

OProofs由两条互补的数据构建路径组成:

1、公开资源再验证生成
以NuminaMath-LEAN、Lean-Workbook、Leanabell-Prover-FormalStmt等权威开源Lean资源为起点,经清洗去重后,交由agentic proving系统重新生成并验证全部证明,同步采集检索上下文、失败日志与修复轨迹。

2、自然语言→形式化自动转化
从Common Crawl与GitHub大规模挖掘数学自然语言陈述,借助CriticLean工具链自动转化为Lean 4形式化表达,再经agentic proving流程完成证明生成与验证。

从覆盖维度看,OProofs横跨代数(60.1%)、分析(13.7%)、数论(13.0%)、几何(6.8%)四大数学分支;难度分布以初等(27.4%)与高中水平(48.9%)为主,同时包含本科难度(18.9%)与研究生难度(4.8%)问题。

五项评测稳居前列:三项榜首、两项次席

研究团队在MiniF2F、MathOlympiad、ProofNet、ProverBench、PutnamBench五大Lean 4评测基准上完成系统评估,默认报告Pass@32指标,基于n=64条独立多轮rollout的无偏估计。

32B超越671B,M-A-P全开源数学定理证明模型OProver,五项评测三项第一

在开源权重的全证明prover阵营中,OProver-32B呈现三大核心优势:

1、32B全面碾压671B
OProver-32B在全部五项评测中超越DeepSeek-Prover-V2(671B),并在MiniF2F(93.3)、ProverBench(58.2)、PutnamBench(11.3)上同步领先LongCat-Flash-Prover w/ TIR(560B)。

2、8B反超32B竞品
OProver-8B在全部五个benchmark上均优于Goedel-Prover-V2-32B,参数量仅为后者的四分之一。

3、迭代训练带来持续增益
在MiniF2F-Test上,OProver-8B得分由79.5跃升至91.8(+12.3),OProver-32B由84.7提升至93.3(+8.6)。

32B超越671B,M-A-P全开源数学定理证明模型OProver,五项评测三项第一

消融实验:检索与编译器反馈协同增效

移除多轮编译器反馈导致性能最大幅度下滑:OProver-32B在PutnamBench从11.3跌至7.0,在ProofNet从33.2降至25.8。

若进一步移除检索模块,指标继续下探至5.9与24.7。

这表明性能跃升并非源于简单粗暴的best-of-N采样,而是源自检索提供的结构启发与编译器反馈引导的精准修复之间形成的强协同效应。

其中,Lean编译器反馈提供关键纠错方向;检索上下文则贡献可复用的证明模式与片段模板。

32B超越671B,M-A-P全开源数学定理证明模型OProver,五项评测三项第一

测试时扩展性:推理预算增长稳定提效

随着单次推理预算由8提升至256,OProver-32B在全部五项评测中均呈稳健上升趋势:MiniF2F从87.5升至92.8,MathOlympiad从15.5升至22.0,ProofNet从25.6升至32.8,ProverBench从51.3升至56.9,PutnamBench从6.4升至11.3。

32B超越671B,M-A-P全开源数学定理证明模型OProver,五项评测三项第一

最优预算分配策略与评测难度高度相关:多数benchmark受益于加深单线程修复深度;而PutnamBench等低通过率难题,则需在修复深度与并行探索广度之间取得动态平衡。

32B超越671B,M-A-P全开源数学定理证明模型OProver,五项评测三项第一

全面开源与生态发布

研究团队已完整开源OProver全栈资源,包括模型权重、OProofs语料库及标准化训练流水线,覆盖各阶段checkpoint。

• m-a-p/OProver-32B / OProver-8B — 最终发布模型
• m-a-p/OProver-32B-Base / Round1 — 32B各训练阶段checkpoint
• m-a-p/OProver-8B-Base / Round1 / Round2 — 8B各阶段checkpoint
• m-a-p/OProofs — 176万条命题 / 680万条验证证明 / 106万条修复轨迹

需指出的是,OProver当前聚焦于Lean 4全证明场景。

未来值得关注的方向包括:该agentic refinement框架向Coq、Isabelle等其他主流证明助手的迁移可行性;以及在更长周期的数据-模型协同进化中,性能增长是否具备可持续性。

论文:https://www.php.cn/link/b45357b8257d2ec975e90db3da32947e
代码:https://www.php.cn/link/d847776976cb4d14fd28d53d9f326190
模型与数据:https://www.php.cn/link/161eef2abeb0574e9a8d4e14effea38c

本文首发于微信公众号“量子位”,作者:OProver团队,36氪经授权转载。

相关标签:

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

讯飞智作

讯飞智作是一款AI视频创作工具,AI文本配音工具,数字人课程、营销视频制作。

蛙蛙写作

一款AI论文写作工具,主要用于超级AI智能写作助手,适合需要提升相关任务效率的用户。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

相关专题

更多
LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

80

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

80

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

40

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

60

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

280

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

160

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

140

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

80

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
腾讯元宝使用手册
腾讯元宝使用手册

共0课时 | 0人学习

DeepSeek手册
DeepSeek手册

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn