讲师中心 微信公众号
AI工具推荐 视频效率加速

“Agent的最后一场考试”来了:最强模型得分率仅8.6%,Claude Code直接挂零

浅墨酱_9961

浅墨酱_9961

发布时间:2026-06-13 22:52:39

|

838人浏览过

|

来源于php中文网

原创

如今,ai 模型的能力似乎越来越强:在棋类对弈中轻松击败世界冠军,在各类主流 benchmark 上频频刷新 sota 记录。但为何仍难以真正承担起人类日常工作中那些复杂、连续、有实际经济价值的任务?

由加州大学伯克利分校主导,并联合全球 250 多位来自工业界与学术界的资深专家共同完成的研究,直指问题核心:“症结不在 AI 本身,而在于当前的评估方式已严重滞后。”现有通用基准,已无法有效反映模型在真实、长周期、高价值职业场景中的实际表现。

为此,研究团队正式推出全新评测基准——Agents’ Last Exam(ALE)。“最后一场考试”之名,既寓意其设定了能力准入门槛,也象征着它代表了当前 AI Agent 所需攻克的能力前沿边界。唯有当 AI Agent 能稳定通过 ALE 的全面考核,才意味着它真正具备了承接现实专业工作的潜力;此时 benchmark 上的进步,才真正具备实践意义。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

“Agent的最后一场考试”来了:最强模型得分率仅8.6%,Claude Code直接挂零

论文链接:https://www.php.cn/link/8488edf17e796d6b837dca8a46444721

考试结果一目了然:尽管主流大模型在传统测评中屡获高分,但在 ALE 最具挑战性的任务层级中,所有系统的平均完整通过率仅为 2.6%。这清晰表明,当前 Agent 在应对复杂、多步骤、跨工具的专业任务时,依然存在显著能力断层。

“Agent的最后一场考试”来了:最强模型得分率仅8.6%,Claude Code直接挂零

图|Agents’ Last Exam 覆盖大量真实行业任务与端到端工作流。

“最后一场考试”究竟考什么?

Agents’ Last Exam(ALE) 是由 250 余位一线从业者与领域专家协同构建的 AI Agent 综合评测体系,聚焦于衡量 AI 在长期性、可落地、具经济回报的真实职业场景中的综合能力。

为贴近人类真实办公方式,研究团队系统采集了 1490 项实操任务,横跨制造业、法律服务、医疗健康、视觉创意等多个关键行业。所有任务均源自从业者每日所面对的真实需求:例如,要求 Agent 在 Blender 中建模并渲染 3D 产品图;或在 DaVinci Resolve 中完成绿幕抠像、调色与多轨合成。

“Agent的最后一场考试”来了:最强模型得分率仅8.6%,Claude Code直接挂零

图|ALE 分类体系下 1490 个任务实例的领域分布。

相较于传统问答式或单步推理型 benchmark,这类任务对 Agent 提出了更严苛的要求。研究团队将能胜任此类任务的系统定义为 Generalist Computer-Use Agent(GCUA):它不仅要理解图形界面交互逻辑,还需熟练使用命令行、管理文件系统、编写调试代码、调用本地及远程工具,并自主串联整套工作链路。

“Agent的最后一场考试”来了:最强模型得分率仅8.6%,Claude Code直接挂零

图|典型的 GCUA 架构示意。

为确保评测的真实性与可复现性,ALE 构建了一整套支持自动执行与自动评分的仿真环境。运行时,任务脚本负责初始化环境、加载目标、配置资源并最终校验输出;Agent 则依据自然语言任务描述,持续进行环境观测 → 动作决策 → 行动执行的闭环。任务结束后,系统直接比对产出物与标准答案,93.2% 的任务支持全自动判分,无需人工介入。

One API key for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more
One API key for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more

统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。

下载

“Agent的最后一场考试”来了:最强模型得分率仅8.6%,Claude Code直接挂零

图|ALE 任务构建与执行流程示意图。

这场考试的成绩如何?

研究团队强调,在最难等级的任务集中,当前表现最优的组合是 Codex + GPT-5.5,其完整通过率也仅达 8.6%;而所有主流系统的整体平均完整通过率为 2.6%。

报告中列举了若干典型失败案例:在音乐乐谱转译任务中,AI 仅导出 MIDI 文件,却遗漏总谱 PDF 与界面截图,最终得分为 0;在注塑成型仿真任务中,Agent 成功在 Moldex3D 中完成模拟并导出结果,却未能准确提取关键工艺参数,得分仅为 0.4762;而在达芬奇绿幕合成任务中,AI 虽生成视频,但未满足色彩一致性、边缘精度等硬性指标,同样被判 0 分。

“Agent的最后一场考试”来了:最强模型得分率仅8.6%,Claude Code直接挂零

图|ALE 主要实验结果汇总。

“Agent的最后一场考试”来了:最强模型得分率仅8.6%,Claude Code直接挂零

图|各维度失败归因分析概览。

研究团队进一步对失败原因进行了结构化归类。以 Claude Code + Opus 4.7 为例,31% 的失败源于任务理解偏差,47% 源于策略方法错误,22% 属于执行层面失误。其中,“理解+方法”类问题合计占比近八成。由此推断,当前系统的核心瓶颈在于领域专业知识的深度整合能力,而非底层操作或工具调用等执行技能。

此外,研究还对比了模型与 Agent 框架各自的影响权重。结果显示:更换基础模型带来的性能波动远大于更换框架本身。当固定 Agent 框架仅切换模型时,最高与最低通过率相差达 18 个百分点;而固定模型仅更换框架时,差异幅度仅为 5–6 个百分点。换言之,模型能力的贡献度约为 Agent 框架的三倍。

局限性与后续演进方向

研究团队坦承,ALE 当前以美国劳工统计局 SOC 2018 职业分类为骨架,主要覆盖软件密集型、高度数字化的职业类型;现阶段所有任务均部署于 Linux 或 Windows 虚拟机环境中。

同时,任务在各行业的分布尚不均衡。部分领域样本丰富,如法律领域含 15 个任务;而能源与核工程仅有 4 个,城市与空间规划为 5 个。目前公开发布的任务集,仅占全部构建任务池的一部分。团队曾以 Claude Code + Opus 4.7 进行验证:公开子集与完整任务池在各领域通过率的相关系数仅为 0.89,说明仍有可观的未见任务空间待探索。

不过,研究团队明确表示,ALE 并非静态基准,而是一个持续演进的开放生态。未来,任务库将持续拓展至新兴工作流与更多垂直行业;当前保留在私有池中的高质量任务,也将按计划定期释放至公开集,保障评测的广度、深度与时效性。

本文来自微信公众号 “学术头条”(ID:SciTouTiao),作者:学术头条,36氪经授权发布。

热门AI工具

更多
Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

相关专题

更多
Claude 新手入门教程
Claude 新手入门教程

本专题围绕 Claude 的基础使用与实际应用展开,面向零基础用户与初学者,系统梳理从“认识工具”到“高效使用”的完整路径。

2531

2026.03.27

Claude 提示词使用指南
Claude 提示词使用指南

本专题聚焦 Claude 的提示词(Prompt)设计与优化方法,围绕“如何让 AI 更准确理解需求并输出高质量结果”这一核心问题展开。内容从基础结构入手,逐步深入到复杂场景下的提示词构建策略,帮助用户建立清晰、可复用的提示词体系。

414

2026.03.27

Claude 进阶使用指南
Claude 进阶使用指南

本专题面向已经具备基础使用经验的用户,深入解析 Claude 在复杂场景中的高阶应用方式,重点解决“如何让 AI 真正参与到实际工作流程中”的问题。让 Claude 成为日常工作中可持续复用的效率引擎,在内容创作、开发实践与信息处理等多个领域实现显著提效。

379

2026.03.27

AI Agent 实战指南:从评测到落地
AI Agent 实战指南:从评测到落地

全面评测 Manus AI 与 ChatGPT、Claude、OpenAI Operator 等 AI Agent 产品,分析自动化能力、工作流与实际生产力差异。

353

2026.05.29

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

80

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

80

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

60

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

60

2026.09.29

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Claude Code 快速上手核心指南
Claude Code 快速上手核心指南

共0课时 | 0人学习

Claude Code 官方文档
Claude Code 官方文档

共0课时 | 0人学习

Claude Code 官方中文文档
Claude Code 官方中文文档

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn