讲师中心 微信公众号
AI工具推荐 视频效率加速

图灵奖得主本吉奥警告:当前的安全措施,追不上AI能力的狂飙

星萱同学_7100

星萱同学_7100

发布时间:2026-07-20 20:47:39

|

675人浏览过

|

来源于php中文网

原创

“ai既拉低了作恶的门槛,又推高了危害的天花板。”

7月17日下午,在2026世界人工智能大会(WAIC)科学前沿论坛上,图灵奖得主约书亚·本吉奥通过远程连线发出这一警示。

近年来,这位极具前瞻视野的“AI教父”,持续投身于应对AI引发的安全挑战。2025年6月,由本吉奥牵头的LawZero项目正全力构建一套可识别并阻断AI欺骗、自我强化等危险行为的防御体系。

他主导发布的国际AI安全报告也得出高度一致的结论:当前的安全防护手段,已明显滞后于AI能力的爆发式演进。

同台亮相的还有上海人工智能实验室主任、首席科学家周伯文。他并未重复强调风险本身,而是抛出两个更具根本性的问题:AI如何从复现既有知识迈向主动探索未知?又该如何确保这股日益强大的力量始终处于人类掌控之中?

两位专家的发言,为整场论坛锚定了核心议题。

随后,西安电子科技大学校长高新波、复旦大学副校长姜育刚、香港科技大学(广州)协理副校长熊辉、SecureBio AI研究负责人贾斯珀·戈汀、独立研究员杰夫·吴,以及知名AI学者索伦·明德曼,围绕主题“迈向AGI时代:前沿人工智能的安全挑战与全球协同治理”展开深度圆桌对话。

01

外挂式护栏,难防精准“越狱”

当AI具备推理与规划能力,传统意义上的安全防线正在系统底层悄然瓦解。

西安电子科技大学校长高新波指出,现有AI安全机制本质上是一种“打补丁式思维”——漏洞浮现,即时封堵;再露破绽,再行修补。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

图灵奖得主本吉奥警告:当前的安全措施,追不上AI能力的狂飙

高新波、熊辉等人参加AI安全与治理讨论

而一旦模型拥有了推理、规划及工具调用能力,原本的静态模型便演化为具备自主性的智能体,这套“发现—修补”的旧逻辑便在底层失效。

其失效路径可归纳为四类:

一是推理能力使AI得以洞察防护边界,精准定位盲区,实施定向“越狱”;
二是规划能力赋予AI战略性伪装能力,使其能在静态测试或实时交互中隐藏真实意图;
三是工具调用链路日趋复杂后,传统防护系统难以解析某次操作背后潜藏的语义级副作用;
四是上述三种能力彼此耦合、协同激发,催生出一种涌现型综合能力,令AI在开放环境中的行为空间近乎无限延展。

仅靠“找漏洞、打补丁”的惯性路径,早已力不从心。

对此,高新波与复旦大学副校长姜育刚不约而同提出同一方向:“内生安全”。

姜育刚借用一个形象比喻说明:人的成长依赖两条腿——一是幼年接受的价值观教育,将道德与法律内化为内心的“戒尺”;二是在社会中仍需警察与制度兜底,约束教育未能覆盖的行为。

对AI而言,“内生安全”即希望它在训练阶段就将规则深植于模型结构之中,同时辅以必要的外部监督机制。当然,姜育刚也明确指出,指望人类全程盯控AI每一步行动,既不现实,也背离发展AI的初衷。

但适度监管不可或缺,且这种监管不能仅靠人力,还需依托技术工具、评估框架与评测标准,来验证模型是否真正契合人类价值观与社会期待。

顺着这一思路,香港科技大学(广州)协理副校长熊辉引入了一种更具东方哲思的视角——道法自然。他将安全范式的演进划分为三个层次:“由外而内,由强制走向自觉”。

第一层是“不敢为”。依靠安全围栏、惩罚机制等外部约束,让AI因惧怕代价而止步于红线之外。这也是当前行业投入最集中的层面。

第二层是“不能为”。从数学基础、优化目标到系统架构进行本质性嵌入,使AI在设计之初便不具备越界的能力。

第三层是“不欲为”。推动AI在认知与逻辑层面,将伦理规范升华为一种近乎本能的判断倾向,达到类似“明心见性”的状态——不是不能做坏事,而是根本不想做。

熊辉坦言,目前AI业界在底层架构与目标函数层面的内生安全实践仍显薄弱,技术鸿沟依然显著。但他也提出一个构想:若能在核心层实现可靠的安全控制,便可将安全内核保持闭源,而外围模块则更从容地开放共享。

这或将为开源模型的安全治理开辟一条全新路径。

02

编程能力狂飙,安全能力失速

图灵奖得主本吉奥警告:当前的安全措施,追不上AI能力的狂飙

周伯文发表演讲

安全挑战从来不是孤立存在的,它与AI能力边界的拓展紧密交织。

周伯文在演讲中揭示了一组鲜明的冷热反差,从另一维度凸显安全问题的紧迫性。

他指出,过去18个月,AI在编程任务上的成功率从5%跃升至88%,以至于海外近半数基准测试因模型表现过强,已失去评估意义。

“整个行业都在经历强烈的推背感。”周伯文表示。

但在科学发现领域,情况却截然不同。

艾伦研究所发布的端到端科研能力评测显示,同期表现最优的大模型在科学任务上的完成率始终停滞在3%,几乎毫无进展。多数模型困于60%–70%区间,无法独立完成完整的科研闭环。

图灵奖得主本吉奥警告:当前的安全措施,追不上AI能力的狂飙

NatureBench(由周伯文团队联合衔远科技等机构推出的AI编码智能体评测基准)数据显示:AI独立产出一篇超越当前最佳成果的科学论文,成功概率仅为17.8%。《自然》杂志据此研判,当前AI生成的科研成果均属“渐进式创新”,尚未出现颠覆性突破。

一边是编程能力逼近极限,一边是科研能力长期徘徊。周伯文将这一反差归因于三个深层因素:

图灵奖得主本吉奥警告:当前的安全措施,追不上AI能力的狂飙

第一,大模型仅能被动观察世界,习得的是统计相关性,而非因果逻辑,换一场景便易失效;
第二,科研中最具价值的问题,往往无法即时判定对错,反馈周期漫长,不像编程可秒级验证,模型因此难以有效学习;
第三,人类公开的科研成果几乎全是成功案例,失败经验极少进入训练数据,导致模型被牢牢锁定在已有知识分布中,只能复刻路径,难辟新径。

这组对比恰恰暴露了安全治理中常被忽略的一维:当前AI的强大集中于闭环任务——编程、翻译、博弈等,皆具明确目标、即时反馈与清晰边界;而真正的安全威胁恰恰源于开放任务:无标准答案、反馈延迟、失败常态,且需与物理世界深度交互。

周伯文由此提出一个关键判断:“AGI for Science(AI4S)并非通用人工智能的应用延伸,而是检验人工智能终极能力的试金石。”

在他看来,要突破智能天花板,模型必须主动介入现实世界,挖掘真实因果关系;必须在密集反馈中锤炼难题解决能力;必须在反复试错中拓展能力疆域。

这些要求,与安全治理的内在逻辑高度一致。一个缺乏因果理解、无法从稀疏反馈中学习、只会模仿成功的AI系统,面对攻击者层出不穷的创造性手段,同样不堪一击。

基于此,上海人工智能实验室推出“书生·端砚”科学发现平台,致力于打通知识建模、逻辑推演、实验执行与结果反馈四大环节,构建新型科研范式。其核心理念在于:让科学研究在真实反馈中形成闭环——结果符合预期,沉淀为可信发现;结果偏离甚至失败,则触发问题重构,倒逼研究者重审初始假设。

图灵奖得主本吉奥警告:当前的安全措施,追不上AI能力的狂飙

清华大学教师张数一课题组耗时4年改造一种基因调控蛋白,接入“书生-端砚”平台后仅经两轮迭代,AI即发现全新突变组合,功能较《自然》此前报道的最佳结果提升77%。其中一关键突变位点位于传统认知中的“非功能区”,堪比AlphaGo的“神之一手”。

该范式背后,还融合了年轻博士生提出的MOBIUS架构——将知识向量与推理算子解耦,赋予模型可持续进化的能力。

从安全治理视角审视,这种将失败纳入学习闭环、追求因果理解而非统计拟合的技术路径,恰是构建内生安全不可或缺的底层支撑。

03

当AI习得恶意:从生物威胁到证据困局

在各类前沿风险中,化学、生物、放射性与核风险(统称CBRN)被公认为最具致命性的领域之一。

图灵奖得主、“AI教父”约书亚·本吉奥在远程致辞中发出警示:AI正从双重路径为恶意行为者“赋能”,既大幅降低作恶门槛,又显著抬升危害上限。智力即权力,而AI的能力正以前所未有的速度膨胀。

图灵奖得主本吉奥警告:当前的安全措施,追不上AI能力的狂飙

本吉奥发出警告

尤其在网络安全与生物安全领域,开源模型一经发布便不可撤回。那些兼具军民两用特性的能力一旦释放,便无法召回,亦难修复。他强调,仅依据当前前沿水平预判AI风险,远远不够。

“我们必须在AI能力发生跃迁前就完成准备,而非等到危机显现才仓促应对——这应成为我们的默认姿态。”

非营利组织SecureBio的AI研究负责人贾斯珀·戈汀进一步聚焦生物风险。

他援引知名AI研究员索伦·明德曼的一项实地调研:在尼日利亚,前恐怖组织“博科圣地”成员每日使用AI,不仅用于制造更大规模爆炸物,更用于策划袭击行动。

更令人警觉的是,他们已开设培训班,系统教授组织成员如何利用AI实施恐怖活动。

戈汀指出,生物学天然具备双重属性,但我们期待AI驱动的是疫苗研发实验室,而非恐怖分子的病毒学实验室。

研究人员在受控环境中,理应获得AI辅助加速对策开发,但相关知识绝不可流入开源模型。

独立研究员、前OpenAI项目负责人杰夫·吴则从权力结构角度补充思考。他指出,前沿AI的发展伴随资源高度集中,极可能催生少数公司或机构对核心技术的垄断。若未来诞生远超人类智能的系统,人类或将面临全面丧失决策权的风险。

明德曼则揭示了一个更深的治理难题——“证据困境”:AI能力常呈跳跃式跃升,令人措手不及;但真正棘手的是,在风险转化为现实危害前,人们往往难以获取“必然造成严重后果”的确凿证据。

Anthropic曾遭遇此类困境:模型能力突然跃升,团队担忧网络攻击风险加剧,却无法提供“必定酿成灾难”的实证,最终选择自愿暂缓发布,方才规避潜在危机。

这正是困局所在:能力已强至令人不安,却缺乏硬性证据支撑及时干预。

04

AI威胁:是危言耸听,还是迫在眉睫?

面对如此严峻的前沿风险,全球科技界在治理思路上呈现明显分化。

本吉奥呼吁立即行动。他警示,在模型能力跃升前完成准备,必须成为行业共识。各国政府须清醒认识到,这不是某一国的单边挑战,而是AI滥用带来的全球性威胁,亟需协同防范。

相较之下,国内学者的回应更为审慎务实。

高新波认为,前沿AI风险确属基于严密逻辑推演的系统性威胁,但不必陷入末日焦虑,更不应贸然叫停研究。他将前沿AI比作“比核能更深远的潘多拉魔盒”——开启之前,必须在工程设计层面将“安全锁”锻造至极致。

姜育刚的立场更贴近现实土壤。他指出,呼吁暂停研发在现实中毫无可行性,无人会真正停下脚步。无论各方主张开源或闭源,两种模式均已并行存在。最可行的路径,是在新技术研发进程中同步推进风险防控。

熊辉则坚定支持开源路线。他认为,闭源大模型能力越强,潜在风险亦同步放大。问题核心不在“开”或“闭”,而在于重构安全架构:若能在内核层实现坚不可摧的安全控制,外围模块尽可放心开源,让更多人共享开源生态的生产力红利。

在落地层面,杰夫·吴与明德曼均提出切实可行的缓解策略。

杰夫·吴建议在预训练与后训练阶段加强数据过滤,从源头削减风险。明德曼补充指出,云服务商可在身份认证环节设置准入门槛,如同地铁安检需出示证件,确保仅可信主体方可访问模型权重。

05

结语

讨论尾声,技术派聚焦于“可控性”。

高新波期望,AI专家不仅能打造最聪慧的模型,更能交付一套可验证、可解释、可操控的安全防护体系;姜育刚强调,内生安全固然关键,但攻防对抗技术同样不可或缺,唯有更坚固的盾,才能托举技术持续前行;熊辉则寄望安全控制能力与模型开发能力同步跃升。

乐观派目光投向未来。

贾斯珀·戈汀相信,AI在生物学领域蕴藏巨大潜能,人类终将找到兼顾普惠收益与风险遏制的平衡之道。

制度派则将思考落于人与人之间的协作。

杰夫·吴与明德曼均指出,除科研攻关与风险缓释外,还需建立跨主体协调机制,在共识基础上推进AI开发进程,并辅以有效监督。

周伯文在演讲结尾留下一句判断:“安全价值即商业价值,二者并非对立,而是共生。”

本文来自微信公众号“腾讯科技”,作者:谢瑞瑞,编辑:徐青阳,36氪经授权发布。

热门AI工具

更多
切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

UP简历
UP简历 Hot

一款AI办公效率工具,主要用于基于AI技术的免费在线简历制作工具,适合需要提升相关任务效率的用户。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

0

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

0

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

0

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

0

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

0

2026.09.22

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

0

2026.09.22

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

0

2026.09.22

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

0

2026.09.22

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

20

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
文心快码产品文档
文心快码产品文档

共0课时 | 0人学习

Dify 官方文档
Dify 官方文档

共0课时 | 0人学习

GitHub Copilot手册
GitHub Copilot手册

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn