讲师中心 微信公众号
AI工具推荐 视频效率加速

69岁强化学习之父Richard Sutton创业:造20瓦人脑级智能体

老枫同学_5897

老枫同学_5897

发布时间:2026-07-15 10:48:57

|

731人浏览过

|

来源于php中文网

原创

69岁正是“创”的年纪!

强化学习奠基人、2024年图灵奖得主Richard Sutton宣布,自己已与学生Khurram Javed共同离开John Carmack创办的Keen Technologies,正式创立全新AI研究机构——Oak Lab

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

69岁强化学习之父Richard Sutton创业:造20瓦人脑级智能体

Richard Sutton被公认为现代强化学习体系的奠基者:

本科就读于斯坦福大学心理学系,博士阶段师从强化学习先驱Andrew Barto,早期科研足迹遍及GTE Labs与AT&T Labs;

他首创时序差分(Temporal Difference)学习算法,与Barto合著的经典教材《Reinforcement Learning: An Introduction》(《强化学习导论》)至今仍是全球高校与工业界的标准参考;

自2003年起,他长期执教于加拿大阿尔伯塔大学,创建并领导该校强化学习与人工智能实验室(RLAI);

2017至2023年间,担任DeepMind杰出研究科学家,并主导组建DeepMind位于埃德蒙顿的研究中心。

四十余载耕耘,Sutton培养出大批影响深远的AI领军者:

包括AlphaGo核心架构师David Silver、DeepMind蒙特利尔实验室负责人Doina Precup、博弈智能专家Michael Bowling,以及此次携手创业的青年学者Khurram Javed

69岁强化学习之父Richard Sutton创业:造20瓦人脑级智能体

据其公开推文透露,Sutton此次创业的动因极为清晰:

他认为当前主流深度学习范式存在根本性局限——效率低下、泛化脆弱、难以支撑真正意义上的通用智能演进。
这不是局部优化的问题,而是底层思想亟待更迭:必须抛弃渐进式修补,转向基础理论与系统架构的彻底重构。

换言之,Sutton判断:现有技术路径已逼近AGI天花板,无法自然延伸至更高阶的认知能力。

而Oak Lab锚定的终极愿景是:

构建一个参数规模达万亿级、支持运行时实时学习与动态规划、整机功耗严格控制在20瓦以内的自主智能体。

20瓦,正对应人类大脑平均能耗水平。

当整个行业仍在竞相扩建数据中心、堆叠GPU集群之时,这位强化学习的开创者正试图重写“智能”的物理与认知边界。

与卡神分道,但未失敬意

要理解Sutton为何离开,需回溯他出发的地方。

Keen Technologies由传奇游戏编程大师、Oculus前CTO、被誉为“卡神”的John Carmack于2022年创立,聚焦强化学习驱动的AGI探索。

69岁强化学习之父Richard Sutton创业:造20瓦人脑级智能体

2023年9月,Sutton加入Keen——彼时正值DeepMind关闭其在加拿大埃德蒙顿设立的联合实验室,双方合作被视为理论与工程的“黄金组合”:
一边是操作系统与实时系统领域的传奇工程师,一边是强化学习数学框架的奠基人,共同目标直指2030年前实现具备初步AGI特征的原型系统。

然而不到三年,Sutton选择独立前行。

他在X平台发布的声明中,首句即致敬Carmack:

“关于John Carmack和Keen Technologies,我怎么夸都不为过。”

潜台词明确:离开并非否定对方,而是对“抵达终点的方式”产生了不可调和的理念分歧。

在Sutton看来,当下深度学习的发展逻辑已陷入路径依赖——模型迭代不再指向能力跃迁,而沦为超参数微调与数据管道的重复劳动。整个领域亟需一场范式级的重启。

Oak Lab的核心命题

Sutton此次创业所押注的核心理念,可凝练为一句话:

真正的智能,诞生于运行过程中持续生成的经验流。

当前大语言模型的工作范式,本质是“离线锻造+上线复用”:耗费数月、动用千卡集群,在海量静态文本上完成预训练;一旦部署,模型权重基本冻结,仅能通过有限上下文做浅层响应。

即便每日接收亿万条用户交互,绝大多数信息都无法转化为模型内在能力的实质性更新——它无法像生物体那样,在感知—行动—反馈的闭环中实时重塑自身认知结构。

Oak Lab所构想的智能体则截然不同:

它将始终处于“在线状态”:感知环境、执行动作、接收反馈、即时修正策略;
每一次真实世界的交互,都同步触发一次学习更新;
学习不再是周期性批量任务,而是与生存行为无缝耦合的连续过程。

正如Sutton所强调:

AI运行的每一毫秒,都应是它成长的时刻。

69岁强化学习之父Richard Sutton创业:造20瓦人脑级智能体

目前,Oak Lab已明确以OaK架构为技术主线推进研发。

OaK即Options and Knowledge(选项与知识),代表一种面向经验自主涌现的认知操作系统。

该架构旨在让智能体从原始交互中自动提炼具有时间延展性的高层抽象结构,并将其固化为可验证、可调度、可组合的“技能单元”。

举例而言:机器人首次前往厨房取水,全程涉及空间识别、路径规划、物体抓取、阀门操作等多重子任务;
传统方法将其视作单一长序列决策问题;
而OaK架构会引导智能体在实操中自主归纳出“导航至厨房”“握持容器”“开启水源”等模块化技能;
未来面对相似目标时,系统可直接调用已有技能库,并依据实时环境变量进行动态编排与微调。

这种沿时间轴压缩经验、升维抽象的能力,即“时间抽象”,正是人类将零散动作沉淀为熟练技能的关键机制,也是OaK赋予AI的底层认知杠杆。

69岁强化学习之父Richard Sutton创业:造20瓦人脑级智能体

此外,OaK架构还设定了一个与当前深度学习显著背离的设计原则:

不存储历史经验,不回放旧数据。

主流深度强化学习依赖经验回放缓冲区(replay buffer),反复采样过往交互样本进行批量训练;
Oak Lab则主张采用batch size = 1的纯在线学习模式——每获得一条新经验,即刻完成单步参数更新。
团队相信,若将此类算法与事件驱动型神经网络结合,有望将计算开销与能耗压降至现有方案的百分之一甚至更低,从而真正释放实时、持续学习的工程可行性。

由此催生那个极具挑战性的远期目标:万亿参数、实时学习、实时规划、20瓦功耗。

当然,这仍属蓝图阶段。

支撑这一构想的,还有Sutton与Javed近期提出的大世界假说(The Large World Hypothesis)

其核心主张是——现实世界的复杂度永远超越任何模型的表征上限。无论AI如何进化,外部环境的变化速率与信息熵增长速度只会更快。
因此,依赖离线数据集训练的模型注定滞后;唯有具备选择性记忆、主动遗忘、持续在线适应能力的系统,才可能与真实世界共演化。

从《苦涩的教训》到创业实践

熟悉Sutton思想脉络的人,对上述路径并不意外。

2019年,他写下AI圈影响深远的短文《苦涩的教训》(The Bitter Lesson),系统梳理了国际象棋、围棋、语音识别与计算机视觉的发展史,最终得出关键结论:

那些能随算力指数扩展的通用学习与搜索机制,终将碾压一切嵌入人类先验知识的定制化方案。

69岁强化学习之父Richard Sutton创业:造20瓦人脑级智能体

大模型时代的爆发,似乎印证了这一判断:更大规模、更强算力、更广数据,的确推动能力边界不断外推。

但Sutton并未因此认可现状。

在他看来,当前系统仍深陷“人类知识代理”的窠臼——所有训练数据均由人类生产、标注、筛选、清洗、组织;模型所学,不过是人类文明已有表达的统计压缩。

真正的智能体,必须拥有“第一人称经验”的生成能力:通过自主行动探索未知、遭遇失败、建立因果、追求长期目标,并在此过程中创造属于自己的新知识。

这也正是他从“苦涩的教训”迈向“经验时代”的思想跃迁。

2025年,他与AlphaGo核心开发者David Silver共同提出:AI演进将进入以持续经验生成为标志的新阶段,数据来源正从“人类供给”转向“智能体自产”。

Oak Lab,正是这一学术主张走向产业落地的第一块试验田。

四十年前,Sutton在博士论文中写下“temporal credit assignment in reinforcement learning(强化学习中的时序信用分配)”时,强化学习尚属边缘冷门;
四十年后,当全球资本与算力奔涌向大模型商业化浪潮,他依然执着叩问同一个本源问题——
智能,究竟如何从无到有?

One More Thing

老爷子创业后的首个公开亮相,选在上海WAIC世界人工智能大会

在WAIC思想者论坛上,Sutton将发表题为《强化学习的第一性:从经验培育超级智能》的主题演讲。

69岁强化学习之父Richard Sutton创业:造20瓦人脑级智能体

参考链接:https://www.php.cn/link/a6dc4fa9360888fd04a80b9754f41924

本文来自微信公众号“量子位”,作者:关注前沿科技,36氪经授权发布。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

Laper
Laper Hot

Laper是专为编剧、导演和制片人推出的 AI 原生剧本创作工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

相关专题

更多
Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

0

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

0

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

0

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

0

2026.09.22

Conan二进制包配置指南
Conan二进制包配置指南

本专题介绍Conan根据操作系统、编译器、架构和构建类型生成二进制包的方法,讲解Profile、Settings、Options及Package ID的作用,帮助管理不同平台和编译环境下的包版本。

0

2026.09.22

Conan私有仓库搭建教程
Conan私有仓库搭建教程

本专题系统的讲解Conan私有仓库的搭建流程,涵盖仓库服务部署、存储目录配置、用户认证、权限划分和远程地址添加,并介绍内部C++依赖包的上传、下载及版本维护方法。

0

2026.09.22

loomy官网入口地址合集
loomy官网入口地址合集

本专题汇总了 Loomy 桌面 AI 助理的官方入口地址合集及使用指南。提供 macOS 与 Windows 客户端下载 。Loomy 是讯飞推出的桌面级 AI 工作搭子,支持文件整理、数据分析、网页操作及通过飞书/钉钉远程操控电脑,助你高效完成本地办公任务 。

0

2026.09.22

NumPy常见函数使用方法
NumPy常见函数使用方法

本专题整理 NumPy 常见函数使用方法相关教程,覆盖函数大全、参数用法、数组运算、统计聚合、排序处理、where 条件筛选、linspace 创建数列等常用场景,帮助读者快速掌握 NumPy 函数调用思路和实际数据处理技巧。

0

2026.09.22

NumPy性能优化版本更新与常见报错排查
NumPy性能优化版本更新与常见报错排查

本专题整理 NumPy 性能优化、版本更新与常见报错排查相关教程,覆盖向量化计算、广播性能、内存布局、NumPy 2.0 升级、版本兼容冲突、安装导入报错、dtype 溢出、矩阵运算异常和 broadcasting 报错修复,帮助读者系统掌握 NumPy 性能调优与问题定位方法。

20

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
阶跃Al官方手册
阶跃Al官方手册

共0课时 | 0人学习

通义灵码手册
通义灵码手册

共0课时 | 0人学习

Minimax手册
Minimax手册

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn