waic 2026 期间,我们联合多家媒体(其中机器之心是唯一的专业科技媒体)共同对专程来华的强化学习先驱、2024 年图灵奖得主 richard sutton 进行了一场集体采访。
在短短几十分钟的交流中,他谈及刚刚创立的新公司、其构想中“完整心智”的本质、对近八年 AI 发展路径的失望情绪,更抛出一个颇具冲击力的观点:在他看来,试图将 AI “对齐”至所谓“人类价值观”,本身便蕴含风险。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

以下为本次对话内容的整理稿。为提升可读性,我们对原始发言进行了逻辑归类与适度精简。
一家商业实体,支撑一项公益使命
Sutton 当前身兼双重角色:一边是新成立的营利性机构 Oak Lab,另一边则是他早年创办的非营利组织 Openmind Research Institute。当被问及为何在此时点启动新项目时,他解释称,Oak Lab 的定位并非替代,而是与 Openmind 形成互补关系。此前他在 John Carmack 创立的 Keen Technologies 工作三年,“那段经历令我非常满意”,但后来意识到,若由自己主导组建团队,将更能聚焦核心目标。
他强调,二者并非割裂,而是彼此滋养。“研究需要资源,而资源依赖于他人对其价值的认可。”他指出,“所有工作的底层逻辑大体一致,但压倒一切的使命,是弄清智能如何运作,并将这一理解公之于众。”按他的设想,部分成果可在短期内保留并商业化,用所得收益反哺更具长期性、开放性的基础探索——这些成果并无永久保密的必要,但阶段性变现,有助于持续推动更深层的研究。
20 瓦的执念:向生物大脑要能效
Sutton 表示,Oak Lab 的远景目标,是构建一个具备实时学习与规划能力、却仅需约 20 瓦功耗的万亿参数模型,并就此追问其背后的核心路径。
他坦言,并不存在某个“单一突破口”,但他确信当前主流的 LLM 及基础模型范式,在能耗与算力利用上存在巨大冗余。人脑是他反复援引的参照系:“它仅靠约 20 瓦功率,就支撑起我们全部的认知活动。”
矛头直指现代计算架构本身。他认为,数字计算天然复杂,“搬运数据”这一过程本质上效率低下:数据在内存与处理器之间反复迁移,大量能量即消耗于此。若转向大规模并行处理、让数据“原地运算”,整体能效理应显著提升。
何谓“完整心智”?
Sutton 多次强调,他真正倾心的是“完整心智”(complete mind),而非工具型系统。他特意将其与当下热门的“智能体”(agent)概念区隔开来:“我个人极度渴望构建一个‘完整的心智’,而非一个专用于模式识别、或执行某项具体任务的工具——后者终将被前者所调用。”
既然不存在放之四海而皆准的“终极系统”,那么多个“完整心智”之间又该构成何种关系?
Sutton 的回答是:去中心化,一如人类社会。个体拥有各自目标,并通过协作达成更大尺度的协调。他相信,AI 社群终将复现人类社会中那组经典张力——自下而上的自发秩序,与自上而下的集中调控——而如何在这两者间取得动态平衡,本身就是一场永无止境的博弈。“所以我的回答或许是:我尚无定论。”他坦率承认,但也正因我们早已习惯以此框架思考人类社会问题,它反而可能为 AI 演进提供宝贵镜鉴。
回望八年:一段“令人失望”的旅程
谈及过去八年 AI 的演进轨迹,Sutton 使用了“一定程度的失望”这一措辞。
在他叙述中,AlphaGo 与 AlphaZero 时代已确立“从经验中学习”的可行性,包括借助模拟经验进行训练;然而此后,行业重心再度回归对人类标注数据的依赖;而最近数年,恰恰是“依赖人类数据、而非自主经验学习”这一路径的强势反弹。
不过他也察觉风向或正悄然转变:“如今我们的议题中已出现‘能动性’(agency),我们开始关注智能体、关注计算机自主使用、关注 AI 探索数学边界。”
对于下一个八年,他的判断偏乐观,但这份乐观锚定于“经验”二字。他提到,已有数家专注“经验驱动学习”的初创公司在去年成立;而他本人的 Oak Lab 也正处于融资阶段,“进展顺利,虽未最终落定,但势头良好”。他判断,市场对“经验学习”、对“大模型之后的下一幕”的期待正加速升温。“我们已经见证过 LLM 与基础模型的高光时刻,现在,也有人开始认真发问:接下来会是什么?”
他最后以一句审慎的限定收尾:自己本质是一名科学家,而非商人;但他确实相信,我们正步入一个“经验的时代”。倘若再给他八年时间,这一方向“至少有望获得如今天 LLM 般的广泛认可”。
“机器人幼儿园”:让机器像孩童般试错
Sutton 参与的一个落地项目引发现场追问——位于北京的“机器人幼儿园(Robot Kindergarten)”。据他介绍,该项目旨在打造一个专为机器人设计的物理实验空间,并同步重构机器人本体——使其软硬件足够鲁棒,足以支撑真实世界中的持续试错学习。
他解释此举为何突破常规:“机器人本就不是为实验而生,它们的设计初衷是精准、无误地执行工程师指令。一旦允许其自由探索,往往迅速损毁。”常规演示通常“仅能维持到演示结束那一刻”。而他追求的,是能如视频中婴儿一般,连续数小时、数天、数周乃至数月持续实验的机器人——“一个孩子需要数年时间,才能掌握行走、抓握物体等最基础的能力。”他坚信,一旦机器人真正通过强化学习、从经验与失败中成长,整个机器人领域将迎来质变。
“学习本身即愉悦”
关于婴儿究竟在学什么,Sutton 给出了偏机制化的解读:婴儿在主动探索世界,并依据自身当前认知水平,决定下一步行动。“我们其实并不真正知晓婴儿在做什么,”他说,但他推测,婴儿是在不断重复尝试:能否再次发出那个声音?能否让这个物体以某种方式改变形态?
关键在于,婴儿具备自我评估能力:我还在进步吗?若玩耍一阵后发现收获停滞,便会主动转向新目标。Sutton 将此解读为一种多线程优化机制——它感知到某条路径已无进展(即感到“无聊”),随即切换至另一条,从而维持全局学习速率的最大化。
为此,他提出一句简洁口号:“学习本身让人愉悦(learning feels good)。” 你可以为“学习”定义一个可量化的度量,将其视为一种内在正向反馈,其作用机制与奖励信号高度相似。在他看来,这是一套极为精巧的设计。
两个关键词:“世界模型”与“强化学习”
WAIC 现场不乏团队在推进“显式世界模型”,也有研究者质疑:大规模强化学习是否必须依赖显式建模?Sutton 的回应,一半关乎技术实质,一半则源于他对术语使用的“洁癖”。
他明确表示,我们当然需要一个世界的模型:即一个“状态转移”模型。
但“世界模型”一词存在歧义:有人将其等同于对物理规律的高保真仿真,“我不认为这是必需的”;他所指的,更接近于广义的“知识”——其中既包含物理常识,也涵盖大量其他类型的知识。事实上,世界模型本就是标准智能体架构的四大核心组件之一,分歧仅在于术语尚未统一。
对“强化学习”一词,他也做了类似厘清。有人倾向将其窄化为纯试错行为,排除想象、推理与规划;而 Sutton 坚持认为,正是想象、推理与规划才真正依赖模型,而这在经典教材中本就属于强化学习范畴,其正式名称正是“转移模型”(transition model)。
随后他干脆直言不讳:“我反感 AI 领域动辄为既有概念造新词、将其包装成 buzzword 的风气。‘model’大概是意义最空泛的词——它几乎可指代任何事物,就像‘thing’一样。”他顺势调侃 LLM:“它们其实是 large language things。叫 large language networks 才更准确。”
给年轻一代的建议:回归第一性原理,每日手写一页
面对“一位20岁青年,其接触世界的主要方式是一个持续提供现成答案、且毫无后果的系统”这一提问,Sutton 的第一反应异常直接:“那就别卷入那个系统。”
他给年轻人的建议聚焦两点。其一是回归第一性原理:不因他人主张、或权威断言便轻易采信,而要坚持让结论经受“你可亲自度量”的验证。“科学中没有绝对权威,”他说,随即自嘲补了一句,“而我正以权威身份说出这句话。”你要亲手构筑一块真正理解的领域,那是你的“力量中心”,再由此向外延展。“最终,是你自己要为得出的结论负责。”
其二是他长期践行的习惯:准备一本笔记本,每天手写一页,记录想法、质疑它、打磨它。 他表示这对自身极有价值,但也坦承这是苦功夫:“需坚持一年以上,累积效应才会真正显现。”书写的意义在于“沉淀”那些闪光念头,助其生长、成形。“如果你希望他人重视你的观点,那你至少得先足够重视它——重视到愿意落笔成文。”
对于未来将被 AI 深刻重塑、却未必投身 AI 研究的年轻人,他将 AI 类比为过去几十年指数级跃升的算力:AI 将渗透所有领域,正如算力早已如此,“并无本质不同”;你真正需要做的,是在各自专业中学会驾驭更强的算力。
他特意区分了“智能”与“算力”:算力的影响已深远且将持续扩大;而“智能”将开启一个全新维度,只是其确切到来时间尚不确定。他将这一拐点的中位数估计设在 2040 年,“还有大约 14 年”,也可能提前至 2030 年,“大概率不会晚于 2040 年”。
“对齐,不过是人类的一场幻术”
群访最后一个问题落于 AI 安全:若 AI 开始调用自身经验进行决策,人类如何确保其始终契合我们的价值观?
Sutton 的回应成为全场最具争议的部分。他直接挑战“对齐人类价值观”这一前提:不同个体的价值观千差万别,根本不存在一个统一的“人类价值观”。 “这近乎一种幻觉……说到底,不过是人类的一种幻术。”他的意思是,人们往往回避阐明自身真实意图,只笼统宣称“这是好的”,借此寻求共识,最终由某类被赋予权力的主体裁定何为“好”。
由此,他推导出一个“有争议的真理”:许多人渴求一种能将机器人或 AI 对齐至特定价值观的技术;但倘若这种技术真的诞生,反而将是危险的。他将此平移至人类自身加以论证:如果我们真掌握了一种将人强行对齐至他人价值观的技术,谁有权使用它?又该对齐至何种价值观?“那将是一件邪恶之事。”
在他看来,当今世界最珍贵的特质之一,恰恰是“人类无法被彻底对齐”。“正因为我们缺乏强制统一所有人思想的能力,世界才得以维系和平。”若这种能力真的降临,反而是灾难的开端。
本文来自微信公众号 “机器之心”(ID:almosthuman2014),编辑:Panda ,36氪经授权发布。


















