Richard Sutton的“经验时代”:AI下一程的范式转向

2024年图灵奖得主、强化学习之父Richard Sutton,在2026世界人工智能大会(WAIC)上海主会场再次抛出一个让AI行业不得不正视的判断:我们正处在从“人类数据时代”迈向“经验时代”的拐点,而以大语言模型为核心的范式,并非通往超级智能的正确路径。

从“苦涩的教训”到“经验时代”

理解Sutton此刻的立场,必须回到他2019年的名篇《苦涩的教训》(The Bitter Lesson)。在这篇被AI领域广泛引用的文章中,Sutton提出了一个有力的论点:AI发展的每个关键节点上,依赖人类先验知识的方法最终都会被纯粹利用更大规模计算和数据的方法超越。

这篇文章影响力极大,被大模型狂潮反复援引为Scaling Law的理论基础。但Sutton本人并不买账。在与Dwarkesh Patel的深度访谈中,他预言“未来会出现能从经验中学习的系统,它们性能会强大得多,扩展性也强得多”。依赖人类知识的系统终将被纯粹依靠经验与计算训练的系统取代——这将成为苦涩教训的又一个经典案例。

2025年,Sutton与AlphaGo研究者David Silver联合发表《Welcome to the Era of Experience》,正式将这一思想系统化。文章指出:在数学、编程和科学等关键领域,“从人类数据中提取的知识正在快速逼近极限”。AI需要新数据源——由智能体在与环境交互中持续生成,随能力提升自动增长。

LLM为什么是“错误的起点”

Sutton对LLM的批评基于对智能本质的深层理解,集中于三方面。

缺乏目标。拥有目标是智能的本质,但LLM没有——预测token不会改变世界,无法构成奖励信号。强化学习中目标通过奖励体现:下棋的奖励是赢,松鼠的奖励是找到坚果。没有目标就没有对错。

没有基础真相。LLM“没法预测接下来真实会发生什么”。它们预测的是某人会说什么,而非世界会发生什么。“它们不会对结果感到惊讶”——即使预测与现实不符也不会调整。这不是真正的预测,而是对人类语言模式的复制。

无法持续学习。LLM一旦训练完成就不再学习了。在RL China 2025与汪军教授的对话中,Sutton说:“机器学习确实被用于创建它们,但一旦模型被训练完成,它们就不再学习了。”真正的智能应该像所有动物一样,通过感知-行动-奖励的循环持续学习。

经验范式的技术蓝图

Sutton提出的“经验范式”有着清晰结构。经验流由三组时间序列构成:感知、行动和奖励。智能体不断循环——感知、行动、反馈、调整。

“学习源于这个信息流,学习也是关于这个信息流的,”Sutton解释道。“你的知识是关于’如果你采取某个行动会发生什么’。正因为它是对经验流的陈述,你便可以通过与后续经验流比对来检验它,从而实现持续学习。”

他还阐述了智能体的四个基本组件:策略、价值函数、奖励函数和世界模型。其中世界模型被认为是通向“圣杯”的关键:“我们既希望直接从经验中学习,也希望间接从经验中学习,让经验形成世界模型,利用它来规划行为改进。这种规划就类似于推理。”

RL与LLM的融合正在发生

尽管Sutton批评LLM,现实中的技术演进并非完全割裂。

2026年7月,Moonshot AI发布2.8万亿参数的Kimi K3,在训练中引入强化学习优化代码任务,DeepSWE测试中取得67.3分。这展示了RL遇上大参数模型的潜力——也是Sutton所说的“RL可以作为LLM的一部分”的现实映射。

具身智能领域,WAIC 2026同期发布的两大世界模型从另一个维度印证了Sutton的判断。

大晓机器人的Kairos 3.1构建了“理解-推演-执行-反思”的自进化闭环,首提具身世界模型第一性原理:“世界模型核心价值在于从多模态输入中提炼关键信息,最小化行动代价。”这与Sutton的论述高度一致。

昆仑万维旗下黎曼动力的Riemann-1.0,基于23.2万小时数据训练,采用全因果动作-视频联合建模——正是Sutton所说的“将策略学习与世界动态建模统一到连续状态转移”。LIBERO评测中取得99.0%任务成功率。

Scaling范式的天花板

Sutton直接挑战了当前最主流的信仰:只要增大模型规模和数据,智能就会涌现。“我们开始达到人类数据的极限,”他在2025年北京智源大会上警告。

近期多家机构已观察到规模壁垒现象。杨立昆也得出类似结论——家猫的三维导航和因果理解能力,在某种意义上比所有LLM加起来都强大。

Sutton提出的替代路径:让智能体在真实或高保真模拟环境中持续运行,用环境回馈作为奖励信号,发展可复用的世界模型。AlphaGo第37手和AlphaProof的奥赛银牌,都证明了从自我经验中学习可产生超越人类的策略。

对年轻人的忠告

访谈最后,Sutton给了一个出人意料的建议:“每天写下一页你自己的想法,坚持一年。”

在AI热潮中,研究者很容易被潮流带偏。Sutton说:“领域内容易刮起潮流,让人忽略最根本的问题。在我看来,强化学习才是人工智能的根本。”

每天写一页思考,本质上是在训练AI完全缺乏的能力——独立思考。这与经验的理念一脉相承:真正的知识不是复制来的,而是通过行动、观察和反思构建的。

关注AI前沿的读者可以在通肯智能(TOKEN 导航)持续跟踪这一领域的发展。从Sutton的理论框架到Kairos 3.1和Riemann-1.0的工程实践,一条清晰的脉络正在浮现:AI正在从“模仿人类”走向“自主经验”。

宇宙的第四阶段

Sutton还提出了一个宏大的宇宙叙事:从尘埃到恒星,从行星到生命,现在生命正在孕育被设计的智能。“我们是复制者,正在进入设计的时代,”他说,“未来我们设计AI,AI再设计下一代AI。”复制者依赖已有模板,正如LLM依赖人类数据;设计者通过与世界的交互创造全新之物。Sutton对此乐观而自豪:“我们应该为促成宇宙中这次伟大的转折而感到自豪。”

从2019年的《苦涩的教训》到2025年与Silver合著的《Welcome to the Era of Experience》,再到WAIC上对LLM范式的挑战,Sutton用数十年验证了一条思想线索。他提出的问题——AI到底应该如何学习?智能的本质究竟是什么?——值得每一位从业者认真思考。对这些根本问题的持续追踪,正是通肯智能(TOKEN 导航)这类深度分析平台的核心价值所在。

FAQ

Q1: Sutton所说的“经验时代”具体指什么?

“经验时代”(The Era of Experience)是Sutton与David Silver在2025年联合提出的概念。核心是AI从依赖静态人类数据,转向通过与环境实时交互生成数据。智能体通过感知-行动-奖励循环学习,数据随能力提升自动增长,不再受限于人类知识边界。

Q2: Sutton为什么说LLM是“死胡同”?

三个核心原因:一是缺乏真正的目标——预测token不构成奖励信号;二是没有基础真相——无法通过与现实比对来验证预测;三是训练后不再学习。LLM更多是在模仿有世界模型的人类,而非自己构建世界模型。

Q3: “苦涩的教训”与“经验时代”有什么关系?

《苦涩的教训》(2019年)论点是可扩展的计算方法最终超越依赖人类先验知识的方法。Sutton认为LLM恰恰是反面案例:严重依赖互联网文本这种人类知识,扩展性存在上限。“经验时代”正是苦涩教训的下一步——纯粹从经验与计算中学习的系统,将取代依赖人类知识的系统。

Q4: 当前有哪些实践体现了“经验时代”方向?

多条技术路线在汇聚:Kimi K3在代码任务中引入强化学习;Kairos 3.1构建了自进化世界模型闭环;Riemann-1.0通过全因果动作-视频联合建模实现策略学习与世界动态建模的统一。共同特征是让AI通过与环境交互生成数据,而非仅从静态数据集中学习。

Q5: Sutton对年轻人有什么建议?

“每天写下一页你自己的想法,坚持一年。”这不仅是培养独立思考能力的方法,也与他关于经验的核心理念相呼应:真正的知识不是从别人那里复制来的,而是通过自己的行动、观察和反思逐步构建的。在AI热潮中,保持独立思考比追随技术潮流更为重要。