引言:谁在讲,讲了什么
2019年,Richard S. Sutton 发表了一篇仅有两页纸的短文《The Bitter Lesson》(苦涩的教训)。这篇短文在AI社区引发了巨大反响,成为被反复引用的"微型经典"。Sutton 是强化学习领域的奠基人之一,他的 TD-learning 算法、策略梯度方法、以及与 Barto 合著的经典教材《Reinforcement Learning: An Introduction》深刻塑造了整个领域。
在 WAIC 2026 的这场演讲中,Sutton 亲自回顾了《苦涩的教训》的核心论点,并将其延伸到一个当下最紧迫的问题:这条历史规律是否同样适用于大语言模型和基础模型?
本章小结
本节介绍了 Sutton 的学术地位和《苦涩的教训》的背景,明确了本场演讲的核心问题——将历史规律投射到当下的基础模型之上。带着这个问题,我们进入 Sutton 对苦涩教训原文的逐段解读。
苦涩的教训:历史模式与原文解读
历史观察:研究者反复犯的同一个错
Sutton 首先回顾了《苦涩的教训》的发表历程:最初于 2018 年以演讲形式呈现,"让在场的不少科学家感到不快"(severely upset some of the scientists present),随后在 2019 年正式发表并在 Twitter 上广泛传播,成为AI圈的一种"微型传奇"(mini legend)。
文章的核心论点基于一个反复出现的历史模式,可以提炼为四步循环:
Sutton 特别强调:这就是为什么这个教训是"苦涩"的——因为研究者自己偏爱的方法虽然一度有效,但最终被其他方法所取代(supersed)。研究者投入了大量心血的领域知识和精巧设计,在算力扩展的浪潮面前不堪一击。
为什么是"搜索"与"学习"
Sutton 在原文里给出了一个底层原因:摩尔定律(及其推广------算力单位成本持续指数下降)。大多数 AI 研究是在"算力恒定"的隐含假设下做的,在这种假设下,塞入人类知识几乎是改进性能的唯一手段。但只要把时间尺度稍微拉长,可用的算力就会爆炸式增长。而能持续吃下这股算力红利的方法,只有两类:
- 搜索(Search)------通过大规模搜索可能的解/路径/动作来利用算力;
- 学习(Learning)------通过在大量数据上的统计学习来利用算力。
这两类方法的共同点是:它们不预设领域的具体结构,而是让算力自己去发现结构。相比之下,人类知识驱动的方法往往把方法"焊死"在某个领域的特定结构上,反而更难去利用后续到来的通用算力。
四个历史案例
Sutton 在演讲中列举了四个关键的历史案例来支撑这一论点:
enumerate
enumerate
二十六字的浓缩版
在演讲中,Sutton 提到他在 X(Twitter)上用一条推文将《苦涩的教训》浓缩为26个词:
这段话值得逐句拆解:
- "Don't be distracted by human knowledge" — 不要被人类知识分心。Sutton 用的词是"distracted",暗示人类知识看似有用,实际上是一种注意力陷阱——它让你偏离了真正能带来长期突破的方向。
- "methods that will scale with computation" — 选择能随算力扩展的方法。关键词是"scale":当算力增长 10 倍、100 倍时,方法本身应该自动变强,而不需要人为重新设计。
- "methods that create knowledge" vs "take advantage of existing human knowledge" — 这是全段最深刻的对比:好的方法创造新知识,坏的方法利用已有的人类知识。前者是开放式探索,后者是封闭式编码。
这条推文把苦涩教训从"否定句"翻成了"肯定句":
- 否定:不要把人类知识当作基础模型的根基;
- 肯定:要去建模"知识是如何被创造出来的"这个过程本身;
- 手段:用搜索与学习——因为这两个过程本身就是"算力发现结构"的通用机制。
本章小结
Sutton 的核心论点可以压缩为一句话:在AI研究中,利用人类知识的做法短期有效但长期被取代,而基于算力扩展的搜索与学习才是真正带来突破的路线。这一模式在象棋、围棋、语音、视觉中反复上演。接下来,Sutton 将这条历史规律直接投射到当下最热的基础模型之上。
基础模型:苦涩的教训适用吗?
Sutton 的判断:既是也不是
这是本场演讲最关键的问题,也是 Sutton 最直接地回应时代关切的部分。他的回答是:既适用,也不适用(briefly yes and no)。
适用的部分(YES):大语言模型确实找到了一种大幅扩展算力的方式。它们利用了当今可用的大规模计算资源和互联网上的海量数据集。可以说,将大语言模型带到今天这一步,本身就体现了对"苦涩的教训"的认知——找到了一种可扩展的方法。
不适用的部分(NO):同样明显的是,大语言模型和基础模型明确地、完全地建立在人类知识之上。它们的"超能力"(superpower)就是人类知识、人类数据。而这恰恰是苦涩的教训所警告的——不要依赖人类知识。
Sutton 的预判:被取代是大概率事件
Sutton 在演讲中给出了明确的立场:
这是一个相当大胆的判断。要知道,发表这番话的场合是 WAIC 2026——在大语言模型和基础模型如日中天的时代。Sutton 的逻辑链条如下:
enumerate
enumerate
本章小结
Sutton 的回答是"既是也不是":大语言模型在算力扩展方面符合苦涩教训的精神,但其核心依赖人类知识这一事实,使其很可能在长期被取代。这一判断将我们引向一个更根本的问题:基础模型到底是什么?只有回答了这个本体论问题,才能判断它们的终局。
大世界视角:为什么全知是不可能的
基础模型到底是什么?
为了回答基础模型在极限情况下的命运,Sutton 认为我们必须先回答一个更根本的问题:基础模型到底是什么?
他指出,"基础模型"(foundation model)已经变成了一个被滥用的流行语(buzzword)——人们在使用这个词时,往往并不清楚自己到底在指什么。而要判断基础模型的未来,必须先搞清楚它的本质。Sutton 给出了他自己的定义:
注意这个定义中的关键限定词:"已确立的、达成共识的"(agreed, established)。Sutton 随即指出,如果基础模型的目标是包含所有知识——包括未知的、不确定的、尚未发现的知识——那是不可能的。但如果是包含已确立的、达成共识的人类知识,那是可能的。
大世界视角:世界远大于任何心智
接下来,Sutton 展开了本场演讲中最具哲学深度的部分——大世界视角(Big World Perspective)。
Sutton 首先纠正了一个直觉性的错误图景:人们可能以为世界和心智是"大致可比的"(roughly comparable),就像一个画面中同时画着世界和一个代表心智的小人,两者尺寸相仿。但正确的图景应该是:世界比任何心智都大得多、复杂得多。
为什么?因为心智只是一个心智,而世界包含了许多其他心智。世界不仅由物理环境构成,更由无数其他有自己独特知识和体验的智能体构成。
一个直觉化的例子:你无法完全了解另一个人
Sutton 用一个非常贴近生活的例子来让这个抽象观点落地:
这个例子的精妙之处在于:它把一个看似抽象的哲学命题变成了每个人都能感同身受的日常经验。你永远无法完全"读取"另一个人的内心——这不是技术限制,而是本体论事实。
推论:广度必然意味着浅度
从"世界远大于任何心智"这一前提出发,Sutton 推导出一个关键推论:
换句话说,通用性和深度是此消彼长的。一个试图覆盖一切知识的系统,注定只能停留在表面;而一个在某个领域拥有深度知识的系统,注定无法覆盖一切。这不是工程问题,而是信息论和认识论层面的根本限制。
本章小结
大世界视角揭示了一个根本性的事实:世界比任何心智都大得多、复杂得多,因此没有任何心智能包含对世界的完整知识。基础模型可以追求成为"已确立人类知识的容器",但不能追求"全知"。通用性必须以浅薄性为代价。这一认识将我们引向 Sutton 对基础模型未来角色的定位。
美丽的真理:谦逊的力量
为什么叫"美丽的真理"?
Sutton 将大世界视角称为一个美丽的真理(beautiful truth)。这乍听矛盾——"你不可能全知"怎么可能是"美丽的"?Sutton 从两个角度阐释了它的美:
enumerate
enumerate
这是一个深刻的观点:大世界视角的限制不是人类专属的弱点,而是任何有限心智的本质属性。无论你有多少参数、多少算力,只要你是一个有限的心智,你就无法包含无限复杂的世界。超级心智也会有自己擅长和不擅长的领域。
对错误野心的纠正
然而,"美丽的真理"对于"错误的野心"(false ambition)来说是个问题。什么错误的野心?就是基础模型试图成为全知的野心——试图涵盖所有知识、回答所有问题的野心。
本章小结
大世界视角是一个"美丽的真理":它让我们谦逊,也解除了超级心智压迫的恐惧。但同时也要求我们放弃基础模型全知的错误野心,转而接受一个更现实、更有意义的定位。这就引出了 Sutton 对AI未来格局的构想。
AI的未来格局:三类心智
不是一种AI,而是多种
Sutton 认为,未来不会只有一种AI,而是会有多种不同类型的AI共存。他将这些AI分为三类,形成一个从"完整心智"到"专用工具"的光谱,基础模型位于中间。
第一类:完整心智——像人一样的AI
Sutton 首先描述了他认为最具野心的AI类型:
注意几个要点:
- "这些不会是基础模型" — Sutton 明确将完整心智和基础模型区分为不同的东西。基础模型不是通往完整心智的路径,而是另一种类型的AI。
- "它们也不会是超级的" — 完整心智不会全知。它们像人一样,有自己的专业领域和局限。
- "持续学习" — 完整心智的关键特征是终身学习(continual learning),在生命周期中不断适应。这与当前大语言模型"训练一次、固化使用"的模式根本不同。
第二类:专用工具——服务人类的简单AI
光谱的另一端是专用工具型AI:
- 例如自动驾驶汽车:做特定的事来辅助人类。
- 它们不一定复杂。
- 它们有指定的范围(designated scope)——在明确的边界内工作。
这类AI不需要通用性,只需要在指定领域内可靠地工作。
第三类:基础模型——准确的知识存储
位于光谱中间的,是基础模型。Sutton 对基础模型的重新定位如下:
Sutton 对当前基础模型的批评非常精准:
enumerate
enumerate
超级百科全书:基础模型的理想形态
Sutton 用一个生动的比喻来描述基础模型的理想形态:超级百科全书(super encyclopedias)。
这个定位的核心转变是:从"试图回答一切问题"到"准确呈现已确立的知识"。前者是一个不可能的目标(因为大世界视角告诉我们全知是不可能的),后者是一个可实现的、有价值的目标。
本章小结
Sutton 构想了AI未来的三类格局:完整心智(像人一样终身学习)、专用工具(指定范围内服务人类)、基础模型(准确的知识存储/超级百科全书)。基础模型不是通往完整心智的路径,而是一种独立的、有价值的AI类型——前提是放弃全知幻想,接受"准确存储已确立知识"的定位。
总结与延伸
Sutton 的结语
Sutton 以简洁有力的话语结束了演讲:
核心论点回顾
回顾整场演讲,Sutton 的论证可以提炼为以下逻辑链:
深度综合:三个层面的启示
认识论层面:知识的两种范式
Sutton 暗中区分了两种根本不同的知识范式:
enumerate
enumerate
苦涩的教训本质上是说:知识编码范式短期有效但长期被知识创造范式取代。Sutton 对大语言模型的判断正是基于这一区分——大语言模型是知识编码范式的巅峰代表,因此长期可能被取代。
技术层面:持续学习 vs 固化训练
Sutton 提到完整心智会"在其生命周期中持续学习"(continue to learn during their lives)。这一点触及了当前大语言模型的一个根本局限:
- 当前大语言模型是训练一次、固化使用的模式——训练完成后,模型参数不再变化,所有"知识"都被压缩在固定的权重中。
- 完整心智需要持续学习(continual learning)——在与世界交互的过程中不断更新自己的知识和策略。
- 这在技术上是一个巨大的挑战:当前模型在训练后的"持续学习"容易导致灾难性遗忘(catastrophic forgetting)——学习新知识的同时丢失旧知识。
Sutton 作为强化学习的奠基人,他心目中的"完整心智"几乎必然是一个强化学习智能体——通过与环境的持续交互来学习和适应。这与当前以"预训练+微调"为核心范式的大语言模型形成了鲜明对比。
战略层面:研究者应该怎么做?
对于AI研究者,Sutton 的演讲传递了一个清晰的战略信号:
延伸思考与开放问题
enumerate
enumerate
拓展阅读
- Sutton 原文:Richard S. Sutton, "The Bitter Lesson", 2019. incompleteideas.net/IncIdeas/BitterLesson.html
- Sutton 26词推文:X/Twitter, 2026, 总结苦涩教训的核心要义。
- Rich Sutton 个人主页:incompleteideas.net — 包含其全部论文和研究哲学阐述。
- 强化学习经典教材:Sutton & Barto, Reinforcement Learning: An Introduction (2nd ed., MIT Press, 2018) — 理解 Sutton 思想体系的必读。
- 视频:本讲对应的 Bilibili 视频 https://www.bilibili.com/video/BV1VHKA67Eit
公开来源:https://www.bilibili.com/video/BV1VHKA67Eit
页面整理:cnfjlhj & Codex。频道与讲者信息仅作为来源元数据。