硅谷知名科技播客主持 Dwarkesh Patel 近日抛出一个疑问:下一代 AI 的训练范式会是什么样?

年仅 25 岁的 Dwarkesh Patel 是硅谷迅速窜红的科技播客主持与写作者,凭借 Dwarkesh Podcast 已跻身 AI 讨论的核心圈。他的访谈对象涵盖 Ilya Sutskever、Andrej Karpathy、Dario Amodei、Demis Hassabis、Mark Zuckerberg 等 AI 与科技翘楚。TIME 杂志将他列入 2024 年 TIM100 AI 榜单,称其播客已成为众多 AI 从业者必追的节目。

在最新一期节目中,他将前沿 AI 实验室押注的路线提炼为一个关键词:RLVR,即可验证奖励的强化学习。
简言之,就是让模型在大量可自动判定对错的任务中不断试错,以培育规划、纠错、迭代和长期执行的能力。现今编程、数学等领域的突飞猛进,很大程度上源于这种思路。
但 Dwarkesh 真正追问的是:如果下一代 AI 仅靠这类“可验证任务训练”,是否足够?
他的回答是:可能不足。
因为任务不仅要“可验证”,还必须“可操练”。
这里的关键概念是grindability,即可磨性。在 AI 训练语境中,这指“可反复刷题性”或“可大规模铺展的能力”。
编程任务就是典型的可操练任务。你可以预备一个软件库、一个待修复的漏洞、一组测试用例,然后将同一环境复制数千份,让数千个智能体同时尝试。谁通过测试,谁就得分。这个过程可并行、可重现、可重置,极其适合 RLVR。
数学问题也类似。答案是否正确可验证,训练环境也容易复制。
但 Dwarkesh 提了一个耐人寻味的问题:为什么 AI 在“使用电脑”这件事上,进展反而慢于编程和数学?
表面看,电脑使用也能验证。比如是否成功下单、场地是否订妥、税表是否提交,这些结果都可判别。但难题在于,它很难被大规模复制和回放。你无法让一千个智能体同时在亚马逊上重复跑同一个结账流程,因为真实网站会识別机器人、封锁账户、变动状态。当然可以克隆 Slack、Gmail、亚马逊这类应用来做模拟器,但这在当前仍是高成本、低扩展性的工程。
Dwarkesh 指出:AI 在某个领域进步迅速,不仅因为答案可验证,更因为该领域能被包装成可复制、可回放、可并行试错的训练环境。
这也说明了为何编程、数学、游戏类任务成为 RLVR 的天然沃土,而许多现实世界任务却难以直接融入这套训练范式。
- 若想训练一个 AI 从零开始创业,怎么办?
- 若想训练它赢取一场官司,怎么办?
- 若想训练它在市场中稳定盈利,或助力一位候选人胜选,怎么办?
这些任务当然也有结局。企业是否做起来,官司是否打赢,交易是否盈利,选举是否胜出,最终都能评判。
但它们的问题在于:反馈太迟缓,变量太庞杂,世界无法重置,也无法在数据中心里复制上千遍。
一次创业可能持续数年。一场政治竞选依赖具体区域、候选人、选民情绪、媒体氛围和偶发事件。一件法律案件也无法从同一起点复制成千个平行宇宙,让不同智能体各自试错。
这类环境在强化学习里接近于所谓 reset-free、non-stationary environment:无法随意重置,且环境本身还在持续变化。
Dwarkesh 因此提问:在可验证、可操练环境里练就的 RLVR 智能体,真能泛化到这些现实任务吗?
这不是一个靠口号能回应的问题,而是一个实证问题。
乐观者会说,只要 RLVR 环境足够多样、足够复杂,模型最终会学到通用的智能体能力。它在编程、数学、网页、工具使用中锤炼出的规划和试错能力,最终会迁移到创业、组织管理、政治、法律、科学研究等领域。
但 Dwarkesh 对此存疑。
因为现实世界里最有价值的知识,往往不以清晰、可验证、可重复的形式出现。它们可能源自一次含糊的客户回馈,一次挫败的会议,一个组织内部的隐性流程,一种只有在真实任务中才会暴露的失败模式。模型要学会这些,不能仅靠“刷题”,还必须具备真正的样本效率。
这就将讨论引向全文最关键的一点:learning back to the weights,把学习重新压入权重。
今天的大模型已极擅长 in-context learning。它可以在一个长上下文中阅读大量资料,理解一个项目脉络,临时适应用户或组织的需求。但问题是,这种学习多停留在上下文窗口中。会话结束后,模型并不一定真正“长记性”。
Dwarkesh 认为,这是一种巨大的浪费。
因为模型真正有价值的训练信号,恰恰在部署后才浮现。模型被真实用户使用,进入真实组织,参与真实任务,暴露出真实错误。它会看到公司内部如何运作,人们实际拿它做什么,哪些地方频繁失败,哪些建议在现实中根本无效。
但如果这些经验无法沉淀回模型权重,那它就只是一次会话里的短暂适应,而非能力的长期增长。
他以人类学习作类比:人并非靠逐字记忆每天发生的所有事情而变强。一个员工工作半年后变得有用,不是因为他记得每封邮件、每句会议记录,而是因为他将这些经历压缩成了判断力、直觉、流程理解和问题模式。
模型也应如此。
真正的 continual learning,不是无限扩大 KV cache,也不是把所有历史记录塞入上下文,而是从真实经验中提炼少量真正有用的知识,再将它们压缩进权重。
这正是 Dwarkesh 认为下一代训练范式必须解决的问题。
那么,具体如何操作?
他提到了一个正在探讨的方向:on-policy self-distillation,简称 OPSD。
可以大致理解为:让一个已在长会话中积累大量经验的模型,扮演“老员工”或 teacher;然后训练基础模型,令其在缺少这些完整上下文的情况下,也能做出类似 teacher 的判断。
换言之,把模型在一次真实任务中通过上下文学到的东西,再蒸馏回模型本身的权重。
这与普通 SFT 不同。最粗糙的 SFT 可能只是让模型预测会话里出现过的 token,相当于让它复述整个工作日志。但这并非有效学习。真正要紧的不是记住全部细节,而是提炼出那些能帮助模型下次做得更好的关键洞察。
OPSD 的优势在于,它不一定需要外部可验证奖励。只要模型能在上下文里学到有用东西,就可以将“学过之后的模型”当作 teacher,让基础模型向其对齐。
同时,相比普通 RL 只有最终 reward,OPSD 可以提供更密集的监督信号。它可以在 token 层级对比 teacher 和 student 的概率分布差异,从而将一次真实任务中的稀缺经验压缩为更小、更精准的权重更新。
除了 OPSD,Dwarkesh 还提出另一个方向:dreaming。
这里的 dreaming 指 AI 依据真实世界观察,自行构建一个模拟环境,然后在其中反复练习、尝试策略、强化有效行为。
这听似强化学习传统中的 model-based RL,也酷似 Sutton 一直强调的智能体通过环境互动累积经验。区别在于,Dwarkesh 将其置于大模型和真实部署的语境中。
例如,一个 AI 在真实公司里观察某个业务流程后,不只是写一份总结,而是耗费大量算力,构造出该流程的“游戏版模拟环境”。接着它在里面测试不同沟通策略、执行路径和项目推进方式,看什么更可能成功。最后,再将这些模拟练习中获得的经验压缩回模型。
如果这条路线成立,它可能会成为新的扩展轴。
过往 AI 的扩展主要来自三条轴:pretraining、RL 和 inference-time compute。Dwarkesh 设想,未来可能还会增加第四条轴:test-time training,或者说 dreaming。模型不只是推理,而是在推理和任务执行过程中,为特定用户、特定组织、特定项目构建模拟环境,并在其中训练自己。
这也是为什么评论区有人提及 David Silver 和 Richard Sutton 的《Welcome to the Era of Experience》:那篇文章同样强调,AI 不能永远依赖人类数据,下一阶段的关键将是智能体从自身与环境互动中汲取经验。

Dwarkesh 则将这个宏观判断具体落实到了今天的大模型训练问题上:RLVR 是一个重要的过渡阶段,它让模型在可验证任务里练就智能体能力;但要涉足更复杂的现实世界,模型必须学会从真实部署中持续学习,并把经验写回权重。
在 Dwarkesh 构想的 2027 或 2028 年,训练流程可能会演变为:
- 首先,RLVR 训练出一个基本胜任的智能体。这个智能体被掷入一个陌生问题中,至少能摸清状况,尝试不同策略,遇阻后继续迭代;
- 然后,这个智能体被部署到现实世界,开始承担真实工作。它可能和用户连续协作一周,参与一个不在原始训练分布内的项目;
- 一周结束后,用户给它一个肯定或否定的评价,甚至写一段工作评语。如果结果是正面的,模型就会将本次任务中学到的东西蒸馏回基础模型。这个过程可能采用 OPSD,可能采用 dreaming,也可能采用某种尚未问世的新技术。
一旦这条路径走通,AI 的能力边界便不再被初始那些“可验证任务”所限。
它可以先通过 RLVR 学会编程、数学、网页任务、工具调用;再通过真实部署学习组织管理、业务流程、复杂协作;然后从这些经验出发,继续扩展到邻近领域。
这也意味着,AI 进步的主要源头可能会改变。
过去,一个模型发布前训练完毕,用户只是使用它。下一代模型可能是:发布前先训练出基础智能体,发布后通过海量真实任务继续学习。每一次与用户交互,每一次真实项目执行,每一次失败和修正,都可能成为下一轮能力提升的素材。
所以,Dwarkesh 所谓的“下一代训练范式”,并非简单指模型要更大、数据要更多、RL 要更强。
它真正指向的是:AI 从发布前训练,迈向发布后学习;从人类数据,转向环境经验;从上下文里的临时适应,走向权重中的长期能力。
未来最重要的 AI 训练数据,可能不再只是互联网上已有的文本,也不只是实验室里构建的可验证任务,而是 AI 在真实世界里完成真实任务时,自己累积的经验。
参考链接:
https://x.com/dwarkesh_sp/status/2070551894674555081