递归自我改进,真正的瓶颈不是会写代码|Dwarkesh Podcast × John Schulman, Beren Millidge, Charlie O'Neill
- 原始标题
- AI researchers debate how close we are to recursive self-improvement
- 节目 / 来源
- Dwarkesh Podcast
- 嘉宾
- John Schulman, Beren Millidge, Charlie O'Neill
- 原始发布日期
- 2026-09-11
- 时长
- 约 97 分钟
- 内容类型
- 圆桌访谈 / AI 研究自动化
- 原始内容
- 前往原始来源 ↗
先说结论
这期最重要的判断是:如果 AI 研究真的进入递归自我改进,触发点大概率不是“模型终于会写更多代码”,而是它开始稳定承担研究循环里更难外包的部分:选择目标、设计实验、解释失败、把短期反馈变成长期判断,并且在真实部署中持续学习。中文深度整理,非逐字翻译。
John Schulman、Beren Millidge 和 Charlie O'Neill 的分歧不在于 AI 会不会继续变强。他们都默认模型会在编码、实验执行、环境求解和知识压缩上继续推进。真正的问题是,当前的训练范式能否把这些局部能力串成自我推进的研究系统。也就是说,模型不是只要能跑实验就能自动改进自己;它还必须知道哪些实验值得跑,什么时候该换方向,以及怎样定义下一个更有价值的目标。
这期内容在讨论什么
Dwarkesh Patel 把问题设置得很直接:如果十年后世界并没有被大量超级智能彻底改变,最可能的技术原因是什么?嘉宾们给出的候选答案包括长期泛化不够、仿真环境和真实世界之间仍有断层、模型无法高效从部署经验中更新,以及人类仍然掌握“目标定义”和“研究品味”这类更高层判断。
这不是一场普通的 AGI 时间表讨论。它更像一次对 AI 研发工厂的拆解:前训练、后训练、RL 环境、蒸馏、长上下文、公司内部数据、真实用户反馈、组织激励,每个环节都可能成为加速器,也可能成为刹车。节目里反复出现的线索是:能力增长已经不只是模型参数和数据量的故事,而是整个研究闭环能不能被自动化。
核心观点
第一,代码能力不是自动化 AI 研究的最后一公里。模型已经能在许多编码任务上显著提高效率,但研究不是把需求写成代码这么简单。研究的关键经常是提出正确问题,发现当前指标不对,或者意识到应该优化另一个更根本的目标。Schulman 特别强调,即使技术执行可以被自动化,人类仍会长期参与“我们到底想要什么”的定义。
第二,长期 RL 的核心赌注,是从许多可验证环境中学到通用工作能力。实验室正在把 coding、finance、office workflow、浏览器操作、协作任务等做成训练环境,希望模型学会坚持、信息 triage、工具使用、上下文管理和多步计划。这个方向成立的话,模型会越来越像可雇佣的远程知识工作者;不成立的话,它可能只是在数据中心里擅长某些模拟任务。
第三,仿真到真实世界的迁移是最硬的疑问。越是长周期任务,越难在训练环境里完整模拟。经营公司、推动客户、打赢官司、做长期研究,都需要与真实人类、制度和市场互动。如果模型必须靠真实部署经验才能变好,而权重更新又远比人类学习低效,那么递归改进就会慢很多。
第四,蒸馏会削弱“少数巨头永久垄断”的叙事。Schulman 认为,只要某种能力能通过模型行为表现出来,就可能被较小模型学习。真正难的是得到足够真实、足够宽的提示分布。节目提到,中国团队通过代理或路由服务接触美国前沿模型的真实 coding prompt,这类数据对蒸馏尤其有价值,因为它不是实验室编出来的题,而是用户实际会问的问题。
第五,RL 的成功可能被误解了。Beren 的解释是,很多看似 RL 带来的能力,其实先来自高质量 mid-training 和合成推理数据;RL 更像是在此基础上调整策略,把概率集中到能得到正确结果的行为上。它不必从零学会推理,所以“每轮反馈只有少量信息”的问题没有看起来那么致命。但这也留下一个副作用:模型可能变得更会做对题,同时输出风格更收敛、更少样化。
第六,架构的作用不能只用短期 benchmark 衡量。Charlie 提醒说,某些架构变化不是在同一任务上立刻多拿几分,而是打开新的使用区间。长上下文、压缩注意力、更低推理成本,都会决定模型能不能处理更长的工作链条,也决定 RL rollout 是否经济。换句话说,数据、架构和环境不是相互独立的三项投入;架构让某类数据第一次变得可用,数据又让架构优势显现出来。
推理链与关键例子
节目开头先 steelman 了“不会快速起飞”的可能性。一个版本是 Moravec 悖论的延伸:人类以为数学、编程、棋类这样的高智力任务最难,结果它们反而先被模型突破;而那些我们觉得自然的自我引导、长期适应、现实互动,也许才是机器最难补齐的部分。如果这种反差持续,模型可能在 benchmarks 和精心设计的环境里极强,却仍无法把世界变成一个可靠的训练场。
接着,讨论转向 AI 研究自身。Charlie 给了一个很有用的区分:如果目标已经明确,AI 可能带来巨大加速。例如,降低 pre-training loss、发现 scaling law 里的错误假设、优化学习率随模型规模的关系,这类任务有清晰反馈,也有大量可分析数据。模型可以更快地试错、复盘和提出改进。但真正难的是发现“应该优化什么”。历史上的关键转折,比如把下一词预测当成大规模智能训练目标,并不是单纯算得更快就必然得到的结论。
这也是递归自我改进最关键的断点。一个自我推进的系统需要先提出目标,再优化目标,再评估结果,然后提出下一个目标,而且这个循环不能跑偏。只要其中任何一环需要人类重新定义方向,所谓“爆炸式起飞”就会被现实摩擦拖慢。
对于训练自动化研究员,嘉宾们认为实际路线不会是让模型从零重新发明深度学习,而是更务实地沿着当前前沿继续补洞。实验室会把最新发现的 bug、失败案例、训练栈问题和研究经验转成环境,让下一代模型练习解决。换句话说,模型不是退回历史早期重走一遍,而是在前沿上学习“上一个版本哪里坏了”。这种做法更现实,也更符合算力约束,但它同样意味着人类和组织仍在设计训练分布。
在真实世界学习上,嘉宾们提出了一个组织层面的判断:是否出现“蜂群式学习”,未必首先是技术问题,而是激励问题。企业是否愿意把客户部署数据、内部操作记录和失败案例回流给模型训练,取决于商业、隐私、安全和竞争结构。即使技术上能学,现实中也可能因为数据无法汇聚而变慢。
这也解释了为什么“模型公司会不会集中化”没有简单答案。一边是规模经济、算力采购、训练经验和分发渠道带来的集中化;另一边是蒸馏、开源模型、企业私有数据和特定场景学习带来的去中心化。如果未来模型主要靠少数通用能力取胜,巨头会更强;如果未来的关键在于部署后的本地经验、行业工作流和公司内部反馈,小团队或垂直厂商就仍有空间。
节目里关于数据的讨论也很关键。嘉宾们没有把数据简单看成“更多文本”。后训练时代的数据更像任务环境、失败案例、交互轨迹和人类偏好集合。一个模型能不能成为研究员,不取决于它读过多少论文摘要,而取决于它是否经历过足够多高质量的研究情境:提出假设、遇到反例、修正方法、评估代价、解释结果。这类经验很难靠静态网页语料替代。
最后,节目谈到创造力和 RL。Dwarkesh 问,LLM 的 RL 是否可能产生类似 AlphaGo 那种超出人类直觉的创造性。Beren 认为,长周期任务中已经能看到某种“Move 37 式”的搜索能力,例如模型在复杂安全事件里组合出人类没有直接示范过的策略。Schulman 则补了一个重要区分:一种创造力是解决高约束搜索问题,模型会非常擅长;另一种是人类作品那样的分布多样性,RL 反而可能把它压窄。
边界、保留意见与争议
这期最值得保留的地方,是嘉宾们同时承认加速和摩擦。乐观的一面是,模型已经能承担越来越长的工作链条;一旦它能连续跑几轮实验反馈而不崩,AI 研究的局部速度就会显著提升。悲观或谨慎的一面是,速度提升未必等于完整递归循环。研究品味、目标设定、真实部署反馈、组织数据回流,都会决定加速能不能复利。
另一个争议是时间表。嘉宾们对“通用远程白领工作者”的预期相当激进,认为可用形态可能很快出现,但对“顶尖 AI 研究者获得数量级生产力提升”更谨慎一些。到“所有可通过电脑完成的认知工作都超过顶尖人类”这个层级,估计也仍有明显分歧:有人给出几年量级,有人认为更可能需要更长时间,尤其取决于长期学习和跨领域迁移。
还有一个隐含风险是蒸馏带来的同质化。如果大量开源或小模型都从少数前沿模型学习行为,生态会更快追平,也可能更快收敛到相似的偏好、表达方式和错误模式。能力扩散是好事,但如果全行业都在复制同一批模型的“品味”,多样性和独立纠错能力会下降。
整理后的观察
这期的价值在于,它把“递归自我改进”从一个神秘词拆成了具体生产流程。真正的问题不是 AI 会不会变聪明,而是聪明能否被组织成一个稳定、闭环、可累积的研发机器。会写代码、会跑实验、会总结论文,只是零件;能提出目标、识别坏目标、从失败中更新判断、把部署经验变成下一轮训练,才是发动机。
所以,更合理的观察不是“某个模型发布后世界马上起飞”,而是看几个更细的信号:模型能否独立完成多轮实验闭环;训练环境能否覆盖越来越长的现实任务;部署反馈能否安全回流;人类是否还在承担目标定义的大头;以及模型是否开始在研究方向选择上表现出可迁移的品味。
如果这些信号同时出现,递归自我改进就不再只是时间表争论,而会变成研发组织结构的现实变化。到那时,最稀缺的未必是单个聪明模型,而是能把模型、数据、反馈、目标和安全边界组织成可靠循环的系统能力。