Building the Automated AGI Lab: Core Automation's Jerry Tworek and Rohan Anil
加载中...
点击任意话题卡片查看该时段的完整对话内容。
开场片段用踢足球和学习数学作对比,说明“从经验中学习”并不等同于强化学习。踢足球更像反复尝试、根据结果微调的自我强化过程;学习数学则是阅读困难概念、在脑中深入思考直到知识连接起来。嘉宾强调,两者都属于经验学习,但机制非常不同。当前行业可能已经把前所未有的算力投入到经验学习中,但强化学习并不是经验学习的终点,未来还需要研究者提出更好的方法来利用这些数据。
主持人介绍两位嘉宾在 OpenAI、Google Brain、Gemini 和 Anthropic 的研究背景后,追问 Jerry 关于“替代 Transformer 的第一步是深刻欣赏它”的推文。Jerry 解释说,欣赏 Transformer 不是悼词,而是要理解它做得好的地方和弱点。许多架构研究只试图让 Transformer 更便宜、更高效,却较少思考如何让它更强大。他认为行业已经掌握了两类大规模算法:预训练和强化学习;在此基础上,下一步要重新审视过去六年主要依靠参数、MoE 和注意力扩展的路线,并从 Codex、Claude Code 等自动化系统的成功与局限中反推仍未解决的问题。
Jerry 进一步说明为什么他认为架构是核心问题。他回顾自己曾是强化学习最大化主义者,相信一旦在 OpenAI 大规模扩展 RL,就能很快解决 AGI 问题,甚至在 2024 年会预测 2025 年是 AGI 之年。但现实是,模型和 benchmark 分数持续提升,却没有解决全部真实世界任务。他由此意识到,训练任务和评测任务往往是同一枚硬币的两面,而真实世界分布更混乱、更不透明,训练数据没有真正复现用户场景。因此,他认为模型必须能在测试时学习,在用户数据和真实任务上适应。现有 in-context learning 容量有限,持续微调又有灾难性遗忘和低数据效率问题,所以需要新的、可在架构层表达的元学习算法。
主持人追问新架构是否仍会像 Transformer,因为 OpenAI 长期尝试扩展 RL,似乎直到 Transformer 提供可扩展世界先验后才真正奏效。Jerry 回应说,Transformer 与 RL 的成功同时发生,但关键很大程度上是经济问题。理论上 LSTM 也能扩展,只是扩展效果更差、训练更贵、产品表现更弱,可能无法证明投入巨额训练成本的商业回报。Transformer 的独特之处在于,它不仅技术上可扩展,而且训练成本低于产生的收入,使机器学习第一次展现出强经济价值。Jerry 还指出,OpenAI 早期押注“更小但更可扩展的算法”,虽然曾被学界批评为不够科学,却最终带来了今天的大模型能力。
Jerry 解释 Core Automation 的使命时指出,许多架构研究长期停留在过小规模上,研究者常先在小数据集、小计算预算中验证,再考虑扩展。但强化学习的经验表明,某些能力需要达到一定算力基线才会显现,其他架构也可能如此。主持人因此提出,如果需要高算力,为什么不在大实验室内部做。Jerry 回答说,这是时机问题:当前最大、最成功的 AI 实验室正处于高度竞争市场中,更倾向于继续扩展已经盈利的 Transformer,以赢得下个季度,而不是投入可能一两年后才改写领域的替代路线。较小实验室也往往追随大厂方向,例如集中发布编码 agent。因此 Core Automation 想填补生态中探索不同路径的空位。
Rohan 回忆自己在 Google Brain 时与 Transformer 诞生同期的经历。他说 Ashish、Noam 等人提出 Transformer 时,自己也在做在线蒸馏研究,并在同一个内部研究会议上展示。Transformer 在 Google 内部起初并没有被普遍视为重大突破,只有少数人真正理解其潜力。最初工作也高度聚焦于机器翻译这一实际问题,即击败 LSTM 的翻译模型。直到 GPT-2 和 GPT-3 之后,业界才更清楚地看到 Transformer 在大规模语言模型上的优势。这段回顾说明,后来改变行业的架构创新,在早期组织内部也可能只是众多研究之一。
Rohan 从“架构如何花费计算”这一角度评价 Transformer。他认为 Transformer 是一种非常高效的计算使用方式,但现在行业大量计算发生在推理阶段,并被花在 token 生成上。预训练建立了具有一定上下文长度的 Transformer,强化学习随后通过链式思维让模型需要更多计算,而实现方式往往是一次生成一个 token。Rohan 指出,这从推理角度非常低效, speculative decoding 等方法更像是在修补自回归逐 token 生成带来的问题。他还提到,行业用了两三年才把稀疏性、专家混合和训练效率打磨到如今被视为理所当然的状态。Transformer 的问题之一是计算深度不足,而提出这一问题本身就打开了许多新研究方向。
Rohan 最后强调,真正的基础研究通常需要较长时间才能进入产业,过去往往要五六年才会落地。关键不仅是研究者有内在信念,例如 Jerry 相信 RL 必不可少,Rohan 自己曾是预训练最大化主义者;还需要架构能够高效运行在硬件上。理论上最优的架构如果无法生产化,对行业没有实际价值。因此,从研究想法产生,到实现、生产化、内核编写和端到端系统整合,都必须形成完整闭环。他指出,目前只有少数地方拥有这样一体化的团队能力。