← 返回访谈列表

Memory and Continual Learning 深度访谈

Memory and Continual Learning: Engram's Dan Biderman and Jessy Lin

8
话题段落
1294
字幕段落
44m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

从预训练到持续学习的核心问题

开场提出核心问题:预训练或后训练为何能让模型产生神奇的泛化能力,以及企业私有数据如何被模型像掌握常识或编程能力一样真正学会。主持人介绍 Engram 是关注记忆与持续学习的 AI 实验室,并引用其网站观点:他们不把世界分成预训练和后训练,而认为模型应始终处于训练中。嘉宾回应说,今天模型已经足够聪明,真正限制其有用性的不是原始智能,而是对新任务、新岗位、新公司语境等不断变化上下文的理解;记忆和持续学习本质上是同一枚硬币的两面,关键是把新知识深度写入模型权重。

持续学习模型记忆企业上下文权重内化

外部记忆、上下文工程与内部化记忆的边界

主持人追问,把记忆放在外部数据库或塞入上下文窗口是否不算真正记忆。嘉宾认为工具使用、上下文工程和外部记忆都会继续发挥作用,但目前被低估的是把前沿实验室用于数学、代码等能力提升的训练流程应用到企业和特定领域语境中。另一位嘉宾用人类做笔记作类比:便签和笔记有价值,但人第二天继续工作时,大脑中也会留下新的直觉与记忆痕迹。当前方案更像外部化记忆,而未来每天生成的 token 量会巨大,单纯保存、搜索和重读会昂贵且令模型困惑。

上下文工程外部记忆训练流程token成本

Engram 的团队模型与训练架构

嘉宾介绍 Engram 的产品形态:他们与 Notion、Microsoft、Harvey 等合作,在长期工作发生的工作区中收集团队文档、交互、对代理的反馈等上下文,并训练每个团队自己的模型。目标不是让模型在测试时临时读取文件,而是像在公司工作多年的人一样理解公司倡议、工作方式、招聘流程和内部操作规范。技术上,他们把这些信息训练进权重,使用多种适配器微调方法,如 LoRA、prefix、稀疏架构等,并结合监督微调、强化学习、on-policy distillation 等方式,把原始文档和交互转化为有效训练信号。实现上需要白盒权重访问,开源模型最容易支持,闭源模型则需要合作。

团队模型适配器微调工作区数据白盒权重

成本、质量与训练层级的取舍

主持人总结这种方法的潜在权衡:先消耗更多计算把公司工作方式写入权重,之后每次推理少发送上下文。嘉宾确认这是优势之一,并强调减少重查资料、重读文件和巨大系统提示词,可以带来两个数量级的 token 消耗下降,某些场景甚至从十万 token 降到百 token。尤其是与人、团队、组织和优先级有关的信息,往往不存在于单一文档中,模型可通过训练隐式学习。训练也能填补新任务上的能力空窗:当模型对某些个性化任务尚未完全擅长时,轻量自治学习能在三到六个月的领先窗口中创造价值。团队级训练先于个人级,是因为团队更有组织化的上下文积累,但个人电脑和手机未来也会成为目标。

推理成本上下文压缩个性化能力团队与个人

事实记忆与抽象学习并非二元对立

主持人提出,大模型把大量事实记在权重中到底是特性还是缺陷;是否应只学习国家、首都等抽象概念,而不记住具体事实。嘉宾认为,某种程度上必须记住东西,才能把它们组合成更复杂的概念。真正缺失的是判断什么值得记忆。很多学术基准考察极细碎事实,如某地桥梁长度,但这类知识不一定值得占用模型容量。人类记忆是有损的,智能的一部分在于压缩重要信息、过滤不重要信息。他们认为事实学习和技能学习无法完全分离;如果模型连基础事实都要频繁查找,就难以推进更深层推理。另一位嘉宾补充,深度学习的神奇之处在于把传统计算机科学中“数据库”和“算法”混在一起,而企业 AI 落地又在让二者重新分离并需要周期性融合。

事实记忆抽象学习有损压缩数据库与算法

类梦境的离线消化与训练范式

在谈到是否借鉴人类梦境时,嘉宾表示只是非常宽泛地受到启发:当前系统缺少一个把上下文深度内化的阶段,很多事情都发生在测试时,即用户给出上下文后模型现场思考,但这种方式会受限并产生错误。更理想的方式是把一次交互后的经验重新消化进模型,使下次能用正确方式推进得更远。另一位嘉宾指出,梦境虽不连贯,但人在梦中会看到场景、与自己对话,并试验在社会环境和物理世界中的可行动性。Engram 想给模型从实际交互中退出来的时间,让它在环境中实验自己知道什么、能做什么,以及如何处理尾部和极端情况。

离线学习梦境类比经验消化模型自我实验

从高风险领域到大众化训练能力

主持人询问是否有学术背景下的典型案例能说明这一问题。嘉宾举了假设例子:如果一家 AI 实验室必须在一周后赢得数学奥林匹克竞赛,它不会只是建立数学教材目录、让人标注章节和图表再做检索;更可能是收集资料、合成训练数据、启动训练任务,在五六天内评估效果并迭代。对训练过模型的人来说,训练显然是一种更优的方式,能把不同思想与能力整合起来。嘉宾认为,这种“训练的魔力”已经在数学、代码、网络安全等高风险领域得到体现,而 Engram 想把类似能力带到更多人和更多现实场景中。

训练优势数学竞赛高风险领域能力普及

为何不是前沿大模型实验室包办一切

主持人追问,为什么最终产品不会由基础模型实验室直接掌握。嘉宾表示,Engram 的世界观不同于前沿实验室:后者追求一个越来越大、在众多领域越来越智能的通用模型;而 Engram 设想的是每个人、每个组织拥有自己的模型。许多需要学习的内容是私有的,不会进入后训练数据集;有些甚至彼此冲突,因为不同公司或个人希望以不同方式完成同一任务。现实世界中的许多任务模糊、难以定义什么是好结果,也缺少干净监督和明确奖励信号,因此与前沿实验室围绕 AGI、数学和代码建立的训练管线并不完全一致。另一位嘉宾补充,前沿实验室的首要目标是 AGI 和通用能力,而 Engram 更关注具体私有语境中的持续适配。

前沿实验室私有模型个性化训练AGI路径