Google DeepMind Distinguished Eng (L9): How To Land a Job at a Frontier Lab | Vlad Feinberg
加载中...
点击任意话题卡片查看该时段的完整对话内容。
开场介绍 Vlad Feinberg 是 Google DeepMind 的预训练方向负责人,访谈主题是如何进入前沿实验室。他解释,LLM 已同时连接研究与产品,实验室所需技能非常广泛。他特别点名 kernel 开发和低层工程能力,因为无论是改模型架构、优化 serving、改进 KV cache,还是提高吞吐与降低延迟,都需要把新方法高效实现到大规模系统中。这类能力在各实验室和项目中都有强需求。
主持人询问 DeepMind 是否像 OpenAI、Anthropic 一样区分 applied org 和 research org。Vlad 说 DeepMind 有不同聚焦方向,例如用 Gemini 改进搜索结果,但他不愿把应用与研究划得太清。即使是产品集成,也涉及事实性、引用来源、答案 grounding、来源质量评估等硬研究。同时,预训练和后训练等经典 LLM 研究团队仍存在,但他们也要负责模型稳定训练和实际交付,不能只做配方设计。
谈到软件工程师与纯 AI 研究者的光谱时,Vlad 以团队的蒸馏工作为例说明,很多新技术的基础来自基础设施投入。蒸馏需要用大型教师模型在海量 token 上生成统计信息,计算和存储成本可达数百万美元级别,因此每一秒、每一个字节都很重要。他们多次重写蒸馏基础设施,重新设计抽象、存储、跨数据中心读写,最终加速研究迭代并帮助形成更强模型。
主持人追问普通后端工程师转入研究时会遇到的差异。Vlad 认为关键转折点在于研究具有更高风险和更高回报,需要所谓 research taste:判断在项目的多个里程碑路径中该走哪条路。他把软件工程比作相对确定的 DAG,可以按服务、存储和模块逐步推进;而研究更像随机图或 MDP,很多节点代表的想法可能失败,也可能打开新可能,因此必须估计成功率、时间成本和潜在收益。
Vlad 进一步解释后端工程师做研究时最容易短板的是缺少研究领域上下文。他强调研究者必须谦逊地承认过去已有大量相关投入,只有理解人类在该主题上的最前沿,才可能继续推进它。这包括有效遍历引用树、判断哪些论文高价值、在不完整阅读时评估论文是否值得深入,以及具备理解论文所需的机器学习、计算机科学、数学和课程背景。
以蒸馏和预训练为例,Vlad 说明 LLM 研究的核心语境是 scaling laws。重点不只是幂律形式,而是给定某种扩展配方后,能预测投入更多 FLOPs 训练时最终 test loss 会如何变化。不同于 ImageNet 时代可以反复用验证集试错,LLM 大规模预训练往往是一次性押注:每次上规模都比过去投入更多计算,因此需要从小规模实验推断大规模表现。Kaplan、Chinchilla、GPT、PaLM 等工作共同塑造了这种研究视角。
最后一段转向招聘标准。主持人概括说,如果要选择能加入团队并推动前沿的人,判断标准会包括他们对前沿本身的理解、对既有文献的掌握,以及支撑这些理解的先修能力,也就是 Vlad 在文章中提到的数学成熟度。Vlad 回应说,一旦具备数学成熟度,阅读和理解 Kaplan、Chinchilla 这类论文会更容易;如今这些基础论文已是候选人的基本门槛,进一步还要能深入同等层级论文并理解其研究想法。