“The Future of AI is Here” — Fei-Fei Li Unveils the Next Frontier of AI
加载中...
点击任意话题卡片查看该时段的完整对话内容。
访谈开场指出,过去两年消费者 AI 公司与应用快速涌现,但 Fei-Fei Li 将这一时刻放在更长的 AI 历史中理解。她回顾自己二十多年经历:AI 从上一个寒冬走出,现代 AI 诞生,深度学习展示出下棋等能力,随后语言模型等技术逐渐被产业采用。她认为当前不只是文本模型成熟,而是像素、视频、音频等多种模态都开始出现可用模型和应用,因此 AI 正处在近乎字面意义上的“寒武纪大爆发”。
Justin Johnson 回顾自己在本科末期接触深度学习的经历。他提到 Google Brain 的“猫论文”让他第一次理解到通用学习算法、大规模算力和海量数据结合后会产生强大效果,这成为他之后十多年研究的核心配方。他随后进入 Stanford,在 Fei-Fei Li 身边经历了深度学习和计算机视觉从早期技术萌芽走向多种应用的阶段,包括语言建模、判别式视觉、图像理解、生成图像和生成文本等。他形容当时每天查看 arXiv 新论文像拆礼物一样,AI 圈内人早已持续体验到今天公众才感受到的快速发现节奏。
Fei-Fei Li 说明自己并非从计算机科学直接进入 AI,而是受物理学训练影响,习惯提出宏大问题,并由此被“智能”这一谜题吸引。她在 Caltech 攻读 AI 与计算神经科学博士时,公众眼中的 AI 仍处寒冬,但她看到机器学习和统计建模正在积蓄生命力。她把自己称为“机器学习原生一代”,相对 Justin 所代表的“深度学习原生一代”。在博士后期和助理教授早期,她意识到当时被低估的关键要素是数据:如果让数据驱动模型,就能释放此前未见的能力。这一认识促成了 ImageNet 的大胆押注,即把视觉数据集从数千或数万规模推进到互联网规模。
主持人将 ImageNet、Transformer 和 Stable Diffusion 等视为关键时代节点,追问 AI 的核心解锁是否来自算法。Justin 认为最容易被低估的是算力。他用 AlexNet 举例:2012 年的突破模型只有 6000 万参数,在两块 GTX 580 上训练六天,而按最新 Nvidia GB200 的算力估算,同样训练量可缩短到不到五分钟。Fei-Fei Li 补充,AlexNet 所用卷积神经网络思想早在 1980 年代已存在,与早期模型相比,真正差异在 GPU 和海量数据。对话进一步讨论“苦涩教训”:算法应能充分利用不断增长的算力,同时互联网、人工标注、alt tag 等数据来源也共同推动了深度学习突破。
Justin 区分了 ImageNet 时代和后来的生成式 AI 时代。他认为 ImageNet 代表的是监督学习时代:研究者拥有大量数据,但必须由人类逐一标注,模型训练任务也被预先设计好的类别体系所约束。例如 ImageNet 团队需要决定一千个类别,COCO 等数据集也要精心选择八十个检测类别。主持人提出语言数据也带有人类隐性标注,因为句子结构由人类创造。嘉宾承认这一点在哲学上重要,尤其适用于语言,但强调监督学习时代的核心限制在于任务定义更窄、概念本体更人工化,而后来模型开始学会利用不需要显式人工标注的数据。
Fei-Fei Li 指出,生成模型并非最近才出现,早在她读研时期,研究者就已经从概率分布角度讨论如何生成字母、数字和其他内容,只是当时效果无法令人印象深刻。她借 Justin 的博士轨迹说明领域如何逐步前进:先从数据项目开始,再到图像与文字匹配,随后从像素生成文字;再到 2015 年神经风格迁移,将照片转为梵高风格等图像。Justin 回忆自己读到风格迁移论文后在周末复现算法,但原始方法需要对每张图运行优化循环,速度很慢,后来他的实时加速工作获得产业关注。Fei-Fei Li 还提到 Justin 后期用场景图作为语言结构输入,通过 GAN 生成完整图像,是早期文本到图像方向的重要尝试。她认为对研究者而言,生成式 AI 是连续发生的过程,只是对外部世界来说结果显得突然。
主持人将话题转向 Fei-Fei Li 长期关注的空间、像素与视觉智能,并询问她创办 World Labs 是否来自技术解锁或个人转折。Fei-Fei Li 回答说,这既是个人的也是智识上的延续。她把自己的研究旅程描述为不断寻找“北极星”,并相信这些北极星对 AI 领域进步至关重要。早期她曾认为图像叙事是视觉智能的核心目标,因为这是 AI 或 AGI 的重要组成部分;当学生们较快实现相关方向后,她继续寻找下一步。她强调视觉智能始终是自己的热情所在,因为任何智能体,无论是人、机器人还是其他形式,都需要看见世界、理解世界并在其中行动、导航、操作和创造。