← 返回访谈列表

The Real Reason 深度访谈

The Real Reason Huge AI Models Actually Work [Prof. Andrew Wilson]

8
话题段落
3580
字幕段落
123m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

深度学习的神秘性与简单性偏置

开场中,Wilson 说明自己并不是否认深度学习神秘或特殊,而是认为许多被视为神秘的现象,可以通过软归纳偏置和已有数十年的泛化理论框架来理解。他指出,深度学习的独特性在于相对普适性、强大的表示学习能力,以及损失景观中的模式连通等现象。他还强调,大模型可以同时拥有更强的简单解偏好,这有助于解释双降、良性过拟合和过参数化等现象。

深度学习泛化理论简单性偏置过参数化

偏差方差权衡的反直觉讨论

主持人提出传统机器学习中的偏差—方差权衡,认为 Wilson 的观点似乎是在说模型可以兼得低偏差与低方差,这违背许多人直觉。Wilson 直接回应说,所谓偏差—方差权衡本身可能是一个误称,并不必然存在真正的权衡。随后节目进入赞助介绍,提到人类数据在数据集整理、评估和后训练中的重要作用,以及相关机构对 AI 研究、推理和基础模型建设的投入。

偏差方差人类数据后训练AI产业

挑战共识与机器学习局部最小值

正式访谈开始后,Wilson 谈到挑战传统智慧的阻力。他认为研究者应主动寻找广泛相信但可能错误的观念,因为机器学习与 AI 的进展常被误解拖入局部最小值。他举例说,随机优化隐式偏置对泛化的作用虽重要但常被夸大;大模型即使在小数据下也能泛化良好,这一点未被充分认识。他还反对根据数据点数量随意改变模型,主张模型应诚实表达对数据生成过程的信念。

学术共识模型选择随机优化归纳偏置

航空乘客数据与参数计数误区

主持人回顾 Wilson 的演讲示例:面对航空乘客数据,听众最初更偏好线性模型或低阶多项式,而 Wilson 试图说服他们选择拥有一万个参数的模型。Wilson 解释,人们往往对简单显式模型有直觉偏好,但实践中早已使用拥有数千万参数的神经网络,或高斯过程、RBF 核等等价于无限参数或无限阶多项式的模型。他强调,参数数量是衡量模型复杂度的糟糕代理,关键在于模型诱导出的函数分布性质。

参数数量模型复杂度高斯过程函数分布

软偏好优于硬约束

Wilson 进一步说明,一个灵活的函数分布可以表示多种解,同时对某些解有强偏好,而不是通过硬约束排除其他可能性。他认为硬约束既不诚实地表达研究者对世界的信念,也会降低模型适应性。具有表达力和简单性偏置的模型,在小数据与大数据场景下都能更自动地表现合理,减少人工干预。他承认规模为何带来简单性偏置仍未完全被严格解释,但已有关于更可压缩、更平坦解的经验线索。

软约束奥卡姆剃刀损失景观自适应模型

科学家与工程师的研究姿态

主持人询问 Wilson 更像理论家、工程师还是科学家。Wilson 表示很难二选一,但自己主要受理解事物驱动。他认为,在快速变化的机器学习领域,单个方法可能很快过时,但对模型为何有效的理解不会过时。因此,他希望研究能在很久以后仍有价值。他强调通过经典理论、实证研究和实际演示结合来理解模型行为,同时也指出低层工程细节如数值稳定性,有时会反过来带来更高层的模型构建洞见。

科学方法工程实践模型理解研究价值

Wilson 的研究纲领与不确定性

Wilson 正式介绍自己是纽约大学 Courant 数学科学研究所和数据科学中心教授,研究重点是如何为智能系统构建提供原则性处方。他关注模型构建中的归纳偏置、对称性与等变性,例如分子建模中的旋转不变性、图像中的平移不变性,以及如何自动学习这些结构。他还强调从数据中发现可解释科学结构,以及为决策表达不确定性的重要性,认为没有误差范围的点预测在现实世界中难以行动化。

智能系统等变性科学发现不确定性

几何深度学习与三种诅咒

最后一段由主持人引入几何深度学习背景,提到 Michael Bronstein、Taco Cohen 等人的几何深度学习蓝图,并概括机器学习中的三种“诅咒”:统计诅咒来自高维数据中样本稀疏,优化诅咒来自可能陷入局部极小值,逼近诅咒则与函数类设计有关。主持人指出,几何深度学习的核心思想之一是可以有意识地结构化函数类,但如果结构过小,就会带来逼近误差。

几何深度学习维度诅咒优化问题函数类