The Real Reason Huge AI Models Actually Work [Prof. Andrew Wilson]
加载中...
点击任意话题卡片查看该时段的完整对话内容。
开场中,Wilson 说明自己并不是否认深度学习神秘或特殊,而是认为许多被视为神秘的现象,可以通过软归纳偏置和已有数十年的泛化理论框架来理解。他指出,深度学习的独特性在于相对普适性、强大的表示学习能力,以及损失景观中的模式连通等现象。他还强调,大模型可以同时拥有更强的简单解偏好,这有助于解释双降、良性过拟合和过参数化等现象。
主持人提出传统机器学习中的偏差—方差权衡,认为 Wilson 的观点似乎是在说模型可以兼得低偏差与低方差,这违背许多人直觉。Wilson 直接回应说,所谓偏差—方差权衡本身可能是一个误称,并不必然存在真正的权衡。随后节目进入赞助介绍,提到人类数据在数据集整理、评估和后训练中的重要作用,以及相关机构对 AI 研究、推理和基础模型建设的投入。
正式访谈开始后,Wilson 谈到挑战传统智慧的阻力。他认为研究者应主动寻找广泛相信但可能错误的观念,因为机器学习与 AI 的进展常被误解拖入局部最小值。他举例说,随机优化隐式偏置对泛化的作用虽重要但常被夸大;大模型即使在小数据下也能泛化良好,这一点未被充分认识。他还反对根据数据点数量随意改变模型,主张模型应诚实表达对数据生成过程的信念。
主持人回顾 Wilson 的演讲示例:面对航空乘客数据,听众最初更偏好线性模型或低阶多项式,而 Wilson 试图说服他们选择拥有一万个参数的模型。Wilson 解释,人们往往对简单显式模型有直觉偏好,但实践中早已使用拥有数千万参数的神经网络,或高斯过程、RBF 核等等价于无限参数或无限阶多项式的模型。他强调,参数数量是衡量模型复杂度的糟糕代理,关键在于模型诱导出的函数分布性质。
Wilson 进一步说明,一个灵活的函数分布可以表示多种解,同时对某些解有强偏好,而不是通过硬约束排除其他可能性。他认为硬约束既不诚实地表达研究者对世界的信念,也会降低模型适应性。具有表达力和简单性偏置的模型,在小数据与大数据场景下都能更自动地表现合理,减少人工干预。他承认规模为何带来简单性偏置仍未完全被严格解释,但已有关于更可压缩、更平坦解的经验线索。
主持人询问 Wilson 更像理论家、工程师还是科学家。Wilson 表示很难二选一,但自己主要受理解事物驱动。他认为,在快速变化的机器学习领域,单个方法可能很快过时,但对模型为何有效的理解不会过时。因此,他希望研究能在很久以后仍有价值。他强调通过经典理论、实证研究和实际演示结合来理解模型行为,同时也指出低层工程细节如数值稳定性,有时会反过来带来更高层的模型构建洞见。
Wilson 正式介绍自己是纽约大学 Courant 数学科学研究所和数据科学中心教授,研究重点是如何为智能系统构建提供原则性处方。他关注模型构建中的归纳偏置、对称性与等变性,例如分子建模中的旋转不变性、图像中的平移不变性,以及如何自动学习这些结构。他还强调从数据中发现可解释科学结构,以及为决策表达不确定性的重要性,认为没有误差范围的点预测在现实世界中难以行动化。
最后一段由主持人引入几何深度学习背景,提到 Michael Bronstein、Taco Cohen 等人的几何深度学习蓝图,并概括机器学习中的三种“诅咒”:统计诅咒来自高维数据中样本稀疏,优化诅咒来自可能陷入局部极小值,逼近诅咒则与函数类设计有关。主持人指出,几何深度学习的核心思想之一是可以有意识地结构化函数类,但如果结构过小,就会带来逼近误差。