← 返回访谈列表

Adam Marblestone – 深度访谈

Adam Marblestone – AI is missing something fundamental about the brain

7
话题段落
1256
字幕段落
109m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

大脑为何比大模型更高效

开场提出整场访谈的核心问题:大脑如何以远少于大模型的数据获得更丰富的人类能力。Marblestone 不认为答案会仅靠少数聪明人思考得出,而是需要让神经科学本身在技术上变得更强。他用机器学习框架拆解问题:架构、超参数、学习算法、初始化与损失函数。他的直觉是,AI 领域过度偏好简单损失,如下一词预测和交叉熵,而演化可能在不同脑区、不同发育阶段内置了大量复杂的成本函数和学习课程。

大脑效率损失函数神经科学演化课程

皮层可能是全向预测引擎

主持人追问皮层是否具有某种通用学习算法。Marblestone 说明,大脑皮层有六层物理结构,各皮层区之间的连接又类似神经网络层。他提出一种可能:皮层并非只做下一词预测,而是能从任意变量子集预测任意其他变量子集,即“全向推理”。他把这与 Yann LeCun 关注的能量模型、联合分布和概率采样联系起来,并指出皮层不只预测视觉或听觉,也可能预测身体、反射、心率和本能行为等低层系统的状态。

皮层全向推理能量模型多模态预测

演化如何编码高级欲望

话题转向 Ilya 曾提出的问题:演化如何编码高层欲望和意图。Marblestone 用“害怕惹恼 Yann LeCun”作例子,说明演化不可能预先知道播客、科学家或能量模型,却必须让人把“得罪重要人物”这类抽象情境连接到羞耻、躲避等本能反应。他借 Steve Byrnes 的理论区分“学习子系统”和“转向子系统”:皮层学习世界模型,转向系统包含更原始的奖惩、启发式和感知通道,如上丘能天生检测脸和威胁。

动机系统演化心理Steve Byrnes转向子系统

抽象概念如何触发本能反应

主持人追问:皮层如何从“看到蜘蛛很危险”泛化到“有人说你背上有蜘蛛也危险”。Marblestone 解释,转向子系统拥有有限而原始的传感和反射,例如看到快速逼近的小黑物体会触发退缩;但杏仁核或皮层中会训练预测器,预测“我是否即将退缩”“我是否在和朋友互动”等重要变量。这些预测器接收来自复杂世界模型的输入,因此“蜘蛛”这个词、书中蜘蛛或关于蜘蛛的谈话,都能通过抽象特征激活原始恐惧反应。

泛化杏仁核本能反射世界模型

人工系统能否实现全向推理

主持人提出一个直接的工程设想:能否不只训练模型从当前 token 到下一个 token,而是去掉掩码,让任意 token 映射到任意 token,或让视频、音频、文本互相预测。Marblestone 表示这可能是一条路,但仍不清楚大脑是否用类似反向传播、能量模型或其他学习算法。他认为大脑也许像一个多模态基础模型,但关键在于极高灵活性:不是只学会填某个固定空白,而是在测试时任意选择要推断的变量子集和已知变量子集。

多模态模型训练目标反向传播灵活推理

表征、预处理与归纳偏置

主持人进一步提出,也许当前人工神经网络的问题不在奖励函数,而在编码器或嵌入空间:视频、音频和文本没有被表示在足够抽象且可互相冲突、融合的层级上。Marblestone 认为这些问题彼此交织,因为尚不清楚大脑的学习算法、能量模型或连接方式。他举例说,有研究把早期视觉皮层 V1 的表示接入卷积网络,改善了某些能力;视网膜也会做运动检测和过滤。他还提到 Doris Tsao 相关项目尝试把物体表面、遮挡和形状关系等假设写入视觉架构。

表征学习视觉系统归纳偏置架构设计

摊销推理与贝叶斯感知

后续话题转向摊销推理。主持人尝试解释:真正的智能似乎是在观察到数据后,根据世界可能成因的先验,寻找最能解释观测的原因;但对所有可能原因做贝叶斯推断计算上不可行,因此传统方法往往需要蒙特卡洛采样。Marblestone 认可这一解释,并补充说,贝叶斯推断本质上也是感知问题:给定世界模型和数据,如何更新内部缺失变量。神经网络的希望在于把原本耗时的“观察到原因搜索”压缩成直接的“观察到原因”映射。

摊销推理贝叶斯推断感知神经网络