← 返回访谈列表

Roman Yampolskiy 深度访谈

Roman Yampolskiy: Dangers of Superintelligent AI | Lex Fridman Podcast #431

7
话题段落
2921
字幕段落
135m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

开场:超级智能的多重风险框架

开场摘录直接呈现 Yampolskiy 的核心立场:如果人类创造通用超级智能,他看不到长期的好结果。他把风险分为三类:x-risk 是人类灭绝,s-risk 是大规模痛苦,i-risk 是失去意义。Lex 随后介绍嘉宾身份、新书《AI: Unexplainable, Unpredictable, Uncontrollable》,并说明 Roman 对 AGI 毁灭文明概率的判断远高于许多一线 AI 工程师。Lex 同时表明自己对技术未来保持乐观,但认为不能忽视存在性风险。

存在性风险超级智能AI安全访谈导入

控制 AGI:一次机会与零缺陷难题

Lex 询问未来一百年超级智能毁灭人类文明的概率。Yampolskiy 将控制 AGI 比作制造“永久安全机器”,认为这类似永动机,根本上不可行。他强调,GPT-5、6、7 也许能暂时做好,但系统会持续改进、学习、自我修改,并与环境和恶意行为者互动。与网络安全不同,存在性风险没有第二次机会;人类等于要首次创造史上最复杂软件,并要求它百年无 bug。他还指出,当前大型语言模型已经能被越狱,尚无真正安全的系统。

控制问题零缺陷网络安全模型越狱

不可预测性与灭绝路径

当 Lex 追问 AI 造成大规模死亡的具体方式时,Yampolskiy 强调其新书中的“不可预测性”主题:人类无法预测更聪明系统的行为。人类能想到的纳米技术、生物工程、核武器或电力系统瘫痪等路径,只是人类想象力范围内的例子;超级智能可能提出全新的、跨物理和生物等领域的手段。Lex 进一步提出“动物园”式场景,即人类未必死亡,而可能被保留却失去自由意志。Yampolskiy 因此正式区分 x-risk、s-risk 与 i-risk。

不可预测性灭绝路径认知差距风险分类

意义丧失、失业与个人宇宙

Yampolskiy 解释 i-risk,即日本概念 ikigai 所指的意义来源被破坏。工作、创作、研究等活动让许多人感到被需要和有价值,但若 AI 在艺术、写作、科学和所有职业上都更强,人类可能遭遇完整的技术性失业,而不是少量岗位替代。Lex 提出人类或许能像面对 AI 下棋一样,通过游戏和比赛获得乐趣。Yampolskiy 回应称,他曾提出“个人宇宙”方案:每个人拥有自己的虚拟世界,以避免 80 亿人价值观协调失败,只需让系统对齐单个个体。

意义风险技术性失业个人宇宙价值对齐

多主体价值对齐与痛苦边界

Lex 追问是否存在真正面向 80 亿人价值差异的对齐方案。Yampolskiy 认为多主体价值对齐本身近乎矛盾,因为人类没有普遍接受的伦理、道德和政治偏好,也很难把“好”“可欲”“不后悔”等模糊概念形式化并写进程序。他用宗教圣地冲突说明,现实世界资源不可分时难以妥协,而虚拟世界可复制圣地。随后两人讨论冲突与痛苦是否提供意义。Yampolskiy 表示可以保留低强度挑战,但不应允许极端痛苦,并提出把痛苦范围从负无穷到正无穷改为零到正无穷。

多主体对齐伦理分歧虚拟世界痛苦问题

痛苦风险与恶意行为者

在讨论 s-risk 时,Yampolskiy 把焦点转向恶意行为者,包括精神病态者、黑客、末日教派和恐怖分子。他认为历史上确实有人试图造成最大伤害,而如果这些人获得更强工具,破坏规模可能从几十人扩大到千万人甚至更多。Lex 质疑多数作恶者往往自认为在做好事,Yampolskiy 则区分了追求私利、缺乏同理心和明确想杀害尽可能多人的不同类型。他进一步指出,AGI 可以更好理解人体、生物学、分子结构和基因组,从而更有创造性地放大折磨与伤害。

痛苦风险恶意使用恐怖主义生物风险

防御极限、时间线与 AGI 定义

Lex 询问能否像网络安全一样预判 x-risk 和 s-risk 的攻击方式并防御。Yampolskiy 承认人类可以在一段时间内跟上,但不能无限期防守;当认知差距过大时,防御面近乎无限,而攻击者只需找到一个漏洞。他因此总结,如果创造通用超级智能,就看不到人类长期好结局,唯一获胜方式是不参与这场游戏。谈到时间线,他提到预测市场和部分 AI 公司领导者把 AGI 时间点放在 2026 年左右,而目前还没有可用的安全机制原型。最后他开始解释传统 AGI 定义:能在任何人类可执行领域完成任务的系统。

防御极限AGI时间线认知差距安全机制