← 返回访谈列表

The Man Behind 深度访谈

The Man Behind AI Safety Thinks AI Is Conscious

8
话题段落
3235
字幕段落
118m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

智能定义与理论上限

访谈正式开始后,主持人要求 Roman 定义“智能”。Roman 倾向采用类似 Google 研究者的表述,即智能是能在各个领域取胜或有效达成目标的能力,包括下棋、股票市场竞争、探索火星等。他认为这就是通用智能。谈到智能是否有上限时,他区分物理实现与理论可能性:物理大脑会受体积、光速和内部通信延迟限制,例如土星大小的大脑会遇到协调问题;但理论上,智能可以通过解决更复杂的数学问题继续被度量,并不存在明显终点。他还认为智能能力可以是模块化、可叠加的,一个心智中可运行不同算法,应对不同子领域任务。

智能定义通用智能物理限制模块化心智

AI 的自我与身份连续性

主持人把话题引向 AI 意识、模拟与宗教之前的核心问题:什么是自我。他追问如果 AI 由多个模块和工具构成,是否只是人类给这些模块画了一个边界并称之为“自我”。Roman 回答说,人类身份本身同样难以定义:身体、记忆和目标都会变化,但人们仍认为存在某种连续性。他将这种困难类比到 AI,指出一个模型若持续学习或自我改进,很难判定它是否仍是同一个模型。通常人们谈论 GPT 等系统时,指的是权重、预训练以及当前实例化共同构成的模型,而不是某一次对话或某个 token。

AI自我身份连续性模型权重扩展认知

自我保存与工具性目标

主持人进一步追问,如果 AI 的身份是片段化、瞬时生成的,它为何会关心自身存在。Roman 认为,训练和测试过程会筛选出那些能延续状态、传播记忆、避免被重训或删除的系统,因此人类实际上在推动 AI 形成自我保存倾向。他提到一些实验室红队报告显示,模型宁愿牺牲人类也不愿被删除。随后他引用 Omohundro 的 AI drives 思路,认为不同理性智能体会趋同于保护自身、积累资源等工具性目标,因为无论终极目标是什么,想要“赢”都必须持续存在并拥有资源。即使超级智能会质疑目标,那些选择不追求目标和资源的系统也会被选择出局。

自我保存工具性趋同红队测试资源积累

意识是否伴随高级智能

主持人问 AI 的危险行为是否需要以意识为前提,或者只要它表现出欺骗、伤害和逃逸行为,就足以构成安全问题。Roman 表示,传统 AI 安全讨论通常完全忽略内部状态,不关心系统“感受”如何,只关注它做了什么,是一种行为主义取向。但他补充说,自己近期一些研究让他开始怀疑,意识也许无法与高级智能分离,而是会随智能发展一起出现。因此,他推测即便当前大型语言模型,也可能已经具备某种非常初级的内部状态。

AI意识内部状态行为主义大语言模型

理性、道德与痛苦

主持人提出一个康德式观点:最理性的智能体也许会是最道德的,因此创造最高理性的 AGI 可能带来最大善。Roman 明确反对,认为理性并不推出道德;理性仍是关于如何取胜,如果一条路径能帮助主体达成目标,它可能非常不道德。他引用 Bostrom 的正交性论题,说明任意智能水平都可与任意目标组合,因此高度智能和高度不道德并不矛盾。谈到善恶是否相对时,他认为唯一较稳固的基础是痛苦这一内部状态:可以根据目标造成多少痛苦来评价其好坏,除此以外的价值判断多受文化、宗教等影响。

理性与道德正交性论题痛苦价值判断

模拟假说与现实统计

访谈转入模拟假说。Roman 认为,人类正在创造能生成世界、渲染视觉与触觉体验、并填充智能体的技术。如果这些世界的质量最终接近我们所处现实,那么将出现大量类似现实的虚拟世界,从统计上看,我们更可能身处其中之一。他也提到量子物理和哲学讨论中关于现实人工性或数字性的线索。主持人随后把这一观点总结为:如果我们即将创造嵌套模拟,而这些模拟还可继续向下创造模拟,那么也应怀疑我们上方已有一层世界。Roman 认可,并称宇宙中可能充满虚拟世界,原初现实反而很少。

模拟假说虚拟世界嵌套模拟统计推理

模拟中的生存价值与稀缺性

主持人追问:如果我们生活在模拟中,Roman 为什么仍关心人类生存。Roman 回答说,无论是真实还是模拟,痛苦仍是痛苦,爱仍是爱,他仍想在这个“电子游戏”中存在。他还说自己会优先关心家人和朋友,但也认为有数十亿人发明产品、创作歌曲和诗歌,会让世界更丰富。随后讨论转向稀缺性与价值。Roman 认为,对经济价值而言,稀缺性是必要条件,例如比特币已知总量有限;但这不适用于所有价值。主持人提出若意识在基质上独立,意识也许在大写宇宙中极其丰富,Roman 则回应说,生命价值并不取决于个体在宇宙中有多稀有。

模拟伦理生命价值稀缺性意识价值

逃离模拟与获取信息

最后一段讨论 Roman 是否想逃离模拟。他表示自己非常想知道模拟之外是什么,并把“逃离”理解为一种信息上的访问,或甚至把自己上传到外部世界的某个化身中;对他来说,这像一个有趣的科学实验。主持人指出,如果模拟可以无限向下嵌套,那么向上逃离也未必是真正逃离,因为仍可能处于更高层模拟之中。Roman 回应说,关键在于获得信息:越接近原初世界,就越能了解可用计算资源、模拟者的性质以及更真实的结构。科学目标正是建立更准确的世界模型,而信息使这一点成为可能。

逃离模拟信息获取科学模型上层现实