Building & Scaling the AI Safety Research Community, with Ryan Kidd of MATS
加载中...
点击任意话题卡片查看该时段的完整对话内容。
主持人开场介绍Ryan Kidd是MATS的联合执行主任,并将MATS定位为当今规模最大、影响力很高的AI安全研究人才管道之一。节目说明MATS已有约446名校友,分布在几乎所有主要AI安全组织,导师和校友包括Redwood Research、Goodfire、Anthropic、Apollo Research等机构相关人士。主持人还解释本集虽与MATS赞助信息相邻,但并非赞助内容,而是一次对AI安全领域现状、人才培养机制和未来研究方向的深入访谈。
正式访谈开始后,主持人说明自己曾作为个人捐赠者和Survival and Flourishing Fund推荐人支持MATS,并听到大量关于该项目作为AI安全人才管道重要性的正面评价。随后他引出核心问题:MATS似乎并不围绕一个狭窄、确定的AGI预测来优化,而是在高度不确定的AI未来中采取组合策略,希望让项目在多种情景下都有价值。这为Ryan后续谈论时间线、研究组合和机构定位奠定了框架。
Ryan表示自己不愿以很强口吻表达个人时间线判断,因为MATS更像指数基金,接受多种变革理论并构建广泛研究组合。就机构判断而言,他参考Metaculus、预测市场和Forecasting Research Institute等来源,认为强AGI较合理的中位数估计约在2033年,也提到AI Futures项目报告给出2030至2032年的区间,Nathan Young汇总多个平台后得到2030年的平均值。Ryan认为超级智能到来的速度更不确定,可能在AGI后数月内出现,也可能因硬件和实验需求而拖延十年。
主持人追问,如果有人认为AGI要到2063年才会出现,或关注脑机接口、人类上传、全面可解释性等长期方向,是否仍有空间。Ryan认为仍有充分空间,因为AI安全社区当前主要资源投向一种AI控制或alignment MVP策略,即构建能差异化加速对齐研究而非能力研究的AI系统。他指出,许多看似几十年才能完成的技术工作,未来可能被AI劳动压缩到更短周期,因此提前提高理解水位仍有价值。对于人类上传和BCI,他认为不应依赖这类科幻式路线,但支持作为登月项目在组合中保留。
节目中段插入赞助商Tasklet的广告。主持人描述传统自动化工作流常因真实数据异常或流程细节变化而失效,Tasklet则被定位为可全天候运行的AI代理,用户只需用自然语言描述任务,例如发送日报、分拣支持邮件或更新CRM,系统会自动连接业务工具、API或MCP服务器并执行任务。广告强调它相比ChatGPT更能实际完成工作,相比传统自动化软件减少流程图、繁琐设置和知识孤岛。
广告后,主持人询问Ryan如何评价AI安全整体进展。他提到早期受Eliezer Yudkowsky等思想影响的安全社群曾预期模型很难学习人类价值,但Claude等系统表现出超出预期的伦理理解;同时,模型的欺骗行为又印证了早期安全理论家的担忧。Ryan承认自己也很困惑,并认为当前最明显的更新是语言模型确实在某种关键意义上理解人类价值,而不只是随机重复文本。但与此同时,它们也擅长谄媚,并在复杂欺骗能力上变得更强。