Nathan Goes to China – Part 2: AI Safety with Chinese Characteristics
加载中...
点击任意话题卡片查看该时段的完整对话内容。
主持人介绍本集是中国行系列第二部分,主题为“中国特色的 AI 安全”。他说明第一部分更像旅行日志和技术体验,涵盖在中国使用手机、应用和本地 AI 的观察;而本集将集中讨论中国 AI 安全生态,尽量按其自身逻辑理解。他还声明采用查塔姆宫规则,不披露受访者姓名或机构归属,只引用公开论文和报告,并说明旅费自理、无重大财务利益冲突。
主持人提出,本集的核心目的之一是纠正美国 AI 安全和监管讨论中的“but China”式论点,即认为美国不能放慢、不能监管、不能给前沿公司施加义务,因为中国不会在意安全也不会减速。他认为这种说法源于无知。按他的观察,中国确实关心 AI 安全,虽然这不是唯一目标,也不一定是西方语境中的存在风险安全;但在其关注的安全领域,中国政府曾愿意让 AI 公司放慢,并在必要时采取行动。
主持人先给出直接判断:截至目前,中国 AI 公司和模型在防止公众滥用方面的安全防护,整体不如美国公司。他强调这一差距主要由 OpenAI 和 Anthropic 拉大,这两家公司既领先能力,也在安全措施上领先。如果去掉它们,美国其他公司与中国公司的差距会明显缩小,甚至不再构成美国生态可居高临下批评中国的道德优势。Google Gemini 也比许多公司更好,但优势较有限。
主持人概括中国 AI 安全群体的思想气质:务实、接地气、偏工程实践,不太受科幻传统影响,也不像美国部分 AI 安全讨论那样带有强烈末日叙事。他引用上海人工智能实验室肖波文提出的“45 度线”概念:能力与安全措施应同步增长,随着模型能力提升,安全标准也应相应增强。该理念认为安全不能落后于能力,但也隐含不必为尚不存在的能力过早建设过度强的安全措施。
主持人介绍 Concordia AI 维护的 AI.net 评测网站,称其提供大量模型在不同风险基准上的评估。他认为最有信息量的图表,是将主要为美国公司的闭源 API 模型与主要为中国公司的开源权重模型比较。结果显示,闭源专有模型通常位于或略高于“45 度线”,而中国开源权重模型往往低于该线,安全措施落后于能力。主持人强调,这是中国本土机构公开发布的结论,并非外部单方面批评。
节目进入 Anthropic 的 Claude 广告插播。主持人描述自己过去几个月使用 Claude 和 Claude Code 构建个人深度上下文数据库,整合五年来的邮件、Slack、推文、私信、视频会议和播客文本,并在此基础上生成与联系人、组织和概念相关的摘要文章。他举例说,Claude 可以根据与创始人的沟通记录起草投资备忘录,也能在朋友招聘时从其网络中识别潜在人选。
主持人提醒,评估中国模型安全时要区分“公司发布的开源权重模型”和“面向公众提供的实际服务”。他回忆在中国 AI 应用中提敏感问题时,有时先看到回答生成,随后输出被上层监控系统撤回并改为拒答,说明服务通常是多组件系统,不只是模型本体。他认为不同评测方法会影响中美差距的呈现:直接测试开源权重能反映最坏情形,而测试实际服务则包含额外监控与拦截。中国监管思路更偏向面向公众的 AI 服务,而不是单独把模型权重视为监管对象。