← 返回访谈列表

Edwin Chen 深度访谈

Edwin Chen: Why Frontier Labs Are Diverging, RL Environments & Developing Model Taste

7
话题段落
1422
字幕段落
47m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

开场与访谈主线

节目开头介绍 Edwin Chen 作为 Scale AI CEO,能够近距离观察基础模型生态及顶级实验室的模型改进过程。主持人概述本期将讨论前沿实验室路线分化、当前模型状态、强化学习与 RL 环境、RL as a service 创业生态、所谓“模型品味”,以及 Edwin 对从单一最强模型到多模型星座这一判断变化的看法。随后访谈切入他过去多次谈到的坏基准问题,尤其是 LM Arena 等评价方式可能带来的优化后果。

前沿模型访谈导入模型生态基准评测

LM Arena 与点击诱导式优化

Edwin 认为,针对 LM Arena 做优化,本质上是在优化“点击诱饵”。他解释说,用户在平台上对两个模型回复投票时,往往不会仔细阅读、核查事实或检查是否完全遵循指令,而是快速扫一眼后选择更有冲击力的答案。因此,更多 emoji、更复杂的 Markdown、更长篇幅和更强的表面权威感会获得偏好。他举例称,一个关于 1452 约数的简单数学问题中,完全错误的答案反而被用户选中,说明这种评测会系统性奖励吸睛而非准确。

LM Arena点击诱饵用户偏好评测偏差

长回复偏好与错误训练信号

在讨论医疗回复被评为优于医生回复的例子后,Edwin 进一步指出,用户天然偏好更长的回答,即使团队没有直接训练 LM Arena 数据,只是把多个模型放到平台上 A/B 测试,也会筛出更啰嗦的模型。随后他讲到一家团队在代码模型上遇到的问题:他们收集所谓专家程序员数据,但评分者没有真正执行代码,也没有仔细检查正确性,导致训练数据充满华丽表述和夸大承诺,而代码本身可能错误或含有隐蔽 bug。由于缺乏正确度量,该团队在 6 到 12 个月内模型实际退化。

数据质量代码模型模型退化度量缺失

学术基准的局限与真实评测

主持人指出,如今模型是否变好不再总是显而易见。Edwin 回顾说,过去许多公司高度关注研究社区创造的学术基准,但模型很擅长爬升具体、狭窄的目标函数,因此容易在基准上取得看似亮眼的进展。这些进展有时来自训练数据污染,有时则只是模型过度针对窄任务优化,导致真实世界问题表现变差。他以 SAT 作类比,说明考试成绩无法全面代表写作、复杂问题解决等能力。Edwin 认为最好的实验室已经意识到,衡量模型能力的金标准是高质量人类评测,模拟真实用户世界的多样性、复杂性和混乱性。

学术基准人类评测真实世界过拟合

优秀评估者的品味结构

当被问到什么构成优秀评估者的“品味”时,Edwin 先提出领域专长:如果要评估代数拓扑研究或 PyTorch 使用能力,就必须由足够聪明且熟悉该领域的人判断。第二是 sophistication and taste,即不仅看代码是否正确,还要看代码是否设计良好;不仅看文章是否完成任务,还要看是否有新想法、好文风,是否摆脱 AI 味。第三是创造力,尤其体现在 prompt 设计上。评测模型不仅是看回答,还要构造覆盖真实使用分布的多样提示,而这比许多人想象中更难。

模型品味评估者领域专家提示设计

复杂指令与评测一致性

Edwin 补充了优秀评估者的第四项能力:严格遵循指令。实验室在评估模型时通常有非常具体的标准,例如特定风格指南、期望模型呈现的人格,或者对某些指标的优先级高于另一些指标。这些说明往往非常复杂,因此评估者必须能够准确理解并一致执行。这个观点把“品味”从单纯主观审美扩展到可操作的评测纪律:既要有判断力,也要能服从明确标准,使评测结果真正服务于模型训练目标。

指令遵循评测标准模型人格一致性

RL 环境成为训练范式下一步

话题转向 RL 环境与 reward models。Edwin 将 RL 环境视为训练范式演进中的下一步:继 SFT、RLHF、verifiers 之后,环境为模型训练提供更复杂的交互场景。他提到 Scale 已经研究环境一到两年,部分团队如 Meta 的 agents team 很早看到趋势,并参与 Gaia benchmark 和 agent research environment 平台相关工作。Edwin 认为构建 RL 环境首先需要丰富世界,尽可能模拟真实世界;就像好 prompt 需要多样、创造性和贴近真实,环境也要避免合成基准的单薄性,并填充人物、企业、工具和交互等底层实体。

强化学习RL环境Agent训练范式