← 返回访谈列表

Building the GitHub for RL Environments 深度访谈

Building the GitHub for RL Environments: Prime Intellect's Will Brown & Johannes Hagemann

7
话题段落
1434
字幕段落
44m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

机构知识与训练的价值

开场片段以“数据和真实专业知识是否是瓶颈”为引子,强调长期积累的领域经验无法靠短提示词轻易复制。嘉宾指出,公司和机构之所以强大,是因为最佳实践与机构知识会随时间复利增长,而不是每天从零开始。这个观点为后续讨论模型后训练铺垫了核心逻辑:训练过程本身可以承载长期互动中形成的经验,让企业把自身知识沉淀进模型能力中。

机构知识专业经验后训练企业能力

Prime Intellect 的使命与基础设施

主持人介绍 Prime Intellect 是当前备受关注的新 AI 实验室之一,使命是让前沿实验室级训练能力触达更多人。嘉宾解释,平台从算力层和算力编排做起,向上覆盖完整后训练栈,包括大规模强化学习训练框架、社区化环境中心、安全代码执行沙箱和评测组件。他们认为开放科学推动人类进步,同时模型定制也有现实商业价值:应用需要针对具体工作流、agent 和任务优化模型,而不仅仅依靠现成模型和提示词。

Prime Intellect开放科学基础设施模型定制

每家公司都将拥有 AI 研究能力

当被问及未来是否每家公司都会预训练或后训练模型时,嘉宾表示他们相信每家公司都会成为 AI 公司,大多数 AI 公司也会希望拥有某种 AI 研究实验室。研究形态并不单一:某些领域可能需要预训练,尤其是在非文本输入输出或高度定制化场景;更多情况下则是围绕特定任务和工作流进行 agentic 后训练。随后嘉宾介绍 Lab 平台,其重点抽象是“环境”:环境包含任务数据集、模型运行 harness,以及用于评分的 rubric 或 reward function,可用于评测,也可作为强化学习训练集。

AI 公司Lab 平台环境评测

产品—模型优化循环

嘉宾进一步说明,Prime Intellect 想让更多公司获得目前主要由大实验室掌握的产品—模型优化循环。OpenAI 能做出 ChatGPT、Anthropic 能做出 Claude Code,是因为它们可以针对自身产品脚手架优化模型,使模型在自家产品里表现更好。但随着这些产品本身成为竞争对象,大实验室未必有动力让模型服务于其他创业公司的特定需求。嘉宾以 Cursor 为例,认为其较早意识到这一点,并通过大规模后训练让 Cursor 本身成为环境来优化专用模型。

产品优化模型优化CursorClaude Code

环境与评测的统一

主持人追问“环境就是评测”这一说法,因为传统理解中环境包含状态、行动和状态变化,而评测只是检查答案是否正确。嘉宾回应说,一两年前很多评测确实更像问答题库,而传统 RL 环境则像 Atari 游戏中的长期状态交互。但现在二者正在融合:大规模训练环境可能模拟网页应用或完整编码平台,agent 在其中执行复杂任务;同时它仍然必须有目标和奖励机制,用来衡量进展和表现。因此,环境之所以像评测,是因为它不仅提供交互过程,也提供可度量的成功标准。

环境评测奖励函数状态交互

何时让应用本身成为环境

围绕 Cursor 的例子,主持人询问何时应构建独立 RL 环境,何时应让实际应用和应用状态本身成为环境。嘉宾认为两者都有合理场景:如果要训练一个优秀的 Rust 编码模型,可能需要多个覆盖不同领域任务的环境;如果公司希望模型擅长调用自家工具或领域语言,也可以围绕这些能力构建环境。对于面向终端用户、用户直接与 agent 交互的产品,产品本身往往最适合作为环境。许多先进 agent 公司已经在做模型选择、提示词评估和成本性能权衡,这些评估基础设施正好也是强化学习所需的基础设施。

应用环境编码模型模型评估系统优化

Harness、环境与后训练方法

最后一段讨论 agent harness 与强化学习的关系。嘉宾认为 harness 是环境的一部分,负责连接模型与系统中的其他组件;在编码 agent 中,CLI coding agent 可以被视为 harness,终端则可视为环境,但其他 agent 形态可能完全不同,例如系统提示词加工具、生成子 agent 的框架等。由于未来使用模型的方式会出现“寒武纪大爆发”,他们选择用更宽的“环境”作为抽象。随后嘉宾强调,环境不只服务于 RL,也可用于蒸馏、SFT、提示优化和模型 A/B 测试;每家 AI 公司都应该优化自己的 AI 系统。谈到后训练时,他们指出 RL 是当前大型模型后训练中最重要、最耗资源的部分之一,但并不是唯一方法。

Agent Harness强化学习后训练系统优化