← 返回访谈列表

ARC-AGI-3 winning team 深度访谈

ARC-AGI-3 winning team - Millennia of minds, compressed into words.

8
话题段落
2423
字幕段落
84m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

语言、进化先验与智能问题

开场讨论了人类智能与 AI 的不对称性:人类拥有数百万年进化积累,因此要求 AI 算法从零完成同样能力有些“不公平”。嘉宾认为领域中的核心开放问题之一是语言是否对智能至关重要,并坦言自己在玩这些游戏时会使用语言思考。随后几位团队成员介绍背景,包括物理、数学、计算机科学、强化学习和数据科学等经历,并用人类几秒钟识别目标、智能体却误判能量条或区域踩踏次数的例子,说明 ARC-AGI-3 关注的是目标理解与泛化能力。

语言与智能人类先验团队背景目标理解

ARC-AGI-3 游戏形式与智能体失败模式

嘉宾介绍了 ARC-AGI-3 的基本任务形态:智能体看到 64x64、16 色像素帧,需要从初始画面中推断目标、可控对象、移动方式和游戏机制。以官方游戏 LS20 为例,模型可能已经理解要把两个东西对齐并走向出口,却在最后一步停住,因为它认为出口外不能移动;人类则会自然尝试一下。这段强调了基准的难点不只是视觉识别,而是从少量互动中推断规则、目标和可行动边界。

ARC-AGI-3游戏机制智能体探索失败案例

从大模型路线到预赛暴力搜索

主持人与嘉宾转向方法史。嘉宾承认当前构建智能系统的最佳配方仍是扩大大型语言模型,但也提到不建议个人从头训练 LLM。随后回顾预览赛方案:当时比赛目标是测试是否存在破坏基准设计的简单方案,而答案是可以通过暴力搜索动作空间实现。由于 ARC-AGI-3 有超过 4000 个动作,团队通过只保留会造成帧变化的动作、学习哪些动作在特定帧有效,并在 10 万动作限制内优化工程实现,最终完成了多个关卡。

大语言模型预览赛暴力搜索动作模型

正式赛硬化、行动效率与 LLM 引导探索

正式赛针对预览赛的漏洞进行了强化:游戏更难,无效但合法的动作也会推进计时条,更重要的是引入 action efficiency,使得超过人类基线两三倍的动作数就会接近零分。嘉宾解释,这让暴力搜索变得不可行,必须更直接地探索,LLM 因而变得有用。团队也尝试过把输入帧作为长序列上下文并直接预测动作的 transductive 方法,但泛化很差,也不符合人类解题时先理解路径、再批量执行动作的直觉,因此转向“coding agent”式方案,并借鉴了其他基于闭源模型的优秀结果。

行动效率LLM引导泛化编码智能体

Transductive、Inductive 与可读推理轨迹

这一段讨论当前方案到底是 transductive 还是 inductive。主持人指出,若推理只服务于当前测试实例,它接近 transduction;但若链式思考形成可复用理由、可进入记忆或库迁移,则更像 induction。嘉宾回应说,ARC-AGI-2 方案更 transductive,而当前方案稍微更 inductive,因为英文推理轨迹可被阅读,可看出模型何时理解游戏、何时没有进展。同时他指出,LLM 内部已有很多游戏先验,例如迷宫概念,即使基准试图去除先验,这些知识仍能帮助模型识别结构并指导行动。

归纳推理推理轨迹游戏先验可解释性

两周限制下的测试时训练与探索策略

嘉宾解释正式方案受两周参赛时间、公开和私有游戏数量极少等限制,因此必须避免过拟合。由于无法预训练,团队考虑沿用 ARC-AGI-2 的 test-time training 思路,但纯奖励强化学习并不合适,因为真实奖励主要来自关卡转换,而一旦过关就无法回到同一关反复优化。嘉宾曾尝试 curiosity、无监督 RL 和世界模型,让模型预测下一帧并探索预测不准的地方,但两周内未能实现。最终采用更简单假设:任何帧变化都值得探索,并通过 replay buffer、经验哈希和 prioritized experience replay 等工程手段让动作模型快速学习。

测试时训练强化学习探索奖励世界模型

抽象、程序化世界模型与神经引导搜索

主持人提出强化学习中的探索常显得表面化,只关注熵或变化,而 ARC 的愿景更接近抽象的获取与综合。嘉宾承认 stochastic goose 更像是在两周内最大化比赛表现,并不完全符合 ARC-AGI-3 理想解法;相比之下,团队另一侧的 duck 方向更接近原始愿景。该方向使用推理 token,用英文文本表达对象、机制、动态和目标等抽象,并生成可执行 Python 程序来提取信息、构建简化世界模型,再在该模型上运行搜索算法。这使系统从像素互动上升到对象和规则层面的表示。

抽象表示程序生成世界模型神经搜索

编码智能体、理解债与需求工程

最后一段转向编码智能体带来的工程组织问题。主持人提到 Claude Code 等工具默认甚至不显示代码,引出“理解债”:团队是否必须理解代码库中的深层抽象,才能构建心智模型并持续演化系统。嘉宾表示团队正在讨论这个问题,目前没有离散答案;他们发现某些非核心模块如 web viewer 可以更依赖 vibe coding,但核心逻辑、实现和评估必须深度理解。由于团队越来越难完全理解自己的代码库,他们开始更重视需求工程:先正式书写、编号和测试需求,团队评审后再交给 coding agent 实现,以提高可控性。

编码智能体理解债需求工程软件协作