Zapier’s Mike Knoop launches ARC Prize to Jumpstart New Ideas for AGI | Training Data
加载中...
点击任意话题卡片查看该时段的完整对话内容。
开场中,Knoop 先回应了关于超级智能风险与监管的总体立场。他认为当前关于“到达超级智能后会出现极坏结果”的叙事很大程度上是理论推演,而非建立在系统真实能力的经验证据上。因此,他主张政策制定应当观察 AI 系统实际能做什么、不能做什么,再据此监管和决策。若过早基于抽象恐惧限制技术,可能会提前切断许多潜在的积极未来。
主持人介绍 Knoop 是 Zapier 联合创始人,并近期共同创办和赞助 ARC Prize。Knoop 随后回顾 Zapier 是连接 6000 多个软件集成的工作流自动化平台,核心特点是让非技术用户也能让软件替自己完成工作。他指出这与 AI 的承诺高度一致:用户希望软件承担更多劳动。他早期关注 GPT-3,但真正触发他转向 AI 研究的是 2022 年初 Chain of Thought 论文,因为它显示语言模型不仅能补全文本,也能作为推理工具使用。
谈到 Zapier 最自豪的 AI 应用时,Knoop 说公司内部已有超过一半员工每天使用 AI,很多自动化流程会在中间加入 ChatGPT 步骤,用于内容生成、非结构化文本抽取等。他重点介绍 Zap 模板生成:过去模板需要人工兼顾创意表达和技术字段映射,承包商每天大约只能做 10 个。后来一名来自合作伙伴营销团队、具有自由写作背景的员工,用多个 Zap 和 OpenAI 搭建端到端系统,让 AI 自动构思、撰写并完成字段映射,人工改为审核输出,产能提升到每天约 1000 个。
在业务指标部分,Knoop 透露 Zapier 即将达到每月 1000 万个 AI tasks 的运行规模。他认为,在自动化 AI 平台这个意义上,Zapier 可能已经是世界上最大的例子之一。这里的重点不是单次聊天,而是 AI 在没有持续人工介入的自动化流程中运行。许多创业者和研究者正在构建 agentic AI 系统,而 Zapier 已经在实际业务场景中以巨大任务量运行类似能力。
访谈转向 ARC AGI。Knoop 说自己在 2022 年放下产品工程管理角色,是想亲自判断当前 AI 是否正走在通往 AGI 的路上。他研究后认为答案是否定的。随着 Zapier 深入构建 AI 产品,他开始关注评测,发现多数 AI eval 正快速接近或达到人类水平,但 2019 年 François Chollet 提出的 ARC 评测不仅没有被攻克,进展还在放缓。他也区分了两类 AGI 观念:一种认为 AGI 不可定义,另一种把 AGI 定义为能完成大多数经济有用工作;而 Chollet 的定义更根本,即“获得新技能的效率”。
Knoop 用游戏 AI 举例说明现有系统缺少一般智能:AI 可以击败人类下围棋、国际象棋、扑克或外交类游戏,但无法简单通过新数据训练就转向另一个游戏,研究者通常必须重新设计算法、架构和训练数据。人类则能在一两个小时内学会新纸牌或桌游并达到基本熟练。这种快速、有效获得新技能以完成开放式或新颖任务的能力,正是 ARC AGI 试图测量的内容。ARC 的任务完全新颖,并有未公开测试集,用来区分依赖记忆的狭义 AI 与能在测试时快速学习的系统。
在解释“效率”时,Knoop 指出 ARC 自 2019 年以来未被攻克,这本身就是其定义基础有价值的经验证据。他将效率理解为系统从核心先验知识出发,进入更广任务空间并解决新任务的能力。ARC 希望看到系统用少量核心知识先验,如目标导向、对象性、对称、旋转等,重新组合成新程序,以精确解决从未见过的任务。竞赛目标是 85%,录制时最先进水平约为 39%。他还解释 Kaggle 竞赛限制:不能联网,计算资源限制为一张 P100 运行 12 小时,因此不能调用 Claude、Gemini、GPT-4 等闭源前沿模型,目的是优先衡量效率。