← 返回访谈列表

Zapier’s Mike Knoop 深度访谈

Zapier’s Mike Knoop launches ARC Prize to Jumpstart New Ideas for AGI | Training Data

7
话题段落
1633
字幕段落
55m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

以能力事实而非神话制定 AI 政策

开场中,Knoop 先回应了关于超级智能风险与监管的总体立场。他认为当前关于“到达超级智能后会出现极坏结果”的叙事很大程度上是理论推演,而非建立在系统真实能力的经验证据上。因此,他主张政策制定应当观察 AI 系统实际能做什么、不能做什么,再据此监管和决策。若过早基于抽象恐惧限制技术,可能会提前切断许多潜在的积极未来。

AI治理超级智能经验主义政策制定

Zapier 的自动化使命与 AI 汇合

主持人介绍 Knoop 是 Zapier 联合创始人,并近期共同创办和赞助 ARC Prize。Knoop 随后回顾 Zapier 是连接 6000 多个软件集成的工作流自动化平台,核心特点是让非技术用户也能让软件替自己完成工作。他指出这与 AI 的承诺高度一致:用户希望软件承担更多劳动。他早期关注 GPT-3,但真正触发他转向 AI 研究的是 2022 年初 Chain of Thought 论文,因为它显示语言模型不仅能补全文本,也能作为推理工具使用。

Zapier工作流自动化非技术用户思维链

内部 AI 自动化带来百倍效率

谈到 Zapier 最自豪的 AI 应用时,Knoop 说公司内部已有超过一半员工每天使用 AI,很多自动化流程会在中间加入 ChatGPT 步骤,用于内容生成、非结构化文本抽取等。他重点介绍 Zap 模板生成:过去模板需要人工兼顾创意表达和技术字段映射,承包商每天大约只能做 10 个。后来一名来自合作伙伴营销团队、具有自由写作背景的员工,用多个 Zap 和 OpenAI 搭建端到端系统,让 AI 自动构思、撰写并完成字段映射,人工改为审核输出,产能提升到每天约 1000 个。

企业效率AI工作流人机协作模板生成

Zapier 成为大规模自动化 AI 平台

在业务指标部分,Knoop 透露 Zapier 即将达到每月 1000 万个 AI tasks 的运行规模。他认为,在自动化 AI 平台这个意义上,Zapier 可能已经是世界上最大的例子之一。这里的重点不是单次聊天,而是 AI 在没有持续人工介入的自动化流程中运行。许多创业者和研究者正在构建 agentic AI 系统,而 Zapier 已经在实际业务场景中以巨大任务量运行类似能力。

AI任务规模自动化平台Agentic AI业务指标

创办 ARC Prize 的动机与 AGI 定义之争

访谈转向 ARC AGI。Knoop 说自己在 2022 年放下产品工程管理角色,是想亲自判断当前 AI 是否正走在通往 AGI 的路上。他研究后认为答案是否定的。随着 Zapier 深入构建 AI 产品,他开始关注评测,发现多数 AI eval 正快速接近或达到人类水平,但 2019 年 François Chollet 提出的 ARC 评测不仅没有被攻克,进展还在放缓。他也区分了两类 AGI 观念:一种认为 AGI 不可定义,另一种把 AGI 定义为能完成大多数经济有用工作;而 Chollet 的定义更根本,即“获得新技能的效率”。

ARC PrizeAGI定义AI评测François Chollet

ARC 衡量测试时快速泛化能力

Knoop 用游戏 AI 举例说明现有系统缺少一般智能:AI 可以击败人类下围棋、国际象棋、扑克或外交类游戏,但无法简单通过新数据训练就转向另一个游戏,研究者通常必须重新设计算法、架构和训练数据。人类则能在一两个小时内学会新纸牌或桌游并达到基本熟练。这种快速、有效获得新技能以完成开放式或新颖任务的能力,正是 ARC AGI 试图测量的内容。ARC 的任务完全新颖,并有未公开测试集,用来区分依赖记忆的狭义 AI 与能在测试时快速学习的系统。

泛化能力测试时学习新颖任务基准测试

效率、85% 目标与竞赛限制

在解释“效率”时,Knoop 指出 ARC 自 2019 年以来未被攻克,这本身就是其定义基础有价值的经验证据。他将效率理解为系统从核心先验知识出发,进入更广任务空间并解决新任务的能力。ARC 希望看到系统用少量核心知识先验,如目标导向、对象性、对称、旋转等,重新组合成新程序,以精确解决从未见过的任务。竞赛目标是 85%,录制时最先进水平约为 39%。他还解释 Kaggle 竞赛限制:不能联网,计算资源限制为一张 P100 运行 12 小时,因此不能调用 Claude、Gemini、GPT-4 等闭源前沿模型,目的是优先衡量效率。

计算效率核心先验Kaggle竞赛模型限制