Ilya Sutskever (OpenAI Chief Scientist) — Why next-token prediction could surpass human intelligence
加载中...
点击任意话题卡片查看该时段的完整对话内容。
访谈开场介绍 Ilya Sutskever 是 OpenAI 联合创始人兼首席科学家,主持人先询问他为何能在领域内多次做出突破。Ilya 将原因归结为极度努力和全力投入。随后话题转向 GPT 的非法用途,主持人问为何没有更多外国政府用它传播宣传或诈骗。Ilya 表示不能排除这类事情已经发生,尤其开源模型可能被尝试用于这些目的;他也认为大规模追踪技术上可行,但需要专门行动。
Ilya 认为,在达到 AGI 之前,AI 会有一个持续多年的经济价值窗口,而且价值会逐年以接近指数方式增长;事后回看,人们可能觉得只有一两年特别关键,因为后期年份的增量远大于早期。他将创业公司可利用的窗口等同于距离 AGI 的时间,但拒绝给出具体数字,并以自动驾驶作类比:系统看似什么都能做,但可靠性、鲁棒性和行为稳定性仍需大量工作。他认为如果到 2030 年 LLM 的经济影响令人失望,最可能原因是可靠性不足。
主持人询问生成式模型之后是否还会有新范式,Ilya 表示当前范式会走得非常远,不应被低估,但最终 AGI 形态可能不是完全相同的形式,而会整合过去不同思想。针对 next-token prediction 只能模仿人类、无法超越人类的说法,他明确提出挑战。他解释,预测下一个 token 并非简单统计,而要求模型理解产生文本的底层现实,包括人的思想、情感和行为机制。因此,一个足够聪明的网络或许能从普通人的数据中外推出更有洞察力、更有能力的人会如何行动。
谈到强化学习数据来源时,Ilya 说明当前 RLHF 中多数强化学习数据已经由 AI 生成:人类反馈主要用于训练奖励函数,之后奖励函数与模型自动交互产生训练数据。对于是否能完全移除人类、像 AlphaGo 那样自我提升,他认为方向上可行,但理想状态不是 100% AI,而是人类教师与 AI 协作,例如人类做 1% 工作、AI 做 99%。关于多步推理,他认为模型在不能“想出声”时表现较差,但允许链式表达时已经相当不错,未来会通过专门训练和更强基础模型继续改善。
Ilya 承认训练大模型终有一天会耗尽可用 token,因此需要在没有更多数据的情况下继续提升模型能力、打磨行为并让模型更精确地执行人类意图。但他同时表示当前数据状况仍然良好,还有大量文本可用。谈到最有价值的数据,他认为通常应选择谈论更聪明、更有趣内容的 token,书籍、论坛和社交平台等不同来源都有价值。对于是否必须转向多模态,他认为纯文本仍能走很远,但多模态是非常有成果潜力的方向。算法改进能带来多少数量级提升,他表示只能通过实践确定。
在快速评价研究方向时,Ilya 认为 retrieval transformers 看起来有前景。谈到机器人,他解释 OpenAI 当年停止机器人研究是正确决定,因为当时机器人数据太少,若要做下去就必须成为一家大规模机器人公司,负责建造和维护大量实体机器人,而即便有 100 台机器人也难以获得足够数据。如今他认为机器人方向可以建立前进路径,但需要投入成千上万甚至更多机器人,逐步收集数据、提升任务实用性,并解决大量物理与物流问题。对于硬件,他表示当前硬件不是根本限制,虽然更便宜或更高带宽会更好。
Ilya 认为 AI 对齐不太可能获得一个单一数学定义,更可能是多个从不同侧面刻画对齐的定义共同提供保障,包括行为测试、一致性检查、对抗压力场景,以及观察神经网络内部运行。模型越强,发布前所需信心越高,而 AGI 本身也是模糊概念。他强调,对齐需要多种方法组合:投入大量算力做对抗性搜索,寻找目标行为与实际行为的偏差;用另一个神经网络理解大模型内部;并让对齐水平提升速度快于能力提升。他也承认当前模型理解仍很初级,未来或许需要一个小而可理解的网络来研究和验证大型网络。
主持人询问何时大多数 AI 研究由 AI 完成,Ilya 以 Copilot 和未来 ChatGPT 后代为例,认为模型可为研究者提供有价值的想法和洞见,帮助突破研究瓶颈。关于对齐研究的十亿美元奖项,他倾向于事后评定:等待两到五年回看哪些成果真正关键,而不是立即由委员会判断。谈到 OpenAI 收入预测,他说公司根据 GPT-3 API、DALL-E 和 ChatGPT 的实际增长数据进行外推。最后,关于 AGI 后生活,他认为人类意义会成为难题,但 AI 可帮助人更清楚地看世界、变得更“开悟”;有些人可能选择成为部分 AI,以扩展心智并解决未来社会难题,而 3000 年的世界无法被当下具体决定。