← 返回访谈列表

When millions of 深度访谈

When millions of AI agents meet

7
话题段落
1155
字幕段落
42m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

从语言模型到智能体

开场介绍了 AI 助手概念的变化:过去用户向大语言模型提问并获得回答,但模型不能真正代替用户执行任务。随着智能体的发展,系统开始具备在环境中行动的能力。嘉宾解释说,智能体并不是新概念,早在强化学习和 3D 模拟环境中就存在;当前的区别在于,大语言模型被放入一个能调用工具、执行动作的“外壳”中。相比单次问答,智能体可以观察世界状态、制定计划,并将多步骤任务串联起来完成,但对敏感或高风险动作仍需要人类批准。

智能体定义大语言模型自主行动人类审批

智能体的用户体验与工具调用

这一段讨论普通用户与智能体互动时的体验差异。嘉宾指出,交互界面与聊天式语言模型仍然相似,因为底层仍有语言模型,但用户的角色会更像决策者和审核者。主持人以筹备婚礼为例说明,语言模型可以列出餐饮商和场地建议,但用户仍需自己发邮件、协调流程;智能体则可在获得权限后调用 Gmail 等工具,起草邮件、发送信息或购买票务。嘉宾同时强调,工具调用带来效率,也带来出错风险,因此用户仍需验证智能体生成和执行的内容。

工具调用用户体验任务自动化权限管理

当前优势:编程与人类监督

嘉宾表示,目前整个行业最集中投入的智能体能力是编程,因为许多形式化流程可以被表达成软件或代码。编码智能体已经在内部和外部被使用,能加速软件开发,让人类把注意力更多放在想法、设计和高层决策上,而不是重复性的样板实现。不过,嘉宾强调智能体并非不能做某些事,而是它们做任何事都不是 100% 准确。任务越复杂,失败率越高,错误可能明显也可能非常隐蔽。因此,人类不仅要在流程中保留审批位置,还要保持警觉,避免因连续成功而产生自动化偏误。

编程智能体软件开发自动化偏误人类监督

长期影响与科学目标

主持人追问智能体是否会彻底改变人类使用 AI 的方式。嘉宾回答说,深层颠覆几乎不可避免,但具体形态仍在形成中。AI 正进入过去难以进入的领域,例如科学研究和数学,虽然问题远未全部解决,人类仍有重要作用,但变化速度明显快于传统工业革命,令人需要谨慎应对。谈到为什么要建设智能体,嘉宾给出个人目标:推动科学、改善健康与人类福祉。他认为,如果能安全地让智能体自主完成复杂任务,同样的人类输入就能推动更多事情发生,从而加速进步。

长期变革科学进步人类福祉技术转型

自动化科学与人类角色

嘉宾进一步说明智能体与科学研究的关系。他认为,科学不仅是短时间内提出想法并推理,也包括实验设计、执行、反馈分析和闭环迭代。当前语言模型已能作为科学合作者,帮助推导和形式化工作,但要更大程度自动化科学,还需要自主研究实验室等基础设施。智能体未来可能安排实验、观察结果并分析反馈,但材料设计、生物技术等真实世界接口需要严密保障措施。嘉宾也指出,现有系统还不是 AGI,主要是在复现和组合人类已有技能,尚未展现出无人类会想到的深层科学突破,因此人类仍有大量角色。

自动化科学实验室智能体安全协议人类角色

智能体为何现在才普及

这一段解释智能体概念长期存在却近期才被大众接触的原因。嘉宾说,早期智能体已经用于数据中心优化、交易算法等狭窄任务,但它们没有语言接口,用户无法自然沟通、学习、影响或引导它们,因此更像传统软件。如今基于语言模型的智能体之所以不同,是因为人类可以用语言与其交互并进行控制。对于为什么全面个人助理仍未到来,嘉宾认为瓶颈已不只是底层模型能力,还包括如何协调、编排和管理智能体。由于模型仍会幻觉,系统需要声誉追踪、持续验证和能承认幻觉存在的工作流设计。

语言接口编排管理信任机制幻觉问题

委派、协作与多智能体失败管理

最后一段转向委派机制。嘉宾说明,复杂任务往往需要被拆分成多个部分,单个智能体未必能独立完成所有环节,因此一个智能体可能通过智能体到智能体协议,把部分工作交给更专门的智能体。委派并不只是并行运行多个智能体,还需要识别哪些智能体可靠、具备什么能力、是否可以认证,并防范恶意交互。嘉宾用大型活动筹备类比:预订会失败、物品会延迟、事故会发生,因此委派者必须管理延迟、失败和问题升级。目前许多多智能体系统更像简单并行化,而非真正具备智能分工和责任管理的委派框架。

任务委派多智能体系统可靠性认证失败管理