← 返回访谈列表

How Open Source Became AI's Backbone 深度访谈

How Open Source Became AI's Backbone | Inferact with a16z

9
话题段落
1250
字幕段落
45m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

开场预告:开放权重与推理基础设施

开场剪辑提前抛出访谈的核心问题:如果 GPU 成本大幅下降,开源 AI 是否会重新获得更大优势;如果内容审核长期无法彻底解决,用户可能更倾向开放方式,因为可以自己控制 guardrail。随后嘉宾提到 VLLM 在 AI 技术栈中的位置,它是推理引擎,类似数据库或操作系统这样的关键软件,用来支撑 AGI 应用。片段还点出 VLLM 与 Nvidia、AMD、Google 等芯片厂商的关系,以及开放权重模型在速度档位和部署控制上的灵活性。

开放权重VLLM推理引擎GPU成本

VLLM 的起源与 LLM 服务难题

主持人介绍 Simon Mo 是 Infact 联合创始人、VLLM 的核心维护者,VLLM 目前在任意时刻运行于约 50 万张 GPU 上。随后话题回到 2022 年、ChatGPT 之前,VLLM 团队最初只是想让一个缓慢的开源演示变快,却发现 LLM 服务背后有大量未解决的系统问题。Simon 解释,大语言模型服务与传统 ML 工作负载根本不同,因为它依赖 GPU 或 TPU 等加速器,计算密集,并要求每个请求都能快速、经济地返回结果;这涉及输入长度分布、非确定性输出、批处理和调度等推理引擎核心问题。

LLM服务系统工程GPU推理批处理调度

从早期开源模型到专用硬件需求

Matt 回顾早期 AI 模型生态时指出,开源一度是 AI 模型的默认形态,甚至 OpenAI 早期也比现在开放得多。那时前沿模型经常以开源或开放权重方式发布,开发者大多能在已有硬件上运行。Simon 补充,ResNet 已经需要 Nvidia K80 等 GPU 才能高效运行,而 BERT 则让语言任务更明显进入“必须用 GPU 才有实际效率”的阶段。Matt 进一步回忆 Hugging Face 上大量 BERT 变体的时代,强调随着模型变大、内存和计算需求上升,VLLM 这类软件从一开始就瞄准了普通开发者无法轻易自行解决的运行问题。

BERTResNetHugging Face模型演进

开源 AI 成为关键基础设施

主持人追问 VLLM 何时从受欢迎的开源项目变成关键基础设施。Simon 将这一变化与“开放前沿智能”联系起来,认为关键节点出现在 2023 年左右,当 GitHub Copilot 和 ChatGPT 成为人们日常生产力中不可或缺的工具时,开放权重模型也开始成为日常应用背后的基石。Matt 从创业公司角度补充说,虽然闭源模型在总体使用上仍更普遍,但大约一年前,许多应用公司开始意识到,如果不想只是做 OpenAI 的 wrapper,就必须采用开源模型,以便进行中训练、后训练、推理和部署优化。Cursor、Decagon、Harvey 等应用层公司都体现了这种趋势。

关键基础设施AI应用创业公司闭源依赖

VLLM 在 AI 技术栈中的位置

谈到大型企业使用开源模型时,Simon 明确说明 VLLM 是推理引擎,它的任务是把可用 GPU 转化为运行智能服务的端点。因此它类似数据库或操作系统,是支撑 AGI 经济的重要基础软件。VLLM 帮助用户获得成本效率、可靠性和前沿模型支持,目前已支持超过一千种模型架构。Simon 还介绍了“day zero model release”的流程,即新模型架构从研究原型转为开放权重发布时,VLLM 能在发布初期迅速支持。它也与 Nvidia、AMD、Google、Amazon、Intel 等硬件厂商合作,很多新芯片会用 VLLM 作为运行和性能基准。

VLLM架构模型支持硬件生态Day Zero发布

开放模型发布背后的多方协作

主持人提到模型发布背后不仅有技术工作,也有很多人与组织之间的协调。Simon 描述这是一个有趣的协同设计过程:模型实验室的研究者完成模型后,最大问题变成如何让全世界高效使用。有些实验室已经在研究或 RL 流程中使用 VLLM,甚至会直接提交代码;另一些实验室则缺少系统工程能力,需要 VLLM 团队协助适配开放权重生态。一个模型发布通常涉及模型实验室、硬件厂商、VLLM、Hugging Face、推理云、超大规模云厂商和多个发布伙伴。Simon 以 Mistral 早期通过 torrent 发布模型为例,说明当时团队在周末紧急支持 VLLM,帮助社区更容易运行和构建。

模型发布生态协作MistralHugging Face

开放权重的政策与生态意义

访谈转向近期围绕开放模型和蒸馏的行业讨论。主持人提到 Infact 签署了 Nvidia open weights and American AI leadership letter,签署方还包括 a16z、Meta、Amazon 等公司。Simon 解释,Infact 想明确支持开放权重在生态中的重要性:世界不能只由专有 API 控制,开放权重、开放开发和模型研究不应被阻断或禁止。虽然推理引擎处在预训练和 RL 之后的下游位置,但它是模型真正接触世界的地方。Simon 强调,他们看到开发者和企业能够借助开放权重模型有效实现自己的想象力和产品能力。

开放权重政策专有APIAI领导力开放生态

成本、控制与企业采用开源的原因

Matt 将企业采用开放权重的动因分为成本和控制两类,并询问二者的相对重要性。Simon 表示,过去几年控制始终重要,而成本在最近几个月变得更突出,例如企业想迁移出昂贵的编码计划,或控制快速上涨的 token 支出。但控制不仅是控制成本,也包括控制性能、延迟、SLA 和系统可观测性。语音代理公司需要确保模型按要求时间响应,这往往只有在自控模型和硬件环境中才能做到。随后 Simon 以 Kimi K3 为例说明,开放模型不总是最便宜,但它把接近前沿的智能带到用户自己的基础设施中,使用户能够微调、测量 token 需求、理解性能曲线,并提供比闭源模型更多速度档位,同时增强数据保留、安全和合规控制。

成本控制性能SLAKimi K3数据合规

性能校准与用户实践的引入

在这一段的结尾,主持人把讨论进一步推进到用户如何在后端校准速度和其他系统参数,并询问哪些用户在这方面做得聪明。Simon 开始回答说,他们确实看到用户能够获得相关收益,但字幕在此处截断,尚未展开具体案例。这个过渡表明,访谈接下来将从开放权重的战略意义进入更具体的推理优化实践,包括不同速度档位、后端配置和用户如何利用基础设施能力形成产品优势。

性能校准用户实践推理优化产品差异化