← 返回访谈列表

Watching America Run Away With AI 深度访谈

Watching America Run Away With AI - Alistair Pullen (Cosine AI)

9
话题段落
1669
字幕段落
55m
对话时长
-
核心金句

📋 访谈摘要

加载中...

📖 话题详览

点击任意话题卡片查看该时段的完整对话内容。

开场预告与访谈背景

开场以快速剪辑呈现访谈核心冲突:Fable 被禁引发主权 AI 焦虑,Cosine 获得建设英国主权 LLM 的授权,同时外界质疑其如何以百万级资源对抗美国公司的十亿级投入。预告还点出模型训练风险、互联网级数据压缩、智能体工具链变化、美国 AI 加速带来的欧洲落后感等主题。随后主持人与 Alistair 在伦敦见面,交代地点位于 Hoxton 和 Shoreditch,距离 Cosine 最初在创始人公寓起步的地方不远。

访谈开场主权AICosine背景AI竞争

Cosine的定位转变

Alistair 介绍 Cosine 是一家位于英国的前沿实验室。三个月前,公司主要开发面向高度监管和高安全环境的顶级代码智能体,客户场景包括金融服务、保险和国防等。近期,公司获得了建设英国首个某种意义上的主权语言模型的任务,这比此前业务规模更大、目标更具雄心。主持人随后把话题引向 Fable 被禁与出口管制,指出这一事件让很多人突然意识到主权 AI 的重要性。

公司定位代码智能体高监管行业英国LLM

Fable事件与主权AI契机

Alistair 说明,Cosine 能参与主权 AI,与公司长期积累的模型训练、模型构建、基础设施、算法和数据团队能力有关。约九到十周前,公司获得英国政府主权 AI 单元支持,得到布里斯托尔 Isambard 超算集群的算力分配。这一资源让一家创业公司有能力认真考虑建设主权模型,因为训练此类模型通常会消耗融资中很大一部分资金。虽然 Cosine 仍会使用部分私有算力,但主体训练将在 Isambard 上完成。Alistair 也强调,这并非年初计划中的事情,而是现有能力与政府资源结合后被打开的新方向。

Fable被禁政府支持算力分配Isambard

百万级资金挑战十亿级投入

主持人提出核心质疑:美国公司拥有数百亿美元级资源,Mistral 也有十亿级融资,Cosine 如何用百万级资金做类似事情。Alistair 回答说,关键在于 Cosine 不是推理服务公司。其客户多在高安全、隔离环境中部署模型,要么直接拿模型权重在自有 GPU 上运行,要么在已有云环境中租用 GPU。因此 Cosine 通过授权技术获利,而不是靠 token 推理赚差价,也不需要像美国公司那样投入巨额资金建设推理数据中心。他承认训练仍需要大量算力,但项目范围被严格限定,并存在 RL 规模、生成数量和推理时计算等方面的取舍。

商业模式推理成本模型授权训练权衡

客户反馈驱动的窄范围模型

在承认资源有限之后,Alistair 强调项目之所以可行,是因为 Cosine 把范围限定得很窄,并且让英国一些大型公司直接提供用例和期望能力。这些企业需求会进入模型训练过程,使模型更贴近实际部署场景,而不是试图构建一个完全泛化、面向所有人的通用模型。主持人随后指出,Mistral、Cohere 等模型还未真正达到前沿闭源模型水平,中国模型也只是最近才开始显得更有竞争力,由此引出模型性能差距的根源问题。

企业用例窄域模型反馈循环模型竞争力

前沿模型差距的三要素

Alistair 将追赶前沿模型的关键概括为三个方面:架构与原始模型规模、活跃参数数量、数据。他以 Mistral Large 3 的 675B 稀疏模型为例,认为其架构可能服务于企业可部署的 GPU 配置,这种务实限制会压低模型性能上限。他还提到一篇通过延迟、开放权重模型和 Vertex 等线索推断 Claude Sonnet、Opus 规模的分析文章,称这影响了 Cosine 主权模型的架构决策。根据该分析,Sonnet 可能有 1.3 到 1.5 万亿总参数、1000 亿以上活跃参数,Opus 可能更大。Fable 的规模则因上线时间太短无法判断,但市场曾流传 10 万亿参数的说法。

模型架构活跃参数Claude模型规模

开源模型与推理部署约束

Alistair 继续解释,DeepSeek V4 Pro 等模型虽然总参数可达约 1.6 万亿,但活跃参数可能只有 300 到 500 亿。他认为这类架构选择很大程度上服务于推理可行性:如果模型需要两节点 B300 级硬件才能装入显存并保持合理吞吐,实际可用人群会大幅缩小。相比闭源实验室能集中拥有大量 GPU,并通过高需求保持利用率,开源或自部署用户更关心硬件闲置成本。因此,无论中国、欧洲还是美国开源模型,都受到部署成本与推理配置的现实约束,难以轻易达到闭源性能。

开源模型推理部署GPU成本DeepSeek

数据、后训练与RL规模

在数据层面,Alistair 认为大型实验室具备优势:它们能从数据经纪商采购大量数据,也拥有成熟的内部数据团队。预训练语料在达到约 30 万亿 token 级别后,各家可能都覆盖了大部分互联网,差异未必巨大;中训练也类似。真正有区分度的是后训练数据和大规模 RL。Cosine 因擅长代码,曾与一些实验室合作过后训练数据,观察到它们对数据格式和使用场景有非常具体的采购需求。主持人插入 Notion 广告后,也提到接下来会讨论 Alistair 对 RL 训练重要性的看法。

训练数据后训练强化学习数据工程

MOE与稠密模型的取舍

主持人追问 MOE 是否只是推理速度取舍,还是因因子化带来结构性优势。Alistair 表示,如果能现实地运行万亿参数级稠密模型,他认为稠密模型会更好,MOE 主要仍受推理成本驱动。他举小规模例子比较 GPOSS 12B 与 Devstral 2 123B:前者约 50 亿活跃参数,后者接近 1200 亿活跃参数,尽管架构不同,但在客户部署和代码智能体体验中,Devstral 明显更好。他借此强调,每 token 的活跃参数数量会显著影响模型的主观体验和任务产出。

MOE稠密模型活跃参数代码智能体