AI 快讯谷歌内测Frozen v2芯片
行业快讯

谷歌内测Frozen v2芯片

2026-07-20T23:02:31.158Z
谷歌内测Frozen v2芯片

谷歌正研发面向 Gemini 推理的专用芯片 Frozen v2,目标是把单位功耗词元处理能力提升至现有自研 AI 芯片的 6 至 10 倍,最早或于 2028 年部署。

谷歌开始把 Gemini 的架构“刻进”芯片

谷歌正在内部推进一款代号为 Frozen v2 的服务器 AI 芯片,目标不是训练更大的 Gemini,而是用更低功耗、更短延迟运行已经训练完成的 Gemini 模型。

**Frozen v2 是一款针对 Gemini 底层模型架构定制的 AI 推理芯片。**据 The Information 报道并由 TechCrunch、IT之家 转述,这款芯片计划把 Gemini 的部分运算逻辑固化到硬件层面,预计每瓦可处理的词元数量达到谷歌现有自研 AI 芯片的 6 至 10 倍,最早可能在 2028 年投入部署。

这个数字如果最终兑现,意味着 Frozen v2 的单位功耗词元吞吐量将提高 500% 至 900%。但需要强调,6 至 10 倍指向的是“每瓦处理的词元数量”,不是单芯片峰值算力,也不等于所有 Gemini 请求的响应速度都会直接提升 6 至 10 倍。

谷歌尚未正式公布 Frozen v2,也没有披露制程、封装方式、显存容量、互连带宽、量产规模和实际基准测试结果。所谓“内部测试”目前更准确地理解为项目正在谷歌内部推进设计与功能验证,而不是已经出现可供外部评测的量产芯片;报道显示,工程团队仍在确定核心模块以及不同组件之间的协同方式。

Frozen v2、谷歌 TPU 与英伟达 GPU 在通用性和 Gemini 推理效率之间的定位示意图

Frozen v2 不是另一代 TPU

**AI 推理芯片是专门执行已训练模型前向计算、生成预测结果或词元的处理器。**训练关注如何用海量数据更新参数,推理则关注模型上线后每次回答需要多少计算、内存带宽、功耗和时间;对拥有数十亿用户入口的谷歌而言,后者往往是一笔长期且持续增长的成本。

Frozen v2 的关键不是单纯增加矩阵乘法单元,而是减少通用硬件为了兼容不同模型而保留的冗余路径。GPU 和 TPU 需要面对不同参数规模、算子组合、注意力结构、精度格式与并行策略,Frozen v2 则可以围绕 Gemini 的高频执行路径安排数据流、缓存、调度和计算单元。

这种差异类似于“可运行任意程序的服务器”与“只负责一种任务的流水线”。前者可以随时换工作,后者一旦确定工序,就能减少分支判断、中间搬运和资源闲置,从而提高每瓦完成的有效工作量。

| 维度 | 英伟达 GPU | 谷歌 TPU | Frozen v2(据报道) | |---|---|---|---| | 产品定位 | 通用并行加速器 | 面向机器学习的专用加速器 | 面向 Gemini 的高度专用推理芯片 | | 主要适配对象 | 多种 AI 模型及并行计算任务 | 多种 TensorFlow、JAX 及机器学习负载 | 与既定底层架构兼容的 Gemini 模型 | | 训练能力 | 强 | 强 | 报道重点为推理,训练能力未披露 | | 模型灵活性 | 高 | 较高 | 较低 | | 硬件定制深度 | 通用计算逻辑 | 固化张量计算能力 | 进一步固化 Gemini 运算逻辑 | | 已披露能效目标 | 因产品与负载而异 | 作为比较基准 | 每瓦词元数为现有谷歌自研 AI 芯片的 6 至 10 倍 | | 预期部署时间 | 已广泛部署 | 已广泛部署 | 最早 2028 年 | | 最大优势 | 软件生态与负载覆盖面 | 谷歌软硬件协同 | Gemini 推理能效与延迟潜力 | | 最大风险 | 成本与功耗较高 | 仍需兼顾多类模型 | 架构变化可能令芯片迅速过时 |

Frozen v2 因此更可能成为 TPU 的补充,而不是替代品。TPU 继续承担模型训练、实验以及更广泛的云端负载,Frozen v2 则适合承接规模稳定、调用量巨大、架构变化相对可控的 Gemini 在线推理任务。

这次不再把完整权重焊死

**模型权重是大模型从训练数据中学习得到、决定其输出行为的数值参数。**同一套基础架构可以通过更新权重获得不同知识、能力和行为,因此权重是模型迭代最频繁、也最不适合被永久固定的部分之一。

Frozen v2 与谷歌早期方案的核心差异,是不再尝试把完整模型权重直接蚀刻进芯片。报道称,最初的 Frozen 构想由谷歌 DeepMind 首席科学家 Jeff Dean 牵头,但完整固化权重意味着芯片只能服务某一个特定版本的 Gemini;模型一升级,昂贵的服务器芯片就可能失去价值,这个方案因此被搁置多年。

Frozen v2 选择固化相对稳定的架构逻辑,同时保留更新模型权重的能力。这个折中方案允许谷歌继续训练和部署新版 Gemini,只要新模型仍然遵循芯片支持的主要计算结构,硬件就不必随着每次权重更新而重新制造。

这里的“固化架构”不应被理解为把一个完整聊天机器人封装进硅片。更可能被硬件化的是稳定的数据流、算子融合方式、内存访问模式、张量形状以及注意力计算路径,而知识、对齐策略和多数模型能力仍由可加载的权重决定。

这也是 Frozen v2 比初代构想更现实的原因。完整权重可能数月就更新一次,而底层架构通常拥有更长的生命周期;谷歌真正押注的是,未来数代 Gemini 会继续使用一套足够相似的计算骨架。

6 至 10 倍能效可能从哪里来

**单位功耗词元吞吐量是芯片每消耗一瓦电力能够生成或处理多少词元的效率指标。**这一指标同时受到计算单元利用率、内存带宽、数据精度、批处理规模、模型结构和软件调度影响,比只看峰值浮点算力更接近大模型在线服务的真实成本。

Frozen v2 的主要收益很可能来自减少数据搬运,而不只是让乘法运算更快。大模型推理需要反复从高带宽内存读取权重,并在生成过程中持续维护 KV Cache;数据在内存、缓存和计算单元之间移动所消耗的能量,可能超过一次算术运算本身。

固定高频执行路径可以让芯片把更多晶体管用于 Gemini 真正需要的模块。谷歌可以针对常用张量尺寸设计计算阵列,围绕模型使用的精度安排数据通路,并把连续算子合并执行,以减少中间结果写回内存的次数。

专用调度还可能降低通用控制逻辑带来的浪费。GPU 为了兼容图形、科学计算和多种 AI 模型,需要保留复杂的调度与分支能力;如果 Frozen v2 已经知道大部分计算将按照什么顺序发生,就可以用更简单的控制逻辑换取更高利用率。

不过,6 至 10 倍仍然只是报道中的项目目标,而不是可复现跑分。谷歌没有说明测试使用哪一代 TPU 作为基线,也没有说明 Gemini 的具体版本、上下文长度、量化精度、并发量和输出长度;缺少这些条件,同一个“每瓦词元数”指标可能出现很大差异。

谷歌真正缺的不是峰值算力,而是可持续供应

谷歌启动 Frozen v2 的直接背景是 AI 算力供应紧张。报道称,内部资源短缺已经影响谷歌云承接部分外部客户订单,而 Gemini 搜索、Workspace、开发者产品和消费级应用还在持续扩大推理需求。

训练集群不足会拖慢新模型发布,但推理容量不足会直接影响每一天的产品供给。一次训练任务结束后,成本可以暂时停止;一次模型上线后,每个用户问题、每次摘要和每段生成内容都会继续消耗计算资源,用户规模越大,推理账单越难控制。

每瓦词元数因此比单卡峰值性能更接近谷歌的商业问题。假设完成同等推理工作原本需要 10 个功耗单位,理论上的 10 倍能效可以把芯片侧计算功耗压缩到 1 个单位;实际数据中心节省幅度不会同样达到 90%,因为冷却、网络、存储、CPU 和电源转换也在耗电,但总体拥有成本仍可能明显下降。

更高能效还可以缓解供电成为数据中心扩张瓶颈的问题。当前大型 AI 集群的限制不再只是能否采购芯片,还包括当地电网能否提供稳定电力、机房能否散热以及高带宽网络能否把数千颗芯片连接起来;当每个词元消耗更少电力,现有园区就能承载更多请求。

Frozen v2 对开发者最直接的价值不会首先体现为一块可以买到的芯片,而是 Gemini 服务的容量、延迟和价格空间。如果谷歌把专用硬件节省的成本传导到产品层,开发者可能看到更稳定的高峰期吞吐、更低的首词元延迟,或者更有竞争力的推理价格;但在官方公布商业方案前,这些都只是合理推演。

最大风险是 Gemini 自己变得太快

Frozen v2 的最大风险不是制造难度,而是软件架构在芯片投产前发生变化。从架构确定、流片、验证到数据中心部署,服务器芯片通常需要多年周期,而 Gemini 的模型结构可能在几个月内迭代一次。

如果后续 Gemini 从稠密 Transformer 大规模转向不同的混合专家结构,或者调整注意力机制、状态空间模块、稀疏计算方式与上下文缓存方案,Frozen v2 固化的执行路径就可能降低利用率。它不一定完全无法运行新模型,但原本预期的 6 至 10 倍优势可能被架构不匹配抵消。

2028 年这一时间点放大了上述不确定性。Frozen v2 即使按最早计划部署,也要面对两年后的模型需求,而当前 AI 行业尚未形成像 CPU 指令集那样稳定、可维持十年以上的模型架构标准。

谷歌目前需要决定“冻结到哪一层”。固化得越深,理论能效越高,但兼容范围越窄;保留得越灵活,芯片越能适应新 Gemini,能效优势却会逐渐靠近 TPU。这不是简单的工程优化,而是对未来模型路线的战略下注。

| 固化层级 | 潜在能效 | 升级灵活性 | 主要风险 | |---|---:|---:|---| | 完整模型权重 | 最高 | 极低 | 模型更新后芯片可能失效 | | 架构与核心运算逻辑 | 高 | 中等 | 只能兼容相近架构,Frozen v2 据称采用这一方向 | | 通用张量算子 | 中等 | 较高 | 与 TPU 定位接近,差异化有限 | | 通用 GPU 指令与计算单元 | 相对较低 | 最高 | 为兼容性承担更多功耗与控制开销 |

这也是谷歌对英伟达路线的一次侧击

Frozen v2 代表的不是“做一颗更强 GPU”,而是云厂商用自有模型反向定义芯片。英伟达的优势在于 CUDA、网络、系统和开发工具组成的通用平台,可以服务不同公司与不同模型;谷歌的优势则是同时掌握 Gemini、编译器、数据中心、云平台和终端入口,可以针对自己的稳定负载做更激进的垂直整合。

这种路线并不适合所有模型公司。只有当单一模型家族拥有足够大的长期调用量时,专用芯片节省的电力和服务器成本才可能覆盖研发、流片、验证与部署投入;中小模型厂商频繁更换架构,继续使用 GPU 或云端通用加速器通常更合理。

谷歌也不会因此摆脱英伟达或 TPU。模型研究需要快速试错,训练任务需要灵活扩展,谷歌云还要服务外部客户的多种模型,这些场景都不适合由 Frozen v2 独立承担;它更像是部署在推理流水线末端的一台“Gemini 专机”。

真正值得关注的竞争指标将从“谁的芯片峰值算力更高”转向“谁生成一个有效词元更便宜”。当基础模型能力逐步接近、推理调用量持续增长时,每百万词元背后的电力、折旧和网络成本会直接决定产品价格与免费额度,专用架构可能成为云厂商控制毛利率的关键工具。

Frozen v2 值得期待,但现在还不是胜利

Frozen v2 是一个方向正确、商业逻辑清晰,但技术风险同样很高的项目。谷歌拥有足够大的 Gemini 推理负载,也具备模型、编译器、芯片和数据中心全栈能力,因此它比多数公司更有条件通过牺牲通用性换取 6 至 10 倍的单位功耗效率。

目前最重要的信息仍然缺失。谷歌需要公布可比较的基准芯片、Gemini 版本、词元吞吐量、首词元延迟、稳态输出速度、功耗、上下文长度和部署规模,外界才能判断 Frozen v2 是一次真正的推理架构跃迁,还是只在特定负载下成立的实验结果。

这款芯片真正的考验也不在 2026 年,而在最早部署的 2028 年。届时如果 Gemini 仍沿用 Frozen v2 所押注的基础架构,谷歌可能获得一条难以被通用 GPU 复制的成本曲线;如果模型范式已经改变,“Frozen”这个代号也可能以另一种方式应验——被冻结的不是 Gemini,而是芯片自身的适用范围。

参考来源

相关推荐

查看全部