7 月 21 日,外媒独家披露谷歌 Alphabet 内部代号 Frozen v2 的专用推理服务器芯片研发进展。这款芯片将 Gemini 底层模型架构直接固化至硅片,内部测试显示,单位功耗下 Token 处理效率达到现有顶级 TPU 的 6 至 10 倍,产品定向服务 AI 智能体高并发推理场景,计划 2028 年落地部署。消息传出后,Alphabet 盘中股价涨幅突破 3%,市场高度看好模型与芯片一体化设计带来的推理能效革新。
当前主流 GPU、TPU 采用通用可编程架构,能够兼容各类大模型,但运行过程中需要持续调度计算资源、频繁迁移内存数据。AI 智能体需要持续生成文本、高频调取上下文缓存,长期运行极易遭遇功耗偏高、推理延迟突出的 “内存墙” 难题。Frozen v2 采用差异化设计思路,并未将完整模型权重固化在硬件内,而是把 Gemini 体系复用频率最高的底层决策、解码运算通路蚀刻进芯片电路,从硬件层面削减计算步骤与数据传输开销。芯片以每瓦可处理 Token 数量作为核心衡量标准,而非单纯追逐峰值算力,高度适配智能体长上下文交互、不间断持续推理的负载特征。同时方案仅锁定标准化运算架构,保留模型权重迭代更新空间,弥补初代 Frozen 方案完全固化模型、硬件生命周期较短的短板。产品定位上,Frozen v2 不会取代第八代 TPU 承担模型训练与通用推理任务,谷歌由此形成双轨芯片布局:TPU 承接外部云客户多样化模型需求,Frozen v2 专供内部 Gemini 大模型、各类智能体、搜索、办公软件等高负载业务,两者形成互补协同。
本届 WAIC 释放明确信号,AI 产业正式迈入智能体规模化落地阶段,海量 Agent 多任务自主调度、云端高并发推理成为算力主要消耗来源,这也是谷歌加速推进 Frozen v2 研发的核心动因。面向企业级智能体与 C 端产品配套云端服务,该芯片可同时承载上万条长文本指令,持续支撑多轮交互;依托低功耗优势,显著降低算力集群供电与散热成本。现阶段谷歌自有搜索助手、办公智能体、多模态产品推理调用量持续攀升,算力缺口已经迫使谷歌云暂缓承接部分外部订单,专用推理芯片落地后能够有效补齐内部算力供给短板。此外,智能体执行跨平台多步骤任务高度依赖大容量上下文缓存,Frozen v2 从硬件层面优化内存读写链路,减少缓存反复搬运带来的额外功耗,持续压低智能体长期运行综合成本。
Frozen v2 项目曝光,标志全球 AI 芯片赛道分化出两条清晰路线,算力竞争重心由峰值算力比拼,转向推理能效、单 Token 运行成本的长期角逐。英伟达、AMD 坚守通用算力路线,GPU 整机方案兼顾训练、推理全场景,生态完善,但在智能体高频推理场景能效存在明显短板;谷歌选择模型深度定制路线,Frozen v2 与 Gemini 体系软硬协同,最大限度压缩推理单位成本,代价是通用性受限,仅适配自家模型生态。除此之外,SambaNova、d-Matrix 以及国内多款专用推理芯片均在推进模型硬件耦合路线,行业逐步形成共识:训练环节依旧依靠通用算力集群,大规模商业化推理场景将持续走向专用化芯片。
该芯片短期仍存在多重落地约束,项目目前处于架构设计阶段,最快 2028 年小规模投产,距离全面商业化尚有两年以上周期,短期内无法缓解全球算力紧张局面。同时产品适配范围有限,仅支持 Gemini 系列大模型,不能对外提供通用算力租赁,难以复刻 TPU 云业务带来的外部营收增量。研发团队持续调整硬件固化的模型逻辑边界,不断平衡运行效率与模型迭代灵活性,项目存在规划调整、缩减量产规模的可能性,谷歌官方也表示内部研发项目未必最终实现量产。拉长周期观察,若 6 至 10 倍能效提升能够成功量产兑现,AI 智能体、云端大模型服务的单 Token 成本将显著下行,加速 B 端、C 端智能体普及。一旦谷歌这套软硬协同方案得到验证,各大头部大模型企业将加速自研专用推理芯片,通用 GPU 在推理市场的份额持续承压。行业资本开支重心也将逐步转移,资源从训练集群持续流向推理专用硬件,匹配 AI 产业从模型训练走向商业化落地的周期切换。
总的来看,Frozen v2 是谷歌为破解智能体推理算力瓶颈打造的战略产品,跳出传统通用 TPU 设计框架,以牺牲通用性换取极致能效,精准契合 AI 行业告别参数内卷、推进智能体工业化落地的大趋势。短期芯片落地周期漫长,难以立刻重塑全球算力竞争格局;长期而言,项目印证软硬一体化定制是推理赛道重要突破方向,也将倒逼英伟达、AMD 加快推理专用芯片迭代,AI 算力行业竞争主线正式由训练算力竞赛,转向智能体推理能效的持续博弈。