Google Frozen v2芯片:当AI模型被“固化”到硅片中
2026年7月20日,The Information的一篇报道在AI硬件行业投下了一颗重磅炸弹。Google正在开发一款代号为“Frozen v2”的服务器芯片,将Gemini模型的架构直接嵌入硅片电路中。消息传出后,Alphabet股价盘中一度上涨3.7%,收盘仍维持1.51%的涨幅。资本市场用真金白银表达了对这条消息的判断:AI推理的硬件范式正在发生根本性转变。
这不仅仅是Google自己的事。Frozen v2代表着一个更深层的行业趋势——从通用计算走向模型专属硅片,从“一个芯片跑所有模型”走向“一个模型拥有一块芯片”。通肯智能(TOKEN 导航)在跟踪AI基础设施演进的过程中注意到,这一趋势正在以超出预期的速度从概念走向工程现实。
Frozen v2到底是什么
要理解Frozen v2的本质,先要理解“Frozen”这个名字的来源。在AI模型训练中,“冻结”(freeze)指的是固定模型中某些参数使其不再更新。Frozen v2将这个概念推到了极致:它不是冻结模型的权重参数,而是将Gemini模型的架构结构永久性地固化到芯片的物理电路中。
这个区分至关重要。AI模型由两个层面组成:架构(architecture)和权重(weights)。架构决定了模型的计算图——注意力机制如何连接、层与层之间如何传递数据、梯度如何流动。权重则是模型训练完成后学到的具体参数值,通常以数十亿甚至数万亿的浮点数表示。
Google DeepMind首席科学家Jeff Dean最初提出的Frozen方案,计划将权重直接嵌入芯片。这意味着芯片只能运行某一个特定版本的Gemini——模型一旦更新迭代,芯片就变成废铁。这个方案很快被否决。Frozen v2转向了一个更聪明的折中:固化架构,保留权重的可更新性。芯片知道“怎么算”,但不知道“算什么”——后者通过加载新权重来实现。
根据目前的信息,工程师们还在决定具体要固化多少架构。这是一个需要精确拿捏的平衡:固化得越多,效率提升越大,但灵活性越低;固化得越少,芯片的通用性越好,但效率优势会被稀释。
三条路线的对比:GPU、Frozen芯片与晶圆级芯片
要理解Frozen v2的意义,必须将它放在当前AI硬件的三条技术路线中进行对比。
路线一:Nvidia的通用GPU路线。H100/H200/Rubin系列GPU的核心优势在于通用性。它们可以加载和运行任何AI模型,通过CUDA生态和成熟的软件栈支撑从训练到推理的全流程。但这种通用性是有代价的:每运行一个模型,GPU都需要从头计算该模型的架构需求——调度指令、分配内存、确定数据流路径。这些“运行时开销”在通用芯片上无法避免。更关键的是,现代AI推理的核心瓶颈不是计算本身,而是数据移动。一次片外内存访问消耗的能量,大约是算术运算本身的100倍以上。GPU必须不断在片上缓存和外部HBM之间搬运数据,这种频繁的数据搬运构成了推理能耗的主要来源。
路线二:Google的Frozen芯片路线。Frozen v2通过固化架构,从根本上减少了运行时开销。芯片不需要在推理时“理解”模型的计算图——正确的数据路由已经物理性地内置在电路中。多个在通用芯片上需要分开执行、各自访问内存的计算步骤,可以融合为一个硬件原语:芯片在一次操作中完成整个复合运算,只写入最终结果,完全跳过中间值的搬运。这种技术在软件层面叫做“算子融合“(operator fusion),但Frozen v2将其永久烧制进了硅片。此外,因为芯片完全围绕Gemini的特定架构设计,理论上可以配备恰好足够的片上内存来承载整个模型,几乎彻底消除推理过程中的片外数据搬运。
路线三:Cerebras的晶圆级芯片路线。Cerebras的WSE-3(Wafer Scale Engine 3)走了一条完全不同的路。它将整个300mm硅晶圆做成一个单一处理器,集成90万个AI核心和44GB片上SRAM。WSE-3的核心优势是消除了芯片间通信瓶颈:所有核心通过片上互联网络连接,延迟在纳秒级别,带宽达到220Pb/s。这在超大规模模型训练中价值巨大,因为传统GPU集群需要通过NVLink、InfiniBand等网络连接数百块GPU,通信开销显著。Cerebras声称单个CS-3系统可以替代24个服务器机架的GPU集群。但WSE-3本质上仍然是通用的AI加速器——它运行任何你加载的模型,只是在规模和互联上做到了极致。
三条路线的本质区别在于:GPU追求通用性,Cerebras追求规模和互联的极致,而Frozen v2追求的是模型-硬件的深度耦合。Frozen v2不试图跑所有模型,也不试图做得更大,它要做的是一件事并且做到极致。
6到10倍能效提升的背后
Frozen v2工程师团队预计的6到10倍能效提升(以每瓦特产生的token数衡量),是目前AI推理芯片领域已知的单代效率飞跃中最大的之一。这个数字是怎么来的?
现代AI推理的能耗主要由三个部分构成:计算(矩阵乘法等浮点运算)、数据搬运(在片上缓存、HBM和DRAM之间移动模型权重和中间激活值)、以及调度开销(芯片在运行时解析指令、分配资源、决定数据流路径)。在通用GPU上,这三者都是显著的能耗来源。
Frozen v2通过三层优化来压缩能耗。第一层:架构固化消除了调度开销。通用芯片在每次推理请求时都需要从头解析模型的计算图并动态调度计算资源。Frozen v2将这些决策物理性地内置到电路中,不再需要运行时调度。第二层:算子融合减少了数据搬运。通用芯片上,相邻的计算步骤必须分别从内存中读取数据、执行计算、再写回内存。Frozen v2将多个步骤融合为一个硬件原语,中间结果直接在芯片内部传递,不需要写回内存再重新读取。第三层:潜在的片上全模型驻留。因为芯片完全围绕Gemini的架构定制,可以配备精确匹配模型规模的片上存储,将“片外内存访问比片上运算能耗高两个数量级”的问题从根本上解决。
这三者叠加产生的效率优势,与比特币挖矿从CPU到GPU再到ASIC的演进路径高度相似。比特币挖矿在2010年代经历了从CPU到GPU到专用ASIC的转变,每一步都伴随着效率的量级提升。AI推理可能正在走同一条路——训练仍然需要GPU的灵活性,但一旦模型进入生产阶段,优先级就从“能跑任何模型”转向“用最少的电跑最多的请求”。
灵活性的代价:模型升级等于芯片更换
Frozen v2最大的风险,也是它与通用芯片最本质的区别在于:它将Google对Transformer架构的长期赌注直接铸入了硅片。
虽然权重可以更新,但架构的固定意味着芯片只能支持在同一架构框架内的模型迭代。如果未来某个时间点,Google决定将Gemini的底层架构从Transformer切换到其他范式——比如状态空间模型(如Mamba)、混合架构、或者某种尚未命名的后Transformer设计——Frozen v2的固化部分将变得毫无价值,无论权重更新得多好。
这是一个不可忽视的风险。自2017年Transformer论文发表以来,它一直是大语言模型的基础架构,但这并不意味着它会永远主导。AI领域的发展速度以月为单位衡量,两年前还被认为不可能的技术路线今天可能已经成为主流。Google需要对Transformer架构的长期稳定性做出极高的信心下注,才能让Frozen v2的投资回报合理化。
而且,即使架构不发生根本性变化,Frozen v2也无法作为商业产品对外销售。因为芯片只支持Gemini模型,它无法像TPU那样通过Google Cloud出租给Meta、Anthropic等外部客户。Google的TPU团队内部有一个目标——拿下Nvidia年收入的10%。Frozen v2完全不在这个战略版图中。它的定位更像是一张战略底牌:在极端算力短缺时,为Google自己的核心产品线提供保障。
据The Information报道,Google内部目前将Frozen v2视为一项探索性工程,而非计划大规模量产的产品线。产量将远低于TPU。这在一定程度上反映了Google对这一赌注的谨慎态度。
2028部署:时间线与算力危机
Frozen v2的部署目标是2028年。这个时间点的选择并非偶然。
Google当前面临着严峻的AI算力短缺。据多家媒体报道,Gemini多模态能力的爆炸式需求已经超出了现有TPU的供给能力,内部矛盾由此激化。Google Cloud甚至被迫拒绝了一些外部客户的业务——这在云计算竞争日趋激烈的当下,是一个令人震惊的事实。2026年4月Google Cloud Next大会上发布的TPU 8t(训练专用)和TPU 8i(推理专用)虽然号称推理性能每美元提升80%,但仍然无法从根本上缓解供需缺口。
Frozen v2正是对这场算力危机的回应。如果6到10倍的能效提升能够兑现,它将意味着Google现有数据中心的每一度电能产生数倍的推理产出——不需要新建电力连接、不需要新的物理空间、不需要等待新的芯片制造周期。对于一个在2026年计划支出1800亿到1900亿美元的公司来说,这种效率杠杆的价值是巨大的。
投资者对Frozen v2消息的积极反应(Alphabet股价盘中涨3.7%),很大程度上反映了市场对Google巨额AI投资回报能力的重新评估。如果Frozen v2能够成功部署,它不仅会降低Google自身的推理成本,还可能让Google以更低的价格提供Gemini API服务,从而从OpenAI和Anthropic手中夺取市场份额。
AI专用化浪潮:更广阔的行业图景
Frozen v2不是孤立事件。它是2026年AI硬件行业向“专用化”加速转型的缩影。
就在Frozen v2被报道的几周前,OpenAI发布了其首款自研芯片Jalapeño——一款与Broadcom合作开发的推理处理器。Anthropic则传出正在与Samsung讨论定制芯片合作的消息。甚至在更早期的市场中,多伦多初创公司Taalas已经在2026年2月推出了HC1芯片,将Llama 3.1 8B模型的权重直接烧制到TSMC N6工艺的815平方毫米硅片中,声称可以实现每用户每秒17000个token的推理速度,且完全不需要HBM。Taalas的创始人来自Tenstorrent,团队仅24人,以3000万美元的开发成本完成了第一代芯片。
这些事件共同指向一个趋势:AI推理正在从“用通用硬件跑所有模型”向“为特定模型或特定模型家族定制硬件”演进。在这个光谱上,Nvidia GPU位于最通用的一端,Google的TPU处于中间位置,Frozen v2和Taalas的HC1则走向了专用化的极端。
但专用化并不意味着通用性的终结。更可能的未来是分层共存:训练阶段继续依赖GPU的灵活性和CUDA生态的成熟度,因为训练过程中模型架构和超参数仍在频繁调整;大规模推理阶段逐步向ASIC和专用芯片迁移,因为模型一旦定型,效率就成为第一优先级;而边缘设备和特殊场景则可能催生更极端的专用化方案。
对于行业观察者和从业者而言,Frozen v2传递了一个清晰的信号:AI基础设施的下一个十年,硬件和软件的边界将变得越来越模糊。模型不再只是运行在芯片上的软件——它正在成为芯片本身的一部分。通肯智能(TOKEN 导航)认为,这种模型与硬件的深度融合,将成为决定AI公司竞争力的关键因素之一。
结语:一场关于确定性的豪赌
Frozen v2的本质,是一场关于技术确定性的豪赌。Google在赌Transformer架构至少在可预见的未来仍然会是大语言模型的基础;在赌Gemini的架构不会发生颠覆性变化;在赌6到10倍的效率提升足以抵消失去灵活性的成本。如果这些赌注全部命中,Frozen v2可能成为AI推理领域的Game Changer——用更少的电能服务更多的用户,在更低的成本基础上构建更强的竞争力。
但如果任何一个赌注落空,这些固化在硅片中的电路就可能成为昂贵的教训。AI的历史上从不缺少被过度专用化而迅速过时的硬件——谷歌自己的TPU v1到v5的快速迭代就是明证。
无论如何,Frozen v2已经改变了对话的方向。AI硬件的竞争正在从“谁的芯片更快”转向“谁能更紧密地将模型和芯片融为一体”。在这场新的竞赛中,单纯的算力堆叠正在让位于架构层面的深度协同优化。对于整个AI行业来说,这既是机遇,也是挑战。
常见问题
Frozen v2会取代Google的TPU吗?
不会。Frozen v2是一条并行的产品线,而非TPU的替代品。Google在2026年4月的Cloud Next大会上发布了TPU 8t(训练专用)和TPU 8i(推理专用),这两款芯片仍然是Google AI基础设施的核心。Frozen v2专注于Gemini系列模型的推理任务,产量预期远低于TPU,且由于硬件只能运行Gemini模型,无法作为商业产品出租给外部客户。
6到10倍的效率提升是实测结果吗?
不是。这是参与项目的工程师的内部预估值,而非经过独立基准测试验证的结果。Google至今未正式确认Frozen v2项目的存在。工程师们预计芯片可以实现每瓦特产生6到10倍于当前TPU的token数量,但最终性能取决于仍在设计中的芯片的具体规格,包括固化多少架构、配备多少片上存储等。
如果Google改变Gemini的架构,Frozen v2会怎样?
这是Frozen v2面临的核心风险。芯片的效率增益来自将Gemini的架构选择物理性地构建到硅片中。如果Google将Gemini重新设计为基于完全不同架构范式的模型——例如状态空间模型(Mamba)、混合架构或其他后Transformer设计——固化在芯片中的电路将不再有效,无论权重如何更新。芯片需要重新流片,而这个过程通常需要12到18个月。
AI推理专用芯片是否会成为行业主流?
更可能的未来是分层共存。训练阶段仍需要GPU的灵活性,因为模型架构在训练过程中频繁调整。大规模推理阶段正在向专用芯片迁移,因为模型定型后效率成为首要目标。比特币挖矿从CPU到GPU到ASIC的演进为AI推理提供了参考先例。Taalas等初创公司、OpenAI的Jalapeño芯片、以及Google的Frozen v2,都在推动推理专用化从概念走向工程实践。
Frozen v2和Taalas HC1有什么区别?
两者都是模型专用化芯片,但定位和策略截然不同。Taalas HC1是将模型权重(包括架构和参数)完全固化到硅片中,只能运行Llama 3.1 8B,声称实现每用户每秒17000个token,完全不需要HBM,但每换一个模型就需要重新流片。Frozen v2只固化架构而保留权重的可更新性,可以在不更换硬件的情况下通过加载新权重来迭代Gemini模型。Frozen v2由Google自研自用,而Taalas作为初创公司面向数据中心市场提供商用产品。
37020202001687