导读:本期聚焦于小伙伴创作的《谷歌秘密研发的“Frozen v2”芯片,如何将Gemini模型的token处理效率提升6-10倍?》,敬请观看详情。AI推理的成本瓶颈是不是无解?谷歌用一块名为“Frozen v2”的专用芯片给出了硬核答案——直接把Gemini模型的权重和计算结构像烙印一样刻进硅片。这项秘密推进的硬件计划,并非又一次制程竞赛,而是从系统级软硬协同的角度重构了生成式模型的运行方式。在传统GPU上跑一次大模型推理,大量功耗浪费在数据搬运和通用计算单元的空转上;Frozen v2则通过存算一体、稀疏化固化、矩阵引擎深度定制等手段,将每一瓦功耗产出的token数量推高6到10倍。这对云端推理成本、边缘设备部署,甚至整个大模型生态的演变都会带来连锁冲击。本文从芯片架构、能效原理、技术挑战三个维度,揭开这块“硅基Gemini”的面纱。

谷歌秘密研发的“Frozen v2”芯片,如何将Gemini模型的token处理效率提升6-10倍?

大模型推理的功耗问题正在成为AI规模化落地的最大掣肘。一块H100 GPU跑一次Llama 70B推理,每秒只能生成几十个token,但功耗却轻松突破700瓦。如果有办法让模型本身和被优化后的硬件彻底绑定,绕过传统冯·诺依曼架构的束缚,情况会怎样?这就是谷歌“Frozen v2”专用芯片的出发点——把Gemini模型的核心计算逻辑“凝固”在硅片上,使得推理过程几乎不需要从外部存储搬运权重,每焦耳能量产出的token数量相比通用GPU提升6到10倍。

架构思路:Gemini模型如何“烙”进芯片

Frozen v2并不是一颗简单的ASIC,而是一种面向特定模型定制的存算一体处理器。其设计核心在于将Gemini模型中已经训练好的权重矩阵,直接以物理结构的形式烧录在芯片的交叉点阵列或非易失性存储器中。以Transformer中的多头注意力权重为例,这些庞大的二维矩阵不再存放在外部HBM或片外DRAM,而是通过电阻式RAM(ReRAM)或类似技术,将权重值映射为器件的电导值。当输入向量以电压形式施加在字线上,阵列中的欧姆定律和基尔霍夫电流定律会瞬间完成矩阵乘法运算,输出电流直接对应计算结果。这个过程完全在模拟域完成,大幅压缩了数据移动的开销。

更进一步,Frozen v2还针对Gemini所特有的混合专家(MoE)结构和长上下文注意力做了结构性固化。MoE中路由网络的稀疏激活模式可以通过片上专用路由电路硬编码,门控计算不再是软件层面的浮点运算,而是由低精度的硬件比较器阵列实时完成。这样一来,每一次推理只需要唤醒极少量的专家参数子区,其余区域几乎不产生静态功耗。对于Gemini支持的超长上下文窗口,芯片内部集成了专门的状态保持单元,将KV缓存直接放在计算单元旁边,避免在token生成过程中反复读写外部缓存,从而让长序列生成时的延迟和功耗显著下降。

这种深度定制的代价是灵活性。一旦模型权重升级或者架构微调,Frozen v2就无法适应。谷歌的策略是将其定位为云端推理卡,服务已经稳定、规模庞大的生产环境。训练仍然由TPU v5p等通用加速器完成,而推理端的能效飞跃由Frozen v2撑起。谷歌内部评估显示,一颗Frozen v2芯片在运行Gemini 1.5 Pro级别的模型时,推理吞吐相当于8颗TPU v5e,而总功耗不到后者的一半,这直接体现为单位功耗token产出的大幅提升。

6到10倍的token/瓦提升从何而来

6到10倍的能效提升并非单一技术所赋予,而是一系列硬件-模型协同优化的叠加结果。传统GPU在推理时,大量的功耗被数据搬运和指令译码所消耗。以HBM为例,每传输1字节数据所消耗的pJ能量是片上SRAM的数十倍甚至上百倍。Frozen v2通过将模型权重常驻在非易失性存算阵列中,推理时几乎没有片外数据搬运。一个token的生成,在GPU上可能需要上千次HBM访问,而在Frozen v2上这些访问被压缩至几乎为零,仅需从缓存中读取上下文状态和当前token嵌入。这是功耗降低的第一重因素。

第二重提升来自计算效率的飞跃。GPU的通用CUDA核心在计算矩阵乘法时,必须取出权值、取��动输入、进行浮点乘法累加、再写回结果,这个过程需要经历取指和译码等多个流水线阶段。而存算阵列本身就是模拟乘加器,一次读取输入即完成整个向量-矩阵乘法,等效于在一个时钟周期内完成了数百个乘加操作,而且不需要指令开销。此外,Frozen v2针对Gemini模型进行了精度重映射,将大部分推理计算降至8位甚至4位整数,同时通过噪声感知训练保证精度几乎无损;更进一步,一些对精度不敏感的归一化操作被替换为纯硬件查找表,这些都是在软件层面难以实现的深度优化。

再有一层增益源自稀疏性的硬件固化。大模型推理中,很大一部分激活值是零或接近零,尤其经过MoE的稀疏门控后。传统GPU必须通过预测掩码和重组线程来利用稀疏性,开销巨大。Frozen v2在芯片设计阶段就引入了细粒度的电源门控和计算跳级机制:当检��到某一列激活值为零时,对应的模拟计算通路会被直接断电;对于MoE中未被选中的专家权重区块,整个子阵列的时钟和偏置都被关闭,漏电功耗近乎归零。这三种技术叠加起来——消除数据搬运、模拟域超低功耗计算、硬件级稀疏加速——才最终实现每瓦特生��6到10倍token的能力。谷歌早期的测试数据显示,在生成同等质量、同等数量的token时,Frozen v2的整卡功耗约为220W,而对比的H100 GPU功耗为700W,且后者token吞吐量仅为前者的约1/2,换算后能效倍率正好落在此区间。

# 模拟Frozen v2的推理调用(伪代码)
# 模型已固化,直接映射到存算阵列地址空间
gemini_core = FrozenV2Chip()
prompt_token_ids = tokenizer.encode(user_prompt)

# 送入Prompt嵌入,返回KV缓存句柄
kv_handle = gemini_core.prefill(prompt_token_ids)

# 逐Token生成循环,几乎无外部内存拷贝
while len(output_ids) < max_tokens:
    # 从芯片内的KV缓存和当前token获取输入
    logits = gemini_core.decode(output_ids[-1], kv_handle)
    next_id = top_p_sample(logits)
    output_ids.append(next_id)
    if next_id == eos_token_id:
        break

行业影响与现实施挑战

如果Frozen v2能顺利量产,对AI推理的成本结构将是一次重写。目前大模型推理成本中,约60%来自电力消耗和散热,剩下才是硬件折旧。在单位token功耗降至1/6的情况下,云厂商可以用更少的电力、更少的服务器节点服务同等规模的流量。这将直接拉低API调用价格,让更多中小开发者负担得起高频、实时的Gemini能力。同时,边缘推理场景也会受益:Frozen v2的低功耗特性使得在手机、AR眼镜等设备上运行百亿参数模型成为可能,谷歌或许会推出一个精简版,内嵌在下一代Pixel设备中,实现真正的离线多模态助手。

然而,模型固化也引入了巨大的工程风险。如果Gemini模型需要修复安全漏洞或更新知识截止时间,正在运行的大批Frozen v2芯片就必须被物理替换。为此,谷歌可能采用“轻量可编程层+固化权重”的混合设计,例如在存算阵列之外保留一小部分可编程逻辑,用于后处理、安全过滤或热修复,但核心计算依然不可更改。此外,这种专用芯片的研发成本极高,仅光罩费用就数千万美元,加上需要与模型团队深度耦合,迭代周期远长于通用芯片。如果谷歌的模型架构发生重大转变,比如从Transformer切换到下一代状态空间模型,Frozen v2将面临淘汰风险。

更大的挑战在于生态话语权。一旦谷歌通过专用芯片将成本打到极致,其他云厂商和AI公司将被倒逼走向相似的软硬一体化道路。亚马逊的Trainium/Inferentia、微软的Maia、甚至Meta的MTIA系列都在做类似的事,但模型固化这一步尚无第二家公开尝试。Frozen v2能否成为行业拐点,取决于其真实能效数据、生产成本,以及Gemini模型本身的迭代节奏。至少从技术路线上看,把大模型“烙进硅片”已经从学术论文走进谷歌的实验室,它宣告了AI硬件正从通用加速走向模型特化的新纪元。

Frozen_v2芯片谷歌TPUGemini模型推理修改时间:2026-08-12 10:18:57

免责声明:​ 已尽一切努力确保本网站所含信息的准确性。网站内容多为原创整理与精心编撰,观点力求客观中立。本站旨在免费分享,内容仅供个人学习、研究或参考使用。若引用了第三方作品,版权归原作者所有。如内容涉及您的权益,请联系我们处理。
内容垂直聚焦
专注技术核心技术栏目,确保每篇文章深度聚焦于实用技能。从代码技巧到架构设计,为用户提供无干扰的纯技术知识沉淀,精准满足专业提升需求。
知识结构清晰
覆盖从开发到部署的全链路。AI、前端、编程、数据库、服务器、建站、系统层层递进,构建清晰学习路径,帮助用户系统化掌握开发与运维所需的核心技术。
深度技术解析
拒绝泛泛而谈,深入技术细节与实践难点。无论是数据库优化还是服务器配置,均结合真实场景与代码示例进行剖析,致力于提供可直接应用于工作的解决方案。
专业领域覆盖
精准对应开发生命周期。从前端界面到后端编程,从数据库操作到服务器运维,形成完整闭环,一站式满足全栈工程师和运维人员的技术需求。
即学即用高效
内容强调实操性,步骤清晰、代码完整。用户可根据教程直接复现和应用于自身项目,显著缩短从学习到实践的距离,快速解决开发中的具体问题。
持续更新保障
专注既定技术方向进行长期、稳定的内容输出。确保各栏目技术文章持续更新迭代,紧跟主流技术发展趋势,为用户提供经久不衰的学习价值。