# 谷歌秘密研发“Frozen v2”专用芯片:将Gemini集成于硅片,单位功耗token性能提升6至10倍
据内部消息人士透露,谷歌正秘密推进代号为“Frozen v2”的专用AI芯片研发项目。该芯片的核心创新在于将最新一代Gemini大模型的推理逻辑直接“固化”于硅片之上,实现模型与硬件的深度融合。初步测试数据显示,在单位功耗下,Frozen v2的token生成性能较当前TPU v5提升了6至10倍,这一突破或将重新定义云端AI推理的经济性边界。
**技术架构:从“软件跑模型”到“硅片即模型”**
传统AI加速器通过通用矩阵乘法单元(如TPU的MXU)来执行模型计算,模型权重动态加载至HBM内存,数据搬运功耗占总功耗的60%以上。Frozen v2采用“近存计算+模型固化”路线:将Gemini的注意力头、前馈网络参数量子化后,直接以硬连线逻辑(hard-wired logics)嵌入芯片的专用神经网络核心中,同时将关键权重数据以非易失性存储单元(如MRAM)集成于计算单元旁。这使得单次推理所需的片外内存访问次数减少约80%,大幅降低数据传输能耗。据内部文档,Frozen v2在单芯片上实现了约4000亿参数的静态存储,足以支撑Gemini 2.0(Ultra级别的精简版)全量推理。
**性能跃升背后的权衡与挑战**
单位功耗下6-10倍的token性能提升,意味着同等TDP(热设计功耗)下,Frozen v2能以更低的成本生成更长的回复序列。例如,在125W的典型功耗限制下,TPU v5的推理吞吐约为每秒2000 tokens,而Frozen v2可达到超过15000 tokens。然而,这种“模型固化”也带来显著灵活性代价:芯片出厂后无法更新模型架构,仅能通过微调权重(如低秩适配)进行有限调整。谷歌必须确保Gemini架构在芯片生命周期内保持竞争力,否则可能面临硬件迭代滞后于模型演进的风险。
**战略影响:从云到端的生态重构**
若Frozen v2量产成功,谷歌将获得显著的推理成本优势,从而在AI云服务价格战中压制微软Azure和亚马逊AWS。更深远的意义在于,该芯片的低功耗特性可能推动Gemini轻量化模型部署至边缘设备(如Pixel手机、Chromebook),实现“模型硬件一体化”的端侧推理。但这也意味着谷歌需同步承担芯片设计、流片及良率控制的高额成本——据估算,Frozen v2的单颗流片成本可能超过TPU v5的两倍,且需与台积电3nm或更先进制程深度绑定。
总体而言,Frozen v2是谷歌从“软件定义AI”向“硬件定义AI”的关键跨越。其成功与否,将不仅取决于性能提升是否兑现,更在于谷歌能否在灵活性与专用性之间找到商业平衡点。