AI服务器内存成本占硬件BOM超75%:Google TPU 8i/8t双轨架构与TurboQuant无损量化技术解析
SEMICON Taiwan 2026峰会上,Google指出高性能内存占AI服务器硬件成本超75%,并详解TPU 8i/8t双轨硬件架构与TurboQuant无损量化算法,实现KV缓存32位压至3位、内存占用降6倍且无精度损失。
- Google Cloud
- TPU 8i
- AI服务器内存
- TurboQuant
- 无损量化
SEMICON Taiwan 2026内存峰会于1日举行,Google Cloud供应链基础设施高级总监Nikhil Cherian在会上表示,随着多模态和混合专家架构的普及,AI计算的限制因素已从功耗受限转向内存受限。高性能内存在AI服务器硬件物料清单(BOM)中的成本占比已超过75%。面对容量、带宽和功耗三大瓶颈,Google正通过硬件卸载与软件算法相结合的双轨策略突破AI内存瓶颈。
在硬件架构层面,Google针对不同场景推出两款TPU产品。面向低延迟推理的TPU 8i配备288 GB高带宽内存,片上SRAM容量提升至384 MiB,达到此前三倍,可将动态对话状态与键值缓存直接置于片上,实现零片外访问延迟。面向大规模训练的TPU 8t则由9600枚芯片组成超大规模计算集群,构建规模达2 PB的共享HBM池,消除片外数据传输瓶颈,并配合TPU Direct Storage技术提升训练效率。
软件层面,Google开发了无需额外训练即可部署的TurboQuant无损量化算法。该算法可将大模型的键值缓存从32位压缩至3位,在精度无损失的前提下将内存使用量减少至原来的六分之一,并使注意力计算速度提升8倍。此外,Google通过整合旧代DRAM技术,延长现有硬件组件的生命周期。
双轨策略核心数据拆解
从硬件部署看,TPU 8i通过三倍提升的片上SRAM容量实现推理任务的本地化缓存,避免片外数据搬运;TPU 8t则以9600芯片和2 PB共享HBM池解决训练阶段的跨芯片数据传输瓶颈。软件侧TurboQuant实现32位到3位的压缩比,KV缓存内存压力降至原有六分之一,同时注意力计算获得8倍加速。Google引入旧代DRAM技术复用,试图在硬件生命周期层面缓解高性能内存的产能与成本压力。
AI内存瓶颈的行业背景
Nikhil Cherian的判断基于当前AI工作负载的结构性变化。多模态数据处理与混合专家模型对内存容量和带宽的需求远高于传统方案,导致硬件成本结构发生偏移。当高性能内存占服务器总成本的四分之三以上时,继续扩容会直接面临容量、带宽与功耗三重瓶颈,硬件卸载与量化压缩因此成为工程层面的直接应对路径。