先说结论:自研芯片不是要取代英伟达,而是为了议价权和定制化
\n最近Google发布了TPU v5p,性能比上一代提升2倍,训练Gemini这种超大规模模型全靠它。另一边,AWS的Trainium、微软的Maia 100也纷纷上桌。巨头们集体自研,难道英伟达的H100不香了?
\n其实,自研芯片的核心逻辑不是全面取代GPU,而是:第一,压价——有自家芯片当备胎,跟英伟达谈采购时腰杆更直;第二,定制——针对自家模型(比如Transformer)做硬件优化,能省下不少算力成本;第三,生态控制——不想被一家供应商卡脖子。
\n下面我拿Google TPU v5e/v5p和NVIDIA H100做个对比,再聊聊其他巨头的动作。
\n\n一、Google TPU v5e/v5p vs NVIDIA H100:硬核参数对比
\n先上干货,我整理了一张对比表:
\n- \n
- TPU v5e:单芯片算力约197 TFLOPs(BF16),256GB HBM,带宽1.6TB/s,专为推理和中型训练设计。 \n
- TPU v5p:单芯片算力约459 TFLOPs(BF16),512GB HBM,带宽2.4TB/s,定位超大规模训练,Google内部用于训练Gemini 1.0/1.5。 \n
- NVIDIA H100:单芯片算力约1979 TFLOPs(稀疏,FP8),但实际训练常用BF16约989 TFLOPs,80GB HBM3,带宽3.35TB/s,支持NVLink全互联。 \n
光看数字,H100单卡性能碾压TPU v5p(约2倍多),但TPU赢在集群互联和成本。Google用自家光路开关(OCS)把TPU连成超大规模pod,v5p pod最多支持8960颗芯片,带宽几乎全带宽。H100虽然用NVLink,但跨节点靠InfiniBand,延迟和带宽都受限于交换机。
\n举个例子:训练Gemini Ultra(据说1.6万亿参数),Google用了大量TPU v5p pod,通过模型并行和数据并行混合,把通信开销压到最低。H100也能训,但需要更多卡和更复杂的网络设计,成本翻倍。
\n\n二、为什么Google坚持用TPU训练Gemini?
\nGoogle从2015年就开始搞TPU,最初只是为了加速推理(TPU v1),后来发现训练也能干。到v5p这一代,Google已经积累了完整的软件栈(PJRT、XLA、JAX),TensorFlow/PyTorch都能无缝跑在TPU上。
\n用TPU训练Gemini的核心优势:
\n- \n
- 成本控制:自家芯片按成本价内部结算,比买H100至少便宜30-50%。Gemini这种千亿参数模型,训练一次电费就几百万美元,用TPU能省一大笔。 \n
- 定制优化:TPU的矩阵乘法单元(MXU)针对Google常用的BF16和INT8做了深度优化,Transformer的注意力计算也能硬件加速。H100虽然支持Transformer Engine,但毕竟是通用架构,某些场景下效率不如TPU。 \n
- 互联优势:Google的OCS光路交换机让TPU pod内带宽极高,适合大规模分布式训练。H100集群里,跨节点通信经常成为瓶颈,需要大量InfiniBand交换机和网卡,成本飙升。 \n
当然,TPU也有短板:不支持FP64,搞科学计算不行;软件生态不如CUDA,很多第三方库没有TPU版本。所以Google也买H100,用于非核心业务或兼容性需求。
\n\n三、AWS Trainium、微软Maia 100:各有各的算盘
\nAWS的Trainium目前出到第二代,单芯片算力约380 TFLOPs(BF16),但AWS强在云原生集成。Trainium通过AWS的Neuron SDK跟SageMaker、EC2深度绑定,用户一键就能拉起训练集群,成本比租H100低20-40%。AWS还搞了UltraCluster,把Trainium通过EFA(弹性结构适配器)互联,规模也能到几万卡。
\n微软的Maia 100更神秘,官方只说了是5nm制程、用于Azure训练和推理。我猜微软的策略是先内部用,再对外卖。Maia 100主要服务OpenAI和Copilot,减少对英伟达的依赖。微软还跟AMD合作,搞了MI300X的定制版,可见其“去NVIDIA化”的决心。
\n这些自研芯片的共同点:
\n- \n
- 不追求绝对性能:单卡算力都比H100低,但通过集群规模和软件优化,总吞吐量能打平甚至超过。 \n
- 深度绑定自家云服务:芯片+网络+软件全栈优化,用户买的是“服务”而非“硬件”。 \n
- 瞄准特定场景:比如训练、推理、或某个框架(如PyTorch)的优化,不搞通用。 \n
四、对英伟达市场地位的影响:短期无损,长期有压力
\n目前英伟达在AI训练市场份额超过80%,H100供不应求。自研芯片短期内撼动不了这个地位,原因:
\n- \n
- 生态壁垒:CUDA和cuDNN的软件栈太强了,95%的AI框架和库都优先支持NVIDIA。自研芯片需要自己写编译器、优化库,投入巨大。 \n
- 规模效应:英伟达一年卖几百万块GPU,研发成本摊得很薄。Google TPU一年出货量可能不到10万块,单颗成本更高。 \n
- 性能差距:H100在单卡性能和灵活性上仍然领先,尤其适合中小型公司。自研芯片只有超大规模客户才划算。 \n
但长期来看,巨头们自研芯片会蚕食英伟达的高端市场。比如Google、AWS、微软这些大客户,原本每年买几十万块H100,现在可能只买10万块,剩下的用自研。英伟达为了保住份额,只能降价或加速迭代,比如明年出的B100据说性能翻倍,但价格估计也翻倍。
\n\n五、总结与展望
\n巨头自研芯片不是要“干掉”英伟达,而是为了在AI算力军备竞赛中掌握主动权。未来格局可能是:
\n- \n
- 英伟达:继续统治通用AI训练市场,但高端客户流失,被迫降价。 \n
- Google/TPU:在自家生态内(搜索、广告、Gemini)全面替换GPU,并可能对外提供TPU云服务。 \n
- AWS/微软:用自研芯片搭配英伟达GPU,提供混合算力方案,降低客户成本。 \n
- AMD/英特尔:趁机抢中低端市场,比如推理和边缘计算。 \n
最后提个醒:如果你不是超大规模公司,别盲目跟风自研芯片。老老实实租H100或者买AMD MI300X,性价比更高。自研芯片的坑,只有巨头才踩得起。
本文来源:一江山水的随笔
本文地址:https://www.298.name/post/218.html
主要内容:Google TPU vs 英伟达GPU:巨头自研芯片背后的算力博弈
版权声明:如无特别注明,转载请注明本文地址!
