共计 1199 个字符,预计需要花费 3 分钟才能阅读完成。
租下 22 万颗英伟达 GPU 的同一天,Anthropic 向谷歌 TPU 承诺了 2000 亿美元
大模型公司的算力战,正在从“谁买到更多 GPU”转向“谁能更高效地组织算力”。 围绕 Anthropic 的最新动作, 谷歌 TPU、英伟达 GPU 与云厂商自研芯片的竞争被再次推到台前。
📌 Anthropic 同时加码 TPU 与 GPU
据市场消息,Anthropic 未来五年将向谷歌云承诺约 2000 亿美元支出, 用于采购规模约 5GW 的 TPU 算力和相关云服务。这一体量在数据中心行业中极为庞大, 意味着谷歌需要为其提供长期、稳定且高度定制化的基础设施。
值得注意的是, 同一天 Anthropic 还被曝租用 SpaceX 的 Colossus 1 超级计算机, 接入超过 22 万颗英伟达 GPU, 主要用于推理等场景。这表明 Anthropic 并非简单“去英伟达”, 而是在训练、推理和备份算力之间重新分工。
🔍 为什么谷歌 TPU 变得更重要
过去两年,AI 公司高度依赖英伟达 GPU, 尤其是 H100、B200 等高端产品。CUDA 生态、供货能力和软件工具链让英伟达处于强势位置, 也让模型厂商承受高昂成本和交付不确定性。
谷歌 TPU 的优势在于与自家云服务、数据中心和软件栈深度结合。材料中提到, 谷歌对 Anthropic 的投资与云采购承诺并行推进, 形成了较强的绑定关系。对 Anthropic 来说, 这种合作有机会换来更明确的算力供给、更低的单位训练成本, 以及更快的模型迭代节奏。
这不是单一芯片替代另一种芯片, 而是大模型企业开始主动设计自己的算力组合。
💡 混合算力架构成为现实选择
- 训练侧:大规模 TPU 集群有利于长期模型训练和底层优化。
- 推理侧:GPU 生态成熟, 适合快速部署和多样化负载。
- 供应链侧:多供应商策略可降低被单一厂商制约的风险。
- 成本侧:自研芯片与云厂商深度绑定, 有望改善单位算力成本。
📊 行业看点: 英伟达优势仍在, 但议价权被挑战
英伟达仍掌握强大的软件生态和高端加速卡市场份额,短期内难以被取代。但当谷歌、亚马逊等云巨头用自研芯片绑定头部模型客户, 英伟达的定价权和供给主导权就会受到持续挑战。
对谷歌而言,Anthropic 是 TPU 对外证明自身能力的重要客户; 对 Anthropic 而言, 降低算力成本并获得稳定供给, 是其与 OpenAI 等竞争对手长期对抗的关键条件。双方的合作, 本质上是一场围绕效率、成本和控制权的再分配。
🚀 绑定越深, 风险也越明显
深度使用 TPU 也并非没有代价。模型架构、算子优化和工程工具链一旦围绕特定硬件展开, 未来迁移成本会升高。多云、多芯片策略虽然提升了弹性, 也会带来调度、数据同步、运维和兼容性难题。
总体来看,Anthropic 的动作说明 AI 产业竞争正在进入新阶段: 参数规模仍重要, 但算力效率、硬件协同和供应链掌控力将成为更关键的胜负手。大模型公司不再只是“买卡者”, 而是逐渐成为算力体系的设计者。