🧊 前沿科技知识库
全部 / 人工智能(AI)

AI 基础设施与算力

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:人工智能·基础设施与算力 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

AI 基础设施是前沿模型的物理底座,涵盖超大规模训练集群、GPU/TPU 互联网络、训练与推理软件栈、模型架构效率技术(MoE、量化、KV cache 优化)、以及数据中心的电力与散热。2025–2026 年,随着旗舰模型训练规模迈入"十万卡级",基础设施的主旋律从"堆算力"转向"每瓦性能"与"每 token 成本":一方面互联带宽、液冷与供电成为集群扩展的硬约束;另一方面推理侧通过 MoE 稀疏化、低精度量化与 KV cache 优化,把单位 token 成本压到历史最低。

能源维度上存在多套口径。有统计称全球数据中心用电 2022 年约 340 TWh(约占全球 1.3%)、2024 年约 460 TWh(约 1.7%)、2026 年预计约 620 TWh(约 2.3%)、2030 年或达约 980 TWh(约 3.5%)(AIデータセンターのエネルギー危機完全解説2026);而援引 Gartner 2026 年 6 月报告的说法是,2026 年全球数据中心耗电约 565 TWh、同比增长 26%,其中 AI 优化服务器约 175 TWh(同比增 84%)(AI Data Center Energy Crisis 2026)。两套数字差异明显,引用时须注明来源与统计边界。

2025–2026 最新进展

十万卡级训练集群落地。 xAI 的 Memphis Colossus 集群以 100,000 块 NVIDIA H100 GPU 起步,用 122 天建成,随后又在 92 天内翻倍到 200,000 块,供电规模约 250 MW,网络采用 Spectrum-X 以太网(xAI's Memphis Colossus: Anatomie eines 100.000-GPU-Supercomputers)。据 NVIDIA CEO 黄仁勋 2026 年 9 月 6 日透露,GPT-6 Astra 的训练动用了约 10 万块 Grace Blackwell 系列 GPU,并计划再投入 40 万块用于后续阶段(GPT-6 Astra : 100 000 GPU Nvidia pour entraîner le modèle)。中国方面,2026 年 7 月 10 日中科曙光宣布首个全国产十万卡 AI 超集群"曙光 8000(登峰)"落成并接入国家超算互联网,标志算力基础设施从万卡级迈向十万卡级部署(全国产十万卡AI超集群落成并接入国家超算互联网)。

吉瓦级"AI 工厂"与史上最大规模资本开支。 OpenAI 主导的 Stargate 已演变为全球性 AI 基础设施网络:截至 2026 年 9 月 18 日,OpenAI 称已锁定超过 10 GW 算力,并另签约 8 IT-GW 的 PORTS-Pike 协议,但其中大部分容量尚未投入运营(Stargate Project Tracker)。Oracle 与 OpenAI 的约 3000 亿美元、为期五年的云合同构成 Stargate 核心,预计电力需求达 4.5 GW(Oracle's $300 Billion OpenAI Gamble)。Stargate Nevada 首期约 5 GW 于 2026 年 7 月通电,1A 期资本开支估计 650–750 亿美元,由 SoftBank 与 Oracle 主要出资(OpenAI's Stargate Nevada Just Went Live);密歇根 Saline Township 园区投资约 160 亿美元、供电 1.4 GW(OpenAI Stargate - Saline Township Campus)。

HBM4 进入量产,内存带宽再翻倍。 Samsung 称其 HBM4 提供 11.7 Gbps 的稳定处理速度,超过 8 Gbps 行业标准约 46%,较上代 HBM3E 的 9.6 Gbps 提升 1.22 倍,并可增强至 13 Gbps(Samsung Ships Industry-First Commercial HBM4)。SK hynix 的 HBM4 将 IO 扩展至 2K,实现超过 2.8 TB/s 带宽,采用逻辑代工工艺后能效提升约 40%,并通过 Advanced MR-MUF 实现最高 16 层堆叠(SK hynix HBM4)。Micron 的 HBM4 36GB 12H 已进入高量产,专为 NVIDIA Vera Rubin 设计,带宽超 2.8 TB/s、能效提升 20%(Micron in High-Volume Production of HBM4);Samsung 并在 NVIDIA GTC 2026 展示面向 Vera Rubin 的 HBM4E(Samsung Unveils HBM4E at NVIDIA GTC 2026)。

互联网络进入 260 TB/s 机架时代。 NVIDIA 的第六代 NVLink 为每个 GPU 提供 3.6 TB/s 带宽,单个 Vera Rubin NVL72 机架总带宽达 260 TB/s,支持大规模 MoE 与长上下文负载;其 scale-up 域可扩展至 1152 块 GPU,并引入共封装光学(co-packaged optics)(NVIDIA NVLink: The Scale-Up Network for AI Factories、NVIDIA Vera Rubin)。scale-out 侧,Spectrum-X 以太网以 Spectrum-6 102.4T 交换机、1.6T ConnectX-9 SuperNIC 与自适应路由构成(NVIDIA Vera Rubin)。NVLink 6 还增加了控制面弹性、部分填充机架运行与热插拔等可靠性特性(NVIDIA NVLink and NVLink Switch)。基于 Rubin 的 DGX SuperPOD 也沿用了同样的互联指标(NVIDIA DGX SuperPOD)。Vera Rubin NVL72 单机架提供最多 3,600 PFLOPS NVFP4 算力、20.7 TB HBM4 与 1.6 PB/s 内存带宽(How the NVIDIA Vera Rubin Platform is Solving Agentic AI's Scale-Up Problem)。

推理侧走向"解耦 + 异构"。 NVIDIA Rubin CPX 是 Rubin 家族中专为上下文处理(prefill)设计的成员:上下文阶段是计算受限、解码阶段是内存带宽受限,二者解耦后可分别优化,Rubin CPX 负责摄取与处理百万 token 级 prompt,标准 Rubin GPU 负责 decode(NVIDIA Rubin CPX、NVIDIA Rubin CPX Accelerates Inference Performance)。NVIDIA 与 Groq 相关的 Groq 3 LPX 加速器采用确定性执行模型与编译器调度的芯片间通信,与 Vera Rubin NVL72 组合支持 prefill-decode 解耦、attention-FFN 解耦(AFD)与外部 drafter 投机解码(How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context)。Vera Rubin 在延迟预算收紧时由 NVIDIA Dynamo 编排异构解码回路(How the NVIDIA Vera Rubin Platform is Solving Agentic AI's Scale-Up Problem)。

自研加速器规模化。 Google 第七代 TPU "Ironwood"(TPU7x)每个 pod 集成 9,216 块液冷芯片,单芯片 BF16 峰值 2,307 TFLOPs、FP8 4,614 TFLOPs、HBM 192 GiB,整 pod 提供约 42.5 ExaFlops(TPU7x (Ironwood)、Tensor Processing Units)。Google 随后公布第八代 TPU,采用双芯片设计、提供 121 ExaFlops 算力并整合更快的存储访问(第 8 世代 TPU:エージェンティック時代に向けた 2 つのチップ)。AWS 的第四代 AI 芯片 Trainium3(首款 3nm AWS AI 芯片)驱动 EC2 Trn3 UltraServers,每芯片提供 2.52 PFLOPs FP8 算力,内存容量比前代提升 1.5 倍(Announcing Amazon EC2 Trn3 UltraServers)。一项对比测试显示,16 块 TPU v7 Ironwood 对 16 块 NVIDIA GB200 运行 Kimi K3,双方均用 vLLM,TPU 达到 709 token/s、GB200 为 452 token/s,前者快约 57%(谷歌TPU跑Kimi比英伟达GPU快57%)。

核心技术与关键概念

MoE(混合专家)架构。 MoE 由专家子网络、专家稀疏性、门控网络与输出组合四要素构成,每 token 只激活少量专家,从而在控制算力的同时扩大总参数量(What Is Mixture of Experts?)。该领域的系统性问题包括 Top-k 路由、共享专家、细粒度专家、token 分发、设备放置、all-to-all 通信与计算-通信重叠等,与光互连带宽直接耦合(The Evolution of Mixture-of-Experts Architectures in Large Language Models)。在万卡级 MoE 训练中,Megatron Core 等框架专门处理专家并行与负载均衡(Scalable Training of Mixture-of-Experts Models with Megatron Core)。

训练框架与并行策略。 PyTorch 仍是绝对主流,90% 以上已发表的大模型(Llama、Mistral、GPT 等)使用 PyTorch,生态成熟度领先 3–5 年;JAX 的 pjit 分片在大规模下是真实优势,但"JAX 在规模上更快"并非保证(PyTorch vs JAX: Which Framework Wins Multi-Node GPU Training、PyTorch vs JAX: which deep learning framework should you choose?)。工程实践中,8–100+ GPU 规模常采用 Megatron-LM 的 TP+PP+DP(三维并行),TPU 侧则用 JAX + Flax 的 pmap/mesh(Frameworks de Treinamento Distribuído)。

推理框架三强。 TensorRT-LLM 在 H100 上的稠密模型吞吐较 vLLM 高 15%–25%,但需编译;vLLM 部署最简、支持 400+ 模型架构与最广硬件;SGLang 凭借 RadixAttention 与专家并行(EP),在大 MoE(如 DeepSeek-R1/V3)与高并发场景表现最佳(vLLM vs SGLang vs TensorRT-LLM)。具体到 Llama 3.3 70B FP8 单卡 H100,TensorRT-LLM 单请求高约 8%、50 并发高约 13%,代价是近半小时的编译(TensorRT-LLM vs vLLM vs SGLang: H100 Benchmark 2026)。vLLM 在 Qwen3.5 上实现了每 GPU 25,000 token/s 的总吞吐(vLLM Reaches 25K Total TPS/GPU on Qwen3.5),并通过 WideEP 与 NVFP4 GEMM 等针对 Blackwell 的精度优化持续提升大 MoE 服务能力(Driving vLLM WideEP and Large-Scale Serving Toward Maturity on Blackwell)。

KV cache 优化与量化。 KV cache 量化是长上下文与高并发的关键:FP8/INT8 可把显存减半,INT4 进一步压缩但可能引入质量损失(KV Cache & PagedAttention Complete Guide (2026))。NVIDIA 的 NVFP4 KV cache 相较 FP8 可将显存占用再降约 50%,但需要 Blackwell 硬件(使用 NVFP4 KV 缓存优化大批次与长上下文推理)。面向 context-heavy agent,UltraQuant 以 4-bit KV 缓存在生产级 Claude Code 轨迹回放上实现 2.71×(MiniMax-M2.5)至 4.38×(Qwen3 系列)的吞吐提升(UltraQuant: 4-bit KV Caching for Context-Heavy Agents)。

蒸馏:通过把大模型的推理/能力迁移到小模型,配合量化压缩部署成本,是推理降本的重要一环(Inference-Time Distillation)。

数据中心散热路线。 当前主流分冷板式、浸没式、喷淋式三大技术路线:冷板式支撑 50–120 kW/机架,浸没式可支撑 100–250 kW/机架的更高功率密度(Direct-to-Chip vs. Immersion Cooling)。Open Compute Project 的 ORv3 48V 规范把直接芯片(direct-to-chip,D2C)液冷视为 30 kW 以上机架的基线,Microsoft 自 2025 年 7 月起在 Azure 园区批量部署 D2C(Architecting Hybrid Cooling Layers)。据 2026 年市场数据,D2C 约占液冷采用量的 43%,是部署最广的方案(Liquid Cooling for GPU Clusters)。

液冷方案的成本结构差异。 液冷路线的选择不仅取决于散热能力,也取决于流体成本与改造难度:一套 500 机架的 D2C 部署约需 5,000–15,000 升冷却液,而同等规模浸没式部署最低需 250,000–500,000 升介电液,流体资本开支指数约为 D2C 的 3–5 倍(Direct-to-Chip vs. Immersion Cooling: Fluid Types)。在中国市场,冷板式在存量机房改造中占比超 85%,而浸没式可支撑单柜 100 kW 至 250 kW 超高功率密度、PUE 低至 1.03–1.05,被视为新建智算中心的核心方案(算力火爆带热液冷赛道)。

代表性项目/公司/产品(附官方链接)

关键数据与评测结果

趋势与争议

电力与电网成为新瓶颈。 高密度 AI 机架要求协调可用电网电力、设施设计、部署周期与长期运营效率;液冷之所以成为主流答案,是因为它能让人在有限电力下"榨出"更多算力(Data center power density)。据 IEA 口径,数据中心用电约 40% 来自天然气、约 15% 来自煤电、核能约占 20%(Powering AI's future: The case for nuclear energy in data centers)。为锁定长期电力,Meta 于 2026 年 1 月签署最多 6.6 GW 核电协议(含与 Constellation 的 1.1 GW、20 年 PPA 及与 TerraPower、Oklo 的远期协议),Amazon 与 Talen Energy 就 Susquehanna 核电(1.9 GW)达成 200 亿美元安排(AI Data Center Energy Consumption Statistics 2026)。近期的电力缓解仍主要依赖燃气、燃料电池与电网效率提升(AI Power Demand: Grid Bottleneck 2026)。

资本开支的可持续性争议。 有测算指出,大型科技公司已把约 96% 的现金流投入资本开支,长期债务合计升至约 3419 亿美元(Alphabet 982 亿、Amazon 1289 亿、Meta 837 亿、Microsoft 311 亿)(AI Capex 2026: Big Tech Now Spends 96% of Its Cash Flow)。一旦 AI 需求放缓,约 7000 亿美元 capex 的回报节奏将受到审视(What an AI slowdown does to $700 billion in AI capex)。

互联路线的分化。 NVLink 代表封闭但高带宽的 scale-up 路线(并借 NVLink Fusion 向半定制开放),以太网阵营(Spectrum-X、Ultra Ethernet)则在 scale-out 上争夺开放生态(NVIDIA Vera Rubin)。同时,自研加速器(TPU Ironwood、Trainium3)在特定负载上对通用 GPU 形成价格/能效竞争(Tensor Processing Units、Announcing Amazon EC2 Trn3 UltraServers)。

推理需求的结构性上移。 随着 Agent、长上下文与推理模型的普及,算力需求曲线正从训练侧向推理侧延伸,算力供给持续紧张(高盛测算:"AI第二阶段"的"资本缺口"要怎么补?)。这也解释了为何 prefill/decode 解耦、KV cache 量化与更低价的 API 档位成为 2026 年基础设施优化的重点(Token prices fall as access tiers rise)。

出口管制与算力地缘。 美国商务部 BIS 于 2026 年 1 月修订对华半导体出口许可政策,将 Nvidia H200、AMD MI325X 等芯片的审查从"推定拒绝"改为"逐案审查"(Department of Commerce Revises License Review Policy、Revision to License Review Policy for Advanced Computing Commodities);同月 Trump 政府宣布对符合条件的对华出口芯片加征 25% 关税,但政策松动未立即转化为商业现实,H200 重返中国市场后收入占比不足 1%(英伟达H200芯片重返中国市场收入占比不足1%)。NVIDIA 在 2025 年 4 月因 H20 出口需许可而计提 45 亿美元费用(NVIDIA 10-K filing)。

参考来源

  1. AIデータセンターのエネルギー危機完全解説2026
  2. AI Data Center Energy Crisis 2026: Colossus, Stargate, and the Race for Power
  3. xAI's Memphis Colossus: Anatomie eines 100.000-GPU-Supercomputers
  4. GPT-6 Astra : 100 000 GPU Nvidia pour entraîner le modèle
  5. 全国产十万卡AI超集群落成并接入国家超算互联网
  6. Stargate Project Tracker
  7. Oracle's $300 Billion OpenAI Gamble
  8. OpenAI's Stargate Nevada Just Went Live
  9. OpenAI Stargate - Saline Township Campus
  10. Samsung Ships Industry-First Commercial HBM4
  11. SK hynix HBM4
  12. Micron in High-Volume Production of HBM4 Designed for NVIDIA Vera Rubin
  13. Samsung Unveils HBM4E at NVIDIA GTC 2026
  14. NVIDIA NVLink: The Scale-Up Network for AI Factories
  15. NVIDIA Vera Rubin
  16. NVIDIA NVLink and NVLink Switch
  17. NVIDIA DGX SuperPOD
  18. How the NVIDIA Vera Rubin Platform is Solving Agentic AI's Scale-Up Problem
  19. NVIDIA Rubin CPX
  20. NVIDIA Rubin CPX Accelerates Inference Performance and Efficiency
  21. How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context
  22. TPU7x (Ironwood) — Google Cloud Docs
  23. Tensor Processing Units — Google Cloud
  24. 第 8 世代 TPU:エージェンティック時代に向けた 2 つのチップ
  25. Announcing Amazon EC2 Trn3 UltraServers
  26. 谷歌TPU跑Kimi比英伟达GPU快57%
  27. What Is Mixture of Experts?
  28. The Evolution of Mixture-of-Experts Architectures in Large Language Models
  29. Scalable Training of Mixture-of-Experts Models with Megatron Core
  30. PyTorch vs JAX: Which Framework Wins Multi-Node GPU Training
  31. PyTorch vs JAX: which deep learning framework should you choose?
  32. Frameworks de Treinamento Distribuído
  33. vLLM vs SGLang vs TensorRT-LLM
  34. TensorRT-LLM vs vLLM vs SGLang: H100 Benchmark 2026
  35. vLLM Reaches 25K Total TPS/GPU on Qwen3.5
  36. Driving vLLM WideEP and Large-Scale Serving Toward Maturity on Blackwell
  37. KV Cache & PagedAttention Complete Guide (2026)
  38. 使用 NVFP4 KV 缓存优化大批次与长上下文推理
  39. UltraQuant: 4-bit KV Caching for Context-Heavy Agents
  40. Inference-Time Distillation
  41. Direct-to-Chip vs. Immersion Cooling: Which is Right for Your AI Data Center?
  42. Architecting Hybrid Cooling Layers for Mixed-Density Data Halls
  43. Liquid Cooling for GPU Clusters: The Direct-to-Chip Decision Framework
  44. NVIDIA HGX Platform
  45. NVIDIA GB300 NVL72
  46. AWS Trainium
  47. NVIDIA Inference Platform
  48. LLM Pricing Statistics (2026)
  49. 新浪财经:AI token 价格创新低
  50. Token prices fall as access tiers rise
  51. cloud accelerator pricing
  52. Best GPU Neoclouds 2026
  53. CoreWeave Raises 2026 Revenue Forecast to $12.4B–$13.2B
  54. CoreWeave Reports Strong First Quarter 2026 Results
  55. AI Data Center Liquid Cooling Adoption to Hit 53% in 2026
  56. Why Liquid Cooling is No Longer Optional for 2026 AI Workloads
  57. Uptime Institute Global Data Center Survey 2026
  58. Data Center Cooling Economics: Liquid vs Air vs Immersion in 2026
  59. 算力火爆带热液冷赛道
  60. 从一块芯片到一座机房
  61. Hyperscaler
  62. AI Data Centre Investment Ranking 2026
  63. Amazon, Google, Microsoft and Meta Lead $700 Billion 2026 AI Infrastructure Race
  64. 高盛测算:"AI第二阶段"的"资本缺口"要怎么补?
  65. Data center power density
  66. Powering AI's future: The case for nuclear energy in data centers
  67. AI Data Center Energy Consumption Statistics 2026
  68. AI Power Demand: Grid Bottleneck 2026
  69. AI Capex 2026: Big Tech Now Spends 96% of Its Cash Flow
  70. What an AI slowdown does to $700 billion in AI capex
  71. Department of Commerce Revises License Review Policy for Semiconductors Exported to China
  72. Revision to License Review Policy for Advanced Computing Commodities
  73. 英伟达H200芯片重返中国市场收入占比不足1%
  74. NVIDIA 10-K filing (nvda-20260125)
  75. Direct-to-Chip vs. Immersion Cooling: Fluid Types, Chemistry, and Selection Rules
  76. 算力火爆带热液冷赛道(腾讯新闻)
  77. The Oil of the AI Age? Compute Futures and the Neocloud Economy
  78. LLM Cost Per Million Tokens: 2026 Inference Pricing Benchmark
  79. KAYTUS AI Compute Pod Wins 2026 iF Design Award and Red Dot Award
← AI 发展史与关键里程碑AI 产品与 UX →