AI 基础设施与算力
最后更新:2026-09-26 | 领域:人工智能·基础设施与算力 | 说明:信息来源为公开网络资料,详见文末参考来源
概述
AI 基础设施是前沿模型的物理底座,涵盖超大规模训练集群、GPU/TPU 互联网络、训练与推理软件栈、模型架构效率技术(MoE、量化、KV cache 优化)、以及数据中心的电力与散热。2025–2026 年,随着旗舰模型训练规模迈入"十万卡级",基础设施的主旋律从"堆算力"转向"每瓦性能"与"每 token 成本":一方面互联带宽、液冷与供电成为集群扩展的硬约束;另一方面推理侧通过 MoE 稀疏化、低精度量化与 KV cache 优化,把单位 token 成本压到历史最低。
能源维度上存在多套口径。有统计称全球数据中心用电 2022 年约 340 TWh(约占全球 1.3%)、2024 年约 460 TWh(约 1.7%)、2026 年预计约 620 TWh(约 2.3%)、2030 年或达约 980 TWh(约 3.5%)(AIデータセンターのエネルギー危機完全解説2026);而援引 Gartner 2026 年 6 月报告的说法是,2026 年全球数据中心耗电约 565 TWh、同比增长 26%,其中 AI 优化服务器约 175 TWh(同比增 84%)(AI Data Center Energy Crisis 2026)。两套数字差异明显,引用时须注明来源与统计边界。
2025–2026 最新进展
十万卡级训练集群落地。 xAI 的 Memphis Colossus 集群以 100,000 块 NVIDIA H100 GPU 起步,用 122 天建成,随后又在 92 天内翻倍到 200,000 块,供电规模约 250 MW,网络采用 Spectrum-X 以太网(xAI's Memphis Colossus: Anatomie eines 100.000-GPU-Supercomputers)。据 NVIDIA CEO 黄仁勋 2026 年 9 月 6 日透露,GPT-6 Astra 的训练动用了约 10 万块 Grace Blackwell 系列 GPU,并计划再投入 40 万块用于后续阶段(GPT-6 Astra : 100 000 GPU Nvidia pour entraîner le modèle)。中国方面,2026 年 7 月 10 日中科曙光宣布首个全国产十万卡 AI 超集群"曙光 8000(登峰)"落成并接入国家超算互联网,标志算力基础设施从万卡级迈向十万卡级部署(全国产十万卡AI超集群落成并接入国家超算互联网)。
吉瓦级"AI 工厂"与史上最大规模资本开支。 OpenAI 主导的 Stargate 已演变为全球性 AI 基础设施网络:截至 2026 年 9 月 18 日,OpenAI 称已锁定超过 10 GW 算力,并另签约 8 IT-GW 的 PORTS-Pike 协议,但其中大部分容量尚未投入运营(Stargate Project Tracker)。Oracle 与 OpenAI 的约 3000 亿美元、为期五年的云合同构成 Stargate 核心,预计电力需求达 4.5 GW(Oracle's $300 Billion OpenAI Gamble)。Stargate Nevada 首期约 5 GW 于 2026 年 7 月通电,1A 期资本开支估计 650–750 亿美元,由 SoftBank 与 Oracle 主要出资(OpenAI's Stargate Nevada Just Went Live);密歇根 Saline Township 园区投资约 160 亿美元、供电 1.4 GW(OpenAI Stargate - Saline Township Campus)。
HBM4 进入量产,内存带宽再翻倍。 Samsung 称其 HBM4 提供 11.7 Gbps 的稳定处理速度,超过 8 Gbps 行业标准约 46%,较上代 HBM3E 的 9.6 Gbps 提升 1.22 倍,并可增强至 13 Gbps(Samsung Ships Industry-First Commercial HBM4)。SK hynix 的 HBM4 将 IO 扩展至 2K,实现超过 2.8 TB/s 带宽,采用逻辑代工工艺后能效提升约 40%,并通过 Advanced MR-MUF 实现最高 16 层堆叠(SK hynix HBM4)。Micron 的 HBM4 36GB 12H 已进入高量产,专为 NVIDIA Vera Rubin 设计,带宽超 2.8 TB/s、能效提升 20%(Micron in High-Volume Production of HBM4);Samsung 并在 NVIDIA GTC 2026 展示面向 Vera Rubin 的 HBM4E(Samsung Unveils HBM4E at NVIDIA GTC 2026)。
互联网络进入 260 TB/s 机架时代。 NVIDIA 的第六代 NVLink 为每个 GPU 提供 3.6 TB/s 带宽,单个 Vera Rubin NVL72 机架总带宽达 260 TB/s,支持大规模 MoE 与长上下文负载;其 scale-up 域可扩展至 1152 块 GPU,并引入共封装光学(co-packaged optics)(NVIDIA NVLink: The Scale-Up Network for AI Factories、NVIDIA Vera Rubin)。scale-out 侧,Spectrum-X 以太网以 Spectrum-6 102.4T 交换机、1.6T ConnectX-9 SuperNIC 与自适应路由构成(NVIDIA Vera Rubin)。NVLink 6 还增加了控制面弹性、部分填充机架运行与热插拔等可靠性特性(NVIDIA NVLink and NVLink Switch)。基于 Rubin 的 DGX SuperPOD 也沿用了同样的互联指标(NVIDIA DGX SuperPOD)。Vera Rubin NVL72 单机架提供最多 3,600 PFLOPS NVFP4 算力、20.7 TB HBM4 与 1.6 PB/s 内存带宽(How the NVIDIA Vera Rubin Platform is Solving Agentic AI's Scale-Up Problem)。
推理侧走向"解耦 + 异构"。 NVIDIA Rubin CPX 是 Rubin 家族中专为上下文处理(prefill)设计的成员:上下文阶段是计算受限、解码阶段是内存带宽受限,二者解耦后可分别优化,Rubin CPX 负责摄取与处理百万 token 级 prompt,标准 Rubin GPU 负责 decode(NVIDIA Rubin CPX、NVIDIA Rubin CPX Accelerates Inference Performance)。NVIDIA 与 Groq 相关的 Groq 3 LPX 加速器采用确定性执行模型与编译器调度的芯片间通信,与 Vera Rubin NVL72 组合支持 prefill-decode 解耦、attention-FFN 解耦(AFD)与外部 drafter 投机解码(How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context)。Vera Rubin 在延迟预算收紧时由 NVIDIA Dynamo 编排异构解码回路(How the NVIDIA Vera Rubin Platform is Solving Agentic AI's Scale-Up Problem)。
自研加速器规模化。 Google 第七代 TPU "Ironwood"(TPU7x)每个 pod 集成 9,216 块液冷芯片,单芯片 BF16 峰值 2,307 TFLOPs、FP8 4,614 TFLOPs、HBM 192 GiB,整 pod 提供约 42.5 ExaFlops(TPU7x (Ironwood)、Tensor Processing Units)。Google 随后公布第八代 TPU,采用双芯片设计、提供 121 ExaFlops 算力并整合更快的存储访问(第 8 世代 TPU:エージェンティック時代に向けた 2 つのチップ)。AWS 的第四代 AI 芯片 Trainium3(首款 3nm AWS AI 芯片)驱动 EC2 Trn3 UltraServers,每芯片提供 2.52 PFLOPs FP8 算力,内存容量比前代提升 1.5 倍(Announcing Amazon EC2 Trn3 UltraServers)。一项对比测试显示,16 块 TPU v7 Ironwood 对 16 块 NVIDIA GB200 运行 Kimi K3,双方均用 vLLM,TPU 达到 709 token/s、GB200 为 452 token/s,前者快约 57%(谷歌TPU跑Kimi比英伟达GPU快57%)。
核心技术与关键概念
MoE(混合专家)架构。 MoE 由专家子网络、专家稀疏性、门控网络与输出组合四要素构成,每 token 只激活少量专家,从而在控制算力的同时扩大总参数量(What Is Mixture of Experts?)。该领域的系统性问题包括 Top-k 路由、共享专家、细粒度专家、token 分发、设备放置、all-to-all 通信与计算-通信重叠等,与光互连带宽直接耦合(The Evolution of Mixture-of-Experts Architectures in Large Language Models)。在万卡级 MoE 训练中,Megatron Core 等框架专门处理专家并行与负载均衡(Scalable Training of Mixture-of-Experts Models with Megatron Core)。
训练框架与并行策略。 PyTorch 仍是绝对主流,90% 以上已发表的大模型(Llama、Mistral、GPT 等)使用 PyTorch,生态成熟度领先 3–5 年;JAX 的 pjit 分片在大规模下是真实优势,但"JAX 在规模上更快"并非保证(PyTorch vs JAX: Which Framework Wins Multi-Node GPU Training、PyTorch vs JAX: which deep learning framework should you choose?)。工程实践中,8–100+ GPU 规模常采用 Megatron-LM 的 TP+PP+DP(三维并行),TPU 侧则用 JAX + Flax 的 pmap/mesh(Frameworks de Treinamento Distribuído)。
推理框架三强。 TensorRT-LLM 在 H100 上的稠密模型吞吐较 vLLM 高 15%–25%,但需编译;vLLM 部署最简、支持 400+ 模型架构与最广硬件;SGLang 凭借 RadixAttention 与专家并行(EP),在大 MoE(如 DeepSeek-R1/V3)与高并发场景表现最佳(vLLM vs SGLang vs TensorRT-LLM)。具体到 Llama 3.3 70B FP8 单卡 H100,TensorRT-LLM 单请求高约 8%、50 并发高约 13%,代价是近半小时的编译(TensorRT-LLM vs vLLM vs SGLang: H100 Benchmark 2026)。vLLM 在 Qwen3.5 上实现了每 GPU 25,000 token/s 的总吞吐(vLLM Reaches 25K Total TPS/GPU on Qwen3.5),并通过 WideEP 与 NVFP4 GEMM 等针对 Blackwell 的精度优化持续提升大 MoE 服务能力(Driving vLLM WideEP and Large-Scale Serving Toward Maturity on Blackwell)。
KV cache 优化与量化。 KV cache 量化是长上下文与高并发的关键:FP8/INT8 可把显存减半,INT4 进一步压缩但可能引入质量损失(KV Cache & PagedAttention Complete Guide (2026))。NVIDIA 的 NVFP4 KV cache 相较 FP8 可将显存占用再降约 50%,但需要 Blackwell 硬件(使用 NVFP4 KV 缓存优化大批次与长上下文推理)。面向 context-heavy agent,UltraQuant 以 4-bit KV 缓存在生产级 Claude Code 轨迹回放上实现 2.71×(MiniMax-M2.5)至 4.38×(Qwen3 系列)的吞吐提升(UltraQuant: 4-bit KV Caching for Context-Heavy Agents)。
蒸馏:通过把大模型的推理/能力迁移到小模型,配合量化压缩部署成本,是推理降本的重要一环(Inference-Time Distillation)。
数据中心散热路线。 当前主流分冷板式、浸没式、喷淋式三大技术路线:冷板式支撑 50–120 kW/机架,浸没式可支撑 100–250 kW/机架的更高功率密度(Direct-to-Chip vs. Immersion Cooling)。Open Compute Project 的 ORv3 48V 规范把直接芯片(direct-to-chip,D2C)液冷视为 30 kW 以上机架的基线,Microsoft 自 2025 年 7 月起在 Azure 园区批量部署 D2C(Architecting Hybrid Cooling Layers)。据 2026 年市场数据,D2C 约占液冷采用量的 43%,是部署最广的方案(Liquid Cooling for GPU Clusters)。
液冷方案的成本结构差异。 液冷路线的选择不仅取决于散热能力,也取决于流体成本与改造难度:一套 500 机架的 D2C 部署约需 5,000–15,000 升冷却液,而同等规模浸没式部署最低需 250,000–500,000 升介电液,流体资本开支指数约为 D2C 的 3–5 倍(Direct-to-Chip vs. Immersion Cooling: Fluid Types)。在中国市场,冷板式在存量机房改造中占比超 85%,而浸没式可支撑单柜 100 kW 至 250 kW 超高功率密度、PUE 低至 1.03–1.05,被视为新建智算中心的核心方案(算力火爆带热液冷赛道)。
代表性项目/公司/产品(附官方链接)
- NVIDIA NVLink / Spectrum-X:https://www.nvidia.com/en-sg/data-center/nvlink/
- NVIDIA Vera Rubin 平台:https://blogs.nvidia.com/blog/vera-rubin/
- NVIDIA HGX 平台(Rubin / Blackwell Ultra):https://www.nvidia.com/en-us/data-center/hgx/
- NVIDIA GB300 NVL72:https://www.nvidia.com/en-eu/data-center/gb300-nvl72/
- Google TPU(Ironwood / TPU7x):https://cloud.google.com/tpu
- AWS Trainium:https://aws.amazon.com/ai/machine-learning/trainium/
- vLLM:https://vllm.ai/blog/2026-08-06-qwen35-25k-tps
- NVIDIA 推理平台(TensorRT-LLM / Dynamo):https://www.nvidia.com/en-gb/solutions/ai/inference/
- SK hynix HBM4:https://product.skhynix.com/products/dram/hbm/hbm4.go
- CoreWeave(GPU 云):https://investors.coreweave.com/news/news-details/2026/CoreWeave-Reports-Strong-First-Quarter-2026-Results/
关键数据与评测结果
- 推理成本持续下探:BenchLM Token Price Index 显示,截至 2026 年 9 月,前沿 LLM token 价格较 2023 年 3 月低约 84%(指数 16,基准 100)(LLM Pricing Statistics (2026))。据数据服务商 Silicon Data,其按使用量加权的大模型 token 支出指数首次跌破每百万 token 1 美元,报 0.97 美元(新浪财经)。另有来源称,从 GPT-4 时代到 GPT-5 时代前沿 API 单价下降约 10 倍,而面向人的准入价格反而向每月 200 美元上限攀升(Token prices fall as access tiers rise)。
- 单位 token 成本:据 SemiAnalysis InferenceX(2026 年 4 月),GB300 NVL72 在 116 TPS/user 交互性下可达每百万 token $0.123;NVIDIA B200 在 GPT-OSS-120B 上达到每百万 token 两美分的生产基准(NVIDIA Inference Platform、cloud accelerator pricing)。
- 机架级规格:NVIDIA GB300 NVL72 集成 72 块 Blackwell Ultra GPU 与 36 块 Grace CPU,FP8/FP6 Tensor Core 算力 720 PFLOPS、INT8 24 POPS、FP16/BF16 360 PFLOPS,机内 NVLink 带宽 130 TB/s(NVIDIA GB300 NVL72、NVIDIA Inference Platform)。NVIDIA HGX Vera Rubin NVL8 平台则由 8 块 Rubin SXM 搭配单路 Vera CPU(88 个 Arm 兼容的自定义 Olympus 核心)构成,NVFP4 推理算力 400 PFLOPS、NVFP4 训练 280 PFLOPS、FP8/FP6 训练 140 PFLOPS,CPU 侧配 1.5 TB LPDDR5X、带宽 1.2 TB/s(NVIDIA HGX Platform)。
- GPU 云(neocloud)财务与积压订单:CoreWeave 2026 年 Q2 营收 25.8 亿美元、同比增 112%,净亏损 6.26 亿美元,营收积压(backlog)约 1040 亿美元(Best GPU Neoclouds 2026),并把 2026 全年营收指引上调至 124 亿–132 亿美元(CoreWeave Raises 2026 Revenue Forecast);另一口径显示其 Q1 2026 积压为 994 亿美元,并与 Meta 签下 210 亿美元、与 Anthropic 签下多年协议(CoreWeave Reports Strong First Quarter 2026 Results)。Nebius 2026 年 Q2 营收 5.82 亿美元、同比增 454%、ARR 约 30 亿美元(Best GPU Neoclouds 2026)。
- 液冷渗透率:TrendForce 预测 AI 芯片的液冷渗透率 2026 年将达 53%(2025 年为 33%),并进一步升至 59%(AI Data Center Liquid Cooling Adoption to Hit 53% in 2026)。浸没式相变液冷可支持 150 kW/机架以上的功率密度;冷板式可捕获服务器约 80% 的热量(Why Liquid Cooling is No Longer Optional for 2026 AI Workloads)。
- 能效 PUE:Uptime Institute《2026 全球数据中心调查》给出行业平均 PUE 为 1.52,延续七年的相对停滞(Uptime Institute Global Data Center Survey 2026)。而分技术路线看,先进风冷 PUE 约 1.45–1.60、直接芯片 1.10–1.20、单相浸没 1.03–1.08(Data Center Cooling Economics)。浸没式可将机房 PUE 压至约 1.04,综合节电 15%–20%(从一块芯片到一座机房)。
- 液冷市场:赛迪顾问数据显示,2025 年中国液冷数据中心市场规模达 159.8 亿元、同比增长 45.2%,预计 2026 年达 232.5 亿元;中金公司预测 2026 年全球智算中心液冷市场规模有望突破 1147 亿元、同比增长 273%(算力火爆带热液冷赛道)。
- 厂商级散热方案:有整机方案(KAYTUS AI Compute Pod)宣称单机架冷却能力最高 130 kW、PUE 低至 1.1,并实现制冷与 IT 负载的秒级同步、制冷能效提升逾 10%(KAYTUS AI Compute Pod Wins 2026 iF Design Award and Red Dot Award)。
- neocloud 的电力与合同化:截至 2026 年 8 月,CoreWeave 活跃电力约 1.5 GW(51 个数据中心)、合同电力约 4.2 GW、积压约 1290 亿美元;Nebius 目标合同电力 5.0 GW,并累计与 Microsoft(约 170 亿美元)及 Meta(最高约 270 亿美元)签约(The Oil of the AI Age? Compute Futures and the Neocloud Economy)。
- 成本下降曲线:Andreessen Horowitz 的 "LLMflation" 分析显示,达到 GPT-3(2021 年 11 月)性能水平(MMLU 42 分,当时定价每百万 token 60 美元)的模型,到 2024 年末在 Together.ai 托管下每百万 token 仅需 0.06 美元(LLM Cost Per Million Tokens: 2026 Inference Pricing Benchmark)。
- 云厂商资本开支:2026 年 Alphabet 指引 1950–2050 亿美元,Microsoft 约 1900 亿美元,Meta 1250–1450 亿美元(Hyperscaler)。另有统计口径称 Amazon 约 2000 亿美元、Google 约 1950 亿–2050 亿美元,四家合计推动约 7000 亿美元的基础设施竞赛(AI Data Centre Investment Ranking 2026、Amazon, Google, Microsoft and Meta Lead $700 Billion 2026 AI Infrastructure Race)。高盛则把资本开支分为三阶段:2023–2025 年约 6330 亿美元(年均约 2110 亿美元)、2026–2027 年约 1.73 万亿美元(年均约 8630 亿美元)、2028–2030 年进一步扩张(高盛测算:"AI第二阶段"的"资本缺口"要怎么补?)。
趋势与争议
电力与电网成为新瓶颈。 高密度 AI 机架要求协调可用电网电力、设施设计、部署周期与长期运营效率;液冷之所以成为主流答案,是因为它能让人在有限电力下"榨出"更多算力(Data center power density)。据 IEA 口径,数据中心用电约 40% 来自天然气、约 15% 来自煤电、核能约占 20%(Powering AI's future: The case for nuclear energy in data centers)。为锁定长期电力,Meta 于 2026 年 1 月签署最多 6.6 GW 核电协议(含与 Constellation 的 1.1 GW、20 年 PPA 及与 TerraPower、Oklo 的远期协议),Amazon 与 Talen Energy 就 Susquehanna 核电(1.9 GW)达成 200 亿美元安排(AI Data Center Energy Consumption Statistics 2026)。近期的电力缓解仍主要依赖燃气、燃料电池与电网效率提升(AI Power Demand: Grid Bottleneck 2026)。
资本开支的可持续性争议。 有测算指出,大型科技公司已把约 96% 的现金流投入资本开支,长期债务合计升至约 3419 亿美元(Alphabet 982 亿、Amazon 1289 亿、Meta 837 亿、Microsoft 311 亿)(AI Capex 2026: Big Tech Now Spends 96% of Its Cash Flow)。一旦 AI 需求放缓,约 7000 亿美元 capex 的回报节奏将受到审视(What an AI slowdown does to $700 billion in AI capex)。
互联路线的分化。 NVLink 代表封闭但高带宽的 scale-up 路线(并借 NVLink Fusion 向半定制开放),以太网阵营(Spectrum-X、Ultra Ethernet)则在 scale-out 上争夺开放生态(NVIDIA Vera Rubin)。同时,自研加速器(TPU Ironwood、Trainium3)在特定负载上对通用 GPU 形成价格/能效竞争(Tensor Processing Units、Announcing Amazon EC2 Trn3 UltraServers)。
推理需求的结构性上移。 随着 Agent、长上下文与推理模型的普及,算力需求曲线正从训练侧向推理侧延伸,算力供给持续紧张(高盛测算:"AI第二阶段"的"资本缺口"要怎么补?)。这也解释了为何 prefill/decode 解耦、KV cache 量化与更低价的 API 档位成为 2026 年基础设施优化的重点(Token prices fall as access tiers rise)。
出口管制与算力地缘。 美国商务部 BIS 于 2026 年 1 月修订对华半导体出口许可政策,将 Nvidia H200、AMD MI325X 等芯片的审查从"推定拒绝"改为"逐案审查"(Department of Commerce Revises License Review Policy、Revision to License Review Policy for Advanced Computing Commodities);同月 Trump 政府宣布对符合条件的对华出口芯片加征 25% 关税,但政策松动未立即转化为商业现实,H200 重返中国市场后收入占比不足 1%(英伟达H200芯片重返中国市场收入占比不足1%)。NVIDIA 在 2025 年 4 月因 H20 出口需许可而计提 45 亿美元费用(NVIDIA 10-K filing)。
参考来源
- AIデータセンターのエネルギー危機完全解説2026
- AI Data Center Energy Crisis 2026: Colossus, Stargate, and the Race for Power
- xAI's Memphis Colossus: Anatomie eines 100.000-GPU-Supercomputers
- GPT-6 Astra : 100 000 GPU Nvidia pour entraîner le modèle
- 全国产十万卡AI超集群落成并接入国家超算互联网
- Stargate Project Tracker
- Oracle's $300 Billion OpenAI Gamble
- OpenAI's Stargate Nevada Just Went Live
- OpenAI Stargate - Saline Township Campus
- Samsung Ships Industry-First Commercial HBM4
- SK hynix HBM4
- Micron in High-Volume Production of HBM4 Designed for NVIDIA Vera Rubin
- Samsung Unveils HBM4E at NVIDIA GTC 2026
- NVIDIA NVLink: The Scale-Up Network for AI Factories
- NVIDIA Vera Rubin
- NVIDIA NVLink and NVLink Switch
- NVIDIA DGX SuperPOD
- How the NVIDIA Vera Rubin Platform is Solving Agentic AI's Scale-Up Problem
- NVIDIA Rubin CPX
- NVIDIA Rubin CPX Accelerates Inference Performance and Efficiency
- How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context
- TPU7x (Ironwood) — Google Cloud Docs
- Tensor Processing Units — Google Cloud
- 第 8 世代 TPU:エージェンティック時代に向けた 2 つのチップ
- Announcing Amazon EC2 Trn3 UltraServers
- 谷歌TPU跑Kimi比英伟达GPU快57%
- What Is Mixture of Experts?
- The Evolution of Mixture-of-Experts Architectures in Large Language Models
- Scalable Training of Mixture-of-Experts Models with Megatron Core
- PyTorch vs JAX: Which Framework Wins Multi-Node GPU Training
- PyTorch vs JAX: which deep learning framework should you choose?
- Frameworks de Treinamento Distribuído
- vLLM vs SGLang vs TensorRT-LLM
- TensorRT-LLM vs vLLM vs SGLang: H100 Benchmark 2026
- vLLM Reaches 25K Total TPS/GPU on Qwen3.5
- Driving vLLM WideEP and Large-Scale Serving Toward Maturity on Blackwell
- KV Cache & PagedAttention Complete Guide (2026)
- 使用 NVFP4 KV 缓存优化大批次与长上下文推理
- UltraQuant: 4-bit KV Caching for Context-Heavy Agents
- Inference-Time Distillation
- Direct-to-Chip vs. Immersion Cooling: Which is Right for Your AI Data Center?
- Architecting Hybrid Cooling Layers for Mixed-Density Data Halls
- Liquid Cooling for GPU Clusters: The Direct-to-Chip Decision Framework
- NVIDIA HGX Platform
- NVIDIA GB300 NVL72
- AWS Trainium
- NVIDIA Inference Platform
- LLM Pricing Statistics (2026)
- 新浪财经:AI token 价格创新低
- Token prices fall as access tiers rise
- cloud accelerator pricing
- Best GPU Neoclouds 2026
- CoreWeave Raises 2026 Revenue Forecast to $12.4B–$13.2B
- CoreWeave Reports Strong First Quarter 2026 Results
- AI Data Center Liquid Cooling Adoption to Hit 53% in 2026
- Why Liquid Cooling is No Longer Optional for 2026 AI Workloads
- Uptime Institute Global Data Center Survey 2026
- Data Center Cooling Economics: Liquid vs Air vs Immersion in 2026
- 算力火爆带热液冷赛道
- 从一块芯片到一座机房
- Hyperscaler
- AI Data Centre Investment Ranking 2026
- Amazon, Google, Microsoft and Meta Lead $700 Billion 2026 AI Infrastructure Race
- 高盛测算:"AI第二阶段"的"资本缺口"要怎么补?
- Data center power density
- Powering AI's future: The case for nuclear energy in data centers
- AI Data Center Energy Consumption Statistics 2026
- AI Power Demand: Grid Bottleneck 2026
- AI Capex 2026: Big Tech Now Spends 96% of Its Cash Flow
- What an AI slowdown does to $700 billion in AI capex
- Department of Commerce Revises License Review Policy for Semiconductors Exported to China
- Revision to License Review Policy for Advanced Computing Commodities
- 英伟达H200芯片重返中国市场收入占比不足1%
- NVIDIA 10-K filing (nvda-20260125)
- Direct-to-Chip vs. Immersion Cooling: Fluid Types, Chemistry, and Selection Rules
- 算力火爆带热液冷赛道(腾讯新闻)
- The Oil of the AI Age? Compute Futures and the Neocloud Economy
- LLM Cost Per Million Tokens: 2026 Inference Pricing Benchmark
- KAYTUS AI Compute Pod Wins 2026 iF Design Award and Red Dot Award