🧊 前沿科技知识库
全部 / 硬件与半导体

AI 集群网络(Networking for AI Clusters)

2026-09-26 · 硬件与半导体
最后更新:2026-09-26 | 领域:硬件·互连与数据中心 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

AI 集群网络负责把成千上万颗加速卡连接成一个可协同训练与推理的整体,其性能直接决定大规模并行任务的效率。业界把网络分为两个层次:Scale-up(纵向扩展),在机架内以高带宽、低时延的私有互连打通 GPU 之间的全互联;Scale-out(横向扩展),通过 InfiniBand 或以太网把大量节点连接为集群。随着 Mixture-of-Experts(MoE)等架构普及,all-to-all 通信量显著上升,网络的带宽、时延与拥塞控制成为训练性能的关键变量。工程上,AI 集群组网主要有两类实践:以 InfiniBand 为代表的专用高性能网络,和以以太网(RoCEv2,以及 UEC 规范的持续演进)为代表的开放网络,NVIDIA 同时提供两条路线(NVIDIA Quantum InfiniBand Switches and Appliances)。

最新进展(2025–2026)

核心技术与关键概念

代表性项目 / 公司 / 产品(附官方链接)

关键数据与评测结果(附来源)

趋势与争议

参考来源

← 存储技术类脑与新型计算(Neuromorphic and Novel Computing) →