--- title: GPU 集群 created: 2026-04-08 updated: 2026-04-15 type: concept tags: [server, cooling] sources: [raw/articles/2025-airport-construction-summit.md, raw/articles/keydak-airport-expo-2025.md, raw/articles/头豹研究院-中国AIDC产业发展白皮书2025-2025-07.md, raw/articles/上海市-智算中心建设导则2025版-2025-01.md] sources_count: 0 confidence: 0.5 last_confirmed: 2026-04-15 status: active --- # GPU 集群 ## 定义 GPU 集群是由多台搭载 GPU(图形处理器)的服务器通过高速网络互联组成的计算单元,专门用于并行处理 AI 训练、推理、科学计算等高密度算力负载。 在机场智算中心场景下,GPU 集群是核心算力载体,支撑大模型训练、视频分析、智能决策等应用。 --- ## 核心组成 ### 算力芯片选型 || 芯片 | 生产厂商 | FP16 算力 | 显存带宽 | NVLink带宽 | 功耗 | 机场适用场景 | ||------|---------|----------|----------|------------|------|-------------| || A100 SXM | NVIDIA | 312 TFLOPS | 2TB/s | 600GB/s | 400W | 训练/推理(当前主流) | || H100 SXM | NVIDIA | 1P | 3.35TB/s | 900GB/s | 700W | 大模型训练 | || H200 SXM | NVIDIA | 1P | 4.8TB/s | 900GB/s | 700W | 大规模训练/推理(HBM3e升级) | || B100 | NVIDIA | 1.75P | 8TB/s | 1.8TB/s | 1,000W | 超大规模智算中心 | || B200 | NVIDIA | 2.25P | 8TB/s | 1.8TB/s | 1,200W | 超大规模智算中心 | || **GB200 NVL72** | NVIDIA | **5P** | **16TB/s** | **3.6TB/s** | **2,700W** | 万卡集群(整机柜方案) | || 昇腾 910B | 华为 | 320 TFLOPS | — | — | 400W | 国产替代/推理 | > 数据来源:头豹研究院《中国AIDC产业发展白皮书2025》 ### 服务器形态(基于NVIDIA HGX架构) || 形态 | GPU算力 | GPU功耗 | 总功耗 | 适用场景 | ||------|---------|---------|--------|---------| || HGX A100 | 2.4P | 3.2kW | 6.5kW | 训练/推理(存量主流) | || HGX H100 | 8P | 5.6kW | 10.2kW | 训练集群主体 | || HGX B100 | 14P | 5.6kW | 10.2kW | 超大规模部署 | || **HGX B200** | **18P** | **8kW** | **14.3kW** | 万卡集群核心节点 | > GB200 NVL72 为整机柜方案(72 GPU + 36 Grace CPU),单柜总功耗可达**2700W GPU芯片**,整柜更高。机场智算中心液冷需按**单柜15-30kW**设计。 > 数据来源:头豹研究院《中国AIDC产业发展白皮书2025》 ### 网络架构 GPU 集群内网络是性能瓶颈,业界通常采用以下三层: || 网络层 | 带宽需求 | 协议/技术 | ||--------|---------|---------| || **计算网络**(GPU 间通信)| 800Gbps-1.6Tbps | InfiniBand HDR/NDR, RoCEv2 | || **存储网络** | 100-400Gbps | NVMe-oF, RoCEv2 | || **管理网络** | 1-10Gbps | 以太网 | > 上海《智算中心建设导则2025》要求大规模训练场景下采用**智能无损网络**,计算网宜达**200Gbps**。 > 关键参数:GPU_PCIe_带宽需与网络带宽匹配(H100 SXM5 支持 900GB/s 双向 NVLink) --- ## 机场智算集群规划参数 基于行业实践,机场智算中心典型规模参考: | 机场规模 | 推荐 GPU 集群规模 | 机柜数 | 典型功率密度 | |---------|-----------------|--------|-------------| | 年旅客量 < 1000万 | 32-64 卡 | 8-16 柜 | 50-80kW/柜 | | 年旅客量 1000-5000万 | 64-256 卡 | 16-32 柜 | 60-100kW/柜 | | 年旅客量 > 5000万 | 256-1024+ 卡 | 32-128+ 柜 | 80-120kW/柜 | --- ## 液冷配合(GPU 集群必选散热方案) GPU 集群单机柜功率 50-120kW,传统风冷无法满足散热需求。 ### 液冷方案对比 | 方案 | 散热能力 | 建设成本 | 运维复杂度 | 适用规模 | |------|---------|---------|-----------|---------| | **冷板式液冷** | ~120kW/柜 | 中 | 中 | 主流方案 | | **浸没式液冷** | >200kW/柜 | 高 | 低(长期) | 超大规模 | | **风液融合**(冷板+高效风冷)| 60-150kW/柜 | 中低 | 低 | 快速部署 | > 华为自有冷板液冷技术已实现单柜 120kW 散热能力,详见 [[prefab-modular-dc]] --- ## 调度与运维 | 层面 | 技术选型 | |------|---------| | 集群管理 | Kubernetes + GPU Operator, Slurm | | 分布式训练框架 | PyTorch DDP, Megatron-LM, DeepSpeed | | 推理服务 | vLLM, TensorRT-LLM, Triton | | 监控 | DCIM + Prometheus + Grafana | | 算力调度 | 阿里云 ACK, 华为 CCI, 自研调度器 | --- ## 与现有页面的关联 - **[[modern-airport-trends]]** — 智算集群是四型机场趋势的技术驱动力 - **[[prefab-modular-dc]]** — 预制模块化 DC 是 GPU 集群的物理载体 - **[[power-and-cooling]]** — GPU 集群高功率密度决定液冷必选 - **[[network-architecture]]** — 计算网络(InfiniBand/RoCE)是集群性能关键 - **[[airport-data-center-overview]]** — GPU 集群是智算中心的核心子系统 --- ## 机场集群投入参考 基于行业数据(千卡H100集群,头豹研究院2025白皮书): | 组成 | 费用 | |------|------| | 算力设备 | 约3亿元 | | 网络设备 | 约2,500万元 | | 存储/安全 | 约1,000万元 | | 平台软件/液冷改造 | 约1,000万元 | | **总计** | **约3.5亿元** | **年运营支出**: 约5,000万元(电力占主导) 1. **国产替代路径** — 昇腾 910B 与 NVIDIA H100 的软件生态差距(CUDA 迁移成本) 2. **GPU 虚机化** — vGPU/算力切分技术尚不成熟,多租户场景受限 3. **能效指标** — 智算中心如何定义适合机场场景的 PUE 基准(传统 DC PUE<1.3 目标不适用) 4. **运维人才** — 机场 IT 团队普遍缺乏 GPU 集群运维能力 --- ## 延伸阅读 - 机场智算中心技术方案:根目录 `机场智算中心技术方案.md` - Keydak 风液融合方案:`raw/articles/keydak-airport-expo-2025.md`