Files
my-vault/airport-wiki/concepts/gpu-cluster.md
T

5.6 KiB
Raw Blame History

title, created, updated, type, tags, sources
title created updated type tags sources
GPU 集群 2026-04-08 2026-04-08 concept
server
cooling
raw/articles/2025-airport-construction-summit.md
raw/articles/keydak-airport-expo-2025.md
raw/articles/头豹研究院-中国AIDC产业发展白皮书2025-2025-07.md
raw/articles/上海市-智算中心建设导则2025版-2025-01.md

GPU 集群

定义

GPU 集群是由多台搭载 GPU(图形处理器)的服务器通过高速网络互联组成的计算单元,专门用于并行处理 AI 训练、推理、科学计算等高密度算力负载。

在机场智算中心场景下,GPU 集群是核心算力载体,支撑大模型训练、视频分析、智能决策等应用。


核心组成

算力芯片选型

|| 芯片 | 生产厂商 | FP16 算力 | 显存带宽 | NVLink带宽 | 功耗 | 机场适用场景 | ||------|---------|----------|----------|------------|------|-------------| || A100 SXM | NVIDIA | 312 TFLOPS | 2TB/s | 600GB/s | 400W | 训练/推理(当前主流) | || H100 SXM | NVIDIA | 1P | 3.35TB/s | 900GB/s | 700W | 大模型训练 | || H200 SXM | NVIDIA | 1P | 4.8TB/s | 900GB/s | 700W | 大规模训练/推理(HBM3e升级) | || B100 | NVIDIA | 1.75P | 8TB/s | 1.8TB/s | 1,000W | 超大规模智算中心 | || B200 | NVIDIA | 2.25P | 8TB/s | 1.8TB/s | 1,200W | 超大规模智算中心 | || GB200 NVL72 | NVIDIA | 5P | 16TB/s | 3.6TB/s | 2,700W | 万卡集群(整机柜方案) | || 昇腾 910B | 华为 | 320 TFLOPS | — | — | 400W | 国产替代/推理 |

数据来源:头豹研究院《中国AIDC产业发展白皮书2025》

服务器形态(基于NVIDIA HGX架构)

|| 形态 | GPU算力 | GPU功耗 | 总功耗 | 适用场景 | ||------|---------|---------|--------|---------| || HGX A100 | 2.4P | 3.2kW | 6.5kW | 训练/推理(存量主流) | || HGX H100 | 8P | 5.6kW | 10.2kW | 训练集群主体 | || HGX B100 | 14P | 5.6kW | 10.2kW | 超大规模部署 | || HGX B200 | 18P | 8kW | 14.3kW | 万卡集群核心节点 |

GB200 NVL72 为整机柜方案(72 GPU + 36 Grace CPU),单柜总功耗可达2700W GPU芯片,整柜更高。机场智算中心液冷需按单柜15-30kW设计。

数据来源:头豹研究院《中国AIDC产业发展白皮书2025》

网络架构

GPU 集群内网络是性能瓶颈,业界通常采用以下三层:

|| 网络层 | 带宽需求 | 协议/技术 | ||--------|---------|---------| || 计算网络GPU 间通信)| 800Gbps-1.6Tbps | InfiniBand HDR/NDR, RoCEv2 | || 存储网络 | 100-400Gbps | NVMe-oF, RoCEv2 | || 管理网络 | 1-10Gbps | 以太网 |

上海《智算中心建设导则2025》要求大规模训练场景下采用智能无损网络,计算网宜达200Gbps

关键参数:GPU_PCIe_带宽需与网络带宽匹配(H100 SXM5 支持 900GB/s 双向 NVLink


机场智算集群规划参数

基于行业实践,机场智算中心典型规模参考:

机场规模 推荐 GPU 集群规模 机柜数 典型功率密度
年旅客量 < 1000万 32-64 卡 8-16 柜 50-80kW/柜
年旅客量 1000-5000万 64-256 卡 16-32 柜 60-100kW/柜
年旅客量 > 5000万 256-1024+ 卡 32-128+ 柜 80-120kW/柜

液冷配合(GPU 集群必选散热方案)

GPU 集群单机柜功率 50-120kW,传统风冷无法满足散热需求。

液冷方案对比

方案 散热能力 建设成本 运维复杂度 适用规模
冷板式液冷 ~120kW/柜 主流方案
浸没式液冷 >200kW/柜 低(长期) 超大规模
风液融合(冷板+高效风冷) 60-150kW/柜 中低 快速部署

华为自有冷板液冷技术已实现单柜 120kW 散热能力,详见 prefab-modular-dc


调度与运维

层面 技术选型
集群管理 Kubernetes + GPU Operator, Slurm
分布式训练框架 PyTorch DDP, Megatron-LM, DeepSpeed
推理服务 vLLM, TensorRT-LLM, Triton
监控 DCIM + Prometheus + Grafana
算力调度 阿里云 ACK, 华为 CCI, 自研调度器

与现有页面的关联


机场集群投入参考

基于行业数据(千卡H100集群,头豹研究院2025白皮书):

组成 费用
算力设备 约3亿元
网络设备 约2,500万元
存储/安全 约1,000万元
平台软件/液冷改造 约1,000万元
总计 约3.5亿元

年运营支出: 约5,000万元(电力占主导)

  1. 国产替代路径 — 昇腾 910B 与 NVIDIA H100 的软件生态差距(CUDA 迁移成本)
  2. GPU 虚机化 — vGPU/算力切分技术尚不成熟,多租户场景受限
  3. 能效指标 — 智算中心如何定义适合机场场景的 PUE 基准(传统 DC PUE<1.3 目标不适用)
  4. 运维人才 — 机场 IT 团队普遍缺乏 GPU 集群运维能力

延伸阅读

  • 机场智算中心技术方案:根目录 机场智算中心技术方案.md
  • Keydak 风液融合方案:raw/articles/keydak-airport-expo-2025.md