Files
airport-wiki/concepts/tech-infrastructure/gpu-cluster.md
T

143 lines
5.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
title: GPU 集群
created: 2026-04-08
updated: 2026-04-15
type: concept
tags: [server, cooling]
sources: [raw/articles/2025-airport-construction-summit.md, raw/articles/keydak-airport-expo-2025.md, raw/articles/头豹研究院-中国AIDC产业发展白皮书2025-2025-07.md, raw/articles/上海市-智算中心建设导则2025版-2025-01.md]
sources_count: 0
confidence: 0.5
last_confirmed: 2026-04-15
status: active
---
# GPU 集群
## 定义
GPU 集群是由多台搭载 GPU(图形处理器)的服务器通过高速网络互联组成的计算单元,专门用于并行处理 AI 训练、推理、科学计算等高密度算力负载。
在机场智算中心场景下,GPU 集群是核心算力载体,支撑大模型训练、视频分析、智能决策等应用。
---
## 核心组成
### 算力芯片选型
|| 芯片 | 生产厂商 | FP16 算力 | 显存带宽 | NVLink带宽 | 功耗 | 机场适用场景 |
||------|---------|----------|----------|------------|------|-------------|
|| A100 SXM | NVIDIA | 312 TFLOPS | 2TB/s | 600GB/s | 400W | 训练/推理(当前主流) |
|| H100 SXM | NVIDIA | 1P | 3.35TB/s | 900GB/s | 700W | 大模型训练 |
|| H200 SXM | NVIDIA | 1P | 4.8TB/s | 900GB/s | 700W | 大规模训练/推理(HBM3e升级) |
|| B100 | NVIDIA | 1.75P | 8TB/s | 1.8TB/s | 1,000W | 超大规模智算中心 |
|| B200 | NVIDIA | 2.25P | 8TB/s | 1.8TB/s | 1,200W | 超大规模智算中心 |
|| **GB200 NVL72** | NVIDIA | **5P** | **16TB/s** | **3.6TB/s** | **2,700W** | 万卡集群(整机柜方案) |
|| 昇腾 910B | 华为 | 320 TFLOPS | — | — | 400W | 国产替代/推理 |
> 数据来源:头豹研究院《中国AIDC产业发展白皮书2025》
### 服务器形态(基于NVIDIA HGX架构)
|| 形态 | GPU算力 | GPU功耗 | 总功耗 | 适用场景 |
||------|---------|---------|--------|---------|
|| HGX A100 | 2.4P | 3.2kW | 6.5kW | 训练/推理(存量主流) |
|| HGX H100 | 8P | 5.6kW | 10.2kW | 训练集群主体 |
|| HGX B100 | 14P | 5.6kW | 10.2kW | 超大规模部署 |
|| **HGX B200** | **18P** | **8kW** | **14.3kW** | 万卡集群核心节点 |
> GB200 NVL72 为整机柜方案(72 GPU + 36 Grace CPU),单柜总功耗可达**2700W GPU芯片**,整柜更高。机场智算中心液冷需按**单柜15-30kW**设计。
> 数据来源:头豹研究院《中国AIDC产业发展白皮书2025》
### 网络架构
GPU 集群内网络是性能瓶颈,业界通常采用以下三层:
|| 网络层 | 带宽需求 | 协议/技术 |
||--------|---------|---------|
|| **计算网络**GPU 间通信)| 800Gbps-1.6Tbps | InfiniBand HDR/NDR, RoCEv2 |
|| **存储网络** | 100-400Gbps | NVMe-oF, RoCEv2 |
|| **管理网络** | 1-10Gbps | 以太网 |
> 上海《智算中心建设导则2025》要求大规模训练场景下采用**智能无损网络**,计算网宜达**200Gbps**。
> 关键参数:GPU_PCIe_带宽需与网络带宽匹配(H100 SXM5 支持 900GB/s 双向 NVLink
---
## 机场智算集群规划参数
基于行业实践,机场智算中心典型规模参考:
| 机场规模 | 推荐 GPU 集群规模 | 机柜数 | 典型功率密度 |
|---------|-----------------|--------|-------------|
| 年旅客量 < 1000万 | 32-64 卡 | 8-16 柜 | 50-80kW/柜 |
| 年旅客量 1000-5000万 | 64-256 卡 | 16-32 柜 | 60-100kW/柜 |
| 年旅客量 > 5000万 | 256-1024+ 卡 | 32-128+ 柜 | 80-120kW/柜 |
---
## 液冷配合(GPU 集群必选散热方案)
GPU 集群单机柜功率 50-120kW,传统风冷无法满足散热需求。
### 液冷方案对比
| 方案 | 散热能力 | 建设成本 | 运维复杂度 | 适用规模 |
|------|---------|---------|-----------|---------|
| **冷板式液冷** | ~120kW/柜 | 中 | 中 | 主流方案 |
| **浸没式液冷** | >200kW/柜 | 高 | 低(长期) | 超大规模 |
| **风液融合**(冷板+高效风冷)| 60-150kW/柜 | 中低 | 低 | 快速部署 |
> 华为自有冷板液冷技术已实现单柜 120kW 散热能力,详见 [[prefab-modular-dc]]
---
## 调度与运维
| 层面 | 技术选型 |
|------|---------|
| 集群管理 | Kubernetes + GPU Operator, Slurm |
| 分布式训练框架 | PyTorch DDP, Megatron-LM, DeepSpeed |
| 推理服务 | vLLM, TensorRT-LLM, Triton |
| 监控 | DCIM + Prometheus + Grafana |
| 算力调度 | 阿里云 ACK, 华为 CCI, 自研调度器 |
---
## 与现有页面的关联
- **[[modern-airport-trends]]** — 智算集群是四型机场趋势的技术驱动力
- **[[prefab-modular-dc]]** — 预制模块化 DC 是 GPU 集群的物理载体
- **[[power-and-cooling]]** — GPU 集群高功率密度决定液冷必选
- **[[network-architecture]]** — 计算网络(InfiniBand/RoCE)是集群性能关键
- **[[airport-data-center-overview]]** — GPU 集群是智算中心的核心子系统
---
## 机场集群投入参考
基于行业数据(千卡H100集群,头豹研究院2025白皮书):
| 组成 | 费用 |
|------|------|
| 算力设备 | 约3亿元 |
| 网络设备 | 约2,500万元 |
| 存储/安全 | 约1,000万元 |
| 平台软件/液冷改造 | 约1,000万元 |
| **总计** | **约3.5亿元** |
**年运营支出**: 约5,000万元(电力占主导)
1. **国产替代路径** — 昇腾 910B 与 NVIDIA H100 的软件生态差距(CUDA 迁移成本)
2. **GPU 虚机化** — vGPU/算力切分技术尚不成熟,多租户场景受限
3. **能效指标** — 智算中心如何定义适合机场场景的 PUE 基准(传统 DC PUE<1.3 目标不适用)
4. **运维人才** — 机场 IT 团队普遍缺乏 GPU 集群运维能力
---
## 延伸阅读
- 机场智算中心技术方案:根目录 `机场智算中心技术方案.md`
- Keydak 风液融合方案:`raw/articles/keydak-airport-expo-2025.md`