140 lines
5.6 KiB
Markdown
140 lines
5.6 KiB
Markdown
---
|
||
title: GPU 集群
|
||
created: 2026-04-08
|
||
updated: 2026-04-08
|
||
type: concept
|
||
tags: [server, cooling]
|
||
sources: [raw/articles/2025-airport-construction-summit.md, raw/articles/keydak-airport-expo-2025.md, raw/articles/头豹研究院-中国AIDC产业发展白皮书2025-2025-07.md, raw/articles/上海市-智算中心建设导则2025版-2025-01.md]
|
||
---
|
||
|
||
# GPU 集群
|
||
|
||
## 定义
|
||
|
||
GPU 集群是由多台搭载 GPU(图形处理器)的服务器通过高速网络互联组成的计算单元,专门用于并行处理 AI 训练、推理、科学计算等高密度算力负载。
|
||
|
||
在机场智算中心场景下,GPU 集群是核心算力载体,支撑大模型训练、视频分析、智能决策等应用。
|
||
|
||
---
|
||
|
||
## 核心组成
|
||
|
||
### 算力芯片选型
|
||
|
||
|| 芯片 | 生产厂商 | FP16 算力 | 显存带宽 | NVLink带宽 | 功耗 | 机场适用场景 |
|
||
||------|---------|----------|----------|------------|------|-------------|
|
||
|| A100 SXM | NVIDIA | 312 TFLOPS | 2TB/s | 600GB/s | 400W | 训练/推理(当前主流) |
|
||
|| H100 SXM | NVIDIA | 1P | 3.35TB/s | 900GB/s | 700W | 大模型训练 |
|
||
|| H200 SXM | NVIDIA | 1P | 4.8TB/s | 900GB/s | 700W | 大规模训练/推理(HBM3e升级) |
|
||
|| B100 | NVIDIA | 1.75P | 8TB/s | 1.8TB/s | 1,000W | 超大规模智算中心 |
|
||
|| B200 | NVIDIA | 2.25P | 8TB/s | 1.8TB/s | 1,200W | 超大规模智算中心 |
|
||
|| **GB200 NVL72** | NVIDIA | **5P** | **16TB/s** | **3.6TB/s** | **2,700W** | 万卡集群(整机柜方案) |
|
||
|| 昇腾 910B | 华为 | 320 TFLOPS | — | — | 400W | 国产替代/推理 |
|
||
|
||
> 数据来源:头豹研究院《中国AIDC产业发展白皮书2025》
|
||
|
||
### 服务器形态(基于NVIDIA HGX架构)
|
||
|
||
|| 形态 | GPU算力 | GPU功耗 | 总功耗 | 适用场景 |
|
||
||------|---------|---------|--------|---------|
|
||
|| HGX A100 | 2.4P | 3.2kW | 6.5kW | 训练/推理(存量主流) |
|
||
|| HGX H100 | 8P | 5.6kW | 10.2kW | 训练集群主体 |
|
||
|| HGX B100 | 14P | 5.6kW | 10.2kW | 超大规模部署 |
|
||
|| **HGX B200** | **18P** | **8kW** | **14.3kW** | 万卡集群核心节点 |
|
||
|
||
> GB200 NVL72 为整机柜方案(72 GPU + 36 Grace CPU),单柜总功耗可达**2700W GPU芯片**,整柜更高。机场智算中心液冷需按**单柜15-30kW**设计。
|
||
|
||
> 数据来源:头豹研究院《中国AIDC产业发展白皮书2025》
|
||
|
||
### 网络架构
|
||
|
||
GPU 集群内网络是性能瓶颈,业界通常采用以下三层:
|
||
|
||
|| 网络层 | 带宽需求 | 协议/技术 |
|
||
||--------|---------|---------|
|
||
|| **计算网络**(GPU 间通信)| 800Gbps-1.6Tbps | InfiniBand HDR/NDR, RoCEv2 |
|
||
|| **存储网络** | 100-400Gbps | NVMe-oF, RoCEv2 |
|
||
|| **管理网络** | 1-10Gbps | 以太网 |
|
||
|
||
> 上海《智算中心建设导则2025》要求大规模训练场景下采用**智能无损网络**,计算网宜达**200Gbps**。
|
||
|
||
> 关键参数:GPU_PCIe_带宽需与网络带宽匹配(H100 SXM5 支持 900GB/s 双向 NVLink)
|
||
|
||
---
|
||
|
||
## 机场智算集群规划参数
|
||
|
||
基于行业实践,机场智算中心典型规模参考:
|
||
|
||
| 机场规模 | 推荐 GPU 集群规模 | 机柜数 | 典型功率密度 |
|
||
|---------|-----------------|--------|-------------|
|
||
| 年旅客量 < 1000万 | 32-64 卡 | 8-16 柜 | 50-80kW/柜 |
|
||
| 年旅客量 1000-5000万 | 64-256 卡 | 16-32 柜 | 60-100kW/柜 |
|
||
| 年旅客量 > 5000万 | 256-1024+ 卡 | 32-128+ 柜 | 80-120kW/柜 |
|
||
|
||
---
|
||
|
||
## 液冷配合(GPU 集群必选散热方案)
|
||
|
||
GPU 集群单机柜功率 50-120kW,传统风冷无法满足散热需求。
|
||
|
||
### 液冷方案对比
|
||
|
||
| 方案 | 散热能力 | 建设成本 | 运维复杂度 | 适用规模 |
|
||
|------|---------|---------|-----------|---------|
|
||
| **冷板式液冷** | ~120kW/柜 | 中 | 中 | 主流方案 |
|
||
| **浸没式液冷** | >200kW/柜 | 高 | 低(长期) | 超大规模 |
|
||
| **风液融合**(冷板+高效风冷)| 60-150kW/柜 | 中低 | 低 | 快速部署 |
|
||
|
||
> 华为自有冷板液冷技术已实现单柜 120kW 散热能力,详见 [[prefab-modular-dc]]
|
||
|
||
---
|
||
|
||
## 调度与运维
|
||
|
||
| 层面 | 技术选型 |
|
||
|------|---------|
|
||
| 集群管理 | Kubernetes + GPU Operator, Slurm |
|
||
| 分布式训练框架 | PyTorch DDP, Megatron-LM, DeepSpeed |
|
||
| 推理服务 | vLLM, TensorRT-LLM, Triton |
|
||
| 监控 | DCIM + Prometheus + Grafana |
|
||
| 算力调度 | 阿里云 ACK, 华为 CCI, 自研调度器 |
|
||
|
||
---
|
||
|
||
## 与现有页面的关联
|
||
|
||
- **[[modern-airport-trends]]** — 智算集群是四型机场趋势的技术驱动力
|
||
- **[[prefab-modular-dc]]** — 预制模块化 DC 是 GPU 集群的物理载体
|
||
- **[[power-and-cooling]]** — GPU 集群高功率密度决定液冷必选
|
||
- **[[network-architecture]]** — 计算网络(InfiniBand/RoCE)是集群性能关键
|
||
- **[[airport-data-center-overview]]** — GPU 集群是智算中心的核心子系统
|
||
|
||
---
|
||
|
||
## 机场集群投入参考
|
||
|
||
基于行业数据(千卡H100集群,头豹研究院2025白皮书):
|
||
|
||
| 组成 | 费用 |
|
||
|------|------|
|
||
| 算力设备 | 约3亿元 |
|
||
| 网络设备 | 约2,500万元 |
|
||
| 存储/安全 | 约1,000万元 |
|
||
| 平台软件/液冷改造 | 约1,000万元 |
|
||
| **总计** | **约3.5亿元** |
|
||
|
||
**年运营支出**: 约5,000万元(电力占主导)
|
||
|
||
1. **国产替代路径** — 昇腾 910B 与 NVIDIA H100 的软件生态差距(CUDA 迁移成本)
|
||
2. **GPU 虚机化** — vGPU/算力切分技术尚不成熟,多租户场景受限
|
||
3. **能效指标** — 智算中心如何定义适合机场场景的 PUE 基准(传统 DC PUE<1.3 目标不适用)
|
||
4. **运维人才** — 机场 IT 团队普遍缺乏 GPU 集群运维能力
|
||
|
||
---
|
||
|
||
## 延伸阅读
|
||
|
||
- 机场智算中心技术方案:根目录 `机场智算中心技术方案.md`
|
||
- Keydak 风液融合方案:`raw/articles/keydak-airport-expo-2025.md`
|