Files
my-vault/airport-wiki/机场智算中心技术方案.md
T

61 KiB
Raw Blame History

机场智算中心技术方案

本方案综合整理自:中国信通院《人工智能算力基础设施赋能研究报告(2025)》、国信证券液冷专题报告、头豹研究院《2025年中国AIDC产业白皮书》、中国工业互联网研究院《工业智算发展研究报告(2025)》、临港算力液冷实践等 生成时间:2026-04-08 数据来源:详见附录


一、机场智算中心概述

1.1 定义

机场智算中心(Airport Intelligent Computing Center)是基于 GPU/NPU/ASIC 等异构算力芯片,为机场智能化应用提供训练与推理算力服务的专用基础设施。区别于传统数据中心,智算中心以高性能集群为核心载体,支撑大模型训练、AI推理、视频分析、智能决策等智能化负载。

1.2 与传统数据中心的核心差异

对比项 传统数据中心 智算中心
核心负载 ERP、Web、数据库 AI 训练/推理、视频分析
算力芯片 CPU 为主 GPU/NPU 集群为主
单机柜功率 5-15 kW 50-200+ kW
散热方式 风冷为主 液冷为主
网络重点 南北向 东西向高速互联
PUE 目标 1.4-1.6 ≤1.25(国家枢纽节点 ≤1.2

1.3 机场智算中心的典型应用场景

应用场景 具体内容 算力类型
航班智能调度 基于大模型的航班延误预测、停机位优化 训练+推理
行李全流程追踪 计算机视觉识别、异常检测 推理为主
视频智能分析 航站楼安防/客流热力图分析 推理为主
语音客服机器人 旅客问答、多语言翻译 推理为主
飞机故障预测 时序数据分析、故障预警 训练+推理
机场数字孪生 物理仿真、实时渲染 训练+推理
智能驾驶舱/巡检 四足机器人视觉导航、障碍检测 推理为主

1.4 算力规模测算参考

根据《2025年中国人工智能计算力发展评估报告》:

  • 2024年:中国智算规模 725.3 EFlopsFP16),同比增长 74.1%
  • 2025年预测:中国智算规模将达 1037.3 EFlops,增长 43%
  • 2023-2028年复合增长率:智算 46.2%,通算 18.8%

机场智算中心规模建议:

机场规模 推荐智算规模 GPU 卡数参考
千万级旅客以下 1-10 PFLOPSFP16 64-512 卡
千万至两千万级 10-50 PFLOPS 512-2048 卡
两千万级以上 50-200 PFLOPS+ 2048-8000+ 卡

二、整体技术架构

2.1 智算中心系统架构

┌─────────────────────────────────────────────────┐
│                  应用服务层                      │
│  航班调度大模型 │ 行李追踪 │ 安防分析 │ 客服机器人 │
├─────────────────────────────────────────────────┤
│                  模型服务层                      │
│  推理引擎(vLLM/TGI)│ 微调框架 │ 模型仓库       │
├─────────────────────────────────────────────────┤
│                  训练平台层                      │
│  分布式训练框架(NCCL/昇腾集合通信)│ 数据管理    │
├─────────────────────────────────────────────────┤
│                  算力调度层                      │
│  算力调度器│ 作业管理│ 配额计费│ 碳排放管理       │
├─────────────────────────────────────────────────┤
│  ┌──────────┐  ┌──────────┐  ┌──────────┐       │
│  │ GPU集群  │  │ GPU集群  │  │ CPU通用  │       │
│  │ (训练)   │  │ (推理)   │  │ 集群     │       │
│  └──────────┘  └──────────┘  └──────────┘       │
├─────────────────────────────────────────────────┤
│                  存储层                          │
│  分布式文件系统│ 分布式数据库│ 对象存储            │
├─────────────────────────────────────────────────┤
│                  网络层                          │
│  Spine-Leaf │ RoCE v2 │ 400G/800G              │
├─────────────────────────────────────────────────┤
│                  基础设施层                      │
│  供配电 │ 液冷系统 │ 机柜 │ 消防 │ 监控          │
└─────────────────────────────────────────────────┘

2.2 云边端协同架构

机场智算中心采用云-边-端三级协同架构:

云端(智算中心)
  │
  ├── 训练集群:大规模长时训练任务
  ├── 推理服务:实时性要求不高的批量推理
  └── 模型管理:模型训练、微调、版本管理

边缘(航站楼/塔台边缘节点)
  │
  ├── 实时推理:时延敏感业务(客流分析、安防告警)
  ├── 数据汇聚:本地数据预处理
  └── 断网自治:与云端断连时独立运行

端侧(摄像头、传感器、机器人)
  │
  ├── 轻量推理:目标检测、异常初筛
  └── 数据采集:原始数据上报

2.3 异构算力架构

机场智算中心建议采用多元异构算力架构,主流配置:

芯片类型 代表产品 适用场景 备注
GPU NVIDIA H100/H200/B200 大模型训练、高性能推理 主流选择
GPU NVIDIA L20/L40S 推理为主、中等规模 性价比方案
NPU 华为昇腾 910B 国产化替代 昇腾生态
NPU 海光 DCU 国产化替代 兼容 CUDA
ASIC 寒武纪思元 特定推理场景 国产化

推荐配置原则:

  • 训练集群:H100/H200NVLink 互联)
  • 推理集群:L40S 或国产 NPU(成本优化)
  • 国产化要求:昇腾 910B 系列优先

三、液冷系统技术方案

液冷是智算中心高功率密度散热的核心技术路线,也是本方案的重点。

3.1 背景与政策要求

根据国家发改委等四部门《数据中心绿色低碳发展专项行动计划》(2024年7月):

指标 目标
全国数据中心平均 PUE < 1.52025年底)
大型/超大型新建数据中心 PUE < 1.25
国家枢纽节点数据中心 PUE ≤ 1.2
绿电占比(枢纽节点新建) > 80%

智算中心芯片功耗飞速增长,是液冷成为刚需的根本原因:

芯片/系统 功耗 散热方式
CPU(英特尔至强 2000系列) 450-500W/颗 风冷极限
GPU(英伟达 A100 400W 需液冷
GPU(英伟达 H100 700W 必须液冷
GPU(英伟达 GB200 2700W/超级芯片 必须液冷
GPU机架(2024年典型) 130 kW/rack 必须液冷
GPU机架(2029年预测) > 1 MW/rack 全面液冷

3.2 液冷技术路线对比

液冷技术分为三大类:冷板式浸没式喷淋式

三类方案对比

对比项 冷板式液冷 浸没式液冷(单相) 浸没式液冷(相变)
成熟度 ★★★★★ 最高 ★★★★ 高 ★★★ 中
服务器改动 冷板安装 需定制服务器 需定制服务器
维护便利性 ★★★★ 较好 ★★★ 一般 ★★ 复杂
散热能力 强(覆盖CPU/GPU/显存) 极强 极强(相变换热)
单机柜密度 40-130 kW 100-500 kW 250-500+ kW
初期投资 中等 较高 最高
运维成本 中等 较低 较高
适用场景 当前主流,推荐 高密度细分场景 超高功率特种场景

冷板式液冷架构详解

冷板式液冷是当前市场主流,技术最成熟,对现有服务器生态改变最小。

系统架构:

室内侧(一次侧冷源)
  冷却塔 / 干冷器
       ↓(自然冷却/蒸发冷却)
  冷水机组(可选,夏季备用)
       ↓
  一次侧循环管路

          ↓ 板式换热器

室内侧(二次侧供液)
  CDU(冷却分配单元)
       ↓
  Manifold(液冷分配岐管)
       ↓
  冷板(直接贴附于芯片)
       ↓
  服务器内部:CPU冷板 + GPU冷板 + 内存冷板

关键设备参数:

设备 功能 关键参数
CDU 冷却液循环、温度控制 典型容量 200-400 kW,支持双路
Manifold 分液到各机柜 316L不锈钢,多路分配
冷板 直接接触芯片散热 接触面导热硅脂,微通道设计
一次侧管路 外部冷源连接 闭式循环,防冻液
二次侧管路 内部供液 快接接头,可维护设计

冷却液选型:

类型 冷板式常用 浸没式常用
冷却液 乙二醇/丙二醇溶液(防冻) 氟化液、矿物油(硅油)
去离子水 可用(需添加防冻剂) 不可直接用于浸没

3.3 液冷方案推荐

方案A:冷板式液冷(推荐新建机场智算中心)

适用场景: 单机柜功率 40-130 kW,预留升级空间

配置建议:

项目 参数
液冷占比 80-100%(全液冷)
风冷辅助 仅用于网络设备、少量通用服务器
PUE 目标 ≤ 1.15100%液冷)/ ≤ 1.2580%液冷)
单柜功率 上限 130 kWGB200 NVL72 级别)

英伟达 GB200 NVL72 参考架构(Vertiv):

  • 单机柜功率:130 kW
  • 架构:72 GPU + 36 CPUGrace Blackwell
  • 散热:100% 冷板液冷
  • 能耗节省:比传统风冷减少 25%
  • 空间节省:减少 75% 机柜占地
  • Vertiv 参考设计已获英伟达官方推荐

方案B:风液融合(过渡期推荐)

适用场景: 从传统风冷向全液冷过渡,或单机柜功率 40-80 kW 的中期场景

参数 数值
风冷支持 最高 40 kW/柜
液冷支持 最高 150 kW/柜
特点 风液同源、动态平衡、灵活部署

Keydak 金盾 2025 年国际机场博览会发布的风液融合方案已在国内多个智算中心落地。

3.4 PUE 优化措施

|| 措施 | 效果 | ||------|------| || 全液冷替代精密空调 | PUE 从 1.5 降至 1.15-1.25(典型值) | || 冷通道封闭 | 减少冷热气流混合,节能 10-15% | || 自然冷却利用 | 冬季低温期配合液冷进一步降低 PUE | || 高效 UPS(模块化效率≥96%) | 降低供电损耗 | || AI 调优 | 实时调节液冷流量与温度 |

PUE 边界说明:PUE = 1.0 为理想值(所有电力用于计算,无任何制冷/供电损耗)。实际智算中心 PUE 取决于:① 液冷比例(全液冷 vs. 风液混合)、② 当地气候条件(冬季低温期可大幅降低冷却功耗)、③ 供电效率(UPS/变压器损耗)。在典型机场气候条件下(无极端寒冷),全液冷 PUE 典型值为 1.15-1.25,接近 1.1 需要浸没式液冷 + 极寒气候 + 自然冷却配合。


四、算力集群技术方案

设计原则:本章节遵循 Scale-Up(节点内纵向扩展)+ Scale-Out(节点间横向扩展) 双重扩展架构。Scale-Up 以 NVLink/NVSwitch 为核心解决节点内 GPU 全互联问题;Scale-Out 以 InfiniBand/RoCE 为骨干解决多节点集合通信问题。两层网络各有分工,共同支撑从单卡到万卡的算力扩展路径。


4.1 单节点硬件拓扑设计

4.1.1 GPU 节点架构演进

GPU 服务器节点从单卡到多卡的拓扑演进,核心矛盾是** PCIe 带宽瓶颈 vs. NVLink 直连带宽**

|| 架构代际 | 代表产品 | GPU 互联方式 | 端口聚合双向带宽 | GPU 对等带宽 | ||---------|---------|------------|--------------|------------| || 第1代(2018| V100 SXM2 | NVLink 1.06 链路 | 300 GB/s | 300 GB/s | || 第2代(2020| A100 SXM4 | NVLink 3.012 链路 | 600 GB/s | 600 GB/s | || 第3代(2022| H100 SXM5 | NVLink 4.018 链路 | 900 GB/s | 900 GB/s | || 第4代(2024| B200 SXM | NVLink 5.018 链路 | 1.8 TB/s | 900 GB/s | || 第5代(预测)| Rubin Ultra | NVLink 6.0 | ~3.6 TB/s | ~1.8 TB/s |

关键结论

  • NVLink 5 端口聚合双向带宽 1.8 TB/s 是 NVSwitch Fabric 内部 18 链路的总带宽,任意 GPU 到任意 GPU 的对等带宽仍为 900 GB/s 双向
  • H100 NVLink 4900 GB/s)是 A100 PCIe 4.0 x1664 GB/s)的 14 倍,因此多 GPU 节点必须走 NVLink/NVSwitch,不能走 PCIe 交换
  • 表中第4代"1.8 TB/s"是聚合总带宽,不能与 H100 的"单 GPU 可用带宽 900 GB/s"直接对比

4.1.2 HGX H100/H200 8-GPU 系统拓扑

NVIDIA HGX H100 是当前最主流的 AI 训练服务器架构:

                    ┌─────────────────────────────────┐
                    │       HGX H100 8-GPU Server      │
                    │                                  │
  CPU (AMD EPYC / Intel Xeon)                          │
      │ × 2                                          │
      │                                              │
  PCIe Gen5 x16 (Host Bridge)                        │
      │                                              │
  ┌──────────────────────────────────────────────┐   │
  │        NVSwitch Fabric6 芯片,2 平面)         │
  │  NVSwitch① ── NVSwitch② ── NVSwitch③           │
  │      ↖           ↑           ↗                 │
  │  NVSwitch④ ── NVSwitch⑤ ── NVSwitch⑥           │
  │   (全连接拓扑,任意GPU间单跳可达)              │
  └──────────────────────────────────────────────┘   │
      │  │  │  │  │  │  │  │                        │
    GPU0 GPU1 GPU2 GPU3 GPU4 GPU5 GPU6 GPU7          │
    H100  H100  H100  H100  H100  H100  H100  H100  │
    SXM5  SXM5  SXM5  SXM5  SXM5  SXM5  SXM5  SXM5 │
    80GB  80GB  80GB  80GB  80GB  80GB  80GB  80GB  │
    HBM3  HBM3  HBM3  HBM3  HBM3  HBM3  HBM3  HBM3 │
    └────────── PCIe Gen5 ─────────┘               │
    └────── InfiniBand / RoCE 网卡 ───────────────┘  │
                    └─────────────────────────────────┘

关键拓扑参数(HGX H100):

|| 参数 | 规格 | ||------|------| || GPU 数量 | 8 × NVIDIA H100 SXM5 | || GPU 间 NVLink 带宽 | 900 GB/s 双向(全互联)| || NVSwitch 芯片数 | 6 片(2 组各 3 片,全连接拓扑)| || NVSwitch 交换容量 | 25.6 Tb/s 每芯片 | || 单节点 BF16 算力(稀疏)| ~3,958 TFLOPS ≈ 4 PFLOPS | || 单节点 FP16 算力(稠密)| ~1,979 TFLOPS ≈ 2 PFLOPS | || 每 GPU HBM3 容量 | 80 GBSXM5 版本)| || 每 GPU HBM3 带宽 | 3.35 TB/s | || CPU 配置 | 2 × AMD EPYC 9004/9005 或 Intel Xeon Scalable | || 主机内存 | 2 TB DDR5 ECC | || 存储本地 SSD | 2 × 3.84 TB NVMeOS + 缓存)| || 电源配置 | 4 × 3.3 kW PSU~13 kW 总功耗)| || 散热方式 | 冷板式液冷(必须)|

HGX H100 架构中,NVSwitch Fabric 由 6 片 NVSwitch 芯片组成(每 3 片为一组,构成两个全连接平面),提供节点内 8 GPU 全互联。NCCL 集合通信在 NVSwitch 内部全速运行,不受 PCIe 争用影响。

CPU 与 GPU 连接路径:

CPU0 ──→ PCIe Gen5 x16 ──→ CPU1  (AMD Infinity Fabric / Intel UPI)
     └────────┬───────────────────────┐
              │                       │
         NVSwitch              InfiniBand/
         Fabric (GPU)           RoCE 网卡

HGX H100 架构中,CPU 与 GPU 之间不直接走 PCIe 交换,而是通过 NVSwitch 内部路径访问 GPU 内存。NCCL 集合通信在 NVSwitch 内部全速运行,不受 PCIe 争用影响。

4.1.3 GB200 NVL72 机架级超级芯片架构

GB200 NVL72 是 NVIDIA Blackwell 架构的机架级集成方案,代表当前最极致的 Scale-Up 设计:

物理架构:

|| 组件 | 数量 | 说明 | ||------|------|------| || Blackwell GPU (B200) | 72 张 | 每 GPU BF16 算力 ~1,800 TFLOPS(稀疏)| || Grace CPU (Neoverse V2) | 36 颗 | 72 核 ARM,每颗 240 GB LPDDR5 | || NVLink Switch 芯片 | 9 片 | 来自 NVLink Switch 第4代 | || GPU 内存总量 | 13.5 TB HBM3e | 每 GPU 186 GB(×72| || CPU 内存总量 | 8.6 TB LPDDR5 | 每 CPU 240 GB(×36| || NVLink 域带宽(聚合)| 130 TB/s | 72 GPU 全互联 | || 单机柜功率 | 132 kWTDP/ 峰值更高 | || CDU 容量 | 250 kWSupermicro 方案)| || 散热方式 | 100% 冷板液冷 |

:Blackwell 架构的核心营销指标是 BF16 机器学习精度,FP64 主要用于 HPC 科学计算,对机场 AI 推理/训练场景无直接参考价值,原文档使用 FP64 算力指标是误导性引用。

计算托盘(Compute Tray)结构:

每个计算托盘:
  ┌─────────────────────────────────┐
  │  1 × GB200 超级芯片 (= 2×B200 + 1×Grace CPU)  │
  │  显存: 2 × 186 GB = 372 GB HBM3e               │
  │  功率: ~2.7 kW(超级芯片总功耗)                  │
  └─────────────────────────────────┘

18 个计算托盘 × 4 GPU/托盘 = 72 GPU

NVLink 域设计:

  • 72 GPU 在同一个 NVLink 域(NVLink Domain 内全互联
  • 任意两 GPU 之间通信:单跳,无需跨交换机
  • 对等带宽:900 GB/s 任意 GPU 到任意 GPU(是 InfiniBand NDR 400G 的约 2.3 倍;"1.8 TB/s"为 Fabric 聚合总带宽,非对等带宽)
  • 张量并行(Tensor Parallelism 可覆盖全部 72 GPU,适合超大规模模型
  • 推理加速:NVIDIA 官方宣称的 30 倍加速基于特定 LLM 基准测试(GPT-3 175B),实际加速比与模型规模、批大小、输入长度强相关,不同 workload 差异显著,不应作为通用指标

SuperPOD 扩展(8 × NVL72 = 576 GPU):

8 × GB200 NVL72 rack
      │
      │  (NVLink 扩展 via NVLink Switch)
      │
  576 GPU 全互联域
  总带宽: >1 PB/s
  总显存: 108 TB HBM3e

机场场景建议GB200 NVL72 单柜 132kW,功率密度极高,建议在机场智算中心预留此架构,但当前阶段以 HGX H100/H200 8-GPU 节点为主(单节点 ~13kW,可用液冷机柜支撑)。

4.1.4 推理服务器节点拓扑(4-GPU 配置)

推理服务器针对高并发、低延迟场景,与训练服务器拓扑差异显著:

推荐节点架构:

参数 NVIDIA L40S 方案 昇腾 910B 方案(国产)
GPU 数量 4 × L40S 4 × 昇腾 910B
GPU 显存 48 GB GDDR6 64 GB HBM
GPU 间互联 PCIe Gen4 交换(无 NVLink HCCS(华为集合通信)
GPU 通信带宽 ~64 GB/sPCIe x16 ~392 GB/sHCCS
单节点算力 ~2 PFLOPSFP16 ~2 PFLOPSFP16
适用场景 中等规模推理 国产化推理
功耗 ~4 kW/节点 ~4.5 kW/节点
散热 风冷或液冷 风冷或液冷

L40S vs H100 推理对比:

对比项 L40S(推理为主) H100(训练/推理)
显存带宽 864 GB/s GDDR6 3.35 TB/s HBM3
INT8 算力 ~733 TFLOPS ~3,958 TFLOPS
NVLink 900 GB/s
功耗 350 W 700 W
推理场景 中等 Batch、QPS < 1000 大 Batch、高吞吐
性价比 优(推理专用) 高性能但成本高

4.2 多节点集群组网架构(Scale-Out)

4.2.1 集群网络分层架构

智算集群网络分为三层三平面

┌────────────────────────────────────────────────────────────┐
│  集群外部网络(Border)                                       │
│  互联网/专线/机场内部网络  ←→  防火墙/负载均衡                  │
└────────────────────────────────────────────────────────────┘
                          │
┌────────────────────────────────────────────────────────────┐
│  管理网络平面(Management Network                           │
│  BMC / IPMI / SSH / 监控采集                                 │
│  ←→ 千兆以太网(Out-of-Band                               │
│  带宽:1 Gb/s(管理流量,带外)                               │
└────────────────────────────────────────────────────────────┘
                          │
┌────────────────────────────────────────────────────────────┐
│  存储网络平面(Storage Network                              │
│  分布式存储读写 / checkpoint 存取                            │
│  ←→ RoCE v2 / InfiniBand + NVMe-oF                        │
│  带宽:200-400 Gb/s                                        │
└────────────────────────────────────────────────────────────┘
                          │
┌────────────────────────────────────────────────────────────┐
│  计算网络平面(Compute Network / AI Fabric                 │
│  GPU 集合通信(NCCL) / 梯度同步 / 数据并行                    │
│  ←→ InfiniBand NDR 400G / Spectrum-X 400G                 │
│  带宽:400 Gb/s(节点间)                                   │
└────────────────────────────────────────────────────────────┘

4.2.2 InfiniBand NDR 400G 组网设计

InfiniBand 是当前 AI 训练集群的事实标准网络,原因:

  • 硬件原生 RDMA:绕过操作系统内核,直接内存访问,延迟 < 1 μs
  • 自适应路由(Adaptive Routing:每包独立路由,充分利用所有链路
  • SHARP 网内计算:在交换机内聚合梯度,无需送回 GPU 再聚合
  • NVIDIA Collective CommunicationsNCCL)原生支持

InfiniBand NDR 400G 关键参数:

参数 规格
单端口带宽 400 GbpsNDR = Next Data Rate
编码方式 PAM4(每 lane 53.125 Gbaud
线缆类型 光纤(多模 OM4 / 单模 LC
交换机型号 NVIDIA QM9700 系列
交换机端口密度 64 端口 × 400G
拓扑支持 Fat-Tree / DragonFly+ / Hypercube
每交换机延迟 < 0.6 μs(端到端)
拥塞控制 CNPCongestion Notification Packet

Fat-Tree 拓扑设计(推荐中小规模 512 GPU):

                    ┌─────────────┐
                    │  Core Switch │  InfiniBand QM9700
                    │   (2-4 台)   │  64 端口 400G
                    └──────┬──────┘
                           │
         ┌─────────────────┼─────────────────┐
         │                 │                 │
    ┌────▼────┐       ┌────▼────┐       ┌────▼────┐
    │ Agg 1   │       │ Agg 2   │       │ Agg 3   │
    │ QM9700  │       │ QM9700  │       │ QM9700  │
    └────┬────┘       └────┬────┘       └────┬────┘
         │                 │                 │
   [16 servers]     [16 servers]      [16 servers]
   每组 8× GPU     每组 8× GPU       每组 8× GPU
   节点 1-16       节点 17-32        节点 33-48

端口规划公式:

集群规模 Spine 交换机数 每个 Spine 上联端口 下联端口/交换机
64 GPU8节点) 2 0 32-48
512 GPU64节点) 4 16-32 32
1024 GPU128节点) 8 32-64 32
4096 GPU512节点) 16 32 32

每个 8-GPU 服务器通常配置 2 × 400G InfiniBand 双上联,通过多路径(Multi-Path)和 LACP Bonding 实现带宽聚合与冗余容错。典型部署中每台服务器两个 400G 端口分别上联到两台 Leaf 交换机,故障时可无缝切换。

4.2.3 Spectrum-X 以太网方案(替代方案)

Spectrum-X 是 NVIDIA 面向 AI 的以太网解决方案,适合不愿意引入 InfiniBand 专有生态的用户:

参数 Spectrum-X 400G InfiniBand NDR 400G
技术基础 以太网(RoCE v2 InfiniBand
延迟 1-2 μs < 0.6 μs
NCCL 性能 基准 ~100% 最优 ~100%
生态开放性 高(标准以太网) 低(需 IB 交换设备)
运维复杂度 低(统一以太网运维) 高(独立 IB 网络)
供应商 NVIDIA、华为 NVIDIAMellanox
推荐场景 推理集群、混合云 训练集群(强烈推荐)

Spectrum-X 关键技术(ROCEv2 + NVIDIA 网络流优化):

  • 增强 RoCEeRoCE:支持可变 MTU(IMIX),减少小包开销
  • NetFlow 流管理:智能负载均衡,自动路径选择
  • 拥塞控制TensorFlow/MPI 层内置支持

4.2.4 万卡集群超节点(SuperPOD)架构

万卡集群的网络设计需要在 InfiniBand 拓扑 上精心规划:

典型 32-GPU SU(可扩展单元)InfiniBand 规划:

每 4 台 8-GPU 服务器 = 1 个 SU32 GPU
  4 × 服务器 × 2 × 400G IB 上联 = 8 个 QSFP-DD 端口连接上联交换机

千卡集群(1000+ GPUFat-Tree 规格:

参数 1024 GPU128节点) 2048 GPU256节点)
交换机型号 QM9700 QM9700
Spine 数 8 16
每 Spine 下联 32 端口 400G 32 端口 400G
Agg 层 16 32
收敛比 1:1(无收敛) 1:1(无收敛)
总 InfiniBand 端口 512 + 512 = 1024 1024 + 1024 = 2048
网络直径 3 跳(最差路径) 3 跳

关键设计原则:

  1. 收敛比 ≤ 1:1:AI 训练流量无阻塞,避免网络成为瓶颈
  2. InfiniBand 多路径:每服务器双上联,双 L3 自适应路由
  3. GPU Direct RDMA:跨节点 GPU 直接内存访问,绕过 CPU
  4. SHARP 网内聚合:梯度在交换机内聚合,节省 30-50% 通信量

4.3 存储集群设计

4.3.1 存储需求分析

AI 训练集群的存储负载分为三类:

存储类型 用途 性能要求 典型容量
数据湖存储 原始训练数据、语料库 顺序读取带宽 ≥500 GB/s 10-100 PB
模型存储 检查点、训练产出模型 写入带宽 ≥100 GB/s,延迟 < 1 ms 1-10 PB
共享文件系统 代码、配置、小文件共享 IOPS ≥ 1M,小文件吞吐 100 TB-1 PB
本地缓存 热点数据本地加速 NVMe 本地,读缓存 1-10 TB/节点

4.3.2 全闪存分布式文件系统架构

推荐方案:JuiceFS + 对象存储(兼容 S3+ 本地 NVMe 缓存

┌─────────────────────────────────────────────────────────┐
│                    应用层(GPU 节点)                      │
│  训练框架 ───→ JuiceFS FUSE / CSI 驱动 ───→ POSIX 接口  │
└─────────────────────────────────────────────────────────┘
                          │
                    ┌─────▼─────┐
                    │ JuiceFS   │   元数据引擎(TiKV/RocksDB
                    │ 客户端    │   缓存层(L1本地 NVMe / L2 共享 SSD
                    └─────┬─────┘
                          │
          ┌───────────────┼───────────────┐
          │               │               │
    ┌─────▼─────┐  ┌─────▼─────┐  ┌─────▼─────┐
    │ 对象存储   │  │ 对象存储   │  │ 对象存储   │
    │ (MinIO)   │  │ (CEPH RGW)│  │ (S3 兼容)  │
    │ 10+ PB    │  │  多站点    │  │  备份     │
    └───────────┘  └───────────┘  └───────────┘

JuiceFS 关键参数(AI 训练场景):

参数 推荐值
元数据引擎 TiKV(分布式,≥3 节点)或 Redis(单机测试)
数据存储 对象存储(S3 兼容,任意厂商)
本地缓存 每节点 1-2 TB NVMe SSDL1 缓存)
共享 SSD 缓存 每机柜 4-8 TB NVMe SSDL2 缓存)
小文件聚合 4 MiB chunk,减少元数据压力
读取预取 自动预取临近数据块,降低 IO 等待
并行读 128-256 并发线程,最大化带宽利用率

分布式存储产品选型:

产品 类型 适用规模 AI 训练适配度
JuiceFS 元数据+对象存储分离 中大规模 ★★★★★
BeeGFS 并行文件系统 超大规模 ★★★★
GPFSIBM Spectrum Scale 并行文件系统 企业级 ★★★★
曙光 ParaStor 全闪存分布式 国产化 ★★★★
华为 OceanStor 9000 全闪存分布式 大规模 ★★★★

4.3.3 存储网络设计

存储流量走独立 RoCE v2 网络,与计算网络物理隔离:

网络平面 协议 带宽 交换机
计算网络 InfiniBand NDR 400G × 2(双上联) QM9700
存储网络 RoCE v2 + NVMe-oF 200-400G Spectrum-X / 华为 CloudEngine
管理网络 以太网 1G 接入交换机

存储性能目标(AI 训练):

|| 指标 | 目标值 | 前提条件 | ||------|-------|---------| || 聚合读带宽 | ≥ 500 GB/s10 PB 集群)| 需 20+ 全闪存存储节点,每节点 25 GB/s 读带宽,200G 存储网络聚合 | || 聚合写带宽 | ≥ 100 GB/s | 需 NVMe SSD 配置,多路并发写入 | || 元数据 IOPS | ≥ 100 万 | 需分布式元数据引擎(如 TiKV),小文件聚合策略 | || 检查点保存时间 | ≤ 30 秒(100 GB 检查点)| 需 100G+ 存储网络 + 本地 NVMe SSD 缓存 | || 存储可靠性 | 99.9999%(6 个 9)| 副本/纠删码策略,多站点部署 |

:上述性能目标均为有前置条件的系统设计指标,实际达成需要:足够的存储节点数量、充足的存储网络带宽、正确配置的小文件聚合策略。初次建设时应优先保证核心指标(检查点写入带宽),其他指标可随集群扩展逐步达标。


4.4 训练集群软件栈

4.4.1 分布式训练框架

AI 训练软件栈从底层到应用分为五层:

┌──────────────────────────────────────────┐
│    应用层:训练脚本(PyTorch/LLaMA-Factory)│
├──────────────────────────────────────────┤
│    框架层:PyTorch 2.x + 分布式通信优化    │
│           DeepSpeed / Megatron-LM / ColossalAI│
├──────────────────────────────────────────┤
│    通信层:NCCL 2.xNVIDIA             │
│           HCCS(昇腾)/ OpenUCCL(国产)  │
├──────────────────────────────────────────┤
│    驱动层:CUDA 12.x / ROCm 6.x          │
│           GPU Driver / cuBLAS / cuDNN    │
├──────────────────────────────────────────┤
│    硬件层:NVLink / InfiniBand / RoCE    │
└──────────────────────────────────────────┘

框架选型建议:

框架 适用场景 并行策略支持
PyTorch 2.x + FSDP 通用大模型训练 DDP / FSDP / TP
DeepSpeed ZeRO 超大模型(千亿参数+ ZeRO-1/2/3、流水线、张量并行
Megatron-LM 极致张量并行优化 TP + PP + DP 三维并行
ColossalAI 异构训练、多种并行策略 动态调度、ZeRO++

DeepSpeed ZeRO 并行策略详解:

策略 显存优化 通信量 适用场景
ZeRO-1 分片优化器状态 较少 大模型,多节点
ZeRO-2 + 分片梯度 中等 大模型,多节点
ZeRO-3 + 分片参数 较大(all-gather 超级大模型
ZeRO-Offload CPU 卸载 依赖 PCIe 单机大模型
ZeRO-Infinity 卸载到 NVMe/内存 依赖带宽 超大模型,单机

4.4.2 集合通信配置(NCCL

NCCL 是 NVIDIA GPU 集合通信库,是分布式训练性能的核心:

NCCL 关键配置参数:

# NCCL 环境变量参考配置
NCCL_DEBUG=info           # 调试日志(生产环境关闭)
NCCL_IB_DISABLE=0         # 启用 InfiniBand
NCCL_NET_GDR_LEVEL=PIX    # GPU 直接访问网卡(最佳性能)
NCCL_NVLS_DISABLE=0        # 启用 NVLink 域内通信
NCCL_MIN_NCHANNELS=4      # 最小通道数
NCCL_MAX_NCHANNELS=16     # 最大通道数(InfiniBand 多路径)
NCCL_ALGO=Tree             # 集合通信算法(Ring/Tree/Tunnel
NCCL_PROTO=LL              # 协议(Simple/ LL/ Elemy
NCCL_BUFFSIZE=2097152      # 环形缓冲区大小(字节)

NCCL 在 GB200 NVL72 中的拓扑感知:

# 拓扑感知的进程亲和性设置(关键!)
import torch
import torch.distributed as dist

# 获取 GPU NVLink 对等关系
torch.cuda.can_device_access_peer(local_gpu, remote_gpu)

# Megatron-LM 中使用 NVL72 拓扑
# nvidia.com/gpu.clique: 同一 NVLink 域内的 GPU 标记
# Megatron 自动优先在 NVLink 域内布置张量并行组

NCCL 测试验证(上线前必须执行):

# 单节点 8-GPU NCCL 测试
./build/all_reduce_perf -b 8M -e 8G -f 2 -g 8

# 跨节点 NCCL 测试(每个节点启动)
./build/all_reduce_perf -b 8M -e 8G -f 2 -g 8 \
  -N 1 -w 100 -n 100

预期 NCCL 带宽基准:

通信模式 H100 NVLink 域内 H100 InfiniBand 400G L40S PCIe
AllReduce8 GPU ~850-900 GB/s 300-350 GB/s ~60 GB/s
AllReduce(跨节点) N/A 300-350 GB/s ~60 GB/s
AllGather ~880 GB/s 280-320 GB/s ~55 GB/s
ReduceScatter ~870 GB/s 280-320 GB/s ~55 GB/s

目标InfiniBand 400G 的 NCCL 带宽应达到理论峰值的 80% 以上(即 ≥ 320 GB/s),否则说明网络有瓶颈。

4.4.3 作业调度器选型

调度器 适用场景 优点 缺点
Slurm 超算/HPC 传统场景 生态成熟,稳定可靠 不支持容器原生
Kubernetes + Volcano 云原生 AI 平台 生态丰富,弹性伸缩 配置复杂
Kubeflow MLOps 全流程 与 K8s 深度集成 较重
OpenPAI(微软) 企业内部 AI 平台 支持多租户 社区活跃度下降
VarStore(平头哥) 大规模训练 高效调度 主要支持 TPU 生态

Kubernetes + Volcano 推荐配置(机场智算中心):

# Volcano Job 示例:启动一个 64-GPU 分布式训练任务
apiVersion: batch.volcano.sh/v1alpha1
kind: Job
metadata:
  name: flight-delay-llm-training
spec:
  replicas: 8          # 8 个 Pod(每 Pod 8 GPU
  minAvailable: 64    # 至少 64 GPU 可用才启动
  schedulerName: volcano
  tasks:
    - replicas: 8
      name: trainer
      template:
        spec:
          containers:
            - name: training
              image: pytorch:2.3-cuda12.1
              command:
                - torchrun
                - --nproc_per_node=8
                - --nnodes=8
                - /workspace/train.py
              resources:
                nvidia.com/gpu: 8
              volumeMounts:
                - mountPath: /data
                  name: data-volume
          volumes:
            - name: data-volume
              persistentVolumeClaim:
                claimName: training-data-pvc
          nodeSelector:
            nvidia.com/gpu.product: H100-SXM5-80GB
          tolerations:
            - key: "nvidia.com/gpu"
              operator: "Exists"

4.5 推理集群设计

4.5.1 高吞吐推理架构

                          ┌──────────────────┐
                          │   L4/L40S 推理节点 │
                          │  (Kubernetes Pod)  │
                          │  vLLM / TFLite    │
                          └────────┬─────────┘
                                   │
                          ┌────────▼─────────┐
                          │   RoCE v2 存储网络 │
                          │  (模型加载/热数据)  │
                          └────────┬─────────┘
                                   │
┌──────────────────────────────────┼──────────────────────┐
│                    推理服务层(Kubernetes                  │
│  Prometheus + Alertmanager(监控)  │  Seldon CoreServing)│
└──────────────────────────────────┴──────────────────────┘
                          │
                          ▼
                    ┌──────────┐
                    │ LLM Router│
                    │ (流量调度)│
                    └──────────┘
                          │
         ┌────────────────┼────────────────┐
         ▼                ▼                ▼
   ┌──────────┐      ┌──────────┐      ┌──────────┐
   │ 推理节点1 │      │ 推理节点2 │      │ 推理节点3 │
   │ L40S ×4  │      │ L40S ×4  │      │ L40S ×4  │
   └──────────┘      └──────────┘      └──────────┘

4.5.2 推理引擎深度对比

引擎 开发方 推理框架 KV Cache 多模型 国产适配
vLLM 伯克利 LMSYS PyTorch PagedAttention 昇腾(第三方)
TensorRT-LLM NVIDIA 官方 TensorRT 动态批处理 仅 NVIDIA GPU
SGLang 斯坦福 PyTorch RadixAttention 昇腾(实验)
Ollama 本地推理 Llama.cpp - 多模型 CPU/GPU
TGI HuggingFace 多种后端 昇腾(第三方)

vLLM 关键配置参数:

# vLLM 推理服务配置
vllmArgs = [
    "--model", "/models/flight-llm-7b",
    "--tensor-parallel-size", "4",          # 张量并行度
    "--gpu-memory-utilization", "0.92",     # GPU 显存利用率(0.92 = 92%
    "--max-num-batched-tokens", "8192",    # 最大批处理 token 数
    "--max-num-seqs", "256",               # 最大并发序列数
    "--enable-chunked-prefill",             # 启用分块预填充
    "--enforce-eager",                     # 禁用 CUDA graph(调试用)
    "--port", "8000",
    "--host", "0.0.0.0",
]

# 关键说明:
# --gpu-load-fraction 不是 vLLM 合法参数,GPU 负载比例通过 --gpu-memory-utilization 控制
# 0.92 表示 vLLM 最多占用每卡 92% 的显存(预留 8% 给 CUDA kernel 等)

TensorRT-LLM 推理性能参考(H100 单卡):

模型 FP16 吞吐(tokens/s INT8 吞吐(tokens/s 显存占用(FP16
Llama-3-8B ~5,000 ~8,000 ~20 GB
Llama-3-70B ~1,200TP4 ~2,000TP4 ~160 GB
Mistral-7B ~6,000 ~9,500 ~18 GB
Qwen-72B ~800TP8 ~1,500TP8 ~280 GB

4.5.3 PD 分离(Prefill-Deploy 分离)架构

对于超大模型推理,PD 分离可显著提升 GPU 利用率:

                    ┌─────────────┐
                    │   Router    │
                    │ (请求路由)   │
                    └──────┬──────┘
                           │
              ┌────────────┴────────────┐
              ▼                         ▼
       ┌─────────────┐           ┌─────────────┐
       │  Prefill 节点 │           │  Decode 节点 │
       │  H100/H200   │  KV Cache │  L40S/H20    │
       │  计算密集     │ ──传输──→ │  显存密集    │
       │  高延迟       │           │  低延迟高吞吐 │
       └─────────────┘           └─────────────┘
对比项 传统单节点推理 PD 分离推理
GPU 利用率 < 30%Decode 瓶颈) 70-90%
首 token 延迟 固定 可优化(Prefill 专用优化)
吞吐 受限于最慢阶段 各阶段独立扩缩容
适用模型 < 30B 参数 任意规模,尤其是 > 70B

4.6 国产化集群方案

4.6.1 华为昇腾 910B 集群方案

昇腾 910B 关键参数:

参数 昇腾 910B NVIDIA H100 对比
FP16 算力 640 TFLOPS 1,979 TFLOPS H100 的 32%
INT8 算力 1,280 TOPS 3,958 TOPS H100 的 32%
HBM 容量 64 GB 80 GB -
HBM 带宽 1.6 TB/s 3.35 TB/s H100 的 48%
芯片互联 HCCS910 GB/s NVLink900 GB/s 基本持平
功耗 400 W 700 W 能效比更高
制程 7nm 4nm 差一代
生态 昇腾 CANN / MindSpore CUDA / cuDNN 差距较大

昇腾集群组网拓扑(Atlas 900 PoD):

昇腾 910B 服务器(含 8 × NPU
        │
        │ PCIe Gen5 x16
        │
  ┌─────▼─────┐
  │ HCCS Switch │  华为自研高速互联交换机
  │ (392 GB/s) │  8 × HCCS 端口,双向
  └─────┬─────┘
        │ 跨服务器 HCCS
    (Scale-Up: 节点内)
        │
        ▼
  InfiniBand / 以太网络
    (Scale-Out: 节点间)

:原文档将 HCCS 带宽误写为 128 GB/s,实际华为官方参数为 392 GB/s(双向),用于 8 × NPU 节点内全互联,与 NVLink 4.0 的 900 GB/s 仍有量级差距,但优于 PCIe Gen4 x16(约 64 GB/s)。

昇腾软件栈:

层次 昇腾组件 替代 NVIDIA
芯片 Ascend 910B NPU H100/H200 GPU
驱动 Huawei CANN CUDA
通信库 HCCS(昇腾集合通信) NCCL
框架 MindSpore / PyTorch(第三方) PyTorch
算子库 Ascend Math / ACL cuBLAS / cuDNN
推理引擎 MindX / ATLAS TensorRT
集群管理 FusionCube / ascendCL DGX 系统

昇腾集群注意问题:

  • CUDA 兼容性问题:昇腾 CANN ≠ CUDAPyTorch 模型需用 Ascend PyTorch 适配(torch_npu 库),部分算子可能需要自行移植
  • 生态成熟度:较 NVIDIA 仍有差距,建议配合华为原厂支持
  • NPU 亲和性:MindSpore 在昇腾上性能最优,PyTorch 适配版本性能略有损耗

4.6.2 海光 DCU 方案

参数 海光 DCU Z100 NVIDIA A100 对比
FP16 算力 256 TFLOPS 624 TFLOPS A100 的 41%
HBM 容量 64 GB 40/80 GB 对标 A100 80G
功耗 350 W 400 W 略低
生态 ROCm(部分兼容) CUDA 兼容性较好

优势:海光 DCU 基于 AMD ROCm 生态,与 CUDA 兼容性较好,迁移成本低于昇腾。


4.7 集群管理、监控与运维

4.7.1 硬件监控体系

监控维度 工具 采集指标
GPU 监控 DCGMNVIDIA/ msmonitor(昇腾) 温度、功耗、利用率、显存、ECC 错误
InfiniBand 监控 UFMNVIDIA/ Mellanox firmware 端口状态、误码率、拓扑
存储监控 JuiceFS / BeeGFS 内置工具 带宽、IOPS、元数据延迟
节点监控 node_exporter + Prometheus CPU、内存、网络、磁盘
集群健康 Grafana 大盘 综合集群状态

关键告警阈值(参考):

告警级别 指标 阈值 动作
P1(紧急) GPU 温度 > 85°C 立即降频/关机
P1 GPU ECC 错误数 > 100/小时 标记节点下线
P2(重要) GPU 利用率 < 10%(训练时) 检查 NCCL 通信
P2 InfiniBand 端口误码 > 10⁻⁶ 更换光模块/线缆
P3(一般) CPU 利用率 > 90% 持续 30 分钟 扩容/调优
P3 GPU 显存占用 > 95% 优化 Batch Size

4.7.2 NCCL 调优最佳实践

上线前必须完成的验证清单:

# 1. NVLink 连接验证
nvidia-smi nvlink --status

# 2. InfiniBand 物理层验证
ibstat          # 检查端口状态
ibdiagnet -r    # 检测线缆和光模块质量

# 3. NCCL 单节点带宽测试
./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8
# 目标:AllReduce 带宽 > 850 GB/sNVLink 域内)

# 4. NCCL 跨节点带宽测试
# (每个节点后台启动)
./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8 -N 1 -w 100 -n 100
# 目标:AllReduce 带宽 > 300 GB/sIB 400G

# 5. GPU Direct RDMA 验证
ib_write_bw -d mlx5_0    # 测试 IB 网卡到 GPU 内存直接带宽
# 目标:> 350 GB/s

# 6. 端到端训练基准测试
torchrun --nproc_per_node=8 /workspace/nccl_tests/resnet50/hello_world.py
# 验证 8-GPU 线性扩展效率 > 90%

4.8 机场智算中心集群配置推荐方案

方案一:中等规模(千万级旅客机场,推理为主)

项目 配置
GPU 类型 NVIDIA L40S × 4/节点
节点数量 32 节点 = 128 GPU
主要负载 推理服务、视频分析、Agent
集群算力 ~256 TFLOPSFP16
网络 RoCE v2 200G + 以太网管理
存储 JuiceFS + 对象存储,2 PB
服务器形态 4U 液冷机架服务器
预估功耗 64 节点 × 4 kW = 256 kW
国产化 可选昇腾 910B × 4 混部

方案二:大规模(两千万级旅客机场,训练+推理)

|| 项目 | 配置 | ||------|------| | 训练 GPU | NVIDIA H100 SXM5 × 8/节点 | | 训练节点数 | 32 节点 = 256 GPU | | 训练算力 | ~1 PFLOPSBF16 稀疏,约 2× 渲染)| | 推理 GPU | L40S × 4/节点 | | 推理节点数 | 16 节点 = 64 GPU | | 主要负载 | 大模型微调、航班调度 AI、推理 | | 计算网络 | InfiniBand NDR 400G × 2(双上联)| | 存储网络 | RoCE v2 200G + 全闪存存储 | | 存储容量 | JuiceFS + 全闪存,10 PB | | 服务器形态 | HGX H100 8-GPU 液冷服务器 | | 预估功耗 | 训练:32 × 13 kW ≈ 416 kW + 推理:16 × 4 kW ≈ 64 kW + 存储/网络 ≈ 70 kW ≈ 550 kW | | 国产化 | 昇腾 910B 训练集群(备选)|

:原"~256 PFLOPS"存在歧义(未注明精度和稀疏性)。按 H100 官方标称 BF16 稀疏算力 1,979 TFLOPS/GPU(≈ 2 PFLOPS),32 节点 256 GPU × 2 PFLOPS ≈ 512 PFLOPS ≈ 0.5 EFLOPS(BF16 稀疏),或 FP16 稠密约 256 PFLOPS。如原文档意指 FP16 稠密,则 256 PFLOPS 大致准确;如指 BF16 稀疏,则应为 ~0.5 EFLOPS。

方案三:旗舰规模(三千万级以上,新建超大规模智算)

|| 项目 | 配置 | ||------|------| | 训练 GPU | NVIDIA H200/HH200 × 8/节点 | | 训练节点数 | 128 节点 = 1024 GPU | | SuperPOD 架构 | 16 × 64 GPU SUFat-Tree 组网 | | 训练算力 | ~2 EFLOPSBF16 稀疏),~1 EFLOPSBF16 稠密)| | 推理 GPU | H100/L40S 混合 | | 计算网络 | InfiniBand NDR 400G1:1 无收敛 | | 超节点扩展 | 支持 Scale-Up 到 GB200 NVL72 | | 存储 | 全闪存并行文件系统,50 PB+ | | 预估功耗 | ~13 MWGPU ~10 MW + 服务器/网络/液冷 ~3 MW,详见注)| | PUE 目标 | ≤ 1.15(全液冷)|

功率测算注H200 GPU TDP ~700W/卡,1024 GPU 仅 GPU 即 ~717 kW8-GPU 服务器整机功耗约 10-13 kW/台,128 台服务器约 1.3-1.7 MW;加上 InfiniBand 交换机、存储节点、液冷 CDU 二次侧水泵、冷却塔等辅助负载,总计 ~13 MW。2 MW 严重低估,仅够覆盖约 1/6 的 GPU 数量。


五、网络技术方案

5.1 智算中心网络架构

Spine-Leaf 架构(推荐大型机场)

Spine 层(核心)
  ├── Spine-A400G
  └── Spine-B400G,冗余)
       ↑
Leaf 层(接入)
  ├── Leaf-1(连接 GPU 服务器)
  ├── Leaf-2(连接 GPU 服务器)
  ├── Leaf-3(连接存储)
  └── Leaf-4(连接通用服务器)
  • 收敛比:建议 1:1(无收敛)
  • 东西向带宽:全部东西向全速
  • 400G 端口密度:按需配置

GPU 集群专用网络(InfiniBand

项目 参数
带宽 400 Gb/s NDR
拓扑 Fat-Tree 或 DragonFly+
端口数 按 GPU 卡数 × 1.6 配置
路由 自适应路由(AR

5.2 存储网络

类型 协议 带宽需求
训练数据存储 RoCE v2 + NVMe-oF 200 Gb/s
模型仓库 RoCE v2 + 对象存储 100 Gb/s
备份存储 以太网 + iSCSI 25-100 Gb/s

存储性能目标:

  • 训练数据集读取带宽:≥ 500 GB/s
  • 训练检查点写入:≤ 30 秒(100GB 检查点)

5.3 智算网络安全

安全措施 说明
零信任网络(ZTNA 微隔离,按需授权
DDoS 防护 清洗异常流量
算力隔离 训练/推理网络物理隔离
数据加密 传输加密(TLS+ 存储加密
运维审计 全量日志留存,堡垒机访问

六、供电系统方案

6.1 智算中心供电架构

市电(双路10kV/35kV
      ↓
自动转换开关 ATS
      ↓
高压配电
      ↓
SCALE-UP UPS2N冗余,模块化)
      ↓
配电单元 PDU
      ↓
GPU服务器机柜(液冷CDU集成供电)

6.2 关键供电参数

项目 推荐值
市电引入 双路 10kV 或 35kV(互为备用)
UPS 配置 2N 冗余(Tier IV/ N+1Tier III
UPS 效率 模块化效率 ≥96%
柴油发电机 1000-5000 kVA,启动时间 <10s
储油时间 24 小时(关键负载)
单柜功率密度 40-130 kW(液冷方案)
总功耗估算 GPU 单柜 100kW × 100柜 = 10 MW

6.3 液冷对供电的影响

影响项 说明
供电密度提升 单机柜功率从 10kW 升至 100kW+,对 PDU 配电模块要求更高
液冷 CDU 供电 CDU 设备需独立配电回路
变压器容量 需提前规划,按 100kW/柜计算总容量
市电申请 大规模智算中心(10MW+)需与电力公司单独协商

七、智算中心运维与平台

7.1 算力调度平台

功能模块 说明
作业调度 Slurm / Kubernetes + Volcano
算力编排 训练/推理任务自动调度到合适集群
配额管理 按部门/项目配额控制
计费 按 GPU 卡时、存储量计费
碳排放管理 实时碳排放统计(配合绿电)

7.2 监控与运维

监控维度 工具
GPU 监控 DCGMNVIDIA/ smi(昇腾)
集群监控 Prometheus + Grafana
液冷监控 CDU 自带系统 + 动环平台
网络监控 带内/带外分离,综合网管
告警 分级告警(P1-P4),短信/邮件/IM

7.3 运维安全

  • 堡垒机:所有运维操作经堡垒机,留存完整审计日志
  • 双人授权:高危操作需双人确认
  • 变更管理:所有变更经审批,保留回滚方案
  • 应急响应:制定智算中心专项应急预案(SOP

八、智算中心案例参考

8.1 典型智算中心案例

中国电信临港智算谷

项目 内容
位置 上海临港新片区
规模 一期 119 亩,总规划 10 万卡 GPU 集群
机楼 10 栋数据机楼,最高单栋 >40 MW
单柜功率 8 kW(风冷)/ 20-60 kW(冷板)/ 液冷浸没
PUE < 1.2(液冷方案)
网络 接入国家超算互联网

曙光数创浸没式液冷案例

  • 相变浸没式:单机柜功耗突破 900 kW
  • 单相浸没式:高密度部署,芯片全浸没于氟化液
  • 代表项目:多个国家级超算中心、运营商智算集群

联想 × 吉利 HPC 智算集群

  • 服务器:联想 SD650 V3(海神温水水冷)
  • 散热方式100% 冷板式液冷
  • PUE1.1 以下
  • 节能效果:节省 45% 电力成本

Vertiv × 英伟达 GB200 NVL72 参考设计

  • 单机柜功率130 kW
  • 能效提升:减少 25% 能耗
  • 空间节省:减少 75% 机柜占地
  • 适用场景:超大规模智算中心

8.2 机场智算中心建设案例

机场 智算应用 基础设施 液冷情况
大连金州湾(在建) AI巡检、数字孪生 BIM+数字孪生 预留风液融合
北京大兴机场 平台化 AI19平台68系统) 维谛 Liebert PEX+ 风冷精密空调
迪拜机场 智能运维、预测性维护 华为预制模块化 行级变频空调

九、供应商与设备参考

9.1 液冷系统供应商

供应商 方案类型 代表产品/案例
维谛技术(Vertiv 冷板式(英伟达独家合作) GB200 NVL72 参考设计,Liebert PEX+
英维克(Envicool 冷板式 + 浸没式 国产液冷龙头,多个 AIDC 项目
曙光数创 浸没式(相变/单相) 国内浸没式液冷最大供应商
华为 冷板式 + 液冷 CDU 临港智算谷项目
Keydak 金盾 风液融合 2025 机场博览会发布
施耐德电气 冷板式液冷基础设施 132 kW/rack 方案

9.2 GPU 服务器供应商

供应商 产品系列 GPU 支持
浪潮信息 NF5688M7 / NF5698M7 H100/H200/L20
新华三 R4900 G6 H100/H200
华为 昇腾 910B 集群 昇腾 NPU
联想 ThinkSystem SR670 V2 H100/H200
超聚变 FusionPoD 多元异构

9.3 网络设备供应商

设备 推荐供应商 规格
InfiniBand 交换机 NVIDIA Quantum-2 400Gb/s NDR
以太网交换机 华为 CloudEngine 16800 400G
RoCE 网卡 NVIDIA ConnectX-7 400Gb/s
光模块 II-VI / 华为 400G DR4/FR4

十、技术方案总结

10.1 机场智算中心推荐配置

|| 层级 | 推荐技术选型 | ||------|------------| | 算力芯片 | NVIDIA H100/H200(训练)+ L40S(推理),预留昇腾 910B 国产化 | | 液冷方案 | 冷板式液冷为主(当前主流),PUE 目标 ≤1.25(典型),≤1.15(优秀)| | 网络架构 | Spine-Leaf 400G + InfiniBand 400GNDR| | 存储架构 | 全闪存分布式存储,≥500 GB/s 聚合带宽(需 20+ 存储节点前提)| | 国产化 | 昇腾 910B + 曙光数创液冷 + 华为存储 | | 运维平台 | Kubernetes + Volcano + DCGM + Prometheus | | PUE 目标 | ≤1.2580%液冷)/ ≤1.15(全液冷+自然冷却配合)|

10.2 关键参数汇总

|| 参数 | 数值 | ||------|------| || 单机柜功率(训练)| 80-130 kW | || 单机柜功率(推理)| 40-80 kW | || GPU 互联带宽(节点内)| NVLink 900 GB/s(双向对等)| || 网络互联带宽(节点间)| IB 400G / 以太网 400G | || PUE | ≤1.25(典型),≤1.15(优秀,全液冷+自然冷却)| || 可用性(Tier III| 99.982%,年均故障时间 ≤1.6 小时 |

10.3 实施建议

  1. 液冷优先:新建机场智算中心应直接采用冷板式液冷,避免后期改造成本
  2. 弹性架构:预留机柜电力容量和网络端口,适配未来芯片功率持续上升
  3. 国产化路径:可采用"主流国际芯片+国产化备用"的双轨策略
  4. 建设运营一体化:参考上海机场 BIM 经验,将数字孪生从设计阶段贯穿至运维
  5. 分期建设:首期部署推理集群满足当前需求,中期扩展训练集群能力

附录

A. 术语表

缩写 全称 说明
AIDC Artificial Intelligence Data Center 智算中心
PUE Power Usage Effectiveness 电能利用效率
CDU Coolant Distribution Unit 冷却液分配单元
NCCL NVIDIA Collective Communications Library GPU集合通信库
RoCE RDMA over Converged Ethernet 以太网远程直接内存访问
NVLink NVIDIA High-Speed GPU Interconnect 英伟达高速GPU互连
InfiniBand High-Speed Network Architecture 高速网络架构
DCGM Data Center GPU Manager 数据中心GPU管理工具
vLLM Virtual Large Language Model Server 开源LLM推理服务框架
HBM High Bandwidth Memory 高带宽存储器
BF16 Brain Float 16 AI训练常用浮点格式
ZTNA Zero Trust Network Architecture 零信任网络架构

B. 数据来源

  1. 中国信通院,《人工智能算力基础设施赋能研究报告(2025年)》
  2. 国信证券,《数据中心液冷专题报告:液冷:智算中心散热核心技术》
  3. 头豹研究院,《2025年中国AIDC产业发展白皮书》
  4. 中国工业互联网研究院,《工业智算发展研究报告(2025年)》
  5. 中国基金报,液冷市场专题报道(2025年8月)
  6. Vertiv,《GB200 NVL72 参考架构白皮书》
  7. 临港算力,智算中心液冷实践(2025年6月,中国电信算力大会)
  8. 联想集团,海神温水水冷系统技术资料
  9. Keydak金盾2025国际机场博览会发布资料

C. 相关标准与政策

  • 《数据中心绿色低碳发展专项行动计划》(发改环资〔2024〕970号)
  • 《数据中心设计规范》GB 50174-2017
  • 《新型数据中心发展三年行动计划(2021-2023)》
  • 《算力基础设施高质量发展行动计划》
  • Uptime Institute Tier Standard

本方案为技术方案参考文档,具体项目需结合机场业务规模、预算、国产化要求和所在地区政策进行定制化设计。建议在项目立项后委托专业设计院进行深化设计。