Files
my-vault/airport-wiki/机场智算中心技术方案.md
T
zhiqiang feng 45ea4c2642 chore: add GPU cluster best practices section (11.1–11.9)
- Add liquid cooling, InfiniBand, storage, phased rollout, localization, NCCL validation
- Add 3-tier config comparison (A/B/C) with power/investment estimates
- Add pitfalls checklist and acceptance checklist
- Update log.md
2026-04-10 16:26:08 +08:00

56 KiB
Raw Blame History

title, created, updated, type, tags, sources
title created updated type tags sources
机场智算中心技术方案 2026-04-08 2026-04-10 solution
solution
gpu
liquid-cooling
tier
power
network
raw/articles/shanghai-ai-computing-guidelines.md
raw/articles/headleo-aiDC-whitepaper.md
raw/articles/industrial-ai-computing-report.md
raw/articles/dubai-airport-huawei-dc.md
raw/articles/daxing-airport-vertiv.md
raw/articles/2025-airport-construction-summit.md
raw/articles/zhengzhou-airport-hangang.md
raw/articles/fuzhou-changle-airport-bsj.md

机场智算中心技术方案

本方案以机场 wiki 现有资料库为依据,综合:上海智算中心建设导则(2025)、头豹 AIDC 白皮书(2025)、工业智算报告、大兴/迪拜/大连/郑州/福州/深圳等机场案例 生成时间:2026-04-10 | 数据来源:详见附录


一、概述

1.1 什么是机场智算中心

机场智算中心(Airport Intelligent Computing Center)是支撑机场智能化运营的 GPU/NPU/ASIC 异构算力集群,区别于传统数据中心(CPU 为主、风冷、PUE 1.4+),智算中心以 AI 训练/推理为核心负载,必须采用液冷散热和东西向高速网络。

1.2 传统 DC vs 智算中心核心差异

对比项 传统数据中心 智算中心
核心负载 ERP、Web、数据库 AI 训练/推理、视频分析
算力芯片 CPU 为主 GPU/NPU 集群为主
单机柜功率 515 kW 50200+ kW
散热方式 风冷为主 液冷为主
网络重点 南北向 东西向高速互联
PUE 目标 1.41.6 ≤ 1.25(全液冷 ≤ 1.15

1.3 典型应用场景与算力需求

应用场景 算力类型 典型规模
航班智能调度(大模型) 训练 + 推理 7B70B 参数模型微调
行李全流程追踪(CV 推理为主 100+ 摄像头视频流
航站楼安防/客流热力图 推理为主 实时视频分析
语音客服机器人 推理为主 并发 500+ QPS
飞机故障预测(时序) 训练 + 推理 时序数据分析
机场数字孪生 训练 + 推理 物理仿真 + 渲染
智能巡检机器人 推理为主 边缘部署
行李异常检测(多模态) 推理为主 CV + NLP

1.4 中国智算市场规模参考

年份 中国智算规模 同比增速
2024 725.3 EFlopsFP16 +74.1%
2025E 1,037.3 EFlops +43%
2028E(复合增长 46.2%

数据来源:IDC + 浪潮信息《中国人工智能计算力发展评估报告》

1.5 机场智算中心规模分级建议

机场规模 推荐算力 GPU 卡数参考 典型机柜数
年旅客量 < 1,000 万 110 PFLOPSFP16 64512 卡 832 柜
年旅客量 1,0005,000 万 1050 PFLOPS 5122,048 卡 32128 柜
年旅客量 > 5,000 万 50200+ PFLOPS 2,0488,000+ 卡 128500+ 柜

二、系统架构

2.1 整体架构

┌──────────────────────────────────────────────────────┐
│                   应用服务层                          │
│  航班调度大模型 │ 行李追踪 │ 安防分析 │ 客服机器人   │
├──────────────────────────────────────────────────────┤
│                   模型服务层                          │
│  推理引擎(vLLM / TensorRT-LLM)│ 微调框架 │ 模型仓库 │
├──────────────────────────────────────────────────────┤
│                   训练平台层                          │
│  分布式训练框架(NCCL / Megatron-LM / DeepSpeed   │
├──────────────────────────────────────────────────────┤
│                   算力调度层                          │
│  Kubernetes + Volcano │ 作业管理 │ 配额计费 │ 碳排管理│
├──────────────────────────────────────────────────────┤
│   ┌──────────┐  ┌──────────┐  ┌──────────┐         │
│   │ 训练集群  │  │ 推理集群  │  │ 国产化集群 │         │
│   │ HGX H100 │  │ L40S/昇腾 │  │ 昇腾 910B  │         │
│   └──────────┘  └──────────┘  └──────────┘         │
├──────────────────────────────────────────────────────┤
│                   存储层                              │
│  JuiceFS + 对象存储(S3)│ 全闪存分布式 │ 本地 NVMe 缓存│
├──────────────────────────────────────────────────────┤
│                   网络层                              │
│  Spine-Leaf 400G │ InfiniBand NDR 400G │ RoCE v2    │
├──────────────────────────────────────────────────────┤
│                   基础设施层                          │
│  供配电(2N UPS)│ 液冷系统(CDU)│ 机柜 │ 消防 │ 监控│
└──────────────────────────────────────────────────────┘

2.2 云-边-端协同

云端(智算中心)
  ├── 训练集群:大规模长时训练任务
  ├── 推理服务:实时性要求不高的批量推理
  └── 模型管理:微调、版本管理

边缘(航站楼 / 塔台边缘节点)
  ├── 实时推理:客流分析、安防告警(< 100ms)
  ├── 数据汇聚:本地数据预处理
  └── 断网自治:与云端断连时独立运行

端侧(摄像头、传感器、机器人)
  ├── 轻量推理:目标检测、异常初筛
  └── 数据采集:原始数据上报

2.3 异构算力架构

芯片类型 代表产品 FP16 算力 显存带宽 功耗 适用场景
GPU(主流) NVIDIA H100 SXM5 ~1 PFLOPS 3.35 TB/s 700W 大模型训练
GPU(主流) NVIDIA H200 SXM ~1 PFLOPS 4.8 TB/sHBM3e 700W 大规模训练 / 推理
GPU NVIDIA B200 2.25 PFLOPS 8 TB/s 1,200W 超大规模智算中心
GPU(旗舰) GB200 NVL72 ~5 PFLOPS 16 TB/s 2,700W/芯片 万卡集群(整机柜方案)
GPU(推理) NVIDIA L40S ~2 PFLOPS 864 GB/s 350W 推理为主、中等规模
NPU(国产) 华为昇腾 910B 640 TFLOPS 400W 国产化替代
ASIC(国产) 海光 DCU Z100 256 TFLOPS 350W 国产化替代(ROCm 兼容 CUDA

GB200 NVL72 为整机柜方案:72 GPU + 36 Grace CPU,详见第四章


三、液冷系统

液冷是智算中心高功率密度散热的核心技术路线,也是本方案重点。

3.1 背景:芯片功耗爆炸式增长

芯片 / 系统 功耗 散热方式
CPU(至强 2000 系列) 450500W/颗 风冷极限
GPUA100 400W 需液冷
GPUH100 700W 必须液冷
GPUGB200 2,700W/超级芯片 必须液冷(相变或冷板)
GPU 机架(2024 年典型) ~130 kW/rack 必须液冷
GPU 机架(2029 年预测) > 1 MW/rack 全面液冷

3.2 液冷技术路线对比

对比项 冷板式液冷 浸没式液冷(单相) 浸没式液冷(相变)
成熟度 ★★★★★ 最高 ★★★★ 高 ★★★ 中
服务器改动 冷板安装 需定制服务器 需定制服务器
维护便利性 ★★★★ 较好 ★★★ 一般 ★★ 复杂
散热能力 极强 极强(相变换热)
单机柜密度 40130 kW 100500 kW 250500+ kW
初期投资 中等 较高 最高
适用场景 当前主流,推荐 高密度细分场景 超高功率特种场景

3.3 冷板式液冷架构

系统架构:

室外侧(一次侧冷源)
  冷却塔 / 干冷器
       ↓(自然冷却 / 蒸发冷却)
  冷水机组(夏季备用)
       ↓
  一次侧循环管路
          ↓ 板式换热器
室内侧(二次侧供液)
  CDU(冷却分配单元)
       ↓
  Manifold(液冷分配岐管)
       ↓
  冷板(直接贴附芯片:CPU + GPU + 内存)
       ↓
  服务器内部

关键设备参数:

设备 功能 关键参数
CDU 冷却液循环、温度控制 典型容量 200–400 kW,支持双路
Manifold 分液到各机柜 316L 不锈钢,多路分配
冷板 直接接触芯片散热 接触面导热硅脂,微通道设计
冷却液 冷板式常用 乙二醇/丙二醇溶液(防冻)

3.4 液冷方案推荐

方案 A:冷板式液冷(推荐新建机场智算中心)

参数 数值
液冷占比 80100%(全液冷)
风冷辅助 仅用于网络设备、少量通用服务器
PUE 目标 ≤ 1.15(全液冷)/ ≤ 1.2580% 液冷)
单柜功率上限 130 kWGB200 NVL72 级别)

Vertiv GB200 NVL72 参考架构:

  • 单机柜功率:130 kW
  • 架构:72 GPU + 36 CPUGrace Blackwell
  • 散热:100% 冷板液冷
  • 能耗节省:比传统风冷减少 25%
  • 空间节省:减少 75% 机柜占地

方案 B:风液融合(过渡期)

参数 数值
风冷支持 最高 40 kW/柜
液冷支持 最高 150 kW/柜
特点 风液同源、动态平衡、灵活部署

3.5 PUE / WUE / CUE 三级能效指标

上海智算中心建设导则(2025)要求(全国最严):

指标 新建标准值 运营先进值 长三角集群
PUE(基准) ≤ 1.25
PUE(综合) ≤ 1.22 ≤ 1.18 ≤ 1.20
WUE ≤ 2.2 L/kWh ≤ 2.0 L/kWh
CUE ≤ 1.2 gCO₂/kWh ≤ 1.0 gCO₂/kWh

PUE 优化措施:

措施 效果
全液冷替代精密空调 PUE 从 1.5 降至 1.151.25
冷通道封闭 减少冷热气流混合,节能 1015%
自然冷却利用 冬季低温期配合液冷进一步降低 PUE
高效 UPS(模块化效率 ≥ 96% 降低供电损耗
AI 调优 实时调节液冷流量与温度

3.6 国产液冷供应商参考

供应商 方案类型 代表参数
英维克(Envicool 冷板式 + 浸没式 单机柜散热能力 24 kW,散热效率提升 40%
中科曙光 浸没式液冷 PUE 低至 1.04,年减碳量超万吨
华为 冷板式 + 液冷 CDU 临港智算谷项目,单柜 2060 kW

四、算力集群

设计原则:本章遵循 Scale-Up(节点内纵向扩展)+ Scale-Out(节点间横向扩展) 双重架构。Scale-Up 以 NVLink/NVSwitch 为核心解决节点内 GPU 全互联;Scale-Out 以 InfiniBand/RoCE 为骨干解决多节点集合通信。

4.1 GPU 节点架构演进

代际 代表产品 GPU 互联方式 NVLink 聚合带宽 GPU 对等带宽
第 1 代(2018 V100 SXM2 NVLink 1.06 链路 300 GB/s 300 GB/s
第 2 代(2020 A100 SXM4 NVLink 3.012 链路 600 GB/s 600 GB/s
第 3 代(2022 H100 SXM5 NVLink 4.018 链路 900 GB/s 900 GB/s
第 4 代(2024 B200 SXM NVLink 5.018 链路 1.8 TB/s 900 GB/s
第 5 代(预测) Rubin Ultra NVLink 6.0 ~3.6 TB/s ~1.8 TB/s

注:NVLink 5 "1.8 TB/s" 为 Fabric 聚合总带宽,任意 GPU 到任意 GPU 对等带宽为 900 GB/s 双向(与 H100 相同)。带宽提升主要来自更多链路并行,而非单链路提速。

4.2 HGX H100 8-GPU 节点拓扑

                    ┌─────────────────────────────────┐
                    │       HGX H100 8-GPU Server      │
  CPU (AMD EPYC / Intel Xeon)                           │
      │ × 2                                              │
      │                                                  │
  PCIe Gen5 x16 (Host Bridge)                           │
      │                                                  │
  ┌──────────────────────────────────────────────┐      │
  │        NVSwitch Fabric6 芯片,2 平面)         │      │
  │  NVSwitch① ── NVSwitch② ── NVSwitch③           │      │
  │      ↖           ↑           ↗                 │      │
  │  NVSwitch④ ── NVSwitch⑤ ── NVSwitch⑥           │      │
  │   (全连接拓扑,任意 GPU 间单跳可达)              │      │
  └──────────────────────────────────────────────┘      │
      │  │  │  │  │  │  │  │                         │
    GPU0 GPU1 GPU2 GPU3 GPU4 GPU5 GPU6 GPU7           │
    H100  H100  H100  H100  H100  H100  H100  H100   │
    SXM5  SXM5  SXM5  SXM5  SXM5  SXM5  SXM5  SXM5  │
    80GB  80GB  80GB  80GB  80GB  80GB  80GB  80GB   │
    HBM3  HBM3  HBM3  HBM3  HBM3  HBM3  HBM3  HBM3  │
    └────────── PCIe Gen5 ─────────┘                   │
    └────── InfiniBand / RoCE 网卡 ───────────────┘   │
                    └─────────────────────────────────┘

关键拓扑参数(HGX H100):

参数 规格
GPU 数量 8 × NVIDIA H100 SXM5
GPU 间 NVLink 带宽 900 GB/s 双向(全互联)
NVSwitch 芯片数 6 片2 组各 3 片,双平面全连接)
NVSwitch 交换容量 25.6 Tb/s 每芯片
单节点 BF16 算力(稀疏) ~3,958 TFLOPS ≈ 4 PFLOPS
单节点 FP16 算力(稠密) ~1,979 TFLOPS ≈ 2 PFLOPS
每 GPU HBM3 容量 80 GBSXM5
每 GPU HBM3 带宽 3.35 TB/s
CPU 配置 2 × AMD EPYC 9004/9005 或 Intel Xeon Scalable
主机内存 2 TB DDR5 ECC
本地 SSD 2 × 3.84 TB NVMeOS + 缓存)
电源配置 4 × 3.3 kW PSU(整机 ~13 kW
散热方式 冷板式液冷(必须)

4.3 GB200 NVL72 机架级超级芯片

GB200 NVL72 是 NVIDIA Blackwell 架构的整机柜集成方案,代表当前最极致的 Scale-Up 设计:

组件 数量 参数
Blackwell GPU (B200) 72 张 每 GPU BF16 算力 ~1,800 TFLOPS(稀疏)
Grace CPU (Neoverse V2) 36 颗 72 核 ARM,每颗 240 GB LPDDR5
NVLink Switch 芯片 9 片 第 4 代 NVLink Switch
GPU 内存总量 13.5 TB HBM3e 每 GPU 186 GB(×72
CPU 内存总量 8.6 TB LPDDR5 每 CPU 240 GB(×36
NVLink 域带宽(聚合) 130 TB/s 72 GPU 全互联
单机柜功率 132 kWTDP
散热方式 100% 冷板液冷

计算托盘结构:

每个计算托盘:
  ┌─────────────────────────────────┐
  │  1 × GB200 超级芯片 (= 2×B200 + 1×Grace CPU)  │
  │  显存: 2 × 186 GB = 372 GB HBM3e               │
  │  功率: ~2.7 kW(超级芯片总功耗)                  │
  └─────────────────────────────────┘

18 个计算托盘 × 4 GPU/托盘 = 72 GPU

NVLink 域设计:

  • 72 GPU 在同一个 NVLink 域内全互联,任意两 GPU 通信单跳
  • 对等带宽:900 GB/s(是 InfiniBand NDR 400G 的约 2.3 倍)
  • 张量并行可覆盖全部 72 GPU,适合超大规模模型

机场场景建议:GB200 NVL72 单柜 132 kW,功率密度极高。当前阶段以 HGX H100/H200 8-GPU 节点为主(单节点 ~13 kW,可用液冷机柜支撑)。NVL72 预留规划,待功率和液冷成熟后再规模部署。

4.4 推理服务器节点(4-GPU 配置)

参数 NVIDIA L40S 方案 昇腾 910B 方案(国产)
GPU 数量 4 × L40S 4 × 昇腾 910B
GPU 显存 48 GB GDDR6 64 GB HBM
GPU 间互联 PCIe Gen4 交换(无 NVLink HCCS(华为集合通信)
GPU 通信带宽 ~64 GB/sPCIe x16 ~392 GB/sHCCS
单节点算力 ~2 PFLOPSFP16 ~2 PFLOPSFP16
功耗 ~4 kW/节点 ~4.5 kW/节点
适用场景 中等规模推理 国产化推理

4.5 多节点集群组网(Scale-Out

4.5.1 三层三平面网络架构

┌────────────────────────────────────────────────────────────┐
│  集群外部网络(Border)                                      │
│  互联网 / 专线 / 机场内部网络  ←→  防火墙 / 负载均衡         │
└────────────────────────────────────────────────────────────┘
                          │
┌────────────────────────────────────────────────────────────┐
│  管理网络平面(Management Network                          │
│  BMC / IPMI / SSH / 监控采集                                │
│  ←→ 千兆以太网(Out-of-Band                              │
└────────────────────────────────────────────────────────────┘
                          │
┌────────────────────────────────────────────────────────────┐
│  存储网络平面(Storage Network                              │
│  分布式存储读写 / Checkpoint 存取                            │
│  ←→ RoCE v2 / InfiniBand + NVMe-oF                        │
│  带宽:200400 Gb/s                                        │
└────────────────────────────────────────────────────────────┘
                          │
┌────────────────────────────────────────────────────────────┐
│  计算网络平面(AI Fabric)                                   │
│  GPU 集合通信(NCCL) / 梯度同步 / 数据并行                   │
│  ←→ InfiniBand NDR 400G / Spectrum-X 400G                 │
│  带宽:400 Gb/s(节点间)                                   │
└────────────────────────────────────────────────────────────┘

4.5.2 InfiniBand NDR 400G 组网

InfiniBand 是当前 AI 训练集群的事实标准网络:

特性 说明
硬件原生 RDMA 绕过 OS 内核,延迟 < 1 μs
自适应路由(AR 每包独立路由,充分利用所有链路
SHARP 网内计算 交换机内聚合梯度,无需送回 GPU 再聚合
NCCL 原生支持 NVIDIA 集合通信库直接调用

关键参数:

参数 规格
单端口带宽 400 GbpsNDR = Next Data Rate
编码方式 PAM4(每 lane 53.125 Gbaud
线缆类型 光纤(多模 OM4 / 单模 LC
交换机型号 NVIDIA QM9700 系列
交换机端口密度 64 端口 × 400G
拓扑支持 Fat-Tree / DragonFly+ / Hypercube
每交换机延迟 < 0.6 μs(端到端)
拥塞控制 CNPCongestion Notification Packet

Fat-Tree 拓扑设计(推荐中小规模 512 GPU):

                    ┌─────────────┐
                    │  Core Switch │  InfiniBand QM9700
                    │   (24 台)   │  64 端口 400G
                    └──────┬──────┘
                           │
         ┌─────────────────┼─────────────────┐
         │                 │                 │
    ┌────▼────┐       ┌────▼────┐       ┌────▼────┐
    │ Agg 1   │       │ Agg 2   │       │ Agg 3   │
    │ QM9700  │       │ QM9700  │       │ QM9700  │
    └────┬────┘       └────┬────┘       └────┬────┘
         │                 │                 │
   [16 servers]     [16 servers]      [16 servers]
   每组 8× GPU     每组 8× GPU       每组 8× GPU

4.5.3 Spectrum-X 以太网方案(替代 / 混合场景)

参数 Spectrum-X 400G InfiniBand NDR 400G
技术基础 以太网(RoCE v2 InfiniBand
延迟 12 μs < 0.6 μs
生态开放性 高(标准以太网) 低(需 IB 交换设备)
运维复杂度 低(统一以太网运维) 高(独立 IB 网络)
推荐场景 推理集群、混合云 训练集群(强烈推荐)

4.5.4 万卡集群(SuperPOD)规格

参数 1,024 GPU128 节点) 2,048 GPU256 节点)
交换机型号 QM9700 QM9700
Spine 数 8 16
每 Spine 下联 32 端口 400G 32 端口 400G
Agg 层 16 32
收敛比 1:1(无收敛) 1:1(无收敛)
网络直径 3 跳(最差路径) 3 跳

关键设计原则:

  1. 收敛比 ≤ 1:1AI 训练流量无阻塞
  2. 每服务器双上联(2 × 400G IB),LACP Bonding 冗余
  3. GPU Direct RDMA:跨节点 GPU 直接内存访问,绕过 CPU
  4. SHARP 网内聚合:梯度在交换机内聚合,节省 30–50% 通信量

4.6 存储集群

4.6.1 存储需求分析

存储类型 用途 性能要求 典型容量
数据湖存储 原始训练数据、语料库 顺序读带宽 ≥ 500 GB/s 10100 PB
模型存储 检查点、训练产出模型 写入带宽 ≥ 100 GB/s,延迟 < 1 ms 110 PB
共享文件系统 代码、配置、小文件共享 IOPS ≥ 1M 100 TB1 PB
本地缓存 热点数据本地加速 NVMe 本地读缓存 110 TB/节点

性能目标有前置条件:需足够的存储节点数量(20+ 全闪存存储节点)、充足的存储网络带宽(200G+)、正确配置的小文件聚合策略。

4.6.2 推荐架构:JuiceFS + 对象存储(S3+ 本地 NVMe 缓存

参数 推荐值
元数据引擎 TiKV(分布式,≥3 节点)
数据存储 对象存储(S3 兼容)
本地缓存 每节点 12 TB NVMe SSDL1 缓存)
小文件聚合 4 MiB chunk,减少元数据压力
读取预取 自动预取临近数据块

存储产品选型:

产品 类型 适用规模 AI 训练适配度
JuiceFS 元数据 + 对象存储分离 中大规模 ★★★★★
BeeGFS 并行文件系统 超大规模 ★★★★
GPFSIBM Spectrum Scale 并行文件系统 企业级 ★★★★
曙光 ParaStor 全闪存分布式 国产化 ★★★★
华为 OceanStor 9000 全闪存分布式 大规模 ★★★★

4.6.3 存储网络设计

网络平面 协议 带宽 交换机
计算网络 InfiniBand NDR 400G × 2(双上联) QM9700
存储网络 RoCE v2 + NVMe-oF 200400G Spectrum-X / 华为 CloudEngine
管理网络 以太网 1G 接入交换机

4.7 软件栈与训练框架

4.7.1 五层软件栈

┌──────────────────────────────────────────┐
│   应用层:训练脚本(PyTorch / LLaMA-Factory  │
├──────────────────────────────────────────┤
│   框架层:PyTorch 2.x + 分布式通信优化           │
│           DeepSpeed / Megatron-LM / ColossalAI │
├──────────────────────────────────────────┤
│   通信层:NCCL 2.xNVIDIA                  │
│           HCCS(昇腾)/ OpenUCCL(国产)        │
├──────────────────────────────────────────┤
│   驱动层:CUDA 12.x / ROCm 6.x               │
│           GPU Driver / cuBLAS / cuDNN         │
├──────────────────────────────────────────┤
│   硬件层:NVLink / InfiniBand / RoCE          │
└──────────────────────────────────────────┘

4.7.2 框架选型

框架 适用场景 并行策略
PyTorch 2.x + FSDP 通用大模型训练 DDP / FSDP / TP
DeepSpeed ZeRO 超大模型(千亿参数+ ZeRO-1/2/3、流水线、张量并行
Megatron-LM 极致张量并行优化 TP + PP + DP 三维并行
ColossalAI 异构训练、多种并行策略 动态调度、ZeRO++

4.7.3 NCCL 关键配置

# NCCL 环境变量参考配置
NCCL_DEBUG=info           # 调试日志(生产环境关闭)
NCCL_IB_DISABLE=0         # 启用 InfiniBand
NCCL_NET_GDR_LEVEL=PIX   # GPU 直接访问网卡(最佳性能)
NCCL_NVLS_DISABLE=0       # 启用 NVLink 域内通信
NCCL_MAX_NCHANNELS=16    # InfiniBand 多路径

预期 NCCL 带宽基准:

通信模式 H100 NVLink 域内 H100 InfiniBand 400G L40S PCIe
AllReduce8 GPU ~850900 GB/s 300350 GB/s ~60 GB/s
AllGather ~880 GB/s 280320 GB/s ~55 GB/s
ReduceScatter ~870 GB/s 280320 GB/s ~55 GB/s

目标IB 400G 的 NCCL 带宽应达到理论峰值的 80% 以上(≥ 320 GB/s),否则说明网络瓶颈。

4.7.4 作业调度器选型

调度器 适用场景 优点 缺点
Slurm 超算 / HPC 传统场景 生态成熟,稳定可靠 不支持容器原生
Kubernetes + Volcano 云原生 AI 平台 生态丰富,弹性伸缩 配置复杂
Kubeflow MLOps 全流程 与 K8s 深度集成 较重

4.8 推理集群

4.8.1 推理引擎对比

引擎 开发方 KV Cache 多模型 国产适配
vLLM 伯克利 LMSYS PagedAttention 昇腾(第三方)
TensorRT-LLM NVIDIA 官方 动态批处理 仅 NVIDIA GPU
SGLang 斯坦福 RadixAttention 昇腾(实验)
TGI HuggingFace 昇腾(第三方)

4.8.2 PD 分离架构(超大规模推理)

对于超大模型(> 70B),Prefill-Deploy 分离可显著提升 GPU 利用率:

                    ┌─────────────┐
                    │   Router    │
                    └──────┬──────┘
                           │
              ┌────────────┴────────────┐
              ▼                         ▼
       ┌─────────────┐           ┌─────────────┐
       │  Prefill 节点 │           │  Decode 节点  │
       │  H100/H200   │  KV Cache │  L40S/H20    │
       │  计算密集     │ ──传输──→ │  显存密集     │
       │  高延迟       │           │  低延迟高吞吐  │
       └─────────────┘           └─────────────┘
对比项 传统单节点推理 PD 分离推理
GPU 利用率 < 30%Decode 瓶颈) 7090%
首 token 延迟 固定 可优化
吞吐 受限于最慢阶段 各阶段独立扩缩容
适用模型 < 30B 参数 任意规模,尤其是 > 70B

4.9 国产化集群

4.9.1 华为昇腾 910B

参数 昇腾 910B NVIDIA H100 对比
FP16 算力 640 TFLOPS 1,979 TFLOPS H100 的 ~32%
INT8 算力 1,280 TOPS 3,958 TOPS H100 的 ~32%
HBM 容量 64 GB 80 GB
HBM 带宽 1.6 TB/s 3.35 TB/s H100 的 ~48%
芯片互联 HCCS392 GB/s NVLink900 GB/s HCCS > PCIe Gen4,基本持平 NVLink 4 代单链路
功耗 400 W 700 W 能效比更优
制程 7nm 4nm 差一代
生态 昇腾 CANN / MindSpore CUDA / cuDNN 差距较大,需移植

注:HCCS 双向带宽 392 GB/s(8 × HCCS 端口),用于 8 × NPU 节点内全互联。

昇腾软件栈:

层次 昇腾组件 替代 NVIDIA
芯片 Ascend 910B NPU H100/H200 GPU
驱动 Huawei CANN CUDA
通信库 HCCS(昇腾集合通信) NCCL
框架 MindSpore / PyTorch(第三方) PyTorch
推理引擎 MindX / ATLAS TensorRT

4.9.2 海光 DCU Z100

参数 海光 DCU Z100 NVIDIA A100 对比
FP16 算力 256 TFLOPS 624 TFLOPS A100 的 ~41%
HBM 容量 64 GB 40/80 GB 对标 A100 80G
功耗 350 W 400 W 略低
生态 ROCm(部分兼容) CUDA 兼容性优于昇腾,迁移成本较低

4.10 硬件监控体系

监控维度 工具 采集指标
GPU 监控 DCGMNVIDIA/ msmonitor(昇腾) 温度、功耗、利用率、显存、ECC 错误
InfiniBand 监控 UFMNVIDIA/ Mellanox firmware 端口状态、误码率、拓扑
存储监控 JuiceFS / BeeGFS 内置工具 带宽、IOPS、元数据延迟
节点监控 node_exporter + Prometheus CPU、内存、网络、磁盘
集群健康 Grafana 大盘 综合集群状态

关键告警阈值:

级别 指标 阈值 动作
P1(紧急) GPU 温度 > 85°C 立即降频 / 关机
P1 GPU ECC 错误数 > 100/小时 标记节点下线
P2(重要) GPU 利用率 < 10%(训练时) 检查 NCCL 通信
P2 InfiniBand 端口误码 > 10⁻⁶ 更换光模块 / 线缆

4.11 机场智算中心推荐配置

方案一:中等规模(年旅客量 < 1,000 万,推理为主)

项目 配置
GPU 类型 NVIDIA L40S × 4/节点
节点数量 32 节点 = 128 GPU
主要负载 推理服务、视频分析、Agent
集群算力 ~256 TFLOPSFP16
网络 RoCE v2 200G + 以太网管理
存储 JuiceFS + 对象存储,2 PB
服务器形态 4U 液冷机架服务器
预估总功耗 约 256 kW
国产化 可选昇腾 910B × 4 混部

方案二:大规模(年旅客量 1,000–5,000 万,训练 + 推理)

项目 配置
训练 GPU NVIDIA H100 SXM5 × 8/节点
训练节点数 32 节点 = 256 GPU
训练算力 ~1 PFLOPSBF16 稀疏)≈ 512 PFLOPSFP16 稠密)
推理 GPU L40S × 4/节点
推理节点数 16 节点 = 64 GPU
计算网络 InfiniBand NDR 400G × 2(双上联)
存储网络 RoCE v2 200G + 全闪存存储
存储容量 JuiceFS + 全闪存,10 PB
服务器形态 HGX H100 8-GPU 液冷服务器
预估总功耗 约 550 kW(训练 416 kW + 推理 64 kW + 存储/网络 70 kW
国产化备选 昇腾 910B 训练集群

方案三:旗舰规模(年旅客量 > 5,000 万,新建超大规模智算)

项目 配置
训练 GPU NVIDIA H200/H200 × 8/节点
训练节点数 128 节点 = 1,024 GPU
SuperPOD 架构 16 × 64 GPU SUFat-Tree 组网
训练算力 ~2 EFLOPSBF16 稀疏),~1 EFLOPSBF16 稠密)
推理 GPU H100/L40S 混合
计算网络 InfiniBand NDR 400G1:1 无收敛
超节点扩展 支持 Scale-Up 到 GB200 NVL72
存储 全闪存并行文件系统,50 PB+
预估总功耗 约 13 MWGPU ~7 MW + 服务器/网络/液冷 ~6 MW
PUE 目标 ≤ 1.15(全液冷)

注:H200 GPU TDP ~700W/卡,1,024 GPU 仅 GPU 即 ~717 kW8-GPU 服务器整机约 1013 kW/台,128 台约 1.31.7 MW;加上 InfiniBand 交换机、存储节点、液冷 CDU、冷却塔等辅助负载,总计约 13 MW。


五、供电系统

5.1 供电架构

市电(双路 10kV / 35kV
      ↓
自动转换开关 ATS
      ↓
高压配电
      ↓
SCALE-UP UPS2N 冗余,模块化效率 ≥ 96%)
      ↓
配电单元 PDU
      ↓
GPU 服务器机柜(液冷 CDU 集成供电)

5.2 关键参数

项目 推荐值
市电引入 双路 10kV 或 35kV(互为备用)
UPS 配置 2N 冗余(Tier IV/ N+1Tier III
UPS 效率 模块化效率 ≥ 96%
柴油发电机 1,0005,000 kVA,启动时间 < 10s
储油时间 24 小时(关键负载)
单柜功率密度 40130 kW(液冷方案)
总功耗估算 GPU 单柜 100kW × 100 柜 = 10 MW

5.3 液冷对供电的影响

影响项 说明
供电密度提升 单机柜功率从 10 kW 升至 100 kW+,对 PDU 配电模块要求更高
液冷 CDU 供电 CDU 设备需独立配电回路
变压器容量 需提前规划,按 100 kW/柜计算总容量
市电申请 大规模智算中心(10 MW+)需与电力公司单独协商

六、网络技术方案

6.1 Spine-Leaf 架构(推荐大型机场)

Spine 层(核心)
  ├── Spine-A400G
  └── Spine-B400G,冗余)
       ↑
Leaf 层(接入)
  ├── Leaf-1,2(连接 GPU 服务器)
  ├── Leaf-3(连接存储)
  └── Leaf-4(连接通用服务器)
  • 收敛比:建议 1:1(无收敛)
  • 东西向带宽:全部东西向全速

6.2 网络安全

安全措施 说明
零信任网络(ZTNA 微隔离,按需授权
DDoS 防护 清洗异常流量
算力隔离 训练 / 推理网络物理隔离
数据加密 传输加密(TLS+ 存储加密
运维审计 全量日志留存,堡垒机访问

七、等級标准与选址

7.1 Uptime Tier 等级对比

等级 可用性 年停机时间 适用场景
Tier I 99.67% > 31.5 h 基础,非关键系统
Tier II 99.75% 22 h 冗余组件,非关键业务
Tier III 99.98% ≤ 1.6 h 主机房,推荐等级
Tier IV 99.99% ≤ 0.8 h 最高等级,关键业务

Tier III 核心要求:

  • N+1 可并行维护冗余
  • 电力路径:2N UPS 或 N+1 UPS
  • 冷却系统:N+1 冗余冷冻水系统或风冷系统
  • 网络接入:多运营商、多路由接入

Tier IV 核心要求(机场应急指挥中心、空管核心系统等不允许停机的关键设施):

  • 2N 完全冗余(任意单点故障不影响运行)
  • 双市电引入
  • 2N UPS + 2N 冷却冗余
  • 建设成本约为 Tier III 的 1.52 倍

7.2 选址关键因素

因素 要求
电力容量 必须满足 100 kW/柜 × N 柜,需与电力公司协商
网络延迟 至航站楼核心系统 < 5 ms
地理条件 机场限高、净空要求,土质条件
政策支持 综合保税区政策(可参考福州长乐案例)
绿电条件 靠近可再生能源(如沿海风电)

八、典型机场案例

8.1 郑州航空港(中部最大万卡集群)

参数 数值
当前算力 10,000 PFLOPS(万卡)
规划总规模 100,000 PFLOPS+(三中心:训练/推理/推训一体)
DeepSeek 部署 2025 年 1 月全量接入 DeepSeek-R1(中部首个)
定位 填补东南沿海高端智算缺口
二期规划 边缘 / 云端推理一体机 + 产业闭环

8.2 福州长乐机场综合保税区智算中心

参数 数值
投资 11 亿元(一期 3.3 亿元)
用地面积 33,347 m²50.02 亩)
规划算力 15,000 PFLOPS
预计投产 2026 年 10 月
技术方案 规模化智算液冷机柜 + 体系化网络存储机柜阵列
政策优势 综保区多重政策,深化粵港数字协作

8.3 深圳宝安国际机场(AI 全栈部署标杆)

参数 数值
排名 42 家千万级机场综合评价第二名
DeepSeek 部署 满血版 R1-671B,华为昇腾集群全栈本地化部署
算力底座 华为昇腾算力服务器(规模未披露)
数据整合 打通航班运行、物流服务、设备物联日志等 18 类 核心业务数据

核心智能体矩阵:

智能体 效果
机位智能分配 每日起降分配:4 小时 → 1 分钟,靠桥率:85.44%
AI 安全助手 融合 1,500 份安全文档,检索效率提升 60 倍
一体化主动运控 提前 20 分钟 预判保障节点,正常率提升约 4 个百分点
综合交通全域一张图 响应时间 < 1 分钟(获"兴智杯"一等奖)

8.4 大兴 / 迪拜 / 大连横向对比

机场 等级 总功耗 制冷方案 建设模式 PUE 建设周期
北京大兴 未公开(推 Tier III+ 未公开 Vertiv Liebert PEX+ 精密空调 传统建设 未公开 3 年+
迪拜(DXB Tier III 双认证 1 MW 变容量行级空调 + 封闭通道 预制模块化 < 1.6 10 个月
大连金州湾(在建) 规划 Tier III+ 未公开 风液融合 BIM + 数字孪生 目标 < 1.4 34 年

关键结论:

  1. 快速交付选预制模块化:迪拜案例 10 个月交付,节省 50% 时间
  2. 高功率密度必须液冷:单柜 50 kW 以上场景风冷无法满足
  3. BIM 是新建机场数据中心的标准:设计施工运营一体化
  4. Tier III 是机场数据中心的基准等级:迪拜明确要求 Tier III 双认证

九、供应商参考

9.1 液冷系统

供应商 方案类型 代表产品 / 案例
维谛技术(Vertiv 冷板式(英伟达独家合作) GB200 NVL72 参考设计,Liebert PEX+
英维克(Envicool 冷板式 + 浸没式 国产液冷龙头,多个 AIDC 项目
曙光数创 浸没式(相变 / 单相) 国内浸没式液冷最大供应商,PUE 可低至 1.04
华为 冷板式 + 液冷 CDU 临港智算谷项目
Keydak 金盾 风液融合 2025 年国际机场博览会发布
施耐德电气 冷板式液冷基础设施 132 kW/rack 方案

9.2 GPU 服务器

供应商 产品系列 GPU 支持
浪潮信息 NF5688M7 / NF5698M7 H100/H200/L20
新华三 R4900 G6 H100/H200
华为 昇腾 910B 集群 昇腾 NPU
联想 ThinkSystem SR670 V2 H100/H200
超聚变 FusionPoD 多元异构

9.3 网络设备

设备 推荐供应商 规格
InfiniBand 交换机 NVIDIA Quantum-2QM9700 400Gb/s NDR
以太网交换机 华为 CloudEngine 16800 400G
RoCE 网卡 NVIDIA ConnectX-7 400Gb/s
光模块 II-VI / 华为 400G DR4/FR4

十、关键参数汇总

参数 数值
单机柜功率(训练) 80130 kW
单机柜功率(推理) 4080 kW
GPU 互联带宽(节点内) NVLink 900 GB/s(双向对等,H100
NVLink 聚合带宽(B200 1.8 TB/sFabric 聚合)
GB200 NVL72 对等带宽 900 GB/s(任意 GPU 到任意 GPU
网络互联带宽(节点间) IB 400G / 以太网 400G
NCCL 带宽目标(IB 400G 320 GB/s(理论峰值的 80%
PUE ≤ 1.25(典型)/ ≤ 1.15(全液冷)
WUE(上海标准) ≤ 2.0 L/kWh(先进值)
CUE(上海标准) ≤ 1.0 gCO₂/kWh(先进值)
可用性(Tier III 99.982%,年均故障时间 ≤ 1.6 小时
千卡集群参考造价 3.5 亿元(算力设备 3 亿 + 网络 2,500 万 + 存储 1,000 万 + 平台 / 液冷 1,000 万)

十一、GPU 集群建设建议与方案

以下建议基于上海智算导则(2025)、头豹 AIDC 白皮书、Vertiv GB200 白皮书、郑州/深圳/福州机场建设经验总结,适用于机场智算中心新建或扩建场景。


11.1 液冷是必选项,不是可选项

H100 单卡 700W、GB200 超级芯片 2.7 kW,风冷天花板已过。强行风冷会导致 GPU 过热降频,得不偿失。

液冷方案 适用场景 PUE 代表供应商
冷板式液冷(推荐) 新建首选,40130 kW/柜 1.151.25 VertivGB200 独家合作)/ 英维克 / 华为
浸没式液冷 超高密度(> 200 kW/柜) 1.051.15 曙光数创(国内最大浸没式供应商)
风液融合 过渡期、分期部署 1.251.35 Keydak 金盾(2025 年国际机场博览会发布)

冷板式液冷架构要点:

冷却塔 / 干冷器(一次侧)
        ↓
  冷水机组(夏季备用)
        ↓
  CDU(冷却液分配单元)← 独立配电回路,必须提前规划
        ↓
  Manifold(液冷岐管)
        ↓
  冷板(直接接触 GPU + CPU + 内存)

关键坑:CDU 必须独立配电回路;液冷系统调试周期比风冷长 2–3 个月;单机柜功率超过 100 kW 时,Vertiv GB200 NVL72 是唯一经过验证的方案。


11.2 网络:InfiniBand 是训练集群的事实标准

别在网络上省钱。 网络瓶颈会导致 GPU 训练效率系统性低于预期,且这个问题极难在后期排查。

场景 推荐网络 原因
AI 训练集群 InfiniBand NDR 400GQM9700 交换机) 延迟 < 0.6 μsSHARP 网内聚合节省 30–50% 梯度通信量
推理集群 Spectrum-X 400GRoCE v2)或普通 200G 以太网 无需 IB 生态,运维简单,成本低
存储网络 RoCE v2 + NVMe-oF 与计算网络解耦,独立扩展

组网设计原则:

  1. 收敛比 ≤ 1:1:AI 训练东西向流量极大,收敛比 > 1:1 直接堵死 GPU
  2. 每服务器双上联 2 × 400G IBLACP Bonding 冗余,任何单链路故障不影响集合通信
  3. Fat-Tree 无阻塞拓扑:千卡规模下,最差路径不超过 3 跳

交换机数量估算(512 GPU 集群):

层级 设备 数量
Spine QM9700 8 台
Aggregation QM9700 16 台
每组 Compute SU 64 GPU8 服务器 × 8 GPU 8 组

11.3 存储:别用传统 NAS,直接上 JuiceFS + 对象存储

AI 训练的三类存储需求差异极大,一套 NAS 打天下,必然有至少两类场景拉胯

存储类型 需求特征 推荐方案 性能目标
数据湖 大文件顺序读,带宽优先 对象存储(S3 + JuiceFS 顺序读带宽 ≥ 500 GB/s
**模型存储(Checkpoint 小文件高速写入,延迟敏感 全闪存分布式存储(并行文件系统) 写入带宽 ≥ 100 GB/s,延迟 < 1 ms
共享文件系统 小文件 IOPS 高,元数据压力大 JuiceFS + TiKV 元数据引擎 IOPS ≥ 1M

性能目标有前置条件:需足够的存储节点数量(20+ 全闪存存储节点)、充足的存储网络带宽(200G+)、正确配置的小文件聚合策略(建议 4 MiB chunk)。

推荐架构:JuiceFS + S3 兼容对象存储 + 每节点 12 TB NVMe L1 缓存

# JuiceFS 关键配置示例
# 元数据引擎:TiKV(分布式,≥3 节点)
# 数据存储:S3 兼容对象存储(任意厂商)
# 本地缓存:每节点 12 TB NVMe SSD(L1 缓存热点数据)
# chunk_size4194304  # 4 MiB,平衡元数据压力与读写效率
# 预取:自动预取临近数据块,减少对象存储往返次数

存储产品选型参考:

产品 类型 适用规模 AI 训练适配度
JuiceFS 元数据 + 对象存储分离 中大规模 ★★★★★
BeeGFS 并行文件系统 超大规模 ★★★★
GPFSIBM Spectrum Scale 并行文件系统 企业级 ★★★★
曙光 ParaStor 全闪存分布式 国产化 ★★★★
华为 OceanStor 9000 全闪存分布式 大规模 ★★★★

11.4 分期建设,别一口气建完

智算中心投资巨大(千卡集群 ~3.5 亿元),一次性规划过大的风险极高。推荐三期滚动建设

阶段 建设内容 算力规模 优先级理由
首期(012 个月) 推理集群为主(L40S × 64–128 卡) ~256 TFLOPSFP16 快速产出 AI 业务价值:客服机器人、视频分析、Agent 推理,ROI 可见
二期(1224 个月) 训练集群(H100/H200 × 128256 卡) ~1 PFLOPSBF16 稀疏) 积累自有数据后,开展模型微调和垂直领域训练
三期(2436 个月) 扩展至千卡 + 国产化混部 1,000+ PFLOPS 规模化降本,昇腾 910B 或海光 DCU 纳入备线

分期建设的核心优势:

  • 液冷/电力容量可平滑扩展:避免一次性投入后容量浪费
  • 技术路线验证H100 → H200 → GB200 NVL72,可逐步引入新硬件
  • 业务验证先行:首期推理集群验证业务可行性,二期训练集群才有意义

11.5 国产化:昇腾可用但生态是核心门槛

芯片 FP16 算力 HBM 容量 CUDA 兼容性 迁移成本 建议
NVIDIA H100/H200 1,979 TFLOPS 80 GB 原生 CUDA 主力生产集群
昇腾 910B 640 TFLOPS 64 GB ,需 CANN/MindSpore 移植 备胎 / 政务场景,配合华为原厂
海光 DCU Z100 256 TFLOPS 64 GB 较好ROCm 部分兼容 迁移成本低于昇腾,可作为备选

国产化实施路径(二选一):

路径 A(推荐,低风险):
  主力:NVIDIA H100/H200 训练 + 推理集群
  备线:昇腾 910B 集群(独立调度,混合训练暂不推荐)
  迁移优先级:推理场景优先,训练场景押后

路径 B(高风险,需华为原厂深度绑定):
  主力:昇腾 910B 全栈(MindSpore + CANN + 昇腾集群)
  前提:必须有华为原厂交付团队驻场,且业务模型已通过昇腾兼容性验证

昇腾生态关键障碍(现实评估):

  • PyTorch 模型需要重新适配(昇腾提供 PyTorch Adapter,但非所有算子覆盖)
  • NCCL 通信库替换为 HCCS,集合通信参数需重新调优
  • 推理引擎(vLLM/TensorRT-LLM)昇腾适配不完整,vLLM 昇腾支持为第三方社区维护
  • 结论:昇腾 910B 在推理场景相对可用;训练场景建议等待昇腾 920 或更高代际

11.6 上线前必须验证 NCCL 带宽

这是 GPU 集群上线后最容易被忽略、也最容易出问题的环节。网络配置不当会导致 GPU 训练效率系统性低于预期,且排查链路长(应用层 → NCCL → IB 驱动 → 物理层)。

验证命令:

# ── 节点内 NVLink 带宽验证 ──
# 目标:> 850 GB/s(理论 900 GB/s 的 94%
./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8

# ── 跨节点 InfiniBand 带宽验证 ──
# 目标:> 320 GB/s(理论 400 GB/s 的 80%
# 说明:若 < 320 GB/s,说明 IB 网络存在瓶颈(光模块/线缆/交换机配置/拥塞控制)
./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8 -N 1 -w 100 -n 100

# ── GPU Direct RDMA 验证 ──
# 验证 GPU 直接访问远端存储(绕过 CPU),目标带宽接近 IB 线速
nvidia-smi topo -m   # 查看拓扑矩阵,确认 GPU 与 IB 网卡亲和性

NCCL 带宽不达标的常见原因:

原因 表现 解决
IB 端口误码率 > 10⁻⁶ 带宽波动剧烈,大量重传 更换光模块或光纤
收敛比 > 1:1 跨交换机流量丢包 增补交换机,改无阻塞拓扑
GPU Direct RDMA 未启用 GPU → CPU → 网卡绕路 确认 NCCL_NET_GDR_LEVEL=PIX
NVLink 域内流量被 PCIe 抢带宽 节点内 AllReduce 带宽不足 确认 NVLink 拓扑全连接
SHARP 未启用 梯度聚合消耗额外带宽 启用 SHARPNCCL_SHARP_ENABLE=1

验收标准: 512 GPU 集群规模下,跨节点 AllReduce 带宽稳定 ≥ 320 GB/s,且连续 72 小时压测无掉速。


11.7 推荐配置方案对比

配置项 方案 A:推理优先 方案 B:训练+推理均衡 方案 C:超大规模旗舰
定位 年旅客量 < 1,000 万 年旅客量 1,0005,000 万 年旅客量 > 5,000 万
训练 GPU H100 SXM5 × 8/节点,32 节点 H200 SXM5 × 8/节点,128 节点
推理 GPU L40S × 4/节点,32 节点 L40S × 4/节点,16 节点 H100/L40S 混合,32 节点
总 GPU 卡数 128 卡 384 卡(训练 256 + 推理 128 1,152 卡
训练算力(BF16 稀疏) ~1 PFLOPS ~2.5 PFLOPS
计算网络 RoCE v2 200G IB NDR 400G × 2 上联 IB NDR 400GFat-Tree 1:1 无收敛
存储网络 RoCE v2 200G RoCE v2 200G + 全闪存存储 IB 400G + 并行文件系统 50 PB
散热方案 冷板式液冷 冷板式液冷(80% 液冷占比) 全液冷,PUE ≤ 1.15
液冷 CDU 英维克(200400 kW Vertiv / 华为(400800 kW Vertiv GB200 NVL72 配套
国产化 可选昇腾 910B 混部 昇腾 910B 作为备线 昇腾 920 作为下一代备选
预估总功耗 ~256 kW ~550 kW ~13 MW
预估投资 ~8,000 万元 ~3.5 亿元 ~1520 亿元
PUE 目标 ≤ 1.25 ≤ 1.20 ≤ 1.15
Tier 等级 Tier III Tier III Tier III+

方案 B(训练+推理均衡)是大多数中型机场的推荐起点。千卡集群参考造价分项:算力设备 ~3 亿 + InfiniBand 网络 ~2,500 万 + 全闪存存储 ~1,000 万 + 平台软件/液冷基础设施 ~1,000 万 = ~3.5 亿元


11.8 避坑清单

# 坑点 后果 预防措施
1 液冷 CDU 配电容量未提前规划 液冷系统无法满载,GPU 过热降频 电力容量申请时按 100 kW/柜 × N 柜提前量
2 InfiniBand 收敛比 > 1:1 GPU 训练效率 < 50% 组网设计审查必须过「无阻塞」关
3 存储用了传统 NAS 并行训练时所有 GPU 饿死 存储必须满足 IOPS ≥ 1M、带宽 ≥ 500 GB/s 前置条件
4 国产化迁移低估生态障碍 昇腾集群上线后模型跑不起来 推理场景先行验证,训练场景押后
5 上线前未验证 NCCL 带宽 集群训练效率系统性低于预期 512 GPU 以上集群必须 72 小时压测
6 一次建完未分期 容量浪费或容量不足 三期滚动建设,首期验证业务可行性
7 PUE 目标过于激进(全液冷但液冷调试滞后) 夏季高温期集群性能受限 液冷调试周期留足 23 个月余量

11.9 建设检查清单(验收参考)

液冷系统:

  • CDU 运行状态:出水温度、流量、压力在设计范围内
  • 冷板接触面导热硅脂状态正常,无干涸
  • 液冷回路无泄漏报警
  • 夏季高温工况下 GPU 温度稳定 < 80°C

网络系统:

  • InfiniBand 端口误码率 < 10⁻⁸(连续 24 小时)
  • NCCL 跨节点 AllReduce 带宽 ≥ 320 GB/sIB 400G
  • GPU Direct RDMA 验证通过
  • SHARP 网内聚合启用并生效

存储系统:

  • JuiceFS/并行文件系统 IOPS ≥ 1M(4K 小文件随机读)
  • Checkpoint 写入带宽 ≥ 100 GB/s128 节点同时写)
  • 对象存储读写延迟 < 10 msP99

集群健康:

  • DCGM GPU 监控大屏正常运行
  • 训练作业 72 小时无 GPU ECC 错误告警
  • UFM InfiniBand 管理平台拓扑与实际一致
  • 故障节点自动隔离机制验证通过

附录

A. 术语表

缩写 全称 说明
AIDC Artificial Intelligence Data Center 智算中心
PUE Power Usage Effectiveness 电能利用效率(= 总设施能耗 / IT 设备能耗)
WUE Water Usage Effectiveness 水资源利用效率
CUE Carbon Usage Effectiveness 碳利用效率
CDU Coolant Distribution Unit 冷却液分配单元
NCCL NVIDIA Collective Communications Library GPU 集合通信库
RoCE RDMA over Converged Ethernet 以太网远程直接内存访问
NVLink NVIDIA High-Speed GPU Interconnect 英伟达高速 GPU 互连
InfiniBand High-Speed Network Architecture 高速网络架构(400G NDR
DCGM Data Center GPU Manager 数据中心 GPU 管理工具
vLLM Virtual Large Language Model Server 开源 LLM 推理服务框架
HBM High Bandwidth Memory 高带宽存储器(GPU 显存标准)
BF16 Brain Float 16 AI 训练常用浮点格式
ZTNA Zero Trust Network Architecture 零信任网络架构
SHARP Scalable Hierarchical Aggregation and Reduction Protocol 网内计算协议
UFM Unified Fabric Manager InfiniBand 监控管理工具
GPFS General Parallel File System IBM 并行文件系统

B. 数据来源

  1. 上海,《智算中心建设导则(2025 年版)》— 全国最严 PUE/WUE/CUE 三级指标
  2. 头豹研究院,《2025 年中国 AIDC 产业发展白皮书》— GPU 选型、液冷市场
  3. 中国工业互联网研究院,《工业智算发展研究报告(2025 年)》
  4. Vertiv,《GB200 NVL72 参考架构白皮书》— 130 kW 单柜设计
  5. IDC + 浪潮信息,《中国人工智能计算力发展评估报告》
  6. 中国信通院,《人工智能算力基础设施赋能研究报告(2025 年)》
  7. 福州长乐机场保税区,《15,000P 智算中心可行性报告》(2026-01-22)
  8. 郑州航空港,《中部最大万卡算力集群》报道(2026-03-05)
  9. 深圳机场,《智能化全国第二 AI 全栈部署》报道(2026-01-15

C. 相关标准与政策

  • 《数据中心绿色低碳发展专项行动计划》(发改环资〔2024〕970 号)
  • 《数据中心设计规范》GB 50174-2017
  • 《新型数据中心发展三年行动计划(2021–2023)》
  • 《算力基础设施高质量发展行动计划》
  • Uptime Institute Tier StandardTier I/II/III/IV 认证体系)
  • ANSI/TIA-942-B(数据中心电信基础设施标准)

本方案为技术方案参考文档,具体项目需结合机场业务规模、预算、国产化要求和所在地区政策进行定制化设计。建议在项目立项后委托专业设计院进行深化设计。