1209 lines
56 KiB
Markdown
1209 lines
56 KiB
Markdown
---
|
||
title: 机场智算中心技术方案
|
||
created: 2026-04-08
|
||
updated: 2026-04-15
|
||
type: solution
|
||
tags: [solution, gpu, liquid-cooling, tier, power, network]
|
||
sources: [raw/articles/shanghai-ai-computing-guidelines.md, raw/articles/headleo-aiDC-whitepaper.md, raw/articles/industrial-ai-computing-report.md, raw/articles/dubai-airport-huawei-dc.md, raw/articles/daxing-airport-vertiv.md, raw/articles/2025-airport-construction-summit.md, raw/articles/zhengzhou-airport-hangang.md, raw/articles/fuzhou-changle-airport-bsj.md]
|
||
confidence: 0.5
|
||
status: active
|
||
last_confirmed: 2026-04-15
|
||
sources_count: 0
|
||
---
|
||
# 机场智算中心技术方案
|
||
|
||
> 本方案以机场 wiki 现有资料库为依据,综合:上海智算中心建设导则(2025)、头豹 AIDC 白皮书(2025)、工业智算报告、大兴/迪拜/大连/郑州/福州/深圳等机场案例
|
||
> 生成时间:2026-04-10 | 数据来源:详见附录
|
||
|
||
---
|
||
|
||
## 一、概述
|
||
|
||
### 1.1 什么是机场智算中心
|
||
|
||
机场智算中心(Airport Intelligent Computing Center)是支撑机场智能化运营的 **GPU/NPU/ASIC 异构算力集群**,区别于传统数据中心(CPU 为主、风冷、PUE 1.4+),智算中心以 AI 训练/推理为核心负载,必须采用液冷散热和东西向高速网络。
|
||
|
||
### 1.2 传统 DC vs 智算中心核心差异
|
||
|
||
| 对比项 | 传统数据中心 | 智算中心 |
|
||
|--------|------------|---------|
|
||
| 核心负载 | ERP、Web、数据库 | AI 训练/推理、视频分析 |
|
||
| 算力芯片 | CPU 为主 | GPU/NPU 集群为主 |
|
||
| 单机柜功率 | 5–15 kW | **50–200+ kW** |
|
||
| 散热方式 | 风冷为主 | **液冷为主** |
|
||
| 网络重点 | 南北向 | **东西向高速互联** |
|
||
| PUE 目标 | 1.4–1.6 | **≤ 1.25**(全液冷 ≤ 1.15)|
|
||
|
||
### 1.3 典型应用场景与算力需求
|
||
|
||
| 应用场景 | 算力类型 | 典型规模 |
|
||
|---------|---------|---------|
|
||
| 航班智能调度(大模型) | 训练 + 推理 | 7B–70B 参数模型微调 |
|
||
| 行李全流程追踪(CV) | 推理为主 | 100+ 摄像头视频流 |
|
||
| 航站楼安防/客流热力图 | 推理为主 | 实时视频分析 |
|
||
| 语音客服机器人 | 推理为主 | 并发 500+ QPS |
|
||
| 飞机故障预测(时序) | 训练 + 推理 | 时序数据分析 |
|
||
| 机场数字孪生 | 训练 + 推理 | 物理仿真 + 渲染 |
|
||
| 智能巡检机器人 | 推理为主 | 边缘部署 |
|
||
| 行李异常检测(多模态) | 推理为主 | CV + NLP |
|
||
|
||
### 1.4 中国智算市场规模参考
|
||
|
||
| 年份 | 中国智算规模 | 同比增速 |
|
||
|------|----------|---------|
|
||
| 2024 | 725.3 EFlops(FP16)| +74.1% |
|
||
| 2025E | 1,037.3 EFlops | +43% |
|
||
| 2028E(复合增长 46.2%)| — | — |
|
||
|
||
> 数据来源:IDC + 浪潮信息《中国人工智能计算力发展评估报告》
|
||
|
||
### 1.5 机场智算中心规模分级建议
|
||
|
||
| 机场规模 | 推荐算力 | GPU 卡数参考 | 典型机柜数 |
|
||
|---------|---------|------------|---------|
|
||
| 年旅客量 < 1,000 万 | 1–10 PFLOPS(FP16)| 64–512 卡 | 8–32 柜 |
|
||
| 年旅客量 1,000–5,000 万 | 10–50 PFLOPS | 512–2,048 卡 | 32–128 柜 |
|
||
| 年旅客量 > 5,000 万 | 50–200+ PFLOPS | 2,048–8,000+ 卡 | 128–500+ 柜 |
|
||
|
||
---
|
||
|
||
## 二、系统架构
|
||
|
||
### 2.1 整体架构
|
||
|
||
```
|
||
┌──────────────────────────────────────────────────────┐
|
||
│ 应用服务层 │
|
||
│ 航班调度大模型 │ 行李追踪 │ 安防分析 │ 客服机器人 │
|
||
├──────────────────────────────────────────────────────┤
|
||
│ 模型服务层 │
|
||
│ 推理引擎(vLLM / TensorRT-LLM)│ 微调框架 │ 模型仓库 │
|
||
├──────────────────────────────────────────────────────┤
|
||
│ 训练平台层 │
|
||
│ 分布式训练框架(NCCL / Megatron-LM / DeepSpeed) │
|
||
├──────────────────────────────────────────────────────┤
|
||
│ 算力调度层 │
|
||
│ Kubernetes + Volcano │ 作业管理 │ 配额计费 │ 碳排管理│
|
||
├──────────────────────────────────────────────────────┤
|
||
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
|
||
│ │ 训练集群 │ │ 推理集群 │ │ 国产化集群 │ │
|
||
│ │ HGX H100 │ │ L40S/昇腾 │ │ 昇腾 910B │ │
|
||
│ └──────────┘ └──────────┘ └──────────┘ │
|
||
├──────────────────────────────────────────────────────┤
|
||
│ 存储层 │
|
||
│ JuiceFS + 对象存储(S3)│ 全闪存分布式 │ 本地 NVMe 缓存│
|
||
├──────────────────────────────────────────────────────┤
|
||
│ 网络层 │
|
||
│ Spine-Leaf 400G │ InfiniBand NDR 400G │ RoCE v2 │
|
||
├──────────────────────────────────────────────────────┤
|
||
│ 基础设施层 │
|
||
│ 供配电(2N UPS)│ 液冷系统(CDU)│ 机柜 │ 消防 │ 监控│
|
||
└──────────────────────────────────────────────────────┘
|
||
```
|
||
|
||
### 2.2 云-边-端协同
|
||
|
||
```
|
||
云端(智算中心)
|
||
├── 训练集群:大规模长时训练任务
|
||
├── 推理服务:实时性要求不高的批量推理
|
||
└── 模型管理:微调、版本管理
|
||
|
||
边缘(航站楼 / 塔台边缘节点)
|
||
├── 实时推理:客流分析、安防告警(< 100ms)
|
||
├── 数据汇聚:本地数据预处理
|
||
└── 断网自治:与云端断连时独立运行
|
||
|
||
端侧(摄像头、传感器、机器人)
|
||
├── 轻量推理:目标检测、异常初筛
|
||
└── 数据采集:原始数据上报
|
||
```
|
||
|
||
### 2.3 异构算力架构
|
||
|
||
| 芯片类型 | 代表产品 | FP16 算力 | 显存带宽 | 功耗 | 适用场景 |
|
||
|---------|---------|-----------|---------|------|---------|
|
||
| **GPU(主流)** | NVIDIA H100 SXM5 | ~1 PFLOPS | 3.35 TB/s | 700W | 大模型训练 |
|
||
| **GPU(主流)** | NVIDIA H200 SXM | ~1 PFLOPS | **4.8 TB/s**(HBM3e)| 700W | 大规模训练 / 推理 |
|
||
| **GPU** | NVIDIA B200 | 2.25 PFLOPS | 8 TB/s | 1,200W | 超大规模智算中心 |
|
||
| **GPU(旗舰)** | **GB200 NVL72** | **~5 PFLOPS** | 16 TB/s | 2,700W/芯片 | 万卡集群(整机柜方案)|
|
||
| **GPU(推理)** | NVIDIA L40S | ~2 PFLOPS | 864 GB/s | 350W | 推理为主、中等规模 |
|
||
| **NPU(国产)** | 华为昇腾 910B | 640 TFLOPS | — | 400W | 国产化替代 |
|
||
| **ASIC(国产)** | 海光 DCU Z100 | 256 TFLOPS | — | 350W | 国产化替代(ROCm 兼容 CUDA)|
|
||
|
||
> GB200 NVL72 为整机柜方案:72 GPU + 36 Grace CPU,详见第四章
|
||
|
||
---
|
||
|
||
## 三、液冷系统
|
||
|
||
> **液冷是智算中心高功率密度散热的核心技术路线**,也是本方案重点。
|
||
|
||
### 3.1 背景:芯片功耗爆炸式增长
|
||
|
||
| 芯片 / 系统 | 功耗 | 散热方式 |
|
||
|------------|------|---------|
|
||
| CPU(至强 2000 系列)| 450–500W/颗 | 风冷极限 |
|
||
| GPU(A100) | 400W | 需液冷 |
|
||
| GPU(H100) | 700W | 必须液冷 |
|
||
| GPU(GB200) | **2,700W/超级芯片** | 必须液冷(相变或冷板)|
|
||
| GPU 机架(2024 年典型)| ~130 kW/rack | 必须液冷 |
|
||
| GPU 机架(2029 年预测)| **> 1 MW/rack** | 全面液冷 |
|
||
|
||
### 3.2 液冷技术路线对比
|
||
|
||
| 对比项 | 冷板式液冷 | 浸没式液冷(单相)| 浸没式液冷(相变)|
|
||
|--------|----------|----------------|----------------|
|
||
| 成熟度 | ★★★★★ 最高 | ★★★★ 高 | ★★★ 中 |
|
||
| 服务器改动 | 冷板安装 | 需定制服务器 | 需定制服务器 |
|
||
| 维护便利性 | ★★★★ 较好 | ★★★ 一般 | ★★ 复杂 |
|
||
| 散热能力 | 强 | 极强 | 极强(相变换热)|
|
||
| 单机柜密度 | 40–130 kW | 100–500 kW | 250–500+ kW |
|
||
| 初期投资 | 中等 | 较高 | 最高 |
|
||
| **适用场景** | **当前主流,推荐** | 高密度细分场景 | 超高功率特种场景 |
|
||
|
||
### 3.3 冷板式液冷架构
|
||
|
||
**系统架构:**
|
||
|
||
```
|
||
室外侧(一次侧冷源)
|
||
冷却塔 / 干冷器
|
||
↓(自然冷却 / 蒸发冷却)
|
||
冷水机组(夏季备用)
|
||
↓
|
||
一次侧循环管路
|
||
↓ 板式换热器
|
||
室内侧(二次侧供液)
|
||
CDU(冷却分配单元)
|
||
↓
|
||
Manifold(液冷分配岐管)
|
||
↓
|
||
冷板(直接贴附芯片:CPU + GPU + 内存)
|
||
↓
|
||
服务器内部
|
||
```
|
||
|
||
**关键设备参数:**
|
||
|
||
| 设备 | 功能 | 关键参数 |
|
||
|------|------|---------|
|
||
| CDU | 冷却液循环、温度控制 | 典型容量 200–400 kW,支持双路 |
|
||
| Manifold | 分液到各机柜 | 316L 不锈钢,多路分配 |
|
||
| 冷板 | 直接接触芯片散热 | 接触面导热硅脂,微通道设计 |
|
||
| 冷却液 | 冷板式常用 | 乙二醇/丙二醇溶液(防冻)|
|
||
|
||
### 3.4 液冷方案推荐
|
||
|
||
#### 方案 A:冷板式液冷(推荐新建机场智算中心)
|
||
|
||
| 参数 | 数值 |
|
||
|------|------|
|
||
| 液冷占比 | 80–100%(全液冷) |
|
||
| 风冷辅助 | 仅用于网络设备、少量通用服务器 |
|
||
| PUE 目标 | ≤ 1.15(全液冷)/ ≤ 1.25(80% 液冷)|
|
||
| 单柜功率上限 | 130 kW(GB200 NVL72 级别)|
|
||
|
||
**Vertiv GB200 NVL72 参考架构:**
|
||
- 单机柜功率:**130 kW**
|
||
- 架构:72 GPU + 36 CPU(Grace Blackwell)
|
||
- 散热:100% 冷板液冷
|
||
- 能耗节省:比传统风冷减少 **25%**
|
||
- 空间节省:减少 **75%** 机柜占地
|
||
|
||
#### 方案 B:风液融合(过渡期)
|
||
|
||
| 参数 | 数值 |
|
||
|------|------|
|
||
| 风冷支持 | 最高 40 kW/柜 |
|
||
| 液冷支持 | 最高 150 kW/柜 |
|
||
| 特点 | 风液同源、动态平衡、灵活部署 |
|
||
|
||
### 3.5 PUE / WUE / CUE 三级能效指标
|
||
|
||
上海智算中心建设导则(2025)要求(全国最严):
|
||
|
||
| 指标 | 新建标准值 | 运营先进值 | 长三角集群 |
|
||
|------|----------|----------|---------|
|
||
| **PUE(基准)** | ≤ 1.25 | — | — |
|
||
| **PUE(综合)** | ≤ 1.22 | ≤ 1.18 | ≤ 1.20 |
|
||
| **WUE** | ≤ 2.2 L/kWh | ≤ 2.0 L/kWh | — |
|
||
| **CUE** | ≤ 1.2 gCO₂/kWh | ≤ 1.0 gCO₂/kWh | — |
|
||
|
||
**PUE 优化措施:**
|
||
|
||
| 措施 | 效果 |
|
||
|------|------|
|
||
| 全液冷替代精密空调 | PUE 从 1.5 降至 **1.15–1.25** |
|
||
| 冷通道封闭 | 减少冷热气流混合,节能 10–15% |
|
||
| 自然冷却利用 | 冬季低温期配合液冷进一步降低 PUE |
|
||
| 高效 UPS(模块化效率 ≥ 96%)| 降低供电损耗 |
|
||
| AI 调优 | 实时调节液冷流量与温度 |
|
||
|
||
### 3.6 国产液冷供应商参考
|
||
|
||
| 供应商 | 方案类型 | 代表参数 |
|
||
|--------|---------|---------|
|
||
| 英维克(Envicool)| 冷板式 + 浸没式 | 单机柜散热能力 24 kW,散热效率提升 40% |
|
||
| 中科曙光 | 浸没式液冷 | PUE 低至 1.04,年减碳量超万吨 |
|
||
| 华为 | 冷板式 + 液冷 CDU | 临港智算谷项目,单柜 20–60 kW |
|
||
|
||
---
|
||
|
||
## 四、算力集群
|
||
|
||
> **设计原则**:本章遵循 **Scale-Up(节点内纵向扩展)+ Scale-Out(节点间横向扩展)** 双重架构。Scale-Up 以 NVLink/NVSwitch 为核心解决节点内 GPU 全互联;Scale-Out 以 InfiniBand/RoCE 为骨干解决多节点集合通信。
|
||
|
||
### 4.1 GPU 节点架构演进
|
||
|
||
| 代际 | 代表产品 | GPU 互联方式 | NVLink 聚合带宽 | GPU 对等带宽 |
|
||
|------|---------|------------|--------------|------------|
|
||
| 第 1 代(2018)| V100 SXM2 | NVLink 1.0,6 链路 | 300 GB/s | 300 GB/s |
|
||
| 第 2 代(2020)| A100 SXM4 | NVLink 3.0,12 链路 | 600 GB/s | 600 GB/s |
|
||
| 第 3 代(2022)| H100 SXM5 | NVLink 4.0,18 链路 | 900 GB/s | 900 GB/s |
|
||
| 第 4 代(2024)| B200 SXM | NVLink 5.0,18 链路 | **1.8 TB/s** | **900 GB/s** |
|
||
| 第 5 代(预测)| Rubin Ultra | NVLink 6.0 | ~3.6 TB/s | ~1.8 TB/s |
|
||
|
||
> 注:NVLink 5 "1.8 TB/s" 为 Fabric 聚合总带宽,**任意 GPU 到任意 GPU 对等带宽为 900 GB/s 双向**(与 H100 相同)。带宽提升主要来自更多链路并行,而非单链路提速。
|
||
|
||
### 4.2 HGX H100 8-GPU 节点拓扑
|
||
|
||
```
|
||
┌─────────────────────────────────┐
|
||
│ HGX H100 8-GPU Server │
|
||
CPU (AMD EPYC / Intel Xeon) │
|
||
│ × 2 │
|
||
│ │
|
||
PCIe Gen5 x16 (Host Bridge) │
|
||
│ │
|
||
┌──────────────────────────────────────────────┐ │
|
||
│ NVSwitch Fabric(6 芯片,2 平面) │ │
|
||
│ NVSwitch① ── NVSwitch② ── NVSwitch③ │ │
|
||
│ ↖ ↑ ↗ │ │
|
||
│ NVSwitch④ ── NVSwitch⑤ ── NVSwitch⑥ │ │
|
||
│ (全连接拓扑,任意 GPU 间单跳可达) │ │
|
||
└──────────────────────────────────────────────┘ │
|
||
│ │ │ │ │ │ │ │ │
|
||
GPU0 GPU1 GPU2 GPU3 GPU4 GPU5 GPU6 GPU7 │
|
||
H100 H100 H100 H100 H100 H100 H100 H100 │
|
||
SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 SXM5 │
|
||
80GB 80GB 80GB 80GB 80GB 80GB 80GB 80GB │
|
||
HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 HBM3 │
|
||
└────────── PCIe Gen5 ─────────┘ │
|
||
└────── InfiniBand / RoCE 网卡 ───────────────┘ │
|
||
└─────────────────────────────────┘
|
||
```
|
||
|
||
**关键拓扑参数(HGX H100):**
|
||
|
||
| 参数 | 规格 |
|
||
|------|------|
|
||
| GPU 数量 | 8 × NVIDIA H100 SXM5 |
|
||
| GPU 间 NVLink 带宽 | 900 GB/s 双向(全互联)|
|
||
| NVSwitch 芯片数 | **6 片**(2 组各 3 片,双平面全连接)|
|
||
| NVSwitch 交换容量 | 25.6 Tb/s 每芯片 |
|
||
| 单节点 BF16 算力(稀疏)| ~3,958 TFLOPS ≈ **4 PFLOPS** |
|
||
| 单节点 FP16 算力(稠密)| ~1,979 TFLOPS ≈ **2 PFLOPS** |
|
||
| 每 GPU HBM3 容量 | 80 GB(SXM5)|
|
||
| 每 GPU HBM3 带宽 | 3.35 TB/s |
|
||
| CPU 配置 | 2 × AMD EPYC 9004/9005 或 Intel Xeon Scalable |
|
||
| 主机内存 | 2 TB DDR5 ECC |
|
||
| 本地 SSD | 2 × 3.84 TB NVMe(OS + 缓存)|
|
||
| 电源配置 | 4 × 3.3 kW PSU(整机 ~13 kW)|
|
||
| **散热方式** | **冷板式液冷(必须)** |
|
||
|
||
### 4.3 GB200 NVL72 机架级超级芯片
|
||
|
||
**GB200 NVL72** 是 NVIDIA Blackwell 架构的整机柜集成方案,代表当前最极致的 Scale-Up 设计:
|
||
|
||
| 组件 | 数量 | 参数 |
|
||
|------|------|------|
|
||
| Blackwell GPU (B200) | 72 张 | 每 GPU BF16 算力 ~1,800 TFLOPS(稀疏)|
|
||
| Grace CPU (Neoverse V2) | 36 颗 | 72 核 ARM,每颗 240 GB LPDDR5 |
|
||
| NVLink Switch 芯片 | 9 片 | 第 4 代 NVLink Switch |
|
||
| GPU 内存总量 | 13.5 TB HBM3e | 每 GPU 186 GB(×72)|
|
||
| CPU 内存总量 | 8.6 TB LPDDR5 | 每 CPU 240 GB(×36)|
|
||
| NVLink 域带宽(聚合)| **130 TB/s** | 72 GPU 全互联 |
|
||
| **单机柜功率** | **132 kW**(TDP)|
|
||
| **散热方式** | **100% 冷板液冷** |
|
||
|
||
**计算托盘结构:**
|
||
```
|
||
每个计算托盘:
|
||
┌─────────────────────────────────┐
|
||
│ 1 × GB200 超级芯片 (= 2×B200 + 1×Grace CPU) │
|
||
│ 显存: 2 × 186 GB = 372 GB HBM3e │
|
||
│ 功率: ~2.7 kW(超级芯片总功耗) │
|
||
└─────────────────────────────────┘
|
||
|
||
18 个计算托盘 × 4 GPU/托盘 = 72 GPU
|
||
```
|
||
|
||
**NVLink 域设计:**
|
||
- 72 GPU 在同一个 NVLink 域内全互联,任意两 GPU 通信单跳
|
||
- **对等带宽:900 GB/s**(是 InfiniBand NDR 400G 的约 2.3 倍)
|
||
- 张量并行可覆盖全部 72 GPU,适合超大规模模型
|
||
|
||
> 机场场景建议:GB200 NVL72 单柜 132 kW,功率密度极高。**当前阶段以 HGX H100/H200 8-GPU 节点为主**(单节点 ~13 kW,可用液冷机柜支撑)。NVL72 预留规划,待功率和液冷成熟后再规模部署。
|
||
|
||
### 4.4 推理服务器节点(4-GPU 配置)
|
||
|
||
| 参数 | NVIDIA L40S 方案 | 昇腾 910B 方案(国产)|
|
||
|------|----------------|------------------|
|
||
| GPU 数量 | 4 × L40S | 4 × 昇腾 910B |
|
||
| GPU 显存 | 48 GB GDDR6 | 64 GB HBM |
|
||
| GPU 间互联 | PCIe Gen4 交换(无 NVLink)| HCCS(华为集合通信)|
|
||
| GPU 通信带宽 | ~64 GB/s(PCIe x16)| ~392 GB/s(HCCS)|
|
||
| 单节点算力 | ~2 PFLOPS(FP16)| ~2 PFLOPS(FP16)|
|
||
| 功耗 | ~4 kW/节点 | ~4.5 kW/节点 |
|
||
| 适用场景 | 中等规模推理 | 国产化推理 |
|
||
|
||
### 4.5 多节点集群组网(Scale-Out)
|
||
|
||
#### 4.5.1 三层三平面网络架构
|
||
|
||
```
|
||
┌────────────────────────────────────────────────────────────┐
|
||
│ 集群外部网络(Border) │
|
||
│ 互联网 / 专线 / 机场内部网络 ←→ 防火墙 / 负载均衡 │
|
||
└────────────────────────────────────────────────────────────┘
|
||
│
|
||
┌────────────────────────────────────────────────────────────┐
|
||
│ 管理网络平面(Management Network) │
|
||
│ BMC / IPMI / SSH / 监控采集 │
|
||
│ ←→ 千兆以太网(Out-of-Band) │
|
||
└────────────────────────────────────────────────────────────┘
|
||
│
|
||
┌────────────────────────────────────────────────────────────┐
|
||
│ 存储网络平面(Storage Network) │
|
||
│ 分布式存储读写 / Checkpoint 存取 │
|
||
│ ←→ RoCE v2 / InfiniBand + NVMe-oF │
|
||
│ 带宽:200–400 Gb/s │
|
||
└────────────────────────────────────────────────────────────┘
|
||
│
|
||
┌────────────────────────────────────────────────────────────┐
|
||
│ 计算网络平面(AI Fabric) │
|
||
│ GPU 集合通信(NCCL) / 梯度同步 / 数据并行 │
|
||
│ ←→ InfiniBand NDR 400G / Spectrum-X 400G │
|
||
│ 带宽:400 Gb/s(节点间) │
|
||
└────────────────────────────────────────────────────────────┘
|
||
```
|
||
|
||
#### 4.5.2 InfiniBand NDR 400G 组网
|
||
|
||
**InfiniBand 是当前 AI 训练集群的事实标准网络:**
|
||
|
||
| 特性 | 说明 |
|
||
|------|------|
|
||
| 硬件原生 RDMA | 绕过 OS 内核,延迟 < 1 μs |
|
||
| 自适应路由(AR)| 每包独立路由,充分利用所有链路 |
|
||
| SHARP 网内计算 | 交换机内聚合梯度,无需送回 GPU 再聚合 |
|
||
| NCCL 原生支持 | NVIDIA 集合通信库直接调用 |
|
||
|
||
**关键参数:**
|
||
|
||
| 参数 | 规格 |
|
||
|------|------|
|
||
| 单端口带宽 | 400 Gbps(NDR = Next Data Rate)|
|
||
| 编码方式 | PAM4(每 lane 53.125 Gbaud)|
|
||
| 线缆类型 | 光纤(多模 OM4 / 单模 LC)|
|
||
| 交换机型号 | NVIDIA QM9700 系列 |
|
||
| 交换机端口密度 | 64 端口 × 400G |
|
||
| 拓扑支持 | Fat-Tree / DragonFly+ / Hypercube |
|
||
| 每交换机延迟 | < 0.6 μs(端到端)|
|
||
| 拥塞控制 | CNP(Congestion Notification Packet)|
|
||
|
||
**Fat-Tree 拓扑设计(推荐中小规模 512 GPU):**
|
||
|
||
```
|
||
┌─────────────┐
|
||
│ Core Switch │ InfiniBand QM9700
|
||
│ (2–4 台) │ 64 端口 400G
|
||
└──────┬──────┘
|
||
│
|
||
┌─────────────────┼─────────────────┐
|
||
│ │ │
|
||
┌────▼────┐ ┌────▼────┐ ┌────▼────┐
|
||
│ Agg 1 │ │ Agg 2 │ │ Agg 3 │
|
||
│ QM9700 │ │ QM9700 │ │ QM9700 │
|
||
└────┬────┘ └────┬────┘ └────┬────┘
|
||
│ │ │
|
||
[16 servers] [16 servers] [16 servers]
|
||
每组 8× GPU 每组 8× GPU 每组 8× GPU
|
||
```
|
||
|
||
#### 4.5.3 Spectrum-X 以太网方案(替代 / 混合场景)
|
||
|
||
| 参数 | Spectrum-X 400G | InfiniBand NDR 400G |
|
||
|------|---------------|---------------------|
|
||
| 技术基础 | 以太网(RoCE v2)| InfiniBand |
|
||
| 延迟 | 1–2 μs | < 0.6 μs |
|
||
| 生态开放性 | 高(标准以太网)| 低(需 IB 交换设备)|
|
||
| 运维复杂度 | 低(统一以太网运维)| 高(独立 IB 网络)|
|
||
| **推荐场景** | 推理集群、混合云 | **训练集群(强烈推荐)**|
|
||
|
||
#### 4.5.4 万卡集群(SuperPOD)规格
|
||
|
||
| 参数 | 1,024 GPU(128 节点)| 2,048 GPU(256 节点)|
|
||
|------|-------------------|---------------------|
|
||
| 交换机型号 | QM9700 | QM9700 |
|
||
| Spine 数 | 8 | 16 |
|
||
| 每 Spine 下联 | 32 端口 400G | 32 端口 400G |
|
||
| Agg 层 | 16 | 32 |
|
||
| 收敛比 | 1:1(无收敛)| 1:1(无收敛)|
|
||
| 网络直径 | 3 跳(最差路径)| 3 跳 |
|
||
|
||
**关键设计原则:**
|
||
1. **收敛比 ≤ 1:1**:AI 训练流量无阻塞
|
||
2. 每服务器双上联(2 × 400G IB),LACP Bonding 冗余
|
||
3. GPU Direct RDMA:跨节点 GPU 直接内存访问,绕过 CPU
|
||
4. SHARP 网内聚合:梯度在交换机内聚合,节省 30–50% 通信量
|
||
|
||
### 4.6 存储集群
|
||
|
||
#### 4.6.1 存储需求分析
|
||
|
||
| 存储类型 | 用途 | 性能要求 | 典型容量 |
|
||
|---------|------|---------|---------|
|
||
| **数据湖存储** | 原始训练数据、语料库 | 顺序读带宽 ≥ 500 GB/s | 10–100 PB |
|
||
| **模型存储** | 检查点、训练产出模型 | 写入带宽 ≥ 100 GB/s,延迟 < 1 ms | 1–10 PB |
|
||
| **共享文件系统** | 代码、配置、小文件共享 | IOPS ≥ 1M | 100 TB–1 PB |
|
||
| **本地缓存** | 热点数据本地加速 | NVMe 本地读缓存 | 1–10 TB/节点 |
|
||
|
||
> 性能目标有前置条件:需足够的存储节点数量(20+ 全闪存存储节点)、充足的存储网络带宽(200G+)、正确配置的小文件聚合策略。
|
||
|
||
#### 4.6.2 推荐架构:JuiceFS + 对象存储(S3)+ 本地 NVMe 缓存
|
||
|
||
| 参数 | 推荐值 |
|
||
|------|-------|
|
||
| 元数据引擎 | TiKV(分布式,≥3 节点)|
|
||
| 数据存储 | 对象存储(S3 兼容)|
|
||
| 本地缓存 | 每节点 1–2 TB NVMe SSD(L1 缓存)|
|
||
| 小文件聚合 | 4 MiB chunk,减少元数据压力 |
|
||
| 读取预取 | 自动预取临近数据块 |
|
||
|
||
**存储产品选型:**
|
||
|
||
| 产品 | 类型 | 适用规模 | AI 训练适配度 |
|
||
|------|------|---------|------------|
|
||
| JuiceFS | 元数据 + 对象存储分离 | 中大规模 | ★★★★★ |
|
||
| BeeGFS | 并行文件系统 | 超大规模 | ★★★★ |
|
||
| GPFS(IBM Spectrum Scale)| 并行文件系统 | 企业级 | ★★★★ |
|
||
| 曙光 ParaStor | 全闪存分布式 | 国产化 | ★★★★ |
|
||
| 华为 OceanStor 9000 | 全闪存分布式 | 大规模 | ★★★★ |
|
||
|
||
#### 4.6.3 存储网络设计
|
||
|
||
| 网络平面 | 协议 | 带宽 | 交换机 |
|
||
|---------|------|------|-------|
|
||
| 计算网络 | InfiniBand NDR | 400G × 2(双上联)| QM9700 |
|
||
| 存储网络 | RoCE v2 + NVMe-oF | 200–400G | Spectrum-X / 华为 CloudEngine |
|
||
| 管理网络 | 以太网 | 1G | 接入交换机 |
|
||
|
||
### 4.7 软件栈与训练框架
|
||
|
||
#### 4.7.1 五层软件栈
|
||
|
||
```
|
||
┌──────────────────────────────────────────┐
|
||
│ 应用层:训练脚本(PyTorch / LLaMA-Factory) │
|
||
├──────────────────────────────────────────┤
|
||
│ 框架层:PyTorch 2.x + 分布式通信优化 │
|
||
│ DeepSpeed / Megatron-LM / ColossalAI │
|
||
├──────────────────────────────────────────┤
|
||
│ 通信层:NCCL 2.x(NVIDIA) │
|
||
│ HCCS(昇腾)/ OpenUCCL(国产) │
|
||
├──────────────────────────────────────────┤
|
||
│ 驱动层:CUDA 12.x / ROCm 6.x │
|
||
│ GPU Driver / cuBLAS / cuDNN │
|
||
├──────────────────────────────────────────┤
|
||
│ 硬件层:NVLink / InfiniBand / RoCE │
|
||
└──────────────────────────────────────────┘
|
||
```
|
||
|
||
#### 4.7.2 框架选型
|
||
|
||
| 框架 | 适用场景 | 并行策略 |
|
||
|------|---------|---------|
|
||
| **PyTorch 2.x + FSDP** | 通用大模型训练 | DDP / FSDP / TP |
|
||
| **DeepSpeed ZeRO** | 超大模型(千亿参数+)| ZeRO-1/2/3、流水线、张量并行 |
|
||
| **Megatron-LM** | 极致张量并行优化 | TP + PP + DP 三维并行 |
|
||
| **ColossalAI** | 异构训练、多种并行策略 | 动态调度、ZeRO++ |
|
||
|
||
#### 4.7.3 NCCL 关键配置
|
||
|
||
```bash
|
||
# NCCL 环境变量参考配置
|
||
NCCL_DEBUG=info # 调试日志(生产环境关闭)
|
||
NCCL_IB_DISABLE=0 # 启用 InfiniBand
|
||
NCCL_NET_GDR_LEVEL=PIX # GPU 直接访问网卡(最佳性能)
|
||
NCCL_NVLS_DISABLE=0 # 启用 NVLink 域内通信
|
||
NCCL_MAX_NCHANNELS=16 # InfiniBand 多路径
|
||
```
|
||
|
||
**预期 NCCL 带宽基准:**
|
||
|
||
| 通信模式 | H100 NVLink 域内 | H100 InfiniBand 400G | L40S PCIe |
|
||
|---------|----------------|---------------------|-----------|
|
||
| AllReduce(8 GPU)| ~850–900 GB/s | 300–350 GB/s | ~60 GB/s |
|
||
| AllGather | ~880 GB/s | 280–320 GB/s | ~55 GB/s |
|
||
| ReduceScatter | ~870 GB/s | 280–320 GB/s | ~55 GB/s |
|
||
|
||
> **目标**:IB 400G 的 NCCL 带宽应达到理论峰值的 **80% 以上**(≥ 320 GB/s),否则说明网络瓶颈。
|
||
|
||
#### 4.7.4 作业调度器选型
|
||
|
||
| 调度器 | 适用场景 | 优点 | 缺点 |
|
||
|--------|---------|------|------|
|
||
| **Slurm** | 超算 / HPC 传统场景 | 生态成熟,稳定可靠 | 不支持容器原生 |
|
||
| **Kubernetes + Volcano** | 云原生 AI 平台 | 生态丰富,弹性伸缩 | 配置复杂 |
|
||
| **Kubeflow** | MLOps 全流程 | 与 K8s 深度集成 | 较重 |
|
||
|
||
### 4.8 推理集群
|
||
|
||
#### 4.8.1 推理引擎对比
|
||
|
||
| 引擎 | 开发方 | KV Cache | 多模型 | 国产适配 |
|
||
|------|-------|---------|-------|--------|
|
||
| **vLLM** | 伯克利 LMSYS | PagedAttention | 是 | 昇腾(第三方)|
|
||
| **TensorRT-LLM** | NVIDIA 官方 | 动态批处理 | 是 | 仅 NVIDIA GPU |
|
||
| **SGLang** | 斯坦福 | RadixAttention | 是 | 昇腾(实验)|
|
||
| **TGI** | HuggingFace | 是 | 是 | 昇腾(第三方)|
|
||
|
||
#### 4.8.2 PD 分离架构(超大规模推理)
|
||
|
||
对于超大模型(> 70B),**Prefill-Deploy 分离**可显著提升 GPU 利用率:
|
||
|
||
```
|
||
┌─────────────┐
|
||
│ Router │
|
||
└──────┬──────┘
|
||
│
|
||
┌────────────┴────────────┐
|
||
▼ ▼
|
||
┌─────────────┐ ┌─────────────┐
|
||
│ Prefill 节点 │ │ Decode 节点 │
|
||
│ H100/H200 │ KV Cache │ L40S/H20 │
|
||
│ 计算密集 │ ──传输──→ │ 显存密集 │
|
||
│ 高延迟 │ │ 低延迟高吞吐 │
|
||
└─────────────┘ └─────────────┘
|
||
```
|
||
|
||
| 对比项 | 传统单节点推理 | PD 分离推理 |
|
||
|--------|------------|----------|
|
||
| GPU 利用率 | < 30%(Decode 瓶颈)| 70–90% |
|
||
| 首 token 延迟 | 固定 | 可优化 |
|
||
| 吞吐 | 受限于最慢阶段 | 各阶段独立扩缩容 |
|
||
| 适用模型 | < 30B 参数 | 任意规模,尤其是 > 70B |
|
||
|
||
### 4.9 国产化集群
|
||
|
||
#### 4.9.1 华为昇腾 910B
|
||
|
||
| 参数 | 昇腾 910B | NVIDIA H100 | 对比 |
|
||
|------|---------|-----------|------|
|
||
| FP16 算力 | 640 TFLOPS | 1,979 TFLOPS | H100 的 ~32% |
|
||
| INT8 算力 | 1,280 TOPS | 3,958 TOPS | H100 的 ~32% |
|
||
| HBM 容量 | 64 GB | 80 GB | — |
|
||
| HBM 带宽 | 1.6 TB/s | 3.35 TB/s | H100 的 ~48% |
|
||
| 芯片互联 | **HCCS(392 GB/s)**| NVLink(900 GB/s)| HCCS > PCIe Gen4,基本持平 NVLink 4 代单链路 |
|
||
| 功耗 | 400 W | 700 W | 能效比更优 |
|
||
| 制程 | 7nm | 4nm | 差一代 |
|
||
| 生态 | 昇腾 CANN / MindSpore | CUDA / cuDNN | **差距较大**,需移植 |
|
||
|
||
> 注:HCCS 双向带宽 **392 GB/s**(8 × HCCS 端口),用于 8 × NPU 节点内全互联。
|
||
|
||
**昇腾软件栈:**
|
||
|
||
| 层次 | 昇腾组件 | 替代 NVIDIA |
|
||
|------|---------|-----------|
|
||
| 芯片 | Ascend 910B NPU | H100/H200 GPU |
|
||
| 驱动 | Huawei CANN | CUDA |
|
||
| 通信库 | HCCS(昇腾集合通信)| NCCL |
|
||
| 框架 | MindSpore / PyTorch(第三方)| PyTorch |
|
||
| 推理引擎 | MindX / ATLAS | TensorRT |
|
||
|
||
#### 4.9.2 海光 DCU Z100
|
||
|
||
| 参数 | 海光 DCU Z100 | NVIDIA A100 | 对比 |
|
||
|------|-------------|-----------|------|
|
||
| FP16 算力 | 256 TFLOPS | 624 TFLOPS | A100 的 ~41% |
|
||
| HBM 容量 | 64 GB | 40/80 GB | 对标 A100 80G |
|
||
| 功耗 | 350 W | 400 W | 略低 |
|
||
| 生态 | ROCm(部分兼容)| CUDA | **兼容性优于昇腾**,迁移成本较低 |
|
||
|
||
### 4.10 硬件监控体系
|
||
|
||
| 监控维度 | 工具 | 采集指标 |
|
||
|---------|------|---------|
|
||
| GPU 监控 | DCGM(NVIDIA)/ msmonitor(昇腾)| 温度、功耗、利用率、显存、ECC 错误 |
|
||
| InfiniBand 监控 | UFM(NVIDIA)/ Mellanox firmware | 端口状态、误码率、拓扑 |
|
||
| 存储监控 | JuiceFS / BeeGFS 内置工具 | 带宽、IOPS、元数据延迟 |
|
||
| 节点监控 | node_exporter + Prometheus | CPU、内存、网络、磁盘 |
|
||
| 集群健康 | Grafana 大盘 | 综合集群状态 |
|
||
|
||
**关键告警阈值:**
|
||
|
||
| 级别 | 指标 | 阈值 | 动作 |
|
||
|------|------|------|------|
|
||
| P1(紧急)| GPU 温度 | > 85°C | 立即降频 / 关机 |
|
||
| P1 | GPU ECC 错误数 | > 100/小时 | 标记节点下线 |
|
||
| P2(重要)| GPU 利用率 | < 10%(训练时)| 检查 NCCL 通信 |
|
||
| P2 | InfiniBand 端口误码 | > 10⁻⁶ | 更换光模块 / 线缆 |
|
||
|
||
### 4.11 机场智算中心推荐配置
|
||
|
||
#### 方案一:中等规模(年旅客量 < 1,000 万,推理为主)
|
||
|
||
| 项目 | 配置 |
|
||
|------|------|
|
||
| GPU 类型 | NVIDIA L40S × 4/节点 |
|
||
| 节点数量 | 32 节点 = 128 GPU |
|
||
| 主要负载 | 推理服务、视频分析、Agent |
|
||
| 集群算力 | ~256 TFLOPS(FP16)|
|
||
| 网络 | RoCE v2 200G + 以太网管理 |
|
||
| 存储 | JuiceFS + 对象存储,2 PB |
|
||
| 服务器形态 | 4U 液冷机架服务器 |
|
||
| 预估总功耗 | 约 256 kW |
|
||
| 国产化 | 可选昇腾 910B × 4 混部 |
|
||
|
||
#### 方案二:大规模(年旅客量 1,000–5,000 万,训练 + 推理)
|
||
|
||
| 项目 | 配置 |
|
||
|------|------|
|
||
| 训练 GPU | NVIDIA H100 SXM5 × 8/节点 |
|
||
| 训练节点数 | 32 节点 = 256 GPU |
|
||
| 训练算力 | ~1 PFLOPS(BF16 稀疏)≈ **512 PFLOPS**(FP16 稠密)|
|
||
| 推理 GPU | L40S × 4/节点 |
|
||
| 推理节点数 | 16 节点 = 64 GPU |
|
||
| 计算网络 | InfiniBand NDR 400G × 2(双上联)|
|
||
| 存储网络 | RoCE v2 200G + 全闪存存储 |
|
||
| 存储容量 | JuiceFS + 全闪存,10 PB |
|
||
| 服务器形态 | HGX H100 8-GPU 液冷服务器 |
|
||
| 预估总功耗 | **约 550 kW**(训练 416 kW + 推理 64 kW + 存储/网络 70 kW)|
|
||
| 国产化备选 | 昇腾 910B 训练集群 |
|
||
|
||
#### 方案三:旗舰规模(年旅客量 > 5,000 万,新建超大规模智算)
|
||
|
||
| 项目 | 配置 |
|
||
|------|------|
|
||
| 训练 GPU | NVIDIA H200/H200 × 8/节点 |
|
||
| 训练节点数 | 128 节点 = 1,024 GPU |
|
||
| SuperPOD 架构 | 16 × 64 GPU SU,Fat-Tree 组网 |
|
||
| 训练算力 | ~2 EFLOPS(BF16 稀疏),~1 EFLOPS(BF16 稠密)|
|
||
| 推理 GPU | H100/L40S 混合 |
|
||
| 计算网络 | InfiniBand NDR 400G,1:1 无收敛 |
|
||
| 超节点扩展 | 支持 Scale-Up 到 GB200 NVL72 |
|
||
| 存储 | 全闪存并行文件系统,50 PB+ |
|
||
| 预估总功耗 | **约 13 MW**(GPU ~7 MW + 服务器/网络/液冷 ~6 MW)|
|
||
| PUE 目标 | ≤ 1.15(全液冷)|
|
||
|
||
> 注:H200 GPU TDP ~700W/卡,1,024 GPU 仅 GPU 即 ~717 kW;8-GPU 服务器整机约 10–13 kW/台,128 台约 1.3–1.7 MW;加上 InfiniBand 交换机、存储节点、液冷 CDU、冷却塔等辅助负载,总计约 13 MW。
|
||
|
||
---
|
||
|
||
## 五、供电系统
|
||
|
||
### 5.1 供电架构
|
||
|
||
```
|
||
市电(双路 10kV / 35kV)
|
||
↓
|
||
自动转换开关 ATS
|
||
↓
|
||
高压配电
|
||
↓
|
||
SCALE-UP UPS(2N 冗余,模块化效率 ≥ 96%)
|
||
↓
|
||
配电单元 PDU
|
||
↓
|
||
GPU 服务器机柜(液冷 CDU 集成供电)
|
||
```
|
||
|
||
### 5.2 关键参数
|
||
|
||
| 项目 | 推荐值 |
|
||
|------|-------|
|
||
| 市电引入 | 双路 10kV 或 35kV(互为备用)|
|
||
| UPS 配置 | 2N 冗余(Tier IV)/ N+1(Tier III)|
|
||
| UPS 效率 | 模块化效率 ≥ 96% |
|
||
| 柴油发电机 | 1,000–5,000 kVA,启动时间 < 10s |
|
||
| 储油时间 | 24 小时(关键负载)|
|
||
| 单柜功率密度 | 40–130 kW(液冷方案)|
|
||
| 总功耗估算 | GPU 单柜 100kW × 100 柜 = 10 MW |
|
||
|
||
### 5.3 液冷对供电的影响
|
||
|
||
| 影响项 | 说明 |
|
||
|-------|------|
|
||
| 供电密度提升 | 单机柜功率从 10 kW 升至 100 kW+,对 PDU 配电模块要求更高 |
|
||
| 液冷 CDU 供电 | CDU 设备需独立配电回路 |
|
||
| 变压器容量 | 需提前规划,按 100 kW/柜计算总容量 |
|
||
| 市电申请 | 大规模智算中心(10 MW+)需与电力公司单独协商 |
|
||
|
||
---
|
||
|
||
## 六、网络技术方案
|
||
|
||
### 6.1 Spine-Leaf 架构(推荐大型机场)
|
||
|
||
```
|
||
Spine 层(核心)
|
||
├── Spine-A(400G)
|
||
└── Spine-B(400G,冗余)
|
||
↑
|
||
Leaf 层(接入)
|
||
├── Leaf-1,2(连接 GPU 服务器)
|
||
├── Leaf-3(连接存储)
|
||
└── Leaf-4(连接通用服务器)
|
||
```
|
||
|
||
- **收敛比**:建议 1:1(无收敛)
|
||
- **东西向带宽**:全部东西向全速
|
||
|
||
### 6.2 网络安全
|
||
|
||
| 安全措施 | 说明 |
|
||
|---------|------|
|
||
| 零信任网络(ZTNA)| 微隔离,按需授权 |
|
||
| DDoS 防护 | 清洗异常流量 |
|
||
| 算力隔离 | 训练 / 推理网络物理隔离 |
|
||
| 数据加密 | 传输加密(TLS)+ 存储加密 |
|
||
| 运维审计 | 全量日志留存,堡垒机访问 |
|
||
|
||
---
|
||
|
||
## 七、等級标准与选址
|
||
|
||
### 7.1 Uptime Tier 等级对比
|
||
|
||
| 等级 | 可用性 | 年停机时间 | 适用场景 |
|
||
|------|--------|----------|---------|
|
||
| Tier I | 99.67% | > 31.5 h | 基础,非关键系统 |
|
||
| Tier II | 99.75% | 22 h | 冗余组件,非关键业务 |
|
||
| **Tier III** | **99.98%** | **≤ 1.6 h** | **主机房,推荐等级** |
|
||
| Tier IV | 99.99% | ≤ 0.8 h | 最高等级,关键业务 |
|
||
|
||
**Tier III 核心要求:**
|
||
- N+1 可并行维护冗余
|
||
- 电力路径:2N UPS 或 N+1 UPS
|
||
- 冷却系统:N+1 冗余冷冻水系统或风冷系统
|
||
- 网络接入:多运营商、多路由接入
|
||
|
||
**Tier IV 核心要求(机场应急指挥中心、空管核心系统等不允许停机的关键设施):**
|
||
- 2N 完全冗余(任意单点故障不影响运行)
|
||
- 双市电引入
|
||
- 2N UPS + 2N 冷却冗余
|
||
- 建设成本约为 Tier III 的 1.5–2 倍
|
||
|
||
### 7.2 选址关键因素
|
||
|
||
| 因素 | 要求 |
|
||
|------|------|
|
||
| 电力容量 | 必须满足 100 kW/柜 × N 柜,需与电力公司协商 |
|
||
| 网络延迟 | 至航站楼核心系统 < 5 ms |
|
||
| 地理条件 | 机场限高、净空要求,土质条件 |
|
||
| 政策支持 | 综合保税区政策(可参考福州长乐案例)|
|
||
| 绿电条件 | 靠近可再生能源(如沿海风电)|
|
||
|
||
---
|
||
|
||
## 八、典型机场案例
|
||
|
||
### 8.1 郑州航空港(中部最大万卡集群)
|
||
|
||
| 参数 | 数值 |
|
||
|------|------|
|
||
| 当前算力 | **10,000 PFLOPS(万卡)** |
|
||
| 规划总规模 | **100,000 PFLOPS+**(三中心:训练/推理/推训一体)|
|
||
| DeepSeek 部署 | 2025 年 1 月全量接入 DeepSeek-R1(中部首个)|
|
||
| 定位 | 填补东南沿海高端智算缺口 |
|
||
| 二期规划 | 边缘 / 云端推理一体机 + 产业闭环 |
|
||
|
||
### 8.2 福州长乐机场综合保税区智算中心
|
||
|
||
| 参数 | 数值 |
|
||
|------|------|
|
||
| 投资 | **11 亿元**(一期 3.3 亿元)|
|
||
| 用地面积 | **33,347 m²**(50.02 亩)|
|
||
| 规划算力 | **15,000 PFLOPS** |
|
||
| 预计投产 | **2026 年 10 月** |
|
||
| 技术方案 | 规模化智算液冷机柜 + 体系化网络存储机柜阵列 |
|
||
| 政策优势 | 综保区多重政策,深化粵港数字协作 |
|
||
|
||
### 8.3 深圳宝安国际机场(AI 全栈部署标杆)
|
||
|
||
| 参数 | 数值 |
|
||
|------|------|
|
||
| 排名 | 42 家千万级机场综合评价**第二名** |
|
||
| DeepSeek 部署 | **满血版 R1-671B**,华为昇腾集群全栈本地化部署 |
|
||
| 算力底座 | 华为昇腾算力服务器(规模未披露)|
|
||
| 数据整合 | 打通航班运行、物流服务、设备物联日志等 **18 类** 核心业务数据 |
|
||
|
||
**核心智能体矩阵:**
|
||
|
||
| 智能体 | 效果 |
|
||
|-------|------|
|
||
| 机位智能分配 | 每日起降分配:**4 小时 → 1 分钟**,靠桥率:**85.44%** |
|
||
| AI 安全助手 | 融合 1,500 份安全文档,检索效率提升 **60 倍** |
|
||
| 一体化主动运控 | 提前 **20 分钟** 预判保障节点,正常率提升约 **4 个百分点** |
|
||
| 综合交通全域一张图 | 响应时间 **< 1 分钟**(获"兴智杯"一等奖)|
|
||
|
||
### 8.4 大兴 / 迪拜 / 大连横向对比
|
||
|
||
| 机场 | 等级 | 总功耗 | 制冷方案 | 建设模式 | PUE | 建设周期 |
|
||
|------|------|--------|---------|---------|-----|---------|
|
||
| 北京大兴 | 未公开(推 Tier III+)| 未公开 | Vertiv Liebert PEX+ 精密空调 | 传统建设 | 未公开 | 3 年+ |
|
||
| 迪拜(DXB)| Tier III 双认证 | 1 MW | 变容量行级空调 + 封闭通道 | **预制模块化** | < 1.6 | **10 个月** |
|
||
| 大连金州湾(在建)| 规划 Tier III+ | 未公开 | 风液融合 | BIM + 数字孪生 | 目标 < 1.4 | 3–4 年 |
|
||
|
||
**关键结论:**
|
||
1. **快速交付选预制模块化**:迪拜案例 10 个月交付,节省 50% 时间
|
||
2. **高功率密度必须液冷**:单柜 50 kW 以上场景风冷无法满足
|
||
3. **BIM 是新建机场数据中心的标准**:设计施工运营一体化
|
||
4. **Tier III 是机场数据中心的基准等级**:迪拜明确要求 Tier III 双认证
|
||
|
||
---
|
||
|
||
## 九、供应商参考
|
||
|
||
### 9.1 液冷系统
|
||
|
||
| 供应商 | 方案类型 | 代表产品 / 案例 |
|
||
|--------|---------|---------------|
|
||
| 维谛技术(Vertiv)| 冷板式(英伟达独家合作)| GB200 NVL72 参考设计,Liebert PEX+ |
|
||
| 英维克(Envicool)| 冷板式 + 浸没式 | 国产液冷龙头,多个 AIDC 项目 |
|
||
| 曙光数创 | 浸没式(相变 / 单相)| 国内浸没式液冷最大供应商,PUE 可低至 1.04 |
|
||
| 华为 | 冷板式 + 液冷 CDU | 临港智算谷项目 |
|
||
| Keydak 金盾 | 风液融合 | 2025 年国际机场博览会发布 |
|
||
| 施耐德电气 | 冷板式液冷基础设施 | 132 kW/rack 方案 |
|
||
|
||
### 9.2 GPU 服务器
|
||
|
||
| 供应商 | 产品系列 | GPU 支持 |
|
||
|--------|---------|---------|
|
||
| 浪潮信息 | NF5688M7 / NF5698M7 | H100/H200/L20 |
|
||
| 新华三 | R4900 G6 | H100/H200 |
|
||
| 华为 | 昇腾 910B 集群 | 昇腾 NPU |
|
||
| 联想 | ThinkSystem SR670 V2 | H100/H200 |
|
||
| 超聚变 | FusionPoD | 多元异构 |
|
||
|
||
### 9.3 网络设备
|
||
|
||
| 设备 | 推荐供应商 | 规格 |
|
||
|------|---------|------|
|
||
| InfiniBand 交换机 | NVIDIA Quantum-2(QM9700)| 400Gb/s NDR |
|
||
| 以太网交换机 | 华为 CloudEngine 16800 | 400G |
|
||
| RoCE 网卡 | NVIDIA ConnectX-7 | 400Gb/s |
|
||
| 光模块 | II-VI / 华为 | 400G DR4/FR4 |
|
||
|
||
---
|
||
|
||
## 十、关键参数汇总
|
||
|
||
| 参数 | 数值 |
|
||
|------|------|
|
||
| 单机柜功率(训练)| 80–130 kW |
|
||
| 单机柜功率(推理)| 40–80 kW |
|
||
| GPU 互联带宽(节点内)| NVLink **900 GB/s**(双向对等,H100)|
|
||
| NVLink 聚合带宽(B200)| **1.8 TB/s**(Fabric 聚合)|
|
||
| GB200 NVL72 对等带宽 | **900 GB/s**(任意 GPU 到任意 GPU)|
|
||
| 网络互联带宽(节点间)| IB 400G / 以太网 400G |
|
||
| NCCL 带宽目标(IB 400G)| ≥ **320 GB/s**(理论峰值的 80%)|
|
||
| PUE | ≤ 1.25(典型)/ ≤ 1.15(全液冷)|
|
||
| WUE(上海标准)| ≤ 2.0 L/kWh(先进值)|
|
||
| CUE(上海标准)| ≤ 1.0 gCO₂/kWh(先进值)|
|
||
| 可用性(Tier III)| 99.982%,年均故障时间 ≤ 1.6 小时 |
|
||
| 千卡集群参考造价 | **3.5 亿元**(算力设备 3 亿 + 网络 2,500 万 + 存储 1,000 万 + 平台 / 液冷 1,000 万)|
|
||
|
||
---
|
||
|
||
## 十一、GPU 集群建设建议与方案
|
||
|
||
> 以下建议基于上海智算导则(2025)、头豹 AIDC 白皮书、Vertiv GB200 白皮书、郑州/深圳/福州机场建设经验总结,适用于机场智算中心新建或扩建场景。
|
||
|
||
---
|
||
|
||
### 11.1 液冷是必选项,不是可选项
|
||
|
||
H100 单卡 700W、GB200 超级芯片 2.7 kW,风冷天花板已过。**强行风冷会导致 GPU 过热降频,得不偿失。**
|
||
|
||
| 液冷方案 | 适用场景 | PUE | 代表供应商 |
|
||
|---------|---------|-----|---------|
|
||
| **冷板式液冷(推荐)** | 新建首选,40–130 kW/柜 | 1.15–1.25 | Vertiv(GB200 独家合作)/ 英维克 / 华为 |
|
||
| **浸没式液冷** | 超高密度(> 200 kW/柜)| 1.05–1.15 | 曙光数创(国内最大浸没式供应商)|
|
||
| **风液融合** | 过渡期、分期部署 | 1.25–1.35 | Keydak 金盾(2025 年国际机场博览会发布)|
|
||
|
||
**冷板式液冷架构要点:**
|
||
|
||
```
|
||
冷却塔 / 干冷器(一次侧)
|
||
↓
|
||
冷水机组(夏季备用)
|
||
↓
|
||
CDU(冷却液分配单元)← 独立配电回路,必须提前规划
|
||
↓
|
||
Manifold(液冷岐管)
|
||
↓
|
||
冷板(直接接触 GPU + CPU + 内存)
|
||
```
|
||
|
||
**关键坑**:CDU 必须独立配电回路;液冷系统调试周期比风冷长 2–3 个月;单机柜功率超过 100 kW 时,Vertiv GB200 NVL72 是唯一经过验证的方案。
|
||
|
||
---
|
||
|
||
### 11.2 网络:InfiniBand 是训练集群的事实标准
|
||
|
||
**别在网络上省钱。** 网络瓶颈会导致 GPU 训练效率系统性低于预期,且这个问题极难在后期排查。
|
||
|
||
| 场景 | 推荐网络 | 原因 |
|
||
|------|---------|------|
|
||
| **AI 训练集群** | InfiniBand NDR 400G(QM9700 交换机)| 延迟 < 0.6 μs;SHARP 网内聚合节省 30–50% 梯度通信量 |
|
||
| 推理集群 | Spectrum-X 400G(RoCE v2)或普通 200G 以太网 | 无需 IB 生态,运维简单,成本低 |
|
||
| 存储网络 | RoCE v2 + NVMe-oF | 与计算网络解耦,独立扩展 |
|
||
|
||
**组网设计原则:**
|
||
|
||
1. **收敛比 ≤ 1:1**:AI 训练东西向流量极大,收敛比 > 1:1 直接堵死 GPU
|
||
2. **每服务器双上联 2 × 400G IB**:LACP Bonding 冗余,任何单链路故障不影响集合通信
|
||
3. **Fat-Tree 无阻塞拓扑**:千卡规模下,最差路径不超过 3 跳
|
||
|
||
**交换机数量估算(512 GPU 集群):**
|
||
|
||
| 层级 | 设备 | 数量 |
|
||
|------|------|------|
|
||
| Spine | QM9700 | 8 台 |
|
||
| Aggregation | QM9700 | 16 台 |
|
||
| 每组 Compute SU | 64 GPU(8 服务器 × 8 GPU)| 8 组 |
|
||
|
||
---
|
||
|
||
### 11.3 存储:别用传统 NAS,直接上 JuiceFS + 对象存储
|
||
|
||
AI 训练的三类存储需求差异极大,**一套 NAS 打天下,必然有至少两类场景拉胯**。
|
||
|
||
| 存储类型 | 需求特征 | 推荐方案 | 性能目标 |
|
||
|---------|---------|---------|---------|
|
||
| **数据湖** | 大文件顺序读,带宽优先 | 对象存储(S3) + JuiceFS | 顺序读带宽 ≥ 500 GB/s |
|
||
| **模型存储(Checkpoint)| 小文件高速写入,延迟敏感 | 全闪存分布式存储(并行文件系统)| 写入带宽 ≥ 100 GB/s,延迟 < 1 ms |
|
||
| **共享文件系统** | 小文件 IOPS 高,元数据压力大 | JuiceFS + TiKV 元数据引擎 | IOPS ≥ 1M |
|
||
|
||
> **性能目标有前置条件**:需足够的存储节点数量(20+ 全闪存存储节点)、充足的存储网络带宽(200G+)、正确配置的小文件聚合策略(建议 4 MiB chunk)。
|
||
|
||
**推荐架构:JuiceFS + S3 兼容对象存储 + 每节点 1–2 TB NVMe L1 缓存**
|
||
|
||
```python
|
||
# JuiceFS 关键配置示例
|
||
# 元数据引擎:TiKV(分布式,≥3 节点)
|
||
# 数据存储:S3 兼容对象存储(任意厂商)
|
||
# 本地缓存:每节点 1–2 TB NVMe SSD(L1 缓存热点数据)
|
||
# chunk_size:4194304 # 4 MiB,平衡元数据压力与读写效率
|
||
# 预取:自动预取临近数据块,减少对象存储往返次数
|
||
```
|
||
|
||
**存储产品选型参考:**
|
||
|
||
| 产品 | 类型 | 适用规模 | AI 训练适配度 |
|
||
|------|------|---------|------------|
|
||
| JuiceFS | 元数据 + 对象存储分离 | 中大规模 | ★★★★★ |
|
||
| BeeGFS | 并行文件系统 | 超大规模 | ★★★★ |
|
||
| GPFS(IBM Spectrum Scale)| 并行文件系统 | 企业级 | ★★★★ |
|
||
| 曙光 ParaStor | 全闪存分布式 | 国产化 | ★★★★ |
|
||
| 华为 OceanStor 9000 | 全闪存分布式 | 大规模 | ★★★★ |
|
||
|
||
---
|
||
|
||
### 11.4 分期建设,别一口气建完
|
||
|
||
智算中心投资巨大(千卡集群 ~3.5 亿元),一次性规划过大的风险极高。**推荐三期滚动建设**:
|
||
|
||
| 阶段 | 建设内容 | 算力规模 | 优先级理由 |
|
||
|------|---------|---------|---------|
|
||
| **首期(0–12 个月)** | 推理集群为主(L40S × 64–128 卡)| ~256 TFLOPS(FP16)| 快速产出 AI 业务价值:客服机器人、视频分析、Agent 推理,ROI 可见 |
|
||
| **二期(12–24 个月)** | 训练集群(H100/H200 × 128–256 卡)| ~1 PFLOPS(BF16 稀疏)| 积累自有数据后,开展模型微调和垂直领域训练 |
|
||
| **三期(24–36 个月)** | 扩展至千卡 + 国产化混部 | 1,000+ PFLOPS | 规模化降本,昇腾 910B 或海光 DCU 纳入备线 |
|
||
|
||
**分期建设的核心优势:**
|
||
- **液冷/电力容量可平滑扩展**:避免一次性投入后容量浪费
|
||
- **技术路线验证**:H100 → H200 → GB200 NVL72,可逐步引入新硬件
|
||
- **业务验证先行**:首期推理集群验证业务可行性,二期训练集群才有意义
|
||
|
||
---
|
||
|
||
### 11.5 国产化:昇腾可用但生态是核心门槛
|
||
|
||
| 芯片 | FP16 算力 | HBM 容量 | CUDA 兼容性 | 迁移成本 | 建议 |
|
||
|------|---------|---------|------------|---------|------|
|
||
| **NVIDIA H100/H200** | 1,979 TFLOPS | 80 GB | 原生 CUDA | **低** | **主力生产集群** |
|
||
| 昇腾 910B | 640 TFLOPS | 64 GB | **差**,需 CANN/MindSpore 移植 | 高 | 备胎 / 政务场景,配合华为原厂 |
|
||
| 海光 DCU Z100 | 256 TFLOPS | 64 GB | **较好**,ROCm 部分兼容 | 中 | 迁移成本低于昇腾,可作为备选 |
|
||
|
||
**国产化实施路径(二选一):**
|
||
|
||
```
|
||
路径 A(推荐,低风险):
|
||
主力:NVIDIA H100/H200 训练 + 推理集群
|
||
备线:昇腾 910B 集群(独立调度,混合训练暂不推荐)
|
||
迁移优先级:推理场景优先,训练场景押后
|
||
|
||
路径 B(高风险,需华为原厂深度绑定):
|
||
主力:昇腾 910B 全栈(MindSpore + CANN + 昇腾集群)
|
||
前提:必须有华为原厂交付团队驻场,且业务模型已通过昇腾兼容性验证
|
||
```
|
||
|
||
**昇腾生态关键障碍(现实评估):**
|
||
- PyTorch 模型需要重新适配(昇腾提供 PyTorch Adapter,但非所有算子覆盖)
|
||
- NCCL 通信库替换为 HCCS,集合通信参数需重新调优
|
||
- 推理引擎(vLLM/TensorRT-LLM)昇腾适配不完整,vLLM 昇腾支持为第三方社区维护
|
||
- **结论**:昇腾 910B 在推理场景相对可用;训练场景建议等待昇腾 920 或更高代际
|
||
|
||
---
|
||
|
||
### 11.6 上线前必须验证 NCCL 带宽
|
||
|
||
这是 GPU 集群上线后**最容易被忽略、也最容易出问题的环节**。网络配置不当会导致 GPU 训练效率系统性低于预期,且排查链路长(应用层 → NCCL → IB 驱动 → 物理层)。
|
||
|
||
**验证命令:**
|
||
|
||
```bash
|
||
# ── 节点内 NVLink 带宽验证 ──
|
||
# 目标:> 850 GB/s(理论 900 GB/s 的 94%)
|
||
./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8
|
||
|
||
# ── 跨节点 InfiniBand 带宽验证 ──
|
||
# 目标:> 320 GB/s(理论 400 GB/s 的 80%)
|
||
# 说明:若 < 320 GB/s,说明 IB 网络存在瓶颈(光模块/线缆/交换机配置/拥塞控制)
|
||
./build/all_reduce_perf -b 128M -e 1G -f 2 -g 8 -N 1 -w 100 -n 100
|
||
|
||
# ── GPU Direct RDMA 验证 ──
|
||
# 验证 GPU 直接访问远端存储(绕过 CPU),目标带宽接近 IB 线速
|
||
nvidia-smi topo -m # 查看拓扑矩阵,确认 GPU 与 IB 网卡亲和性
|
||
```
|
||
|
||
**NCCL 带宽不达标的常见原因:**
|
||
|
||
| 原因 | 表现 | 解决 |
|
||
|------|------|------|
|
||
| IB 端口误码率 > 10⁻⁶ | 带宽波动剧烈,大量重传 | 更换光模块或光纤 |
|
||
| 收敛比 > 1:1 | 跨交换机流量丢包 | 增补交换机,改无阻塞拓扑 |
|
||
| GPU Direct RDMA 未启用 | GPU → CPU → 网卡绕路 | 确认 `NCCL_NET_GDR_LEVEL=PIX` |
|
||
| NVLink 域内流量被 PCIe 抢带宽 | 节点内 AllReduce 带宽不足 | 确认 NVLink 拓扑全连接 |
|
||
| SHARP 未启用 | 梯度聚合消耗额外带宽 | 启用 SHARP:`NCCL_SHARP_ENABLE=1` |
|
||
|
||
**验收标准:** 512 GPU 集群规模下,跨节点 AllReduce 带宽稳定 ≥ 320 GB/s,且连续 72 小时压测无掉速。
|
||
|
||
---
|
||
|
||
### 11.7 推荐配置方案对比
|
||
|
||
| 配置项 | 方案 A:推理优先 | 方案 B:训练+推理均衡 | 方案 C:超大规模旗舰 |
|
||
|--------|---------------|---------------------|------------------|
|
||
| **定位** | 年旅客量 < 1,000 万 | 年旅客量 1,000–5,000 万 | 年旅客量 > 5,000 万 |
|
||
| **训练 GPU** | — | H100 SXM5 × 8/节点,32 节点 | H200 SXM5 × 8/节点,128 节点 |
|
||
| **推理 GPU** | L40S × 4/节点,32 节点 | L40S × 4/节点,16 节点 | H100/L40S 混合,32 节点 |
|
||
| **总 GPU 卡数** | 128 卡 | **384 卡**(训练 256 + 推理 128)| **1,152 卡** |
|
||
| **训练算力(BF16 稀疏)**| — | ~1 PFLOPS | ~2.5 PFLOPS |
|
||
| **计算网络** | RoCE v2 200G | IB NDR 400G × 2 上联 | IB NDR 400G,Fat-Tree 1:1 无收敛 |
|
||
| **存储网络** | RoCE v2 200G | RoCE v2 200G + 全闪存存储 | IB 400G + 并行文件系统 50 PB |
|
||
| **散热方案** | 冷板式液冷 | 冷板式液冷(80% 液冷占比)| 全液冷,PUE ≤ 1.15 |
|
||
| **液冷 CDU** | 英维克(200–400 kW)| Vertiv / 华为(400–800 kW)| Vertiv GB200 NVL72 配套 |
|
||
| **国产化** | 可选昇腾 910B 混部 | 昇腾 910B 作为备线 | 昇腾 920 作为下一代备选 |
|
||
| **预估总功耗** | ~256 kW | ~**550 kW** | ~**13 MW** |
|
||
| **预估投资** | ~8,000 万元 | ~**3.5 亿元** | ~15–20 亿元 |
|
||
| **PUE 目标** | ≤ 1.25 | ≤ 1.20 | ≤ 1.15 |
|
||
| **Tier 等级** | Tier III | Tier III | Tier III+ |
|
||
|
||
> **方案 B**(训练+推理均衡)是大多数中型机场的推荐起点。千卡集群参考造价分项:**算力设备 ~3 亿 + InfiniBand 网络 ~2,500 万 + 全闪存存储 ~1,000 万 + 平台软件/液冷基础设施 ~1,000 万 = ~3.5 亿元**。
|
||
|
||
---
|
||
|
||
### 11.8 避坑清单
|
||
|
||
| # | 坑点 | 后果 | 预防措施 |
|
||
|---|------|------|---------|
|
||
| 1 | 液冷 CDU 配电容量未提前规划 | 液冷系统无法满载,GPU 过热降频 | 电力容量申请时按 100 kW/柜 × N 柜提前量 |
|
||
| 2 | InfiniBand 收敛比 > 1:1 | GPU 训练效率 < 50% | 组网设计审查必须过「无阻塞」关 |
|
||
| 3 | 存储用了传统 NAS | 并行训练时所有 GPU 饿死 | 存储必须满足 IOPS ≥ 1M、带宽 ≥ 500 GB/s 前置条件 |
|
||
| 4 | 国产化迁移低估生态障碍 | 昇腾集群上线后模型跑不起来 | **推理场景先行验证,训练场景押后** |
|
||
| 5 | 上线前未验证 NCCL 带宽 | 集群训练效率系统性低于预期 | 512 GPU 以上集群必须 72 小时压测 |
|
||
| 6 | 一次建完未分期 | 容量浪费或容量不足 | 三期滚动建设,首期验证业务可行性 |
|
||
| 7 | PUE 目标过于激进(全液冷但液冷调试滞后)| 夏季高温期集群性能受限 | 液冷调试周期留足 2–3 个月余量 |
|
||
|
||
---
|
||
|
||
### 11.9 建设检查清单(验收参考)
|
||
|
||
**液冷系统:**
|
||
- [ ] CDU 运行状态:出水温度、流量、压力在设计范围内
|
||
- [ ] 冷板接触面导热硅脂状态正常,无干涸
|
||
- [ ] 液冷回路无泄漏报警
|
||
- [ ] 夏季高温工况下 GPU 温度稳定 < 80°C
|
||
|
||
**网络系统:**
|
||
- [ ] InfiniBand 端口误码率 < 10⁻⁸(连续 24 小时)
|
||
- [ ] NCCL 跨节点 AllReduce 带宽 ≥ 320 GB/s(IB 400G)
|
||
- [ ] GPU Direct RDMA 验证通过
|
||
- [ ] SHARP 网内聚合启用并生效
|
||
|
||
**存储系统:**
|
||
- [ ] JuiceFS/并行文件系统 IOPS ≥ 1M(4K 小文件随机读)
|
||
- [ ] Checkpoint 写入带宽 ≥ 100 GB/s(128 节点同时写)
|
||
- [ ] 对象存储读写延迟 < 10 ms(P99)
|
||
|
||
**集群健康:**
|
||
- [ ] DCGM GPU 监控大屏正常运行
|
||
- [ ] 训练作业 72 小时无 GPU ECC 错误告警
|
||
- [ ] UFM InfiniBand 管理平台拓扑与实际一致
|
||
- [ ] 故障节点自动隔离机制验证通过
|
||
|
||
---
|
||
|
||
## 附录
|
||
|
||
### A. 术语表
|
||
|
||
| 缩写 | 全称 | 说明 |
|
||
|------|------|------|
|
||
| AIDC | Artificial Intelligence Data Center | 智算中心 |
|
||
| PUE | Power Usage Effectiveness | 电能利用效率(= 总设施能耗 / IT 设备能耗)|
|
||
| WUE | Water Usage Effectiveness | 水资源利用效率 |
|
||
| CUE | Carbon Usage Effectiveness | 碳利用效率 |
|
||
| CDU | Coolant Distribution Unit | 冷却液分配单元 |
|
||
| NCCL | NVIDIA Collective Communications Library | GPU 集合通信库 |
|
||
| RoCE | RDMA over Converged Ethernet | 以太网远程直接内存访问 |
|
||
| NVLink | NVIDIA High-Speed GPU Interconnect | 英伟达高速 GPU 互连 |
|
||
| InfiniBand | High-Speed Network Architecture | 高速网络架构(400G NDR)|
|
||
| DCGM | Data Center GPU Manager | 数据中心 GPU 管理工具 |
|
||
| vLLM | Virtual Large Language Model Server | 开源 LLM 推理服务框架 |
|
||
| HBM | High Bandwidth Memory | 高带宽存储器(GPU 显存标准)|
|
||
| BF16 | Brain Float 16 | AI 训练常用浮点格式 |
|
||
| ZTNA | Zero Trust Network Architecture | 零信任网络架构 |
|
||
| SHARP | Scalable Hierarchical Aggregation and Reduction Protocol | 网内计算协议 |
|
||
| UFM | Unified Fabric Manager | InfiniBand 监控管理工具 |
|
||
| GPFS | General Parallel File System | IBM 并行文件系统 |
|
||
|
||
### B. 数据来源
|
||
|
||
1. **上海**,《智算中心建设导则(2025 年版)》— 全国最严 PUE/WUE/CUE 三级指标
|
||
2. **头豹研究院**,《2025 年中国 AIDC 产业发展白皮书》— GPU 选型、液冷市场
|
||
3. **中国工业互联网研究院**,《工业智算发展研究报告(2025 年)》
|
||
4. **Vertiv**,《GB200 NVL72 参考架构白皮书》— 130 kW 单柜设计
|
||
5. **IDC + 浪潮信息**,《中国人工智能计算力发展评估报告》
|
||
6. **中国信通院**,《人工智能算力基础设施赋能研究报告(2025 年)》
|
||
7. **福州长乐机场保税区**,《15,000P 智算中心可行性报告》(2026-01-22)
|
||
8. **郑州航空港**,《中部最大万卡算力集群》报道(2026-03-05)
|
||
9. **深圳机场**,《智能化全国第二 AI 全栈部署》报道(2026-01-15)
|
||
|
||
### C. 相关标准与政策
|
||
|
||
- 《数据中心绿色低碳发展专项行动计划》(发改环资〔2024〕970 号)
|
||
- 《数据中心设计规范》GB 50174-2017
|
||
- 《新型数据中心发展三年行动计划(2021–2023)》
|
||
- 《算力基础设施高质量发展行动计划》
|
||
- Uptime Institute Tier Standard(Tier I/II/III/IV 认证体系)
|
||
- ANSI/TIA-942-B(数据中心电信基础设施标准)
|
||
|
||
---
|
||
|
||
*本方案为技术方案参考文档,具体项目需结合机场业务规模、预算、国产化要求和所在地区政策进行定制化设计。建议在项目立项后委托专业设计院进行深化设计。*
|