全球计算联盟_人工智能行业:新一代AIDC定义与实践研究报告_20260928.pdf
摘要
全球计算联盟
新一代AIDC定义与实践研究报告
v0.8
000
ESI 中国电子院
全球计算联盟
联合编制
Global Computing Consortium
全球计算联盟
版权声明
本研究报告版权属于全球计算联盟。
使用说明:未经全球计算联盟事先的书面授权,不得以任何方式复制、
抄袭、影印、翻泽本文档的任何部分。凡转载或引用本文的观点、数
据,请注明“来源:全球计算联盟。
前言
大模型与AI应用高速发展,算力需求持续爆发,AI数据中心
(AIDC)迎来系统性代际变革。芯片功耗攀升、集群规模向十方卡、
百万卡级别跨越,传统以设备选型为主的评估方式,已难以衡量新一 代算力基础设施的综合能力,行业驱需一套可量化、可对比的统一评
价体系。
当前产业对新一代 AIDC已形成广泛共识,本文提出六维指标体
系,从单柜功率、集群规模、交付速度、弹性兼容、运维方式、综合
能效六个维度,系统定义新一代 AIDC 的代际跃迁特征,摆脱单一
产品视角,实现对AIDC 综合能力的客观评判。本报告对该指标体
系展开定义和说明。
指标明确能力自标,架构支撑落地实现。3D数据中心作为新一
代 AIDC 的最佳实践架构之一,报告相关内容由行业内 3D 数据中
心相关资料浓缩提炼。该架构通过系统分层解耦,匹配六维指标的发 展要求,同时它并非唯一技术路线,业界也可通过其他技术路径实现
同等指标水平。
本报告面向产业从业者,打通指标定义与工程实践,文中代际数 值仅代表能力量级,后续将依托项目实践持续迭代优化,为AI算力
基础设施建设提供参考。
编写组
2026年9月
目录
前言,
第一章 AIDC 演进,
第一节 发展方向..
第二节代际演进衡量..
第二章 AIDC 代际指标体系框架.
第一节 总体框架.
第二节 维度一:单柜功率
第三节 维度二:集群规模 6
第四节 维度三:交付速度,
第五节 维度四:弹性兼容. 8
第六节维度五:运维方式, 10
第七节 维度六:综合能效 12
第三章 AIDC 划代. 14
第四章3D数据中心实践
.15
第一节面向AI高密算力时代的3D数据中心架构设计理念
..15
第二节3D数据中心关键技术实践 .16
第三节 六维指标体系与 3D 数据中心的关系 .20
第五章倡议. .21
第一章 AIDC 演进
第一节 发展方向
进入AIDC(人工智能数据中心)时代,AI算力的指数级爆发正驱动数据中心发生一
场深刻而全面的变革。在硬件层面,变革尤为显著:机柜功率已从传统数据中心普遍的 10-20
干瓦级别,跃升至100-300干瓦甚至更高的百干瓦级别,这对建筑的供电、散热和结构承
载能力提出了前所未有的要求。同时,单集群的算力规模正从过去的万卡级别,迅速向十万
卡乃至百万卡的超大规模演进,高密度算力部署已成为行业常态,彻底改变了数据中心的物
理形态和基础设施设计理念
在建设模式上,传统依赖现场测、施工和调试的线性建设模式,正逐步被高效的预制
化、产品化模式所取代。通过将电源模块、制冷单元等核心组件在工厂预制,再到现场进行
快速组装,算力交付周期从过去的以年为单位,大幅压缩至以月甚至周为单位。这种模式不
仅提升了建设效率,更重要的是,它使基础设施具备了高度的灵活性,能够支持算力硬件的
快速迭代和代际升级,极大缩短了技术更新周期。
运维与能效管理也迎来了革命性改变。传统依赖人工巡检和被动故障排查的模式,正被
基于 AI 的智能运维系统所替代,实现了从故障预警、自动定位到闭环自愈的全流程自动化
极天提升了系统的可靠性和稳定性。在能效方面,除了对 PUE(电能利用效率)提出更严
苛的要求外,AIDC 还引入了WUE(水利用效率)、CUE(碳利用效率)等多维评估指标
对水资源消耗和绿色能源占比提出了更高标准,推动数据中心向更绿色、更可持续的方向发
展。
不同于传统 IDC 侧重服务器、交换机等单点设备的性能指标,AIDC 作为一个高度耦
1
合的复杂系统,更强调从单个机柜、整栋楼宇到整个算力集群的端到端整体系统能力。这种
系统性思维驱动行业必须建立一套全新的、能够综合评估算力密度、能效、可靠性、弹性和
智能化水平的量化评估标准,以指导新一代数据中心的设计、建设和运营。
对比维度 传统 IDC AIDC(AIDataCenter)
机柜功率大幅提升(百千瓦级),建筑承
机柜功率较低(通常10-20kW)
硬件特征 载密度显著提高,集群规模向十万卡、百
密度较低,集群规模较小(万卡级)
万卡演进
传统现场施工为主,建设周期长, 预制化、产品化转型,算力交付周期大幅
建设模式
升级改造相对复杂 压缩,支持硬件快速迭代改造
运维模式 依赖人工被动排查和处置故障 系统自动闭环自愈,智能化程度高
对PUE、水资源利用、绿电占比等指标要
能效要求 主要关注 PUE 指标,要求相对宽松
求更为严苟
强调从机柜、楼宇到集群的整体系统能 评估标准 侧重单点设备性能和基础指标
力,需要全新的量化评估标准
表 1 传统 IDC 与 AIDC 的差异
( 全球计算联盟
第二节 代际演进衡量
如何衡量AIDC发展、清晰划分基础设施代际,是AI算力产业发展面临的现实命题
技术行业早已形成用量化指标划分技术代际的成熟范式,可以作为AIDC基础设施代际划分
的参考。
移动通信领域依靠速率、时延、连接数等一组关键指标,清晰区分 3G、4G、5G 的代
际差异,代际升级不以单一设备改动作为标志,而是整套系统能力的跨越。PCle 接口的迭
代同样遵循这一逻辑,每一代的升级核心以带宽、传输速率等量化参数作为判断依据,而非
单纯硬件版本名称。WiFi 技术的演进,也是依靠吞吐、时延、并发接入能力等指标,来界
定 WiFi4、WiFi5、WiFi6 之间的代际边界。
反观AIDC领域,随着大模型驱动算力规模快速扩张,单柜功耗、集群规模、建设模式
都发生巨大变化。如果仅凭产品型号、建筑外观或是企业概念去定义新一代AIDC,容易造
成概念混淆,缺少横向对比的统一标尺。新一代AIDC 的升级,不是单一设备的更新,而是
机柜、楼宇、集群、建设交付、改造兼容、运维、能效多方面的系统性跃迁。
借鉴通信、接口技术的代际划分思路,产业需要构建一套面向全行业、可量化、可横向
对比的指标体系。摒弃单一产品、厂商或者建筑形态的主观判定方式,通过多维度系统能力
指标,客观刻画基础设施整体水平,以此实现用可量化指标定义 AIDC 基础设施的代际跃
迁。
因此,本报告定义了AIDC 代际指标体系框架以及各个指标的说明,并以 3D数据中心
作为实例以供读者参考
第二章AIDC代际指标体系框架
第一节总体框架
秉承上述以指标体系为核心的代际划分思路,在开展新一代 AIDC 评估时,建议将单
个算力集群作为基础评价单元。围绕算力基础设施的全场景特征,分别从“机柜一集群”两
大空间尺度,叠加“建设一改造一运行一能耗”四大生命周期尺度,搭建形成新一代AIDC
六维指标体系。
其中,机柜和集群这两个空间维度,聚焦算力承载能力,主要解答核心问题:一套算力
集群究竟能够承载多大规模的 AI算力。而建设、改造、运行、能耗四大生命周期维度,则
聚焦基础设施的工程落地与运营表现,分别衡量集群的算力交付效率、对未来硬件代际的兼
容适配能力、业务运行的可靠性保障水平,以及整体能源利用效率。结合空间与生命周期两
大评估视角,实现对 AIDC 基础设施从硬件承载、工程建设到运营能效的系统性全覆盖评
估。
维度 观察尺度 指标名称 指标单位
单柜功率 机柜 标准机柜功率 kW/MW
集群规模 集群 单集群算力规模
交付速度 建设周期 机电交付周期 月
弹性兼容 改造周期 代际改造周期 月
运维方式 故障闭环 关键故障闭环时间 小时/分钟/秒
维度 观察尺度 指标名称 指标单位
综合能效 综合能效 电能利用效率 (PUE) 无量纲
表 2 新一代 AIDC 指标体系
六项指标应在同一个算力集群边界内开展评价。集群单位单元包括为该集群服务的IT
设备、专属供配电、制冷、储能、智能运维系统以及对应建筑空间;共享设施应按照设计容
量进行合理分摊。只有统一评价边界,才能避免不同建筑形态、不同机柜尺寸和不同亢余配
置带来的口径偏差。
第二节 维度一:单柜功率
名称:标准机柜功率
单位:kW/MW
定义:标准机柜内 IT设备的最大功率。
将单柜功率密度列为下一代AIDC 架构演进的核心指标之一,主要基于业务负载代际跃
迁与基础设施重构临界点的双重依据。当前以通用云计算为主流的数据中心机柜平均运行密
(参考 NVIDIADGX SuperPOD、ODCC 液冷集群参考架构),传统风冷+列头柜的末端配
电与散热体系在物理极限上已无法无损承载,架构矛盾从"局部优化空间不足"转为"系统性
不可行"。历史演进规律表明,单柜功率每跨越一个数量级(10kW级→百kW级一MW级),
末端配电制式(列头柜/小母线→密集母线→机柜级直供)、散热形态(地板送风一行间风冷
冷板液冷)及机柜本体承重与走线均需同步重构,不存在渐进式修补路径一一这一"密度
5
本报告来源于三个皮匠报告站(www.sgpjbg.com),由用户Id:1181721下载,文档Id:1340568,下载日期:2026-09-21
工程运行参数。
本指标的评价对象范围内为数据中心的IT 设备,包括计算、互连、网络和存储等多种
IT 设备。
不同厂商的机柜宽度、深度以及专属Sidecar配置存在差异,直接比较“单柜多少干瓦
容易产生评价失真。建议以600mm宽标准柜位为归一化基础,并披露机柜深度;专门服务
于该机柜的Sidecar、配电柜或制冷单元,应计入实际占用空间。
标准柜位功率=IT额定连续功率(实际占用宽度/600mm)
心。以此边界确立的单柜功率密度指标用于判定数据中心是否跨入"超密液冷"下一代AIDC,
并为供电制冷链路的前瞻规划提供可量化的设计锚点。
未来单柜功率是否必然达到MW级,仍取决于芯片功率、超节点形态、供电路线、散
热能力和互连技术,但向百kW级持续演进的方向明确。
第三节维度二:集群规模
名称:单集群算力规模
单位:卡
定义:可以并发运行单一大模型同步训练的物理 AI加速卡总数。
将单集群算力规模列为下一代AIDC 演进的核心指标,核心逻辑在于:智算时代,数据
中心的物理边界影响了集群的最优通信边界。传统数据中心的设计起点是“先有机房空间,
再往里部署机柜,最后跑业务”,算力规模是入驻后的结果;而在天模型驱动的下一代架构
6
中,需要先定义跑多大规模的集群,再反向倒推建筑、供电、制冷和网络平面如何建设。单
集群规模影响了数据中心需要承载的总功率、散热能力、互联范围等。数据中心不再是算力,,
最大紧耦合算力规模。
单集群算力规模要求通常受模型参数量、训练样本数、训练时间的影响。这里规定单集
群算力规模的计算公式为:
单集群算力规模=模型算力需求*训练样本数/训练时间/单卡算力/算力利用率
未来单集群算力规模向百万卡级演进,需要电、冷、网、算像一台机器一样协同起来
形成最优的集群系统工程设计。
第四节维度三:交付速度
名称:机电交付周期
单位:月
定义:机电交付周期指在单个算力集群边界内,从机电系统深化设计启动或设备采购启动,
到完成综合调试验收、具备IT设备安全上电条件的日历周期,用于衡量数据中心基础设施
的算力交付速度。
AI算力需求呈现突发性强、窗口期短的特征,大模型训练集群的部署往往要求在数月
内完成。传统数据中心机电交付周期普遍为12~18个月,依赖现场大量交叉作业和顺序施
工,难以匹配 GPU/NPU每 1~2 年一代的硬件迭代节奏。预制化、模块化、产品化的建设
模式将大量现场工作量前移至工厂,使机电交付周期可压缩至6个月以内,部分全预制解决
方案甚至实现3个月级交付。交付周期直接决定算力集群的投资回收窗口和业务响应能力
7
是区分新一代 AIDC 与传统数据中心的关键代际指标之一。
机电交付周期指标适用范围包含为某一算力集群专属服务的机电系统,包括中低压供配
电系统、UPS、未端配电与智能母线、制冷系统(含液冷一次侧、二次侧分配)、弱电与自
控系统、消防系统等。不包括土建结构施工、IT设备安装调试及业务软件部署。
机电交付周期的计算方式为:
机电交付周期= 机电系统具备上电条件日期- 机电深化设计启动日期(或设备采购合同
生效日,以先发生者为准)。
二者中较早的时间为起点),到完成综合调试验收、具备IT设备安全上电条件为终点,所经
历的总日历时间。,
是为了确保不遗漏任何可能制约交付的关键路径一一无论是设计驱动的预制化建设,还是提
前锁定长周期设备的采购行为,只要其中一个条件达成,交付周期就开始计时。终点统一为
反映基础设施的建设交付速度。该口径作为AIDC 划代及实践中衡量交付速度指标的统计依
据。
第五节维度四:弹性兼容
名称:代际改造周期
单位:月
定义:代际改造周期指在单个算力集群边界内,从正式确定算力代际升级改造需求开始,到
8
完成硬件更换、系统联调并实现业务可承载运行的全流程日历周期,用于衡量数据中心基础
设施对算力硬件代际演进的弹性兼容能力。
AI硬件技术选代节奏持续加快,算力硬件代际更新周期不断缩短。对于已投运的数据
中心,若基础设施改造工程量大、周期漫长,将直接产生算力闲置的机会成本,延缓新一代
算力集群的部署节奏。传统数据中心受定制化设计约束,机电系统与初代硬件深度绑定,硬
件代际升级往往涉及大量现场改造、线缆更换与系统调试,改造周期普遍长达6~12个月甚
至更久,且难以实现在线实施。面向新一代AIDC,基础设施需要具备快速被改造的能力:
通过模块化设计、容量预留、标准化接口和预制化改造单元,将改造周期压缩至3个月以内,
部分仅更换IT硬件的场景可缩短至数周。改造周期越短,代表基础设施对未来算力代际更
选的弹性兼容能力越强,是衡量其长期投资价值和代际先进性的关键维度。
代际改造周期覆盖从确定改造需求至业务可承载运行的全过程,按是否涉及机电系统改
动分为两类场景分别统计:
- 1)仅更换IT 硬件:不涉及供配电、制冷、机柜结构等机电系统改动,仅完成新硬件
安装、线缆连接与系统联调;
- 2)涉及机电系统改动:包括供配电容量调整、UPS及未端配电改造、制冷系统升级
(如风冷改冷板液冷、液冷二次侧扩容等)、机柜承重与结构改造、布线调整、自控逻辑更
新等。
评估时需明确改造场景类型,并披露改造过程中业务是否需要停机及停机时长等关键信
息。
代际改造周期的计算公式为:
9
代际改造周期= 业务可承载运行日期- 改造需求确定日期
其中,起点为正式确定算力代际升级改造需求的日期,以改造立项文件、需求确认单或
改造设计任务书下达日期为准;终点为完成硬件更换、系统联调并实现业务可承载运行的日
期。该口径涵盖了从需求明确到改造交付的全流程,避免仅统计施工阶段而忽略前期准备与
后期联调的影响。
对于涉及机电系统改动的场景,应进一步区分机电改造与IT硬件更换的并行或串行关
系:若两者并行实施,则以整体完成联调日期为终点;若串行实施,则以最后完成的部分为
终点。仅更换IT 硬件的场景,终点为新硬件联调完成并承载业务日期。所有场景均需在指
标统计时注明业务停机时长。
第六节维度五:运维方式
名称:关键故障闭环时间
单位:小时/分钟/秒
定义:关键故障闭环时间指关键系统故障从故障产生到故障隔离或恢复的完整周期,由故障
发现、故障定界及应急处置三个阶段构成,综合反映系统的感知、分析及自控能力,是评估
数据中心可靠性和运维能力的核心指标。
在传统数据中心中,供电系统、制冷系统和IT设备通常由不同的管理平台分别管理,
各子系统之间缺乏统一的数据视图和联动机制。当故障发生时,运维人员需要人工跨平台关
联告警、判断因果关系、制定处置方案并逐一手动执行。这种高度依赖人工经验的运维管理
模式越来越难以满足 AIDC 安全、稳定、高效的运行需求。
随着AIDC单柜功率和集群规模上升,给运维带来两方面变化:
一方面,随着大规模集群部署,设备规模快速增长,传感器的监测点位数量突破百万级,
系统的复杂度进一步增加,供电、制冷与 IT 之间的耦合关系更加紧密。传统人町监控的方
式逐步变得不可行,运维监控系统需要加快升级,从被动接收设备故障告警,转变为能够从
大量运行数据中识别异常,在日常运维活动中识别风险隐患并处置,实现故障预测、预防和
提前干预;系统能进一步理解故障背后的因果关系,更好地远程保障和提供技术决策,辅助
甚至指挥运维人员进行运维管理;
另一方面,算力机柜的高密度增长,设备异常处置时间窗口被快速压缩。为提高运维可
靠性,必须借助运维系统更快地完成故障发现和故障定位,此外,部分异常无法依靠人员现
场应急处置,需要系统具备自主执行和智能自治能力
因此,评价运维可靠性的指标建议以关键故障闭环时间为核心指标,其定义为:=()
关键故障闭环时间一般以分钟或小时计,仅在具备自动控制条件的特定故障类型中可达
秒级,不应泛化适用到所有场景。故障闭环三个子阶段过程需要分别记录并单独披露,相关
定义和指标见下表:
子阶段 定义 诊断价值 指标单位
T_故障发现 从异常信号出现到系统识 反映系统故障感知能力 秒级
别并确认故障的时间
T_故障定界 从确认故障到确定根因及 反映系统跨域因果分析 分钟级
具体故障点的时间 能力
T_应急处置 从确定根因到完成隔离或 反映系统自动控制与执 分钟级~小时级
业务恢复的时间 行能力
表 3 故障阶段分类和诊断指标
为进一步全面评估运维能力,还可配套披露以下指标:
会发生,因此需要单独披露,从而客观评价系统的预测性运维能力。
自动闭环率:在一定统计周期内,无需人工干预即可完成全流程的故障处置的比例。此
指标直接反映系统的自动化运维能力。需说明的是,自动闭环率不可能达到100%一一始终
存在需要物理介入的故障类型。合理的期望是逐步提升自动闭环率,而非追求绝对值。
值。建议按"供电故障"制冷故障"IT故障""跨域多点故障"四类分别统计分布范围
第七节 维度六:综合能效
名称: 电能利用效率 (PUE)
单位:无量纲
定义:电能利用效率(PUE)是数据中心消耗的所有能源与IT负载消耗的能源之比,综合
置下,数据中心基础设施在设计阶段的预期电能利用效率;实测PUE指在指定气候区和负
载条件下,在验收或专项测试阶段实测得到的电能利用效率;年度实测PUE 指在单个算力
集群内,按自然年统计的实际总输入电能与IT设备实际消耗电能的比值。三者联合用于衡
量数据中心基础设施从设计承诺、工程交付到长期运行全生命周期的能效水平。
当集群规模从MW走向百MW乃至GW,PUE每改善一个百分点都会带来显著的能源
价值。以100MWIT负载为例,PUE从1.35降至1.25,年节约电量可达约8,700万kWh
直接降低运营成本与碳排放。因此,PUE仍是衡量数据中心能效的核心指标。
行受负载率波动、气候条件变化和运维策略影响,实测值与设计值常存在明显偏差。为此
需同时区分设计PUE、指定气候和负载条件下的测试 PUE,以及投运后的年度实测PUE:
既约束设计承诺,又考核交付与运行水平。
此外,PUE反映的是非IT能耗占比,并不能覆盖数据中心的全部能源价值。水资源利
用效率(WUE)、碳排放(CUE)、绿电比例以及储能削峰填谷带来的用电成本优化,均可
作为扩展指标单独披露。因此,综合能效指标以PUE为核心,同时为扩展能源指标预留披
露空间,以全面评价新一代AIDC 的绿色低碳水平。
综合能效的统计边界为单个算力集群的完整供能链路:从市电进线计量点开始,包含中
低压变配电、UPS、未端配电、制冷系统(含冷机/冷却塔/水泵/液冷二次侧/末端空调等)、
照明、安防、消防、自控等所有基础设施子系统,直至IT设备电源输入端口。IT 设备(服
务器、交换机、存储等)自身能耗为分母,不包含在分子之中。设计 PUE、测试PUE 和年
度实测PUE采用相同的统计方式,以保证可比性。
PUE的计算公式为:
PUE=数据中心总输入电能 /IT设备消耗电能
其中,总输入电能为上述边界内所有基础设施设备在统计周期内消耗的电能之和;IT
设备消耗电能为该集群内所有IT设备电源输入端口测得的电能之和。
年度实测PUE按自然年统计,取全年累计总输入电量与累计IT电量的比值,而非各月
PUE 的算术平均。实测PUE应在明确指定的气候区、IT负载率、供电几余配置和冷却边界
条件下进行测试,测试时长和工况需在报告中披露。设计PUE基于设计工况(如100%负
载率、设计气象参数、供电几余等级等)下的设备效率曲线计算得出。三者对比可反映工程
交付与设计预期的偏差、运行水平与理论最优的差距,为后续优化提供依据。
PUE受气候区域、负载率、供电几余等级、冷却形态及运维水平影响显著,不同项目
只有在气候区、负载率、供电几余和冷却边界相近时,PUE才具备横向可比性。建议在能
效报告中同时披露年平均IT负载率、全年PUE 分布(如按季度或月)、测试PUE的工况条
件及设计PUE 的主要假设。
第三章 AIDC 划代
在综合能效指标体系下,除以PUE为核心评价电能利用水平外,还可配套披露水资源
利用效率(WUE)、碳利用效率(CUE)两项扩展指标,分别刻画算力对应的水资源消耗与
碳排放强度,实现电-水-碳多维度协同评价,完整反映AIDC绿色低碳综合水平。
根据前述指标定义,对AIDC 代际划分如下:
维度 指标名称 传统IDC 新一代AIDC AIDC 未来方向
单柜功率 标准机柜功率 +kW 级 百kW级 MW级
集群规模 单集群算力规模 万卡级 十万卡级 百万卡级
交付速度 机电交付周期 6~9 个月 3~5个月 1~2个月
弹性兼容 代际改造周期 月级 星期级 天级
维度 指标名称 传统IDC 新一代AIDC AIDC 未来方向
运维方式 关键故障闭环时间 被动响应 主动预防 自动闭环
综合能效 电能利用效率 (PUE) ≥1.3 <1.2 <1.1
表 4 新一代 AIDC 六维指标代际量级
注:本文所列代际数值均用于表达能力量级,不构成未经产业验证的强制值。
第四章3D数据中心实践
第一节面向AI高密算力时代的3D数据中心架构设计理念
随着大模型、生成式AI及智能计算快速发展,算力基础设施正由传统通用计算中心向
高密度、高功率、高互联的AI算力中心演进。AIDC作为面向AI时代的新型算力基础设施
其核心并非简单提升设备规模,而是对数据中心空间组织方式、供能体系、热管理模式及交
付运维体系进行系统性重构。
传统数据中心架构建立在IT设备与基础设施长期绑定的模式之上,但面对AI设备快速
迭代、多代设备共存、单柜功率持续提升以及液冷规模化应用等趋势,传统架构逐渐暴露出
空间利用率不足、供电扩展困难、冷热资源匹配效率低、建设周期长以及运维复杂度高等问
题。
其根本原因在于传统数据中心基础设施具有较强刚性,而AI算力发展呈现高动态性和
不确定性。因此,未来数据中心需要由“固定容量承载模式”向“资源池化、动态调度、弹
性演进”的新型架构转变。
C
全球计算联盟
3D数据中心围绕“标准重构、分层解耦、立体堆叠”三大理念,实现IT系统与基础设
施系统的物理解耦和能力独立演进。通过电力、冷量及空间资源池化,实现算力资源跨模块
动态配置,使数据中心具备适应多代AI设备持续演进的能力,构建面向未来AI产业发展的
弹性、绿色、智能算力底座。
第二节3D数据中心关键技术实践
- 1. 资源池化与弹性调度:冷电池化支撑AI 多代次演进
AI 计算设备的发展呈现明显的代际演进特征,不同阶段GPU、AI 加速器及服务器设备
化设计,实现基础设施资源的统一管理和动态调度。
供电池化构建高兼容性的静态底座。传统供电系统通常按照机柜或IT 设备进行固定配
置,难以适应未来高功率设备的快速迭代。3D数据中心采用容量池化与母线池化架构,以
12MW产品化POD为基础标准模块,作为最小部署单元,沿垂直方向部署3MW天容量智
能母线构建统一电力资源池。该架构突破传统机柜级供电物理边界,支持高功率密度AI超
节点与低功率存储、网络设备的混合部署。当下一代AI设备功率提升时(如功率翻倍),可
通过共享母线资源动态调整供电能力,避免重复建设,提高电力利用效率,确保每一瓦特电
力与每一空间的高效利用。
弹性调度实现动态精准的电力调控。AI负载随业务变化而变化,静态池化服务于特定
区域的机柜,无法根据负载变化进行快速的动态响应,导致电力空间利用率低下。3D数据
中心通过引入智能化电力弹性调度机制,依托负载历史数据与分析预测负载功率,比对预测
曲线与实际负载,识别超负荷风险与闲置区域,利用垂直母线分配单元与调度桥架,在业务
零中断前提下重构电力分配路径,实现供电资源从静态分配向动态调配转变,达成供电能力
与算力需求的最优匹配的目的。
制冷池化与冷量调度同步推进:实现冷量资源动态共享。随着液冷技术规模化应用,数
据中心冷却方式由单一风冷逐步向风液混合、全液冷演进。传统冷热源与IT设备绑定的模
同源、冷量全局动态调配。冷源可随不同气候环境选择最优的设备,如丰水区域选择开始冷
却塔,实现最佳能效的目的;缺水区域选择干冷器或闭式冷却塔,闭式循环系统最大限度减
少水资源的使用。集群间及超节点间以CDU模块化扩容方式实现冷量调度,支持更高密度
密度液冷与低密度风冷机柜可在同一POD内混合部署,由液冷二次管路侧智能控制精准供
冷。鉴于热力学系统大惯性、非线性、强耦合的特点,冷量调度采用分级控制架构,侧重热
平衡动态维持与瞬态负载快速响应。
电力与冷量的双重池化,支撑AI设备多代次“零改造”兼容部署,为AI设备代际演进
构筑高可靠弹性底座,同时提高电力利用率和数据机房空间利用率。
- 2.分层解耦与架构极简,支撑高密算力部署
面对AI集群规模扩天带来的空间、电力和散热挑战,3D数据中心通过功能分层和立体
化布局,实现基础设施与算力空间解耦。
分层解耦设计实现高密场景可靠供电高效散热。3D数据中心将AIDC划分为“制冷、IT、
供电、冷源和备电”四个独立功能层,将AI算力部署在独立层空间,最大限度缩短集群间
互联距离,为大集群部署提供物理基础;立体堆叠以垂直互连部署供电与制冷路由,实现最
短路径供冷供电,突破传统数据中心平面布局的管线交叉和空间限制瓶颈,提升空间利用率。
极简供电链路提升供电能力与演进弹性。供电链路采用垂直智能母线直通机柜顶部的设
计方案,减少中间分配环节,配电层级由3级精简至2级,标准单机柜供电能力由40kW
提升至300kW,支撑高密度超节点部署。该设计具备平滑演进至800V直流供电及固态变
压器(SST)等前瞻性架构的能力,为未来技未迭代预留弹性。
极简制冷链路提升能效与独立演进能力。制冷链路通过减少一级换热环节,换热层级由
3级精简至2级,整体换热能效提升,有效解决高密度散热问题;同时制冷设备独立层空间
具备独立演进能力,可平滑过渡至全液冷架构,为未来更高密度机柜部署提供技术弹性
- 3.交付体系从“工程现场制作”向“产品化工厂预制,实现高质量快速部署。
AI算力需求快速增长,对数据中心建设模式提出新的要求。传统依赖现场施工和经验
管理的建设模式已难以满足快速复制和规模化部署需求。3D数据中心打破传统数据中心建
设的“工程定制”模式,确立“产品化+数字化”的核心理念,将数据中心建设由工程项目
模式转变为工业化制造模式。通过标准化POD、参数化接口和产品化设计,将复杂的数据
中心系统拆解为可复制单元,实现从交付“建筑空间”向交付“可量化算力单元”的跨越
形成“产品化设计、模块样板验证、预制化数学化交付”三位一体的高质量管理体系。
标准化POD设计降低系统适配复杂度,样板验证提前发现设计、交付和运维风险,工
厂预制提升产品一致性、交付质量和效率。该模式将传统“现场施工”转变为“工厂制造+
现场装配,降低对人员经验依赖,提高建设效率。
全生命周期数学化与预制验证。设计阶段采用 BIM数字建模和SOP流程管理,将建筑
供电、制冷及IT系统统一建模,实现接口标准化和全过程复用。制造阶段,将关键电力
水力模块前移至工厂完成预制、测试和验证,通过1:1样板试装确保系统可靠性。交付阶段
采用并行施工方式,实现供电、制冷、IT系统同步部署,并结合自动化测试平台完成网络
配置、设备验证和上线流程,提高交付效率。
通过产品化和预制化体系,实现质量保障从工程经验依赖转向系统流程保障,以BIM
全系统建模与SOP工艺数字化实现接口标准化、工序流程化,做到“一次创建、全链路复
用”,同时保证不同项目之间的一致性和可靠性。
三大路径保障体系落地。设计制造一体化,以“乐高式”解耦思维将 AIDC 划分为静态
互三,“一,‘
底座与动态算力,从源头规避设计风险;质量验证标准化,通过1:1样板试装验证可交付性
工,配合“白盒化”逻辑测试与自动化交付流水线,实现网络配置、服务器压测及转维上线
零人工干预。
- 4. Agentic 智能运维:从被动响应到自主决策
智能运维沿“告警监控→分析预测→智能自主决策”三阶段演进。针对 AI 高密集群故
障扩散快、应急窗口时间段的特点,3D数据中心构建“韧性优先、确定性交付、智能体自
治”三位一体体系:韧性优先保障故障快速隔离与恢复;确定性交付以产品化手段消除人为
不确定性,确保基础设施系统的长期可用性;智能体自治以AI与数学李生赋予系统“感知
一决策一执行”能力,实现从“人找数据”到“数据找人”再到“自主决策、系统自愈”的
范式演进。
百万级检测信号秒级上报、云上平台智能实时感知,覆盖供电、散热参数与工质液的生物
化学特性,实现从微米级微通道到宏观建筑园区的全范围映射,并以原子仿真支撑算力多代
次兼容部署验证,实现快速掌握AIDC全局实时健康状态信息
预测性运维覆盖关键场景。制冷侧打通冷却塔至芯片的全液冷链路数字化建模,构建从
芯片到冷源全链路温度与功耗模型,在线监测工质液pH值、电导率以预测微生物滋生、防
数据驱动,提前发现液冷管路泄漏、工质液劣化脏堵、电池失效及母线接触不良等风险隐患,
提升AIDC 全生命周期可用性。
运维管理Agent 实现人机协同。运维管理Agent 可远程完成故障定位定界、变更推演
与作业风险拦截;应急场景下关键部件自主响应,实现供电制冷系统自愈;常规高频基础设
施运维由机器人完成,确保可靠性与效率的全局最优。
第三节 六维指标体系与 3D数据中心的关系
六维指标体系是面向AI时代AIDC发展的产业评价框架。3D数据中心基于AI 算力演进
趋势,对传统数据中心架构进行重新定义,为未来算力基础设施提供参考架构。
3D数据中心采用“分层解耦+架构极简”的设计理念,通过制冷、IT、供电及备电系统
的功能分层,实现了子系统间的空间解耦、接口协同与能力独立演进。在部曙层面,IT 与
基础设施的独立演进结合供电制冷的池化弹性调度,实现了AI多代次兼容及“零改造”下
群。
在工程建设方面,3D数据中心通过标准化模块、产品化设计及工厂预制,配合现场数
字化SOP装配,完成了从“现场施工”到“工厂预制+现场装配”的转型。POD模块标准
化、BIM全链路建模与数字化作业的协同,不仅将质量控制从依赖个人经验转化为系统化工
大幅简化现场交叉界面。实现数据中心从土建开工到整体交付仅需10个月,POD单元在主
设备到场后仅需3个月即可交付。
在运维与安全方面,产品化设计确保了数据中心的高度一致性。基于BIM 与数字化技
术,运维管理从“被动亢余备份”升级为“全生命周期韧性工程”。架构上,通过应急自愈
体系及Agentic AI技术,实现风险预测、故障自愈与远程保障,将安全防线由“事后应急”
前移至“事前预防"。
在能效管理方面,3D数据中心通过优化 L1基础设施与L2算力网络系统的能效,在保
障服务质量的同时降低组件功耗。结合供电制冷架构优化与智能化全域寻优,持续推动能效
提升,最终实现 PUE 降至 1.15 以下的目标。
未来,六维指标体系不依赖单一企业技术路线,而是通过开放指标体系、接口规范和评
价方法,推动产业形成统一参考标准。不同厂商可基于自身技术路径实现指标要求,并通过
标杆项目持续验证和优化,共同推动AI算力基础设施产业升级。
第五章倡议
新一代AIDC仍处于快速演进阶段,机柜功率上限、供电与制冷路线、超天规模互联以
及自动运维边界,仍需要在真实工程中持续验证。六维指标体系的价值,不是提前给所有技
术路线下结论,而是建立一套全产业可以共同讨论、测量和比较的语言。
因此,我们倡议产业内各方面力量:
- 1. 共同完善指标定义
联合算力厂商、数据中心客户、设计院、科研机构和基础设施企业,进一步明确六项指标的
测试边界、分级阈值和评价方法。
2.共同建设参考架构
围绕3D数据中心等代表性架构,推动供电、制冷、IT、储能和智能运维接口标准化,支持
多代次、多厂商和多技术路线。
3. 共同开展标杆验证
选择具有代表性的AIDC 项目,对功率、密度、规模、交付、运维和能效进行测量,用真实
工程数据持续校正指标体系。
4. 共同推进标准与认证
在指标体系和标杆验证基础上,逐步形成参考设计、团体标准、评价认证与产业推广机制。
22
Global Computing Consortium
全球计算联盟
GCC官方微信 GCC官方网站
本站所有资讯是用户利用其本地Agent获取并分享,均为公开信息,如需删除请联系我们。

