大规模智算集群架构与液冷、低碳算力中心工程化落地研究
作者:淞基科技(上海)有限公司、淞基信息通讯研究院、淞基未来信息网研究部、淞基新一代信息技术网研究部
摘要
随着生成式人工智能、大模型训练与推理业务的爆发式增长,万卡级智算集群已经成为人工智能产业基础设施的核心载体。大规模智算集群具备高密度算力、高速互联、高持续功耗的典型特征,传统风冷数据中心在散热极限、PUE 控制、单机柜功率承载等方面的瓶颈日益凸显,液冷技术成为支撑万卡级集群工程落地的关键技术路线。在国家 “双碳” 战略约束下,算力基础设施不再仅追求算力规模最大化,需要同步平衡算力供给扩张、能耗管控、碳排放指标、供电可靠性与算力调度效率之间的关系。本文围绕万卡级智算集群系统互联架构、液冷散热工程方案、高压供电体系稳定性设计、算力能耗量化指标开展系统性研究,梳理绿色数据中心现行标准体系,分析大规模算力资源动态调度机制,探讨在碳约束框架下 AI 算力规模化建设的约束条件、技术路径与工程风险。结合国内多个万卡级智算中心落地案例,对比浸没式液冷、冷板式液冷技术适用场景,分析供电架构、谐波治理、冗余设计对集群持续稳定运行的影响,量化算力 PUE、WUE、碳强度等核心低碳评价指标,识别当前工程落地中的共性难点,提出面向下一代低碳智算中心的建设框架。研究表明,液冷技术可将高密度智算机柜散热能力提升至 300kW 以上,配合高压直流供电、余热回收、智能算力调度体系,能够有效控制算力基础设施碳强度,在满足大模型持续训练业务需求的同时,契合绿色数据中心规范与区域碳排放管控要求。文末针对工程实施、指标测算、技术选型等边界条件给出建议,为后续万卡级乃至十万卡级智算集群规划、设计、建设与运营提供理论参考与工程实践依据。
关键词:智算集群;万卡级;液冷散热;低碳算力;绿色数据中心;算力调度;PUE;碳约束
1 绪论
1.1 研究背景
人工智能大模型技术迭代驱动算力需求呈现指数级增长。大模型预训练、微调、多模态推理业务对 GPU 集群的算力规模、网络带宽、长时间不间断运行能力提出严苛要求,万卡级智算集群逐步从概念走向大规模工程落地。单集群数千至上万张加速卡集中部署,带来单机柜功耗急剧抬升,传统风冷机房单机柜功率上限通常在 15~30kW,无法承载高密度 GPU 集群散热需求,高温、局部热点、风机能耗过高成为制约算力扩容的首要障碍。
与此同时,国内碳管控体系持续完善,数据中心纳入能耗双控、碳排放统计核算范畴。新建大型、超大型算力中心需要满足 PUE 限值、能耗指标、用水指标与碳排放评价要求,单纯依靠增加机房数量堆叠算力的模式难以为继。算力基础设施建设进入 “算力规模、能耗、碳排放、经济性多目标平衡” 阶段。液冷技术、新型供电架构、余热利用、算力智能调度共同构成低碳算力中心的核心技术栈。
万卡级智算集群不同于传统云计算服务器集群,其业务特征为长时间连续高负载运行、跨节点高频数据交互,系统互联架构直接决定集群训练效率。集群内部网络延迟、丢包率会直接影响大模型并行训练的扩展效率。因此,智算中心工程化不能简单复用传统 IDC 建设范式,需要从顶层架构设计阶段,同步统筹算力互联网络、液冷散热、供电冗余、能耗监测、碳计量与资源调度。
1.2 国内外研究现状
海外头部云厂商与 AI 企业较早开展万卡级智算集群建设,在高速互联网络、冷板式液冷、浸没液冷原型验证领域积累较多实践经验。海外研究重点集中在 GPU 集群网络拓扑优化、芯片级散热、算力负载动态调度,侧重算力吞吐最大化,在余热回收、区域碳约束适配层面的研究较少,其建设条件、电力供给结构与国内电力、能耗政策存在显著差异,技术方案不能直接照搬。
国内学术界与产业界近年来持续推进绿色数据中心标准修订,围绕液冷数据中心设计规范、算力中心能耗测算、PUE 评价体系形成一系列行业标准。国内工程实践以冷板式液冷为主,浸没式液冷逐步开展规模化试点。现有文献更多聚焦单一模块,例如仅讨论液冷散热或者网络架构,缺少将万卡级集群互联、液冷工程实施、供电稳定性、能耗指标、碳约束与算力调度一体化的系统性研究。多数研究停留在技术原理层面,对工程落地中的施工难点、运维体系、故障连锁风险、碳指标核算等实操问题论述不足。当前产业亟需一套覆盖架构设计、技术选型、指标管控、运营调度的完整工程化框架,支撑万卡级智算集群低碳落地。
1.3 研究内容与技术路线
本文研究对象为万卡级 AI 智算集群与配套低碳算力中心工程体系。主要研究内容包括:
(1)万卡级智算集群系统互联架构,分析不同网络拓扑、高速互联协议对大规模并行训练的影响,识别网络瓶颈;
(2)液冷技术路线对比,冷板式液冷、浸没式液冷的工程实施方案、可靠性、运维复杂度、适用场景;
(3)高密度算力中心供电架构设计,分析高压供电、UPS、谐波治理、冗余架构对集群供电稳定性的作用,梳理常见供电故障风险;
(4)算力能耗指标体系,PUE、WUE、算力碳强度等指标测算方法,分析碳约束对算力建设规模的约束机制;
(5)绿色数据中心标准体系梳理,研究算力资源跨节点智能调度策略,探索在碳约束前提下,实现算力业务与能耗、碳排放协同优化;
(6)结合工程落地痛点,总结万卡级智算集群建设风险,提出低碳智算中心整体建设建议。
技术路线:文献与行业标准调研→集群互联架构建模→液冷散热方案对比分析→供电系统可靠性分析→能耗与碳指标量化分析→算力调度机制研究→工程落地风险识别→结论与工程建议。
1.4 论文结构安排
第一章为绪论,阐述研究背景、国内外现状、研究内容与技术路线;第二章阐述万卡级智算集群系统互联架构;第三章为液冷散热技术与工程落地方案;第四章研究高密度算力中心供电体系与稳定性保障;第五章构建低碳算力中心能耗与碳排放指标体系;第六章梳理绿色数据中心标准与算力资源调度机制;第七章分析工程落地难点与风险;第八章总结全文并展望未来技术发展方向;最后为数据来源、免责声明。
2 万卡级智算集群系统互联架构
2.1 万卡级集群业务特征
万卡级智算集群面向大模型分布式训练,通常采用数据并行、模型并行、流水线并行、张量并行等混合并行策略。集群内上万张 GPU 卡需要持续交换梯度、模型参数,通信流量巨大且对延迟敏感。与通用云计算业务流量突发、业务隔离的特征不同,大模型训练属于长时间高负载业务,集群通信负载持续处于高位,网络性能直接决定算力扩展效率,即集群扩展效率随节点增加产生的通信损耗,是万卡集群设计首要考量因素。
在小规模集群场景,传统以太网架构成本低、部署简单,但当集群规模突破数千卡至万卡级别,普通以太网带宽、延迟、拥塞控制机制难以满足多卡之间海量参数交换需求,通信开销会显著吞噬算力收益,出现算力扩展效率断崖式下降。因此万卡级智算集群普遍采用高性能互联网络作为底层通信载体。
2.2 高速互联网络拓扑与协议选型
当前万卡集群主流高速互联方案以高速无损网络为主,典型拓扑包括胖树拓扑、叶脊(Spine-Leaf)拓扑。叶脊拓扑是当前大规模智算中心最常用架构,所有服务器网卡连接到叶交换机,叶交换机全部上联至脊交换机,任意两个节点之间跳数少,降低端到端延迟,横向扩展能力强,适合上万节点规模扩展。胖树拓扑分层构建,逐级聚合带宽,适合严格无损、高带宽的大规模 GPU 集群,缺点是交换机数量多,建设成本高,布线复杂,工程实施难度更高。
在互联协议层面,高性能无损互联技术具备低延迟、高带宽、拥塞无损特性,支持 RDMA 远程直接内存访问,绕过操作系统 CPU 参与数据拷贝,大幅降低通信延迟,减少主机 CPU 开销,把更多 CPU 资源留给模型训练任务。在万卡集群中,RDMA 是保障并行训练效率的基础能力。网络设计需要关注带宽配比,GPU 卡内、卡间、节点间、机柜间、机房模块间带宽需要合理配比,避免局部带宽瓶颈。
集群网络分层:第一层为服务器内部 GPU 卡间互联,依托板载高速互联通道;第二层为单机柜内节点互联;第三层为机柜之间叶脊网络;第四层为跨机房模块互联。分层设计可以隔离故障域,单节点、单交换机故障不会引发整个万卡集群瘫痪。网络规划需要预留冗余链路,设计流量工程与拥塞控制策略,在大模型训练突发流量场景下避免丢包。
2.3 集群扩展效率与网络瓶颈分析
强扩展性是万卡集群核心目标,并行计算中存在阿姆达尔定律约束,通信占比越高,集群规模扩大时整体加速比提升越缓慢。当集群规模达到万卡级别,跨节点通信占比显著上升,网络微小延迟、丢包都会被放大,造成训练任务中断、收敛速度下降。
工程实践中常见瓶颈包括:交换机端口带宽不足、布线链路损耗、拥塞控制参数不合理、网卡固件兼容性、跨模块路由跳数过多。在架构设计阶段,需要进行网络仿真,模拟万卡规模下的通信流量,评估不同拓扑下的延迟、带宽利用率、队列拥塞情况,提前识别瓶颈。同时,集群网络需要配套实时监控系统,采集端口带宽、延迟、错包、拥塞标记等指标,实现网络故障快速定位。
2.4 集群系统管理与算力隔离
万卡级集群规模庞大,需要配套集群管理平台,实现硬件状态监控、任务调度、故障隔离、固件批量升级。智算集群业务存在训练任务、推理任务混合部署场景,需要实现算力隔离、网络隔离,避免高负载训练业务抢占推理业务带宽。集群管理系统与算力调度平台打通,向上对接上层 AI 任务,向下感知硬件、网络、散热、供电状态,实现软硬件一体化运维。
3 液冷散热技术与高密度算力中心工程化方案
3.1 高密度算力下风冷技术的局限性
传统风冷依靠机柜内风机将服务器热量通过机房空调输送到室外。单机柜功率超过 30kW 之后,风冷方案缺陷快速显现:风机功耗急剧上升,风机噪声大;机柜内部热点难以消除,GPU 芯片温度波动大;机房空调输送大量冷风,冷热气流掺混造成冷量浪费,整体 PUE 难以降到 1.2 以下。当单机柜功率提升至 80kW、100kW 乃至 200kW 以上,风冷方案在物理层面已经无法实现有效散热,液冷成为高密度万卡智算集群的必然选择。
液冷利用液体远高于空气的比热容与换热系数,直接接触热源或者贴近热源带走热量,换热效率远高于空气,大幅降低散热系统能耗,减少风机使用,降低 PUE,同时降低机房噪声,提升芯片运行温度稳定性,有利于 GPU 长期稳定高负载运行。
3.2 冷板式液冷工程方案
冷板式液冷是目前万卡级智算中心规模化落地的主流路线。在服务器内部,在 GPU、CPU 等发热芯片表面安装金属冷板,冷却液在冷板内部流道循环,直接带走芯片热量。冷却液通过快速接头连接机柜内管路,汇集到机房分配管路,输送至室外冷源。冷却液与芯片不直接接触,服务器主板、内存、硬盘等元器件仍依靠风冷辅助散热。
工程实施要点:管路设计、快速接头选型、防漏设计是冷板式液冷工程核心。管路材料、密封件需要适配冷却液理化特性,长期运行下防止渗漏。机房需要设置漏液检测传感器,在接头、管路低点布设感知探头,一旦检测漏液,自动切断对应机柜供液,触发告警。冷却液需要配置过滤、除气、水质监测装置,控制电导率、颗粒物,防止管路堵塞、腐蚀。
冷板式液冷优势:服务器硬件改动相对可控,运维模式和传统服务器运维有一定延续性,改造门槛低;不改变服务器内部元器件工作环境,元器件受潮风险低。局限性:仅覆盖主要发热芯片,其余器件仍需要风冷,单机柜功率上限低于浸没式液冷;管路接头数量多,接头是渗漏高风险点。
3.3 浸没式液冷工程方案
浸没式液冷分为单相浸没液冷与两相浸没液冷。单相浸没将服务器整机浸泡在绝缘冷却液中,冷却液不发生相变,依靠液体对流带走全部元器件热量;两相浸没依靠冷却液沸腾相变带走热量,换热能力更强。
浸没式液冷工程实施需要定制液冷槽,服务器主板、GPU 全部浸入绝缘冷却液,机房无需大量空调风机,几乎消除风冷风机能耗,单机柜承载功率可以达到 300kW 以上。浸没式液冷不存在冷热掺混,散热系统能耗极低,PUE 可以做到 1.1 甚至更低,余热回收潜力更强。
工程难点:服务器硬件需要适配浸泡环境,元器件、焊接、线缆、电容等器件需要兼容绝缘冷却液;液冷槽的密封、液位控制、冷却液损耗补充;设备维护需要将服务器从槽体内取出,运维流程和传统机房差异大;冷却液采购成本、存量设备改造成本较高。
3.4 液冷系统配套、余热回收与运维体系
液冷算力中心并非仅仅增加服务器冷板或者液冷槽,还包含室外冷却塔、冷机、供液分配单元、储液罐、监测与保护系统。在低碳目标下,液冷系统可以配套余热回收装置,将算力设备产生的热量回收,用于建筑供暖、工业热源,提升能源综合利用效率,进一步降低算力项目整体碳排。
液冷运维体系需要建立专项运维规范:定期管路检漏、冷却液理化指标检测、滤芯更换、密封件老化巡检。万卡级集群规模巨大,一旦发生大规模漏液,会造成大量 GPU 硬件损坏,因此工程设计采用分级保护机制:机柜级、模块级、冷源级多级切断,漏液告警联动任务调度,自动迁移算力任务,降低硬件故障带来业务损失。
3.5 液冷技术选型对比与适用边界
冷板式液冷适合现阶段大规模万卡智算集群落地,兼顾成本、成熟度、运维难度,单机柜 80~150kW 场景是其优势区间。浸没式液冷面向更高密度算力场景,单机柜 150kW 以上,追求极致 PUE 和余热利用,但硬件改造成本、运维复杂度更高,适合新建专项高密度算力园区。技术选型不能单一追求极限散热能力,需要综合评估建设投资、运维成本、项目电力指标、碳排放指标、运维团队能力。
4 高密度算力中心供电体系与供电稳定性研究
4.1 万卡智算集群供电特征
万卡级智算集群总功耗巨大,负载具备高持续性,GPU 负载快速波动会造成瞬时功率冲击。与普通 IDC 负载平稳特性不同,大模型训练启动、断点重启时,集群功率短时间快速拉升,对变压器、母线、配电设备造成冲击。高密度机柜单机柜电流大,机柜内部配电、铜排、线缆载流量选型需要留足余量,同时需要考虑发热。供电系统一旦中断或者电压异常,上万张 GPU 卡训练任务中断,任务断点恢复耗时漫长,算力损失与经济损失巨大,供电稳定性是万卡集群工程落地的核心前提。
4.2 供配电架构设计
主流架构包含:市电接入、主变压器、中压配电、低压配电、UPS 或者高压直流 HVDC、机柜 PDU。传统 UPS 为交流 UPS,存在多级交直流转换,转换环节多,能量损耗高。高密度低碳算力中心越来越多采用高压直流 HVDC 供电,减少交直流变换层级,提升供电效率,降低能耗。
供电冗余设计:万卡级智算中心通常采用双路市电输入,N+1 或者 2N 冗余架构,变压器、冷源、配电设备配置冗余。单点设备故障时,冗余设备自动接管负载,不中断集群算力业务。需要做短路保护、过流保护、浪涌保护设计,抑制电网电压跌落、雷击、谐波干扰。
4.3 谐波治理与电能质量
大量 GPU 属于非线性负载,会产生谐波,谐波造成线缆、变压器发热,降低设备寿命,干扰控制信号,严重时保护装置误动作。万卡集群海量加速卡集中部署,谐波叠加效应显著,必须在配电侧设置有源滤波器 APF、无功补偿 SVG 装置,控制谐波畸变率,满足电能质量国家标准。工程阶段需要做谐波仿真测算,在设备采购、机房配电布局阶段提前治理,不能等到机房上线后再改造。
4.4 供电故障监测、预警与联动机制
配电系统部署电压、电流、功率、温度、电弧监测传感器,建立电能质量实时监控平台。当电压跌落、过载、谐波超标时,系统提前预警。供电监控平台需要和集群算力调度平台联动,在电网异常预警时,逐步降低集群算力负载,优先保存模型训练断点,避免突然断电造成大规模任务失效。
5 低碳算力中心能耗指标体系与碳约束量化分析
5.1 核心能耗评价指标
PUE(电能使用效率)是绿色数据中心最基础指标,PUE = 数据中心总用电 / IT 设备用电。总用电包含 IT 算力设备、冷却系统、供配电损耗、照明等辅助用电。液冷方案通过降低冷却能耗,显著压低 PUE。万卡级智算中心,冷板式液冷可以将 PUE 控制在 1.15~1.2,浸没液冷可以做到 1.1 以内。
WUE 水资源使用效率,衡量数据中心水资源消耗,液冷系统依赖冷却塔,需要统筹节水策略,采用干冷、自然冷却,降低补水消耗,满足区域水资源管控指标。
算力能效指标,常用单位算力功耗,例如每 PFLOPS 功耗,衡量单位 AI 算力消耗电能,直接反映算力硬件与基础设施综合能效。算力碳强度,单位算力对应的二氧化碳排放量,结合区域电网排放因子进行核算,是碳约束场景下核心考核指标。
5.2 碳约束机制对算力建设的约束逻辑
碳约束体系包含能耗指标、碳排放配额、节能审查、环评、能评等管控机制。新建大型智算中心需要纳入区域能耗总量管控,项目能耗、碳排放指标直接决定项目是否可以获批。算力扩张不再是单纯资本投入,同时需要能耗指标、碳配额、土地、电力配套资源。
碳排放量计算公式:项目年度用电量 × 区域电网排放因子。万卡集群持续高负载运行,年度耗电量巨大。降低算力碳排放有三条路径:提升基础设施能效(液冷、高效供电降低用电量);使用绿电,采购风电光伏等可再生能源电力,降低电网排放因子;余热回收提升能源综合利用。
5.3 能耗与碳指标测算边界
工程测算需要明确边界:IT 设备功耗包含 GPU、服务器 CPU、内存;基础设施包含冷源、管路、配电损耗;区分设计指标和实际运行指标。很多项目设计 PUE 偏低,但实际运行在低负载状态下 PUE 恶化。万卡智算业务长期高负载,更容易实现设计能效指标。但需要建立持续监测体系,采集全年逐时用电数据,动态核算碳排放量。
6 绿色数据中心标准体系与算力资源调度机制
6.1 国内绿色数据中心相关标准体系
国内已经形成覆盖数据中心设计、液冷技术、能耗评价、绿色等级评估的标准体系。包含数据中心设计规范、液冷数据中心技术规范、绿色数据中心评估标准、数据中心能耗监测规范等。标准对 PUE 限值、机房安全、液冷管路、漏液防护、电能质量、监测系统提出强制性与推荐性要求。
在项目规划阶段,需要对标现行国标、行标,同时匹配地方能耗、碳排政策。不同省份对于新建大型算力中心 PUE 上限、能耗指标要求存在差异,项目需要同步对接地方主管部门,满足能评、环评、节能审查要求。液冷算力中心部分技术属于新技术,在报审阶段需要结合液冷专项规范开展论证。
6.2 万卡集群算力资源智能调度
传统算力调度多以业务负载均衡、硬件资源分配为目标。在低碳算力中心,调度目标扩展为算力性能、能耗、碳排放多目标优化。智能算力调度平台,实时采集集群算力负载、服务器功耗、冷源能耗、电网碳因子、电价信息,动态调度任务。
调度策略包括:在电网绿电占比高、电网碳因子低的时段,调度高能耗大模型训练任务;在电价高峰、高碳因子时段,压缩非紧急训练任务,优先运行低负载推理业务;动态调整服务器运行频率,在不影响业务收敛目标前提下,做功耗与算力的权衡;跨机房算力调度,把任务迁移到低碳算力节点。
算力调度系统与能耗监测、碳计量平台打通,实现算力业务碳排放实时统计。调度算法需要兼顾业务 SLA 约束,不能为了降碳随意中断关键训练任务,设置任务优先级、断点保存机制,实现低碳目标和业务稳定性平衡。
6.3 算力碳计量与碳管理平台
低碳算力中心需要配套碳计量平台,采集 IT、冷却、配电分项用电,结合区域电网排放因子,实时核算算力碳排,区分不同 AI 任务对应的碳足迹。碳计量数据可用于内部运营优化、绿色算力认证、绿电溯源、碳资产台账管理,支撑绿色算力产品对外服务。
7 工程化落地难点、风险与应对策略
7.1 多专业协同设计风险
万卡智算中心涉及 AI 硬件、高速网络、液冷暖通、供配电、自控、能耗碳计量多个专业。传统设计院缺少万卡级液冷智算一体化设计经验,容易出现各专业接口冲突:服务器液冷接口和机房管路不匹配、高速网络布线空间不足、配电容量没有匹配液冷高密度机柜。解决方案:采用一体化顶层设计,服务器厂商、液冷厂商、网络厂商、设计院在方案阶段联合评审,统一接口规范,开展数字孪生仿真,在数字模型内完成管线、负载、网络仿真验证。
7.2 供应链与设备一致性风险
万卡集群需要大批量 GPU 服务器、高速交换机、液冷部件,大批量设备的硬件一致性、固件版本一致性对集群稳定至关重要。大批量硬件如果存在批次差异,会造成集群节点性能不一致,并行训练出现异常。液冷管路接头、密封件批量质量缺陷会带来大规模漏液隐患。需要建立设备进场检测机制,抽样测试硬件性能、液冷部件承压密封性,统一固件版本,建立硬件批次台账。
7.3 施工与现场实施风险
液冷管路焊接、快速接头安装、高压配电施工、高速光纤布线,施工工艺要求高。现场施工质量缺陷是后期运行故障的主要来源。万卡机房工程量大,工期紧张容易造成施工质量下降。需要制定专项施工规范,分段试压,管路分段检漏,光纤链路逐链路测试,分模块验收,分阶段上电,避免一次性全集群上电带来大规模故障。
7.4 运维人才体系短板
液冷 + 万卡高速网络的智算中心运维复杂度远高于传统 IDC。运维人员需要同时掌握高性能集群运维、高速无损网络、液冷系统、碳计量平台知识,复合型人才供给不足。对策:建立专项运维培训体系,搭建故障演练平台,模拟漏液、供电波动、网络拥塞等故障场景,建立标准化运维 SOP,建立远程监控 + 现场运维两级体系。
7.5 经济性平衡风险
液冷设备、高速交换机、HVDC 供电系统初期建设投资显著高于传统风冷机房。项目存在前期资本投入高,需要在算力收入、能耗节约、碳指标收益之间做经济测算。并非所有场景都适合浸没式液冷,要结合算力业务年限、负载率、电力价格、绿电政策,做全生命周期 LCC 全成本测算,选择匹配技术路线,避免盲目追求极致 PUE 造成投资浪费。
8 总结与展望
8.1 研究总结
万卡级智算集群是大模型产业发展的核心基础设施,其工程落地是算力网络、液冷散热、高压供电、能耗碳管控多系统融合的复杂工程。本文从集群互联架构入手,对比冷板式液冷、浸没式液冷技术工程特点,分析高密度算力中心供电稳定性,构建 PUE、WUE、算力碳强度等低碳指标体系,梳理国内绿色数据中心标准体系,研究面向碳约束场景的多目标智能算力调度机制。
主要结论:
第一,万卡级智算集群必须采用无损高速互联网络,叶脊拓扑 + RDMA 是当前工程主流方案,网络架构设计需要提前做流量仿真,规避通信瓶颈,网络稳定性直接决定集群并行训练效率。
第二,液冷是支撑单机柜超高功耗的必要技术,冷板式液冷成熟度高,适合现阶段万卡集群规模化落地;浸没式液冷面向更高密度场景,PUE 潜力更强,但硬件适配、运维成本更高,需要结合项目需求选型。
第三,高密度 GPU 负载带来谐波、瞬时功率冲击,供电系统必须采用冗余架构,配套谐波治理装置,建立供电预警和算力任务联动保护机制,保障万卡集群不间断运行。
第四,在碳约束目标下,算力建设不能单纯扩张规模,要通过液冷提升基础设施能效、引入可再生能源、余热回收、智能算力调度,控制算力碳强度,平衡 AI 算力扩张与碳排放管控目标。
第五,万卡智算中心工程落地的最大风险是多专业协同、施工质量、复合型运维能力,需要采用一体化顶层设计、数字孪生仿真、分阶段验收,建立全生命周期运维体系。
8.2 未来展望
未来十万卡级别超大规模智算集群,算力密度将持续提升,液冷将逐步从辅助方案成为标配。液冷余热规模化利用、算力中心与工业园区能源联动将成为重要方向。算力调度将从单纯资源调度升级为算力 - 能耗 - 碳一体化调度,算力碳足迹全链路可追溯。同时,国产化加速芯片、国产化高速网络、国产化液冷部件逐步成熟,未来万卡集群将形成自主可控的完整技术体系。绿色数据中心标准体系会持续迭代,算力碳核算、绿色算力认证体系进一步完善,低碳算力将成为算力基础设施的核心竞争力。
随着 AI 模型持续迭代,算力需求还将保持增长,智算中心建设将持续在算力性能、能耗、碳排放、建设成本之间寻找动态平衡。液冷、低碳算力中心工程实践将不断积累经验,支撑我国人工智能产业高质量可持续发展。
数据来源
1. GB 50174《数据中心设计规范》
2. T/CCSA 277《液冷数据中心技术规范》
3. 工信部、发改委关于绿色数据中心相关政策文件
4. 国内大型智算中心项目公开可研报告、PUE 实测数据
5. 行业液冷设备厂商测试报告、高速互联网络性能白皮书
6. 区域电网排放因子、碳排放核算指南
7. 万卡级 AI 集群并行计算、网络扩展效率公开学术文献
8. 国内绿色算力产业白皮书、数据中心能耗监测相关行业调研数据
说明:文中工程指标、性能参数为行业典型实测与仿真数据,不同项目受选址、电力条件、设备选型、运维负载率影响存在差异。 |
免责声明
本文为淞基科技(上海)有限公司、淞基信息通讯研究院、淞基未来信息网研究部、淞基新一代信息技术网研究部联合开展的产业技术研究成果,仅用于学术研讨、行业技术交流,不构成任何项目投资、工程设计、设备采购、立项申报的直接依据。文中所有技术方案、指标测算、风险分析均基于当前公开行业资料与仿真推演,不针对任何特定项目做担保。任何单位依据本文内容开展工程建设、项目申报、投资决策所产生的全部风险与经济损失,本文作者及所属机构不承担任何法律责任。相关工程实施必须委托具备资质的专业设计院、工程单位结合项目所在地电力、土地、能耗、环评政策开展专项设计与评审,完成现场勘察、荷载验算、安全评估后方可实施。本文涉及的产品、技术性能受供应链、硬件批次、运维管理、外部电网条件影响,不承诺指标一定可以复现。未经书面许可,本文内容不得用于商业宣传、投标文件、项目申报材料直接引用,转载、引用需要完整注明来源。




