冷板液冷技术能够有效去除数据中心机架产生的热量,因为如今的机架产生的热量远超空气流动所能带走的量。高密度服务器在持续高负载处理下,会将热量集中在芯片上。风扇和冷空气到达这些热量点的速度很慢,而热量的不断积聚正是促使运营商寻求从源头进行液冷散热的原因。金属冷板放置在处理器上,冷却液流经冷板,热量通过传导的方式从芯片上散失。.
这种权衡取舍是全新的。机架液冷带来了风冷从未遇到过的集成性、成本、可靠性和热回收利用等问题。本文将介绍冷板冷却在数据中心的工作原理、其面临的真正挑战、与浸没式冷却和风冷在热负荷方面的比较,以及改造前需要确认的变量。本文不涉及浸没式水箱设计、设施冷冻水机组容量规划或冷却剂采购规格,因为这些都取决于现场条件和供应商数据。.
数据中心冷板液冷的工作原理
冷板冷却通过传导将热量传递到液体回路中,而不是通过对流传递到空气中。一种加工过的金属 冷盘 它通过导热界面材料与 CPU 或 GPU 紧密接触。冷却液在其内部通道中流动,并将热量传递至冷却液分配单元 (CDU)。然后,CDU 通过热交换器将热量传递给整个系统回路。由于液体直接接触热源,因此这种冷却方式被称为芯片直接冷却。.
板的材料、流量和通道设计都对板的散热能力设定了严格的限制。铜的导热性能优于铝,接近 400 W/m·K,而铝的导热系数仅为 240 W/m·K,因此高热通量板通常采用铜,尽管铜会增加重量和成本。流量大小也存在问题。流量过小会导致结温升高;流量过大则会浪费泵送功率,并且随着时间的推移会腐蚀通道。回路的流量必须与板的散热能力相匹配,不能在温度看起来安全之前就调高。.
即使在液冷机房中,风冷也几乎不会完全消失。冷板可以分担处理器的集中负载,但内存、电源、网络设备和冷凝控制系统仍然需要气流。大多数机房最终都会采用混合式冷却方式,一部分用于液冷,一部分用于风冷。.
数据中心对高效冷却的需求不断增长
机架密度的提升,而非机房面积的增加,才是导致空气冷却技术超出其极限的原因。人工智能和高性能计算使得每个机架都配备了更强大的处理器,而每个机架的发热量增长速度超过了空气处理机的处理能力。粗略来说,当每个机架的功率达到 20 kW 左右时,空气冷却就变得不切实际了,而芯片级直冷板的功率则远高于此,达到了目前高密度人工智能机架的功率范围。具体数值取决于硬件配置、机房的空气流量以及进气温度。.

空气冷却首先遇到的障碍是物理因素,其次才是成本因素。风扇的运行依赖于温差和风量。随着人口密度的增加,所需的风量变得难以承受,房间的某些区域温度会超出推荐范围,形成热点。热点会降低性能并增加可靠性风险。这就是人口密度迫使我们改变冷却方式的根本原因。.
能源和排放是采用液体散热的第二个原因。冷却是数据中心耗电量的很大一部分,因此低效的热力系统会增加电费和碳排放。在源头使用液体可以降低能耗,但节能效果取决于基础系统、气候和工作负载。任何效率数据都应视为一个范围,需要验证,而不是一个固定值。.
冷板液体冷却技术面临的挑战
冷板冷却解决了散热问题,但也带来了四个挑战,这些挑战决定了部署是否成功。每个挑战都涉及工程上的权衡取舍,操作人员可以检查相应的变量。.
与现有机房的整合。将液冷系统改造到风冷机房是难点所在,因为一次改造一个机架会导致两个冷却系统同时运行,使设施团队的运维负担加倍。如果机架共用一个冷却单元 (CDU) 和歧管,则可行的改造单元是相邻的机架排或机架组,这样可以确保回路、维护和泄漏边界保持在同一区域内。.
改造成本。真正导致项目停滞的成本是改造费用,而不是冷板本身的费用。资金投入到常温控单元、歧管、管道以及机房改造中。投资回报取决于空间负荷和运行时间,因此必须根据具体情况进行估算。.
泄漏和腐蚀预防。泄漏和腐蚀是决定液冷回路可靠性的两大失效模式,两者都属于材料和化学问题。混合金属回路,例如铜板为其他部位的铝板供水,容易发生电偶腐蚀。使冷却液的化学成分和抑制剂与接触材料相匹配是预防泄漏和腐蚀的基础。 腐蚀控制, 并且两者都应根据供应商的规格进行验证。.
废热再利用。只有当温度和用量匹配时,回收利用的热量才能带来收益。冷板回路可以提供可重复使用的温热冷却剂,但其价值取决于回路运行温度是否足够高,以及附近是否有其他用途,例如建筑物供暖回路。因此,余热再利用不仅是制冷问题,也是设施规划问题。.
冷板冷却、浸没式冷却和空气冷却:根据热负荷选择合适的冷却方法
正确的方法取决于热负荷和房间温度变化的程度,而不是某种单一的最佳技术。冷板、浸入式和空气冷却分别处理热链的不同环节,因此选择的关键在于是否合适。.

| 方法 | 最佳匹配 | 主要权衡 |
|---|---|---|
| 空气冷却 | 低密度机架;外围组件 | 随着机架密度增加,容量会下降。 |
| 冷板(直接芯片) | 高密度CPU/GPU机架;可适应现有机房 | 冷却芯片,而不是整个机架;仍有一些空气残留。 |
| 浸没 | 极高的热通量 | 将硬件浸入介电液体中;操作变更较大 |
在冷板内部,冷却方式分为单相和两相两种。单相冷却方式使冷却液全程保持液态直至冷却单元(CDU),从而简化了回路的维护。两相冷却方式则允许冷却液在冷板处沸腾,吸收极高的热通量,虽然提高了散热能力,但也增加了回路的复杂性。单相回路适用于常见的CPU和GPU密度;当处理器的热通量超过单相回路的承载能力时,则需要采用两相回路。.
冷板冷却的创新解决方案
解决这些挑战的关键在于两个方面:系统设计和系统运行方式。这两方面都旨在使流动性部署更具可扩展性和可维护性。.
模块化、可扩展的架构解决了集成问题。一个可以逐行扩展的循环系统,可以让整个空间在无需进行任何破坏性改造的情况下扩展,并且随着处理器世代的更迭,它仍然可用。根据实际热负荷来设计散热板、通道和流路尺寸,正是关键所在。 冷板设计 决定最终结果,因为过大或过小的循环回路之后会表现为泵能量浪费或芯片过热。.
监测和预测性维护能够有效解决可靠性问题。流量、温度和压力传感器使操作人员能够在泄漏或管道堵塞发展成停机之前及时发现问题。将这些数据与维护计划相结合,可以减少液路循环所需的人工监控。监测计划应明确规定哪些变量会触发警报以及触发阈值,以便在故障发生前就确定响应措施。.
实施冷板冷却的最佳做法
冷板展开方案在安装前,经过评估和试运行阶段确定。以下步骤预先设定了选项,一旦管道铺设到位,再进行更改成本将非常高昂。.
- 首先评估负载和余量。系统规模应根据当前和近期机架密度来确定,而不是根据今天的平均密度,这样即使硬件更新换代,回路也能继续运行。.
- 先进行试点,再扩大规模。在可控的试验台上验证设计,并在正式投入生产前测量实际流量、温度和压力。.
- 设计时应考虑扩展性。优先采用模块化布局,以便未来无需改造核心回路即可连接更多机架或更高密度的机架。.
- 选用优质接触介质的部件。泵、管道、板和冷却液的材料和化学成分应保持一致,因为泄漏和腐蚀往往从接触介质最薄弱的部位开始。.
- 制定维护和培训计划。安排泄漏、腐蚀和流量检查,并确保员工能够操作回路。.
在确定大厅方案之前,请根据设计数据和供应商数据核对一组简短的变量,而不是使用通用的检查清单。将每个变量都记录为设计值和测量值,以便清楚地看到差距:
- 供回冷却剂温度,与常压装置和板式冷却器设计窗口进行比较
- 与设计点相比,每块板的流量和压降
- 芯片在峰值负载下的温度裕度
- 泄漏检测覆盖率和响应状态
- 所有接触液体的部件均需具备材料和冷却液兼容性。
- 从常压装置到设施回路的热平衡
该列表中的所有限制均来自硬件、冷板、CDU 和冷却液供应商的数据。该列表提供的是需要填写的内容,而不是一组固定的数值。.
建筑边缘的散热量很容易被低估。常温控单元(CDU)必须将其负荷传递给设施回路,而热量如何排出建筑,则取决于此。 数据中心冷却器 或者,循环利用回路决定了机架侧必须承受的冷却液温度。.
结论
当机架密度超过空气冷却能力时,冷板液冷便能发挥作用,而最终选择取决于其适配性和后续性能。其价值体现在芯片到冷却液的路径上。冷板材料和流量平衡决定了散热能力,而集成度、冷却液化学成分和散热性能则决定了部署的可靠性以及改造的价值。人们最常误解的是,冷板完全取代了空气冷却,而实际上,冷板承担了处理器的集中散热任务,而机架的其他部分则继续使用空气冷却。.
对于正在权衡搬迁方案的运营商来说,首先要考虑三件事:目标机架密度、机房是否能够一次改造一排机架,以及回收的热量将如何处理。冷板的设计应根据热负荷而非标榜的效率数值来决定,这才是确保循环系统在处理器更换过程中持续运行的关键。.
常见问题
如果我无法重建整个数据中心,那么冷板冷却是否值得?
冷板冷却可以后期加装,但整排或整组机架的改造比单个机架的改造更便捷。共用冷却分配单元 (CDU) 和歧管的机架可以保持其冷却回路和维护边界的一致性,因此模块化改造可以避免在同一台服务器上运行两套冷却系统。.
对于高密度人工智能机架,我应该选择冷板冷却还是浸没式冷却?
冷板式散热适用于高密度CPU和GPU机架,并可适应现有机房环境,在散热的同时,外围设备仍保持风冷状态。浸没式散热适用于极高热通量环境,将硬件浸入介电液体中,这会带来较大的运行变化。具体采用哪种方案取决于热通量以及机房环境能够承受的变化程度。.
如果我改用冷板散热,还需要风冷吗?
是的。冷板可以冷却处理器,但内存、电源组件、网络和冷凝控制仍然需要空气流通,所以混合式机房很常见。.
如何防止芯片级直接连接回路中的泄漏和腐蚀?
首先要确保材料和冷却液的化学成分匹配。混合金属回路容易发生电偶腐蚀,因此抑制剂和冷却液的选择应遵循与接触材料相匹配的规格和供应商提供的说明,并监测流量、温度和压力,以便及早发现故障。.
机架密度达到什么程度才需要液冷?
当机架功率超过空气冷却不再适用的临界点时,液冷就派上了用场,大致参考值是每个机架约 20 kW。实际临界点取决于硬件配置、机房气流和进气温度,因此需要在现场确认。.
延伸阅读
- 劳伦斯伯克利国家实验室数据中心能源专业中心 — 美国能源部国家实验室项目,涵盖数据中心电力和冷却技术。这是一个厂商中立的数据中心能源和冷却背景信息中心;仅供参考,不适用于特定站点的容量规划。.
- 芯片级直接冷却:数据中心运营商应该了解的一切 — 数据中心知识(Data Center Knowledge),一份行业出版物。以通俗易懂的语言概述了芯片直接冷却的工作原理及其优缺点;是背景阅读材料,而非工程规范。.
- 数据中心液冷最佳策略 — ENCOR Advisors,一家数据中心咨询公司。内容涵盖液冷技术的应用和实施策略;请将其中引用的任何数据视为参考,并根据您自身站点的数据进行验证。.
相关文章
- 创新液体冷却技术在提高电动汽车续航能力方面的作用 — 液冷技术如何控制电池温度以保护电动汽车的续航里程。.
- 智能冷却系统的集成与优化 — 如何在热设计中集成和调整智能冷却系统。.
- 液体冷却板的基本原理 — 液冷板的工作原理以及它如何将热量从热源转移出去。.
- Trumonytechs' 液体冷却为数据中心效率带来革命性变革 — 液冷如何提高数据中心的能源效率。.
- 利用液体技术冷却 IGBT:提高电子效率 — 采用液冷技术管理IGBT功率电子器件的热量。.

