本期速递:随着 AI 等应用快速发展,数据中心能耗持续攀升。本期将解析数据搬运与存储器带来的能效问题,并介绍如何通过架构优化、功耗监测和高效 PMIC 降低能耗与总拥有成本。
全球能源供需矛盾日益突出,而随着新型数据密集型应用需求持续增长,数据中心已处于这一困境的核心。本文将探讨导致数据中心能效低下的原因,并展望提升能效的各种途径。同时,本文也参考了美国能源部(DOE)关于能源效率的研究成果,为相关分析提供理论依据。(1)
能源需求不断攀升,电力都消耗在哪儿?
美国宣布重启三里岛(Three Mile Island)核反应堆为人工智能数据中心供电的消息,或许令许多人感到意外。然而业内众所周知,数据中心电力需求增长速度已远超供电能力。如今,对于数据中心架构师而言,提升电源效率的重要性首次超过了单个器件性能的提升。
半导体研究公司(Semiconductor Research Corporation,SRC)结合全球未来发电能力预测,对这一趋势进行了建模分析。该预测同时假设未来将建设更多核电站以满足持续增长的能源需求。(2) 图1展示了全球能源供需的发展趋势,结果显示, 2055年前后,全球能源供给与需求曲线可能出现交汇,这一严峻形势正在促使整个电子行业重新思考数据中心的设计方式。
图1:全球能源消耗趋势(2)
斯坦福大学的 Shankar 教授进一步分析了这些能源的主要消耗来源。(3) 除人工智能外,加密货币(Cryptocurrency)也是推动能源需求快速增长的重要因素之一。目前,AI 与加密货币两类应用合计已消耗超过 1.5% 的全球能源。根据相关预测,到 2030 年,二者的数据处理所带来的能源消耗将增长至全球能源使用量的 3%;到 2035 年,这一比例还将进一步提升至 4.4%(见图2)。(1) 值得注意的是,图2 的纵坐标采用了对数刻度。诸如加密货币挖矿等应用,其单次操作所需能耗相比处理器执行基础指令高出了18 个数量级,充分说明数据密集型应用已成为能源消耗的主要来源。
图2:不同计算操作的能耗比较(1)
基于这一背景,衡量数据中心效率的方式也产生了变化,相比单纯关注系统性能,更合理的指标是每消耗 1 瓦功率所完成的有效工作量。图3对系统中各类操作的能耗进行了拆分。(1) 值得注意的是,图中上方约三分之二的能耗主要用于数据搬运,而真正用于数据处理的能耗仅占下方约三分之一。
图3:系统功能的能耗分布(4)
存储器、存储设备以及通信层级通常表示为一个金字塔结构,其顶部为处理器寄存器,随后依次为各级缓存(Cache)、DRAM,底部则为存储设备(Storage)和通信网络(见图5)。本文后续分析也将采用这一简化模型。然而,这种金字塔模型最大的弊端是其无法体现各层资源实际上连接在不同的数据总线上。事实上,数据从一种资源传输到另一种资源时,通常需要跨越多个总线完成多次数据搬运,而每一次数据传输都会消耗额外电力,并产生热量。
图4给出了一个典型示例。应用首先通过一条通道(如PCIe)从磁盘读取至 CPU,再经另一条通道(如DDR)写入内存;随后,CPU 又以缓存行(Cache Line)为单位不断从内存读取数据执行计算,并将临时结果重新写回内存。与此同时,应用还可能通过通信通道(例如经 PCIe 连接到广域网)读取数据,对数据进行处理后,再将结果写回磁盘。即使在这样一个十分简单的应用流程中,也可以清楚地看到:真正的数据计算仅占整个流程中极小的一部分,而绝大多数能耗都来自数据搬运。真正参与计算的数据比例几乎低到难以测量,系统的大部分资源实际上都消耗在数据传输过程中。
图4:简单应用中的数据移动过程(5)
为什么要关注存储器?
存储器利用率之所以成为关注重点,是因为它在提高能效方面具有巨大的提升潜力。存储器的功耗与许多 CPU 相当,约占服务器总功耗的22%。存储器层级数量的不断增加既带来了积极影响,也带来了负面影响。积极的一面是,功耗更低的存储器正不断部署到更靠近处理器的位置。消极的一面是,这些近存储器层级容量有限,因此仍需要容量更大、功耗更高的存储器持续向本地存储器填充数据集。各层级存储器的功耗都会累加到系统总功耗中。
例如,高带宽存储器(HBM)的接口能耗约为 1.5pJ/bit,相比之下,双倍数据速率(DDR)存储器模块约为 15pJ/bit,前者具有明显优势(见图5)。遗憾的是,这些存储器仍会产生较高的功耗(例如,每个 HBM 堆栈的功耗为 75W 或 100W),且与高功耗处理器位于同一基板上。这使得其散热极具挑战性。相比之下,每个 DDR 模块的功耗约为 15W,并且位于距离处理器更远的位置,这些区域可采用风冷方式散热。
各层级的效率
推测(Speculation)可以大幅提升系统性能,但推测也意味着必然会产生浪费,即使是处理器寄存器也存在隐藏的浪费。例如,一个采用 32 位整数表示的系统变量,如果其取值范围始终在 1 至 10 之间,那么其隐藏的浪费率达到 87.5%。处理器缓存的命中率通常可达 95% 甚至更高,因此可以反向推算其浪费率约为 5%。随着存储器距离处理器越来越远,DRAM 的访问效率也会逐渐下降:处理器直连 DDR 存储器的浪费率约为 27%,而通过 CXL 连接的 DDR 存储器浪费率则超过 40%。
这些数字看起来或许并不算高,但如果进一步考虑每次 DRAM 访问过程中,为实现 缓存行命中率而发生的内部操作,情况就完全不同了。大多数处理器采用 64 字节缓存行。下面来看一下这 64 字节如何映射到 DRAM 的内部结构。每颗 DRAM 都具有一个 1kB 的内部页缓冲区(Page Buffer),多个 DRAM 通常组合成一个 Rank,每次访问时会同时激活 10 颗 DRAM(见图6)。为了满足单个缓存行的需求,需要激活整个 DRAM 模块,将每颗 DRAM 中的 1kB 数据读入感测放大器(Sense Amplifier),整个模块共读取 10kB 数据。随后,仅有 64 字节数据被读取并发送给处理器。而且,DRAM 的激活操作具有破坏性,激活过程中,存储阵列中的数据会被擦除,因此必须再将感测放大器中的数据重新写回存储阵列。对于一次随机访问而言,64 字节有效数据需要移动总共 20kB 的数据,换算下来,浪费率高达 99.7%。
图6:服务器 DRAM 模块及页缓冲区激活开销
上述 0.3% 的效率仅针对一次 64 字节缓存行的数据移动。如果该 DRAM 层级的命中率只有 60%,那么效率将进一步下降至 0.18%。如果实际仅需要该缓存行中的 1 字节数据,则浪费率将增加至 99.98%。由这个简单示例可以看出,数据中心的整体效率正快速趋近于零。
另一种能够提升系统性能的推测方式是执行推测(Execution Speculation)和访问推测(Access Speculation)。例如,处理器可能会在分支条件判断之前,预先加载分支两侧的代码,以防止执行路径发生跳转。许多 SSD 也采用类似机制,预先加载可能会访问的数据页。如果最终没有发生分支跳转,或者预加载的数据页始终没有被访问,那么这些推测操作所消耗的能量将全部被浪费,即浪费率达到 100%。
总拥有成本(TCO)
随着电力供应逐渐成为数据中心扩建的瓶颈,系统架构师终于开始认识到,总拥有成本(TCO)已经成为推动系统设计的关键因素。虽然处理器厂商仍然专注于提升性能,但其客户必须考虑是否能够为这些设备提供足够的电力并进行散热。据估计,目前数据中心散热消耗的成本约占数据中心运行成本的 43%,这一比例与运行服务器本身所需的成本相当。(6)
因此,系统架构师开始采用新的效率指标,不仅关注每秒可完成多少 PFLOPS(petaFLOPS/second),同时也关注每瓦时能够完成多少 PFLOPS(petaFLOPS/watt-hour)。
提高存储器能效
提高推测访问的准确率,是降低存储器子系统功耗的关键方法之一。对于系统架构师而言,更重要的问题并不是是否采用推测访问,而是考虑:推测访问的成功率是否足以抵消其带来的能耗开销? 例如,如果一个 CXL 存储器模块位于存储池中,并由多个处理器共享,那么某个 DRAM Bank 的实际命中率是多少?一个存储页是否应保持开启状态(延迟预充电,以便再次命中同一存储行),还是应立即关闭(立即执行预充电,并假设该存储行不会再次被访问)?
非一致性存储器访问(NUMA)已经在服务器架构中应用多年,用于支持紧密耦合的处理器根据需求共享存储资源。然而,每增加一次内存访问跳转(Hop),功耗可能增加三倍以上;相比之下,将计算任务迁移到距离目标存储器更近的处理器上,则能够显著降低功耗(见图7)。计算存储(Computational Storage)就是一种任务迁移方式,并已取得一定成效,但其应用仍受到设备可执行任务标准的限制。
图7:服务器 DRAM 模块及页缓冲区激活开销
类似地,将数据放置在适当的存储器层级,也能够显著影响系统能耗。图8展示了按照数据“温度(Temperature)”进行存储器分层的方法,其中热数据(Hot Data)被频繁访问,而冷数据(Cold Data)的访问频率较低。
图8:按数据“温度”进行存储器分层
持久性存储器(Persistent Memory)是用于提高数据可靠性的一种系统方案。持久性存储器可以采用断电后仍能保存数据的存储技术(例如 MRAM),也可以利用备用能源,在断电时将 DRAM 数据保存到非易失性存储器(NVM)中,例如闪存。持久性存储器还能够通过消除“检查点(Checkpointing)”机制来大幅降低系统功耗。所谓检查点,是指保存计算过程中的中间结果(见图9)。在许多系统中,检查点操作占整个系统数据流量的 7% 至 8%,因此也会产生相应的功耗。
图9:持久性存储器可减少检查点操作
混合存储器模块(Hybrid Memory Module)通过将存储设备和直接访问存储器集成于同一模块中,减少系统中的数据传输。例如,可将 SSD 所采用的闪存与 DRAM 集成在一起,由 DRAM 以缓存行为单位直接提供数据访问。统计数据显示,从 SSD 传输到系统存储器的典型数据块大小为 4kB,但应用程序平均仅使用其中约 100 字节,有效利用率仅为 2.5%。因此,通过减少无效数据传输,混合存储器模块能够有效提升系统能效。
软件对能效也有巨大影响
硬件无法解决所有问题,软件在驯服能耗猛兽的过程中也发挥着重要作用。从数据类型对应的功耗来看,浮点数等复杂且大型的数据类型,其能耗要高出多个数量级;而整数运算则消耗更少的能量(见图10)。这一点有时仅仅取决于程序员是否正确选择变量的取值范围。例如,对于 for (i=0; i<10; i++) 这样的循环,变量 i 并不需要采用 32 位计数器。
图10:处理器不同操作的能耗细分(1)
变量类型的选择有时还受到编程语言本身的限制(见图11)。并非所有编程语言都能够灵活选择变量的数据类型,而对于 Python 等广泛用于 AI 应用的语言来说,这种影响会因大量矩阵运算而进一步放大。Python 还有另一个增加能耗的特性:程序源码首先被编译为字节码(Bytecode),随后由虚拟机解释执行;而 C 语言则直接编译为处理器原生代码。
图11:不同编程语言的能耗对比 (7)
无法量化,就无法优化
优化能效的关键,首先是能够测量系统运行时的功耗。MPS 用于存储器模块的电压稳压器(例如MPQ8894, MPQ8895, 和 MPQ8896 和 MPQ8896)均为集成了I2C, I3C或 SidebandBus 等系统管理接口的电源管理IC(PMIC)。通过这些系统管理接口,主机系统能够在系统运行期间访问 PMIC。测试和测量程序运行期间,甚至在客户应用的运行期间,都可以从 PMIC 中读取各路电压轨的电流信息,从而计算存储器模块的实时功耗。
PMIC 还可配置触发条件,并记录所有超过预设最大值的事件。当触发条件满足时,主机系统可以读取遥测寄存器,并根据相应状态采取措施,例如限制那些超过系统功耗限制的应用。
C选择 MPS PMIC 本身就是一种节能措施。与竞争方案相比,采用MPS PMIC可以将电源转换效率提高约 4%,从而使整个数据中心的总功耗降低约 2%。对于一个典型的 300MWh 数据中心而言,这意味着每年可减少约 6MWh 的电力消耗,并减少约 4 公吨 的碳排放。(8)
结论
数据中心的功率需求预计将持续增长,直至数据中心在物理上或经济上无法再继续扩展。数据中心架构师不断地在客户性能需求与成本控制之间寻求平衡,总拥有成本(TCO)已成为系统设计的重要考量因素。
以数据处理量与数据移动量之比衡量的数据中心效率实际上非常低。不过,仍有许多方法可以提高系统效率,包括调整缓存管理参数以及优化推测策略。通过 NUMA、CXL 等互连架构进行资源调度和任务分配,也为系统优化提供了新的途径。
合理选择高能效器件(例如 MPS 稳压器)能够显著降低数据中心的能耗。效率每提高一个百分点,都将带来碳排放的大幅降低,而碳排放是造成污染的主要因素之一。MPS 稳压器从整体系统方案出发,在提供高效率的同时,还提供用于测量和微调方案的方法,以实现最佳节能效果。
软件同样对系统能效具有重要影响。从底层数据类型的分配,到针对不同任务选择合适的编程语言,都会影响系统效率。此外,在系统运行期间持续测量能效,能够帮助数据中心运营人员监测系统健康状态,并根据需要优化或限制系统能耗。MPS 提供的遥测信息能够帮助系统软件了解能量的具体消耗位置。
更重要的是,TCO 分析要求行业将关注重点从“每秒操作数”转变为“每瓦时操作数”,这是能源需求急剧增长所推动的一项重大理念转变。采用 MPS 高效率稳压器将有助于降低数据中心能耗,从而降低数据服务的成本。
注释:
- Energy Efficiency Scaling for Two Decades Research and Development Roadmap. (2024, August). U.S. Department of Energy. Retrieved November 7, 2025, from https://www.energy.gov/sites/default/files/2024-08/Draft_EES2_Roadmap_AMMTO_August29_2024.pdf
- Kaarsberg, T. (2023, March 16). Microelectronics’ Energy Efficiency Scaling for 2 Decades (EES2) Pledge and WG Day 2 Closing. Stanford. Retrieved November 7, 2025, from https://ees2.slac.stanford.edu/sites/default/files/2023-11/Kaarsberg%20Closing%20EES2%20Mar%2016.pdf
- Shankar, S. (2024, November 13). Energy of Computing: Unsustainable Trends and Potential Solutions. Stanford Energy Seminar. Stanford Energy Seminar: Sadasivan Shankar | Energy of Computing: Unsustainable Trends and Potential Solutions - Stanford University
- Gervasi, B. (n.d.). How CXL Lets Us Do Controller Memory Buffers the Right Way. Wolley Inc. Retrieved November 7, 2025, from https://files.futurememorystorage.com/proceedings/2024/20240806_DCTR-102-1_Gervasi.pdf
- Gervasi, B. (2024, July 17). Averting a System and Software Induced Energy Crisis. "Systems and Software for Averting an Energy Crisis" IEEE OCCS & OC ACM Mtg | IEEE Life Members
- Gervasi, B. (2022). A Persistent CXL Memory Module with DRAM Performance. Box
- Kumar, A. (2024, August 3). Top 5 most energy efficient coding languages - WireUnwired Research. WireUnwired. Top 5 Most Energy Efficient Coding Languages - WireUnwired Research
- Greenhouse Gas Equivalencies Calculator | US EPA. (2025, February 24). US EPA. Greenhouse Gas Equivalencies Calculator | US EPA










