Technology

CPU的黄金时代,尚未到来

GPU仍处于聚光灯下,CPU的下一轮机会则可能来自更高效的异构计算。

原文发表于 Realpolitik in Tech,2025年3月。In English

01 GPU当红,CPU仍未退场

注意力机制、高速矩阵运算、大规模并行处理和高带宽内存,共同推动了大语言模型(LLM)的突破。

图形处理器(GPU)擅长并行执行Transformer所需的大量矩阵运算。Transformer则利用注意力机制建模词元之间的关系,构成了ChatGPT、Claude和Grok等生成式人工智能系统的技术基础。

GPU可以同时执行大量计算任务,显著缩短大模型的训练时间。过去数年的生成式AI浪潮,很大程度上建立在这种并行计算能力之上。

但AI计算的重点正在从单纯扩大规模,转向提高效率。DeepSeek等模型表明,通过架构、训练流程和系统工程的协同优化,可以减少冗余计算,降低训练和推理成本。

这种变化也为中央处理器(CPU)创造了新的空间,尤其是在本地推理、边缘设备和通用计算场景中。CPU仍是电脑和智能手机最重要的通用计算核心。

自英特尔4004问世以来,微处理器已经走过半个多世纪。CPU并非一项等待退出舞台的旧技术,它的角色仍在随计算需求变化而演进。

CPU的下一个增长阶段,或许才刚刚开始。

02 DeepSeek:全栈优化如何降低计算成本

DeepSeek让行业重新审视一个问题:前沿模型是否必然依赖不断增加的计算资源?

长期以来,训练前沿语言模型被认为需要巨额算力。外界对GPT-4训练成本的估算一度超过1亿美元,但OpenAI并未公开完整口径。

DeepSeek披露,拥有6710亿参数的DeepSeek‑V3共使用约278.8万个英伟达H800 GPU小时完成最终训练。按每GPU小时2美元估算,这部分成本约为557.6万美元;该数字不包括前期研究、试验、人员和基础设施投入。

它是怎么做到的?

DeepSeek‑V3采用混合专家模型(Mixture of Experts,MoE):模型虽然拥有庞大的总参数量,但处理每个词元时只激活其中一部分参数。

以DeepSeek‑V3为例,每个词元只激活约370亿参数,约占总参数量的5.5%。这使模型能够扩大容量,同时控制单次计算成本。

它还采用FP8混合精度训练,以更低位宽表示部分数值,从而减少显存占用和计算开销,同时通过工程设计维持训练稳定性。

DualPipe并行技术则把计算与通信过程交叠起来,减少GPU等待数据传输的时间,提高集群利用率。

这些优化共同降低了最终训练运行所需的GPU时间,并使模型在多项基准测试中达到接近领先闭源模型的表现。

更值得关注的是,DeepSeek随后发布的蒸馏模型降低了部署门槛。部分较小版本可以在只有CPU或配备有限加速器的设备上运行,尽管速度和体验仍取决于模型规模、量化方式与内存带宽。

这并不意味着GPU不再重要,而是说明架构与系统优化可以改变算力需求,也让CPU在更多推理场景中重新获得价值。

03 L‑Mul:重新思考乘法的能耗

DeepSeek的启示不在某一项单独技术,而在于通过算法、精度、并行和系统工程的协同设计降低计算成本。

与此同时,一项名为L‑Mul的研究从更底层的数值运算入手,尝试降低浮点乘法的能耗。它与DeepSeek的系统级优化方向不同,却都指向同一个问题:AI计算是否还能以更高效的方式完成?

2017年的论文《Attention Is All You Need》提出Transformer架构,并以注意力机制重塑了序列建模方式,为今天的大语言模型奠定基础。

2024年,论文《Addition Is All You Need for Energy-efficient Language Models》提出L‑Mul,展示了如何用整数加法近似浮点乘法,以降低语言模型中相关运算的能耗。

L‑Mul并非把一次乘法机械地改写成多次重复加法,而是利用浮点数的指数和尾数结构,以较低复杂度的整数加法近似乘法结果。

研究团队将其称为L‑Mul,即“线性复杂度乘法”(Linear‑complexity Multiplication)。

这项研究提出的关键问题是:语言模型中的浮点乘法,是否都必须由传统乘法器以同样的精度和能耗完成?

在Transformer等语言模型中,矩阵乘法占据大量计算。GPU正是凭借对这类并行运算的高吞吐能力,成为训练和推理的主要硬件。

L‑Mul尝试改变的不是矩阵运算本身,而是矩阵中每一次标量乘法的实现方式。

它通过近似算法减少对传统浮点乘法器的依赖,而不是用“3+3+3+3”这样的重复加法替代普通整数乘法。

论文引用的硬件估算显示,一次32位浮点乘法的能耗约为一次32位整数加法的37倍;这说明改用加法器具有潜在的能效优势,但实际收益仍取决于硬件实现。

在AI系统中,这类乘法会出现数十亿次,既存在于注意力机制,也存在于前馈网络等其他模块。

论文估算,L‑Mul可使逐元素浮点乘法的能耗最多降低约95%,点积运算的能耗降低约80%;实验结果显示,在特定精度设置下,其模型表现可以接近FP8计算。

这项研究的重要性在于,它把AI能效问题推进到了算术单元层面。

不过,L‑Mul并不意味着AI可以“只靠加法运行”,也不意味着工作负载会自动从GPU转移到CPU。它更可能推动CPU、GPU和专用加速器采用新的低功耗算术单元。

真正的变化,是硬件设计者可以重新权衡精度、速度与能耗,而不必把传统浮点乘法视为唯一选择。

L‑Mul为CPU带来的机会,在于通用处理器也可能通过新指令和硬件单元提升AI推理效率;但它更支持异构计算,而非简单的CPU取代GPU。

04 WLRU:缓存策略还能如何改进

摩尔定律长期描述了集成电路晶体管数量大约每两年翻一番的趋势。晶体管密度不断提高,曾持续推动处理器性能增长和单位计算成本下降。

但处理器性能提升越来越受到另一项瓶颈制约:内存墙。

CPU的计算速度远高于主内存的数据访问速度。处理器如果不能及时取得所需数据,再强的计算单元也只能等待。

缓存位于处理器与主内存(RAM)之间,用来保存近期或频繁访问的数据,以减少高延迟的主内存访问。

问题在于,缓存容量有限,系统必须不断决定哪些数据值得保留、哪些数据应当被替换。缓存越大,也不代表每一次选择都会更准确。

因此,缓存只能缓解而无法消除内存墙。替换策略如果不能预测后续访问,缓存中就可能保留低价值数据,同时逐出即将再次使用的内容。

传统缓存设计高度依赖局部性原理:近期访问过的数据,或与当前地址相邻的数据,往往更可能再次被访问。

最常见的最近最少使用策略(LRU),会优先淘汰最久未被访问的数据,本质上是用历史访问时间预测未来需求。

但并非所有现代工作负载都具有稳定的时间局部性。大型互联网服务、图分析和部分AI应用的数据访问可能更分散,使单纯依赖最近访问时间的策略表现下降。

缓存未命中时,CPU必须从更慢的内存层级取回数据,带来延迟和能耗。此时,问题不只是缓存够不够大,也在于替换策略能否识别对当前工作负载更有价值的数据。

加权最近最少使用(Weighted Least Recently Used,WLRU)试图在访问时间之外加入额外权重,让缓存替换决策同时考虑数据的相对价值。

例如,某些数据虽然近期没有被访问,却可能获取成本高、重建代价大,或对特定任务格外重要。WLRU可以通过权重让这类数据更不容易被淘汰。

换言之,WLRU不只询问“上次何时使用”,还试图衡量“再次获取这项数据需要付出多大代价”。具体效果取决于权重如何定义,以及目标工作负载是否稳定。

这也提醒处理器设计者,改善内存性能不能只依赖增加缓存容量。更大的缓存固然重要,替换算法、预取机制、内存层级和软件访问模式同样关键。

WLRU代表的是一种更广泛的思路:让缓存策略根据数据价值和工作负载特征进行调整,从而更充分地发挥CPU在通用计算中的灵活性。

GPU擅长高吞吐并行计算,CPU则擅长低延迟控制、复杂分支和多样化任务。缓存策略的改进说明,CPU性能仍可以从架构细节中获得增长,而不只依赖制程与频率。

05 CPU的下一轮机会

DeepSeek展示了系统级优化如何降低计算成本,L‑Mul把能效问题推进到算术单元层面,WLRU则从缓存替换策略切入内存瓶颈。三者技术层级不同,却共同说明:计算效率仍有大量空间,不必只靠堆叠更多硬件。

GPU推动了这一轮生成式AI革命,并将继续承担大规模训练和高吞吐推理的核心工作。

但AI计算架构不会停留在单一硬件主导的阶段。

DeepSeek表明系统协同优化可以显著提高算力利用率;L‑Mul探索了低功耗数值运算的新路径;WLRU则提示缓存管理仍有改进空间。

GPU在并行计算中拥有极高吞吐量,但也伴随显著的功耗、成本和数据搬运需求。

CPU的优势不同:部署广泛、编程灵活、低延迟,并且能够承担复杂控制和多样化工作负载。

计算的下一阶段,不会只是继续增加峰值算力,而是提高整个系统的有效利用率。

AI的未来需要GPU、CPU、内存和专用加速器更紧密地协同。在本地推理、边缘计算和能效敏感的场景中,CPU的重要性可能进一步上升。

因此,CPU的“黄金时代”未必意味着它重新取代GPU,而可能意味着通用处理器在异构计算体系中获得新的任务和价值。

免责声明:作者持有WLRU相关专利。