CPU 也供不应求了:AI 基建进入第二阶段
过去两年,AI 基建的关键词几乎只有一个:GPU。
谁能拿到 NVIDIA,谁就有算力;谁能租到 H100、B200,谁就能训练模型,讲出一个更大的故事。云厂商、AI 公司、主权基金、服务器厂商,都围着 GPU 转。
但最近几组信号放在一起看,一个新的变化开始浮出水面:
CPU 也开始供不应求了。
这听起来有点反直觉。毕竟在过去的 AI 叙事里,CPU 更像配角。大家谈 AI 芯片,第一反应是 GPU、HBM、CoWoS、NVLink,很少有人把 CPU 放在最前面。
但 AI 基建正在进入第二阶段。
第一阶段,大家抢 GPU。
第二阶段,大家开始抢整套可运行的系统。
Intel 最新一季财报里,有几个数字值得放在一起看。
2026 年第一季度,Intel 收入 136 亿美元,同比增长 7%。Data Center and AI 业务收入 51 亿美元,同比增长 22%。非 GAAP 毛利率达到 41.0%,明显高于公司此前指引。
Intel 管理层在财报里反复提到两个词:CPU 和 supply。
CEO Lip-Bu Tan 说,AI 正在从基础模型训练,走向推理、agentic AI 和更靠近终端的智能,这会显著增加对 Intel CPU、晶圆和先进封装能力的需求。CFO David Zinsner 则提到,公司业绩反映了 CPU 在 AI 时代越来越重要的角色,以及对 silicon 的“unprecedented demand”。
翻译成更直接的产业语言,就是:
AI 不只是需要 GPU。
它还需要 CPU。
GPU 负责高强度并行计算,但一套真正可运行的 AI 系统,远不只是把 GPU 堆起来。它还要处理用户请求、调度模型、访问数据库、调用工具、管理权限、记录日志、做安全审计、分配多 agent 任务,并且保证延迟、稳定性和成本。
这些事情,很多不是 GPU 的强项。
GPU 像发动机,CPU 更像调度中心。发动机再强,如果没有调度、控制和系统管理,也跑不出一套稳定服务。
这就是为什么 CPU 的角色正在重新上升。
TrendForce 对 Intel 财报电话会的整理里提到一个很有意思的比例变化:在训练场景里,可能是 7 到 8 颗 GPU 对应 1 颗 CPU;到了推理阶段,这个比例可能收紧到 3 到 4 颗 GPU 对应 1 颗 CPU;如果进入更复杂的 agentic 和多 agent 场景,CPU 和 GPU 的比例甚至可能走向 1:1,或者更偏向 CPU。
这不是小变化。
它意味着 AI 需求正在从“训练大模型”扩展到“大规模运行 AI”。而运行 AI,比训练 AI 更像一门系统工程。
训练阶段,市场最关心的是谁有最大集群、最多 GPU、最强模型。推理和 agent 阶段,问题会变得更复杂:系统能不能稳定响应?多 agent 能不能协同?数据能不能安全流动?工具调用能不能被控制?成本能不能压下来?延迟能不能接受?
这些问题背后,都需要 CPU、内存、网络、存储、封装、服务器、数据中心电力和软件调度共同工作。
所以,Intel 最近被讨论最多的一条新闻,其实很有象征意义。
据 Tom’s Hardware 等外媒报道,Intel 最近一季度利润率好于预期,其中一部分原因来自所谓的 yield salvage。简单说,就是一些原本商业价值较低、甚至可能不值得销售的芯片产出,现在被重新分档,降级成可用 SKU,卖给了愿意接受较低规格的客户。
这听起来像“变废为宝”,但不能简单理解成 Intel 在卖坏芯片。
半导体行业本来就有 binning,也就是分档。晶圆切出来的每一颗 die 质量并不完全一样。靠近晶圆中心的通常更稳定、更适合高端产品;靠近边缘的 die,性能、功耗、良率可能更不理想。如果一颗芯片达不到高端 SKU 的标准,但仍然可以稳定运行,它就可能被降级成低一档产品出售。
这不是新发明,是芯片行业的常规操作。
这次真正不寻常的地方在于,市场需求已经强到把过去“低预期”的产出也吸收掉了。
过去客户可能会挑规格、挑性能、挑交期。
现在很多客户先问的是:有没有货?
这才是这条新闻的重点。
它不是证明 Intel 突然全面翻身,也不是证明 Intel 的制造能力一夜之间大幅领先。更准确的判断是:AI 基建的需求已经强到让供应链重新计算价值。
过去边缘的产出,现在可能是收入。
过去备用的配置,现在可能是交付方案。
过去不那么性感的 CPU,现在重新变成稀缺资源。
类似信号不只来自 Intel。
Lenovo 数据中心业务负责人最近也对 CRN 提到,高端服务器 CPU 供应已经出现紧张,尤其是用于 GPU 服务器的 Intel Xeon 6 高端型号。一些数据中心产品的交期甚至可能超过六个月。客户如果想更快拿货,就需要调整配置,可能接受性能较低、能耗较高,或者不同代际的方案。
这就是供应链紧张时最真实的变化。
在产能宽松的时候,客户追求最优配置。
在产能紧张的时候,客户追求可交付配置。
最优性能当然重要,但如果拿不到货,就只能停在 PPT 里。能交付、能上线、能稳定运行,开始变得和峰值性能一样重要。
这也是为什么 Google 和 Intel 最近宣布多年度合作,继续在 Google Cloud 的 AI、推理和通用 workload 中部署 Xeon CPU,并共同开发自定义 IPU。Google 的说法很直接:AI doesn’t run on accelerators alone - it runs on systems.
AI 不是只跑在加速器上,它跑在系统上。
这句话可能是理解下一阶段 AI 基建最重要的一句话。
NVIDIA 其实也早就看到了这一点。2025 年,NVIDIA 宣布向 Intel 投资 50 亿美元,并与 Intel 联合开发数据中心和 PC 产品。这个合作当然有资本和产业联盟的意味,但更重要的是,它说明即使是 GPU 时代最大的赢家,也在把 AI 竞争理解成系统竞争,而不是单颗芯片竞争。
不过,NVIDIA 不是这篇文章的主角。
真正的主角是 AI 基建本身正在变化。
过去,AI 基建像一场 GPU 竞赛。
下一阶段,它更像一场系统交付竞赛。
谁有 GPU,谁有第一张门票。
但谁有 CPU、内存、网络、封装、服务器、电力、冷却、软件调度和供应链组织能力,谁才有可能把这张门票变成真正可运行、可扩展、可计费的服务。
这对企业和投资者都有启发。
如果你只盯 NVIDIA,很容易错过 AI 基建的第二层机会。
第一层是 GPU,是训练集群,是高性能加速器。
第二层是 CPU、内存、网络、存储、封装、服务器、电力、冷却和运维系统。
第一层决定模型能不能训练出来。
第二层决定 AI 能不能大规模跑起来。
过去两年,市场最兴奋的是第一层。接下来,很多真实瓶颈会出现在第二层。
这也是为什么 CPU 供不应求这件事值得重视。
它说明 AI 的需求已经不只是“我要更多算力”,而是“我要更多可运行的系统容量”。
这两个东西不完全一样。
算力可以用一颗芯片、一个指标、一个 benchmark 来讲。
系统容量则复杂得多。它包括能不能按期交付,能不能稳定运行,能不能控制成本,能不能接入企业流程,能不能保证安全,能不能在真实业务里长期服务用户。
AI 从 demo 走向生产环境以后,瓶颈自然会从单点性能,转向系统能力。
所以,Intel 那些原本低预期的芯片产出能被市场吸收,并不是一条孤立新闻。
它更像一个小窗口,让我们看到 AI 基建正在发生的变化:
需求太强,供应链开始重新定价。
系统太复杂,CPU 重新回到中心。
交付太紧张,客户开始接受妥协。
如果说 AI 上半场的问题是:谁有最强模型,谁有最多 GPU?
那么 AI 下半场的问题会变得更朴素,也更残酷:
谁有货?
谁能交付?
谁能把每一寸产能,都变成可运行的系统?
Follow my WeChat
Scan to follow