深度 | AMD Venice 256核2nm:为什么 x86 CPU 在 AI Agent 时代比 GPU 更值钱
核心观点:Venice 的真正对手不是 NVIDIA Vera,也不是 Intel Diamond Rapids,而是台积电的 N2 晶圆产能。2026 年服务器 CPU 全部售罄——怎么造出来,比造出什么更重要。
2026 年 7 月 22 日,Lisa Su 在 Advancing AI 大会的讲台上打出两页 PPT,让全场沉默了。
第一页:在 AI Agent 管线上,7 个阶段纯跑 CPU,只有 1 个阶段用 GPU。第二页:AMD 把服务器 CPU 的 TAM 从 $600 亿直接翻倍到 $1200 亿。
这不光是产品发布。这是明牌告诉行业:AI 的瓶颈已经从"算得快"变成了"管得过来"。
EPYC 9006 Venice——全球第一款量产的 2nm 服务器 CPU,256 核 512 线程,2030 亿晶体管——就是 AMD 对这道题的答案。它和 NVIDIA Vera 代表的是两个完全相反的 CPU 哲学:用 chiplet 堆出 x86 吞吐,还是用单片 ARM 换低延迟。
一、2nm 的代价:$3 万一片晶圆,全线售罄
Venice 的 Compute Die 用台积电 N2 工艺。这是 FinFET 晶体管在统治 15 年后,第一次让位给Gate-All-Around Nanosheet架构。
别被百分比糊弄了——同功耗性能 +10-15%、同性能功耗 -25-30%、晶体管密度 +15%。这些数字本身没多大意思。值钱的事情在两件事上:
第一,N2 产能在 2026 年是垄断性的。三星 SF2 良率还在 50-60%(初始良率"超过 30% 就被认为是超出预期"),Intel 18A-P 刚进风险量产。只有台积电 N2 真正在大规模跑——每片晶圆 $30,000,比 N3 溢价 50%,并且全年产能已售罄。苹果拿走了 50% 以上,AMD、高通、联发科争剩下的池子。
第二,谁拿到 N2 产能,谁就在 2026 年没有对手。Intel Diamond Rapids(192 核, 18A-P)跳票到 2027 年年中,而且在 512 核旗舰版上进一步延迟。这意味着 Venice 在 Q4 2026 到 Q2 2027 之间,将面临12 个月的空窗期——没有同级别的 P-core Xeon 竞品。Clearwater Forest(288 核 E-core, Intel 18A)是 2026 年 Intel 唯一的新牌,但 E-core 定位 scale-out 轻量工作,和 Venice 不在一条赛道。
Morgan Stanley 预测 Venice 2026 年出货约 125 万颗,2027 年直接跳到 675 万颗——5.4 倍的爬坡。同期 NVIDIA Vera 预计 575 万颗,Venice 反超约 100 万颗。
二、Zen 6 不是 Zen 5++:一个从零开始的数据中心架构
8-wide 前端 + 6 独立整数调度器
Zen 5 是 6-wide Dispatch。Zen 6 直接拉到8-wide。每周期可发射的指令数提了 33%。
但更关键的改动在后端。Zen 6 把过去单一的整数调度器拆成6 个独立域,各自管理一组执行单元。AMD 的说法是这降低了电路复杂度、减少了内部延迟——对于 Agent 工作负载里大量的分支密集、上下文频繁切换的代码路径,这比单纯的 IPC 提升更有实际收益。
分支预测器也重写了。工程资料里提到跑了 57 万次高频仿真迭代调优。对于 Agent 场景(执行路径高度不可预测),分支预测精度每提高一个点,都等于一次上下文切换延迟的降低。
原生 512-bit AVX-512:不再拼凑
Zen 4/5 用双 256-bit 单元拼凑 AVX-512——吞吐只有原生的一半。Zen 6 终于掏出了真正的 512-bit 数据路径。再加上新增的AVX-512 BMM指令(VBITREVB、VBMACOR、VBMACXOR),用 bit 级矩阵乘法加速低精度运算。这是 AMD 对 Intel AMX 的回答——不用专门的 tile register,而是扩展现有 AVX-512 生态。
一条重要的旁白:Zen 6不实现 AMX。AMD 和 Intel 共同制定的 ACE(AI Compute Extensions)矩阵加速扩展——已经规划给 Zen 7 “Grimlock”(2028, TSMC A14)。也就是说,Venice 在 CPU 端 AI 推理上,靠的是 AVX-512 BMM 而非专门的矩阵引擎。短期够用,长期看 Zen 7。
IPC 到底涨了多少?
AMD 没给过单独的 IPC 数字。泄漏的范围在 8-15%,我自己倾向于相信10% 左右的混合 IPC 提升。AMD 喊的"比 Turin 强 70%+"是把核心数翻倍、频率提升、IPC 改进打包在一起的总账。但即便只有 10% IPC——这在 2026 年的 x86 大盘下,也已经是相当能打的代际跳跃了。
Chiplet 拓扑:8 个 CCD,双 I/O Die
Venice 旗舰版挂 8 个 CCD,每个 32 核 Zen 6c(两个 16 核 CCX),两台 I/O Die 穿插其间。I/O Die 每颗约 375 mm²(6nm),是 Turin 单 IOD 的两倍硅面积。
图:Venice 旗舰的 8 CCD + 双 I/O Die 布局。双 IOD 是关键——核心数翻倍,内存和 I/O 带宽也翻倍。
双 I/O Die 是这张图的精髓。256 个核心不能共享一套 I/O——Agent 工作负载天然是大量独立小任务并发(每个 Agent 1-2 核独立跑),I/O Die 解耦意味着核心数翻倍时不会被带宽瓶颈卡住。
代价是跨 die 延迟。同一个 CCD 内(单 CCX 16 核),延迟非常低。跨 CCD、跨 CCX 后,延迟能涨到 3-4 倍。但 Agent 负载是 embarassingly parallel 的——不需要跨核心通信。NVIDIA Vera 用单片设计、极低跨核延迟,但只有 88 核。这是两个世界观的碰撞。
三、三张牌:Venice vs Vera vs Diamond Rapids
基础参数一览
| 指标 | AMD Venice SP7 | NVIDIA Vera | Intel Diamond Rapids |
|---|---|---|---|
| 最大核心 | 256C / 512T | 88C / 176T | 192C / 192T |
| 制程 | TSMC 2nm (GAA) | TSMC 3nm | Intel 18A-P |
| 频率 | 5.0-5.15 GHz | 未公布 | 未公布 |
| 内存 | 16-ch DDR5-8000 | LPDDR5X 1.5 TB | 16-ch DDR5 |
| 内存带宽 | 1.6 TB/s | 1.2 TB/s | ~1.6 TB/s |
| I/O | PCIe 6.0 + CXL 3.1 | PCIe 6.0 + CXL 3.1 | PCIe 6.0 |
| SMT | 有 | 有 | 无 |
| 出货时间 | Q4 2026 | H2 2026 | Mid 2027 |
为什么 Diamond Rapids 砍 SMT 是个大问题
Diamond Rapids 192 个 P-core,一个线程一个萝卜一个坑——没有超线程。官方说"单线程性能已足够强,HT 在安全和功耗上不划算"。在云场景下,这意味着每颗 CPU 只给 192 vCPU,而 Venice 能给 512 vCPU。对于按核心数收费的软件许可模式(SQL Server、Oracle、VMware),这是 TCO 的决定性差距。
而且 Intel 要等到 **Coral Rapids(2028)**才会把 SMT 加回来。等于说未来 18-24 个月,Intel 在高端服务器段的线程密度全面落后。
Vera 的牌在哪?
NVIDIA 没想用 Vera 跟 Venice 拼核心数。88 核对 256 核,规模上根本没得打。Vera 的武器是NVLink-C2C(1.8 TB/s)——它和 Rubin GPU 的通道延迟低到纳秒级,在 Vera Rubin NVL72 机架里,36 CPU : 72 GPU 的配置从底层就已经端到端调优过了。
AMD 的数据显示 Venice 在 SPECrate 整数吞吐上领先 Vera 2.2 倍,机架级 100kW 等功耗下领先 3.3 倍。但这个比较用的是 256 核 Venice 对 88 核 Vera——分母差三倍。归一化到每核之后,Venice 高频版(5.0 GHz)约领先 Vera 19%。也就是说,架构层面 Venice 有优势,但不是碾压性的。
真正让 NVIDIA 头疼的是 Vera 只有一款 SKU——88 核。这没法覆盖从云厂商到企业 IT 的全谱系需求。而 Venice 有四条产品线。
四、CPU:GPU 比例改写与 Agent 沙盒
从 1:8 到 1:1,甚至 4:1
训练时代,一台 GPU 服务器配 1-2 颗 CPU,CPU:GPU 比例在 1:4 到 1:8 之间。CPU 基本是"GPU 的网管"——数据搬运和调度。
Agent 时代完全翻过来了。AMD 把 Agent 工作流拆成 9 个阶段,其中7 个——网关响应、上下文组装、规划路由、验证、检索(FAISS 向量搜索)、企业工具、暂态工具——全在 CPU 上跑。只有"推理"那一步走 GPU。
BofA 估测 Agent 场景的 CPU:GPU 配比正从 1:8 向 1:1 演进。Intel CEO 公开说某些场景需要 4:1 的 CPU 过剩配置。
图:Agent 的 7 个 CPU 密集阶段。GPU 只负责蓝色推理环节。
256 核在"装 Agent"上的真实优势
Agent 沙盒场景下,256 核的价值不在"算得快",而在"装得多"。一个典型 Agent 实例占 2-4 GB 内存、1-2 个核。双路 Venice(512 核 / 1024 线程)+ 16 通道 DDR5,一个 2U 服务器能塞进 200-400 个独立 Agent 实例。
双路 Vera(176 核 / 352 线程)、LPDDR5X 下,Agent 沙盒密度最多只有 Venice 的 35-50%。
NVIDIA 的反驳是:"客户不在乎每机架能跑多少 Agent,只关心单个 Agent 回复要几秒。"这是p99 延迟 vs 总吞吐的经典对决。但对于大多数 Agent 应用来说,最慢的阶段是 LLM 推理(秒级),CPU 侧几十纳秒的差异在里面完全被稀释了。
五、开放 vs 封闭:Helios 对 Vera Rubin 的生态战
AMD 同步发布的 Helios 机架架构暴露了另一条战线。Helios 用 UALink(开放 GPU 互联)+ Ultra Ethernet(800 Gbps)+ PCIe 6.0 / CXL 3.0——任何厂商的网络、GPU、交换机都能插进去。Vera Rubin NVL72 用 NVLink 6 + NVSwitch + Spectrum-X,是 NVIDIA 的全栈封闭花园。
Meta 签了 6 GW 的 AMD 定制 GPU 协议。OpenAI 签了 6 GW,外加 AMD 10% 股权期权。Anthropic 签了 2 GW + $5 亿 AMD 股权投资。Oracle 部署了第一个 Helios 超集群(50,000 MI450 GPU)。每一个案子,都是一次"不选 NVIDIA 全栈"的投票。
但这不意味着开放方案更好用。NVIDIA 封闭花园的真正杀伤力在于:你不需要一个 50 人的工程团队去调优网络拓扑、排查 RAS 错误、调 PyTorch 和 vLLM 的分布式后端。对 AWS/Meta 这种体量的公司来说,养一个团队搞定没问题。对于年 IT 预算 $5000 万的中型企业,"开箱即用"才是硬道理。
我判断这两个市场会长期共存:顶级 hyperscaler 选开放(能自己调),中长尾选封闭(不想调)。
六、对中国的多维冲击
国产 CPU 的追赶窗口
Venice 256 核 / 2nm / GAA 的三重跃迁,把国产 CPU 与前沿的距离明确为约两代。海光 C86-4G(128 核,约 Zen 3-4 水平)刚量产,C86-5G 要到 2026 年才出来。华为鲲鹏 950(96 核)2026 Q4,鲲鹏 960(256 核)要到 2028 Q1——核心数平齐但制程差距仍在。
但缺货涨价正在打开"替代窗口"。中国市场的服务器 CPU 价格 2026 年以来涨了超过 40%,AMD / Intel 的高端产品交期已经拉到 6 个月以上。海光靠着 x86 兼容性(零代码迁移),是短期最直接的受益者——Q1 营收增长 68%。
出口管制的灰色地带
Venice 本身(服务器 CPU)目前不在 BIS 对华限制名单上。限制名单针对的是 MI300/MI250X 级别的 AI 加速器。但如果 Agentic AI 让 CPU 成为 AI 瓶颈并引发美国政策审视——高端服务器 CPU 可能被重新分类管制——这个风险不能排除。
学术前沿的中国贡献
有意思的一面:哈工大的 ArcLight 架构(ACL 2026)直接针对多 NUMA CPU 的 LLM 推理优化,比主流框架提速 46%。清华的 CPU-GPU 混合 MoE 推理系统(OSDI 2026)在双路 CPU+ 消费 GPU 上跑 DeepSeek-V3 达到 21.5 tokens/s。这些研究正在为高核心数 CPU 的 AI 推理场景铺理论基石。
七、我说几个判断
第一,Venice 的最大对手不是 Vera,是台积电 N2 产能。全年售罄、苹果占一半、AMD 争剩下的——供应约束比竞争约束更紧。AMD 正在谈三星 SF2 做备胎(初始良率 30%+,远低于 N2),这是在为 2027 年保底。
第二,我预判 2027 年才是真正的战场。Diamond Rapids、Vera 二代(Rosa/Rigel 核心, ARM v9.2)、Venice-X(3D V-Cache, 1,152 MB L3)都集中在 2027 年。Venice 的优势窗口是 12 个月,AMD 需要用这一年把大客户的长期合同锁死。
第三,x86 的护城河在变浅——但还没被填平。AWS Graviton 确实证明了 ARM 在企业级可行,越来越多开源项目原生支持 ARM。但 x86 的生态惯性(30 年软件栈、ISV 认证、运维工具链)仍然是最大的沉没成本壁垒。什么时候 ARM 服务器 CPU 的市场份额超过 50%(BofA 预计 2030 年),这道壁垒才算真正被跨过去。
第四,我赌一件事:Venice 的定价会超出所有人预期。2026 年服务器 CPU 全线涨价——Intel +7-12%,AMD +4-7% 累计 16-17%,中国市场涨 40% 以上。卖方市场下,AMD 没有理由在 Venice 上便宜。这不是 Intel 降价倒逼的时代了。
AI 辅助深度研究,人工视角解读。每周二、四、六更新。分析仅代表个人判断。