从2024年到现在,数据中心圈子里聊互连,绕不开三个词:光互联、CPO(Co-Packaged Optics,共封装光学)和LPO(Linear Pluggable Optics,线性可插拔光学)。不少朋友跑来问我:铜线用了这么多年,为什么突然就“到头了”?这句话真不是营销口嗨。AI集群的带宽密度涨得太快,铜介质在物理层面先撑不住了,光的接力是必然,而CPO和LPO则是光互联在数据中心里最终落地的两种典型形态。这篇东西适合正在规划AI算力机房、搞网络硬件选型,或者纯粹想搞清楚下一代互连技术脉络的读者,我尽量把底层逻辑和工程取舍讲透。
1. 铜线先撞上物理极限:从DAC到AEC,能续多久是多久
1.1 速率翻倍,铜缆的距离腰斩
先看一个很直观的现象:SerDes速率每翻一倍,无源铜缆(DAC)能跑的距离就差不多腰斩一次。
25Gbps的NRZ时代,DAC在机房里跑5米很轻松,机房理线、走线都不是问题。到了56Gbps的PAM4阶段,无源铜缆的有效距离普遍缩到3米左右。等单通道进入112Gbps时,情况就很尴尬了,一根无源DAC能稳定跑2米的都算好的,很多商用线缆实际工程余量只剩下1到1.5米。往前再推一步,224G SerDes时代,业内普遍预期无源铜缆的有效距离会掉到1米以内——这基本等于把“跨机柜互联”这条路直接堵死了。
背后的物理原因说起来不复杂,就是高频损耗。高速信号在铜线里传输,主要损耗来自三块:趋肤效应、介电损耗和串扰。趋肤效应意味着频率越高,电流越往导体表面挤,等效电阻变大;介电损耗则和绝缘材料关系巨大,PVC、FR4这类常规材料的损耗正切在高频下大得吓人。PAM4调制本身又是用4个电平表达2个bit,电平之间的窗口比NRZ窄得多,对信噪比的要求更高。信号还没到对端,眼图就糊成一团,误码率自然压不住。
所以“铜线尽头”不是某个厂商拍脑袋宣布的,是高速链路预算算出来的结果。你去看那些AI服务器机柜内部,GPU之间动辄需要几百Gbps的互联,物理距离却常常要跨越5米以上,无源铜缆在这个距离下已经没有工程可行性了。
1.2 AEC/ACC本质是“急救”:用功耗换距离
有人会说,铜线不是还有有源方案吗?ACC和AEC不就是干这个的吗?
没错,ACC(有源铜缆)在链路两端加放大电路,AEC(有源电缆)更进一步加均衡甚至重定时,能把铜线的有效距离拉长到5到7米。听起来似乎可以续命,但要注意代价:每端都要额外耗电,一对AEC的功耗从几瓦到十几瓦不等,速率越高、距离越长,功耗涨得越凶。
这就像跑步的人跑不动了,在他前面装一台大功率鼓风机,确实能推着他多跑一段,但鼓风机本身也要耗电,而且风力加到头也有极限。到了112G/lane这个速率档,AEC内部的CDR、均衡器复杂度直线上升,功耗和延迟都在往不可接受的方向走。更麻烦的是,铜缆的结构决定了它又粗又重,一个48口的TOR交换机装满粗铜缆,前后面板挤得密不透风,散热和理线都是一场灾难。
所以我的看法是:AEC/ACC只是一个过渡急救方案,它可以帮现有架构多撑一阵子,但不可能撑到1.6T时代成为主流。
1.3 场景逼迫:机柜内5米的硬需求
真正让“铜线尽头”变成行业共识的,是AI集群的实际部署场景。你去看看今天主流的GPU服务器机和TOR交换机的位置关系:网络机柜和计算机柜往往隔着好几米的走线通道,服务器网口到TOR端口之间的物理链路大概率超过3米,跨机柜跳线就更多了,5到7米非常常见。
这个距离放在10G、25G时代完全没问题,但放到112G/lane甚至224G/lane的今天,无源铜缆直接出局,AEC也会很吃力。再加上机柜散热密度越来越高,铜缆的线径和重量进一步抬高部署成本。于是行业被迫往两个方向找出路:要么把光模块做得更高效省电,让可插拔光互联继续扛几年;要么干脆改造封装,让光引擎直接贴近交换芯片——这就是后文要展开的LPO与CPO。
2. 光互联的接力棒:可插拔光模块走过的这几步
2.1 从100G到1.6T,可插拔的黄金路线
光互联并不是今天才有的东西。数据中心从100G时代开始,可插拔光模块就走上了标准化、规模化的路线。QSFP、QSFP-DD、OSFP这些封装形态,加上DR、FR、LR这么一整套按距离划分的标准,让光模块变成了像内存条一样可以自由选配、即插即用的标准件。
演进脉络很清晰:100G时代是4路25G NRZ,400G时代是8路50G PAM4或者4路100G PAM4,800G时代基本定型为8路100G PAM4,而1.6T则走向8路200G PAM4,也就是常说的224G SerDes。
可插拔方案最大的优势是灵活和可维护。模块坏了直接拔下来换,不用动交换机主板;不同厂商的模块只要符合MSA(多源协议)标准就能互相兼容;供应链也成熟,硅光、DFB、EML、DSP方案互相竞争,价格被压得很快。过去这么多年,可插拔光模块一直是数据中心光互联的绝对主流。
2.2 可插拔到底卡在哪:功耗、面板、信号完整性
但到了800G、1.6T这个速率档,可插拔方案开始撞墙,撞的是三堵墙。
第一堵是功耗。800G光模块普遍要15到20瓦,1.6T带DSP的模块可以飙到25瓦以上。一个TOR交换机几十个端口,光模块功耗加起来甚至不输交换芯片本身。这些热量全都要在机柜里排掉,AI机柜本来就是高密度部署,散热压力大得可怕。
第二堵是面板空间。交换芯片的SerDes数量和前面板能塞下的光模块数量成反比。端口速率越高,模块越大,散热要求越高,前面板能放的端口数就越少。你算一下带宽密度就会发现,可插拔方案在1.6T之后基本不可能继续往上堆。
第三堵是信号完整性。交换芯片SerDes到前面板连接器之间,信号要走一段很长的PCB走线,经过过孔、连接器、线缆,每一步都在损耗信号。为了让设备正常工作,模块里必须放一颗功耗不低的DSP做重定时和均衡,把信号重新修一遍。可这个DSP功耗,恰恰是可插拔方案越来越难承受的核心负担。
2.3 为什么“把DSP塞进模块”这条路越来越难走
说到根子上,传统可插拔模块是把重定时功能放在模块内部,用一颗独立的DSP芯片来解决链路补偿问题。速率低的时候,DSP功耗和成本都还合理;速率一高,DSP功耗占了模块总功耗一半以上,成本也跟着翻倍。1.6T模块里那颗DSP的面积、功耗、发热,已经让整机设计非常痛苦。
于是行业出现了两条分化路线。一条是继续用可插拔形态,但不再往模块里塞DSP,把重定时的活儿交还给交换芯片——这就是LPO。另一条更激进,干脆把光引擎搬进交换芯片的封装里,用最短的电通道绕开PCB损耗——这就是CPO。两条路本质都是“把DSP的功能上移”,区别只是上移到哪里。
我个人的理解是:LPO是给可插拔光模块续命,CPO是底层重构。它们不是同一个物种,但解决的是同一个问题。
3. CPO:光引擎靠近交换芯片,短电路换低功耗
3.1 CPO到底改了什么东西
CPO,Co-Packaged Optics,共封装光学。字面意思就是把光引擎和交换芯片封装在同一个基板或者Interposer上,让光器件成为芯片封装的一部分。
传统架构里,交换芯片SerDes发出来的电信号要经过很长的PCB走线到达面板连接器,再进模块DSP做重定时,最后驱动光芯片发光。这条链路长、损耗大、功耗高。CPO架构里,交换芯片和光引擎之间只剩下一段毫米级的芯片内走线,几乎不损失信号。SerDes功耗可以降下来,驱动强度不用开那么大,均衡复杂度也不用那么高。
打个比方,传统方案像是你住在一个小区里,取快递得走到小区门口菜鸟驿站;CPO等于把快递柜搬到你楼道里,路程短了,来回跑消耗的体力自然就小了。这个“路程”缩短,正是CPO最大的功耗红利来源。
当然,CPO也有另外的设计选择,比如近封装光学(NPO),光引擎不直接跟交换芯片共封装在同一基板上,而是放在紧挨着的位置。NPO在封测难度上比CPO低一些,但能耗优势也相应打折。目前行业讨论热度最高的还是CPO。
3.2 外置光源与硅光引擎:CPO的典型架构
CPO的具体架构大致是这样的:一颗大尺寸交换芯片周围排布若干个光引擎,光引擎通常用硅光工艺实现,上面有调制器和探测器;真正发光的激光器一般不放进芯片封装里,而是用一颗外置光源(External Laser Source,业界常说的ELSFP)通过光纤把连续光送进光引擎,由光引擎里的调制器把数据调到光上再发送出去。
为什么要外置光源?因为激光器对温度极其敏感,而交换芯片封装内部的热密度太高,动不动就是几百瓦的散热压力。激光器塞进去,波长会漂、寿命会降,可靠性没法保证。所以业界普遍采用外置光源,让光引擎只负责调制和接收,不负责发光。
这也带来一个工程问题:光引擎要把外部光纤送进来的光耦合进硅光波导,耦合对准的工艺难度非常高,对封装精度、器件公差的要求远超传统光模块。这是CPO“封装优势”的另一面——封装优势有多大,封装难度就有多大。
3.3 工程难点不在光,在封装和热
很多没实际接触过CPO项目的朋友以为难点在光芯片本身,其实硅光调制器这些东西已经很成熟了。真正要命的是三件事。
第一是良率。一颗大尺寸交换芯片本身就很难造,现在还要把多个光引擎封装到同一基板上,哪怕其中一颗光引擎有问题,整个芯片封装单元可能就要报废。良率直接决定成本,这是CPO迟迟没法大规模落地的根本原因之一。
第二是热管理。光引擎对温度很敏感,温度变化会导致调制效率漂移、波长变化,进而影响链路稳定性。可交换芯片封装里的热点密度又极高,怎么在同一个封装里给“大火炉”和“精密仪器”分别做热管理,是一个非常考验封装设计能力的问题。
第三是可测试性与可维护性。传统可插拔光模块坏了就拔下来换,CPO的光引擎坏了怎么办?不能单独更换,只能连交换芯片一起处理。所以CPO系统需要在设计阶段就预留好测试接口、自检机制、甚至外部跳线面板,一旦某个光引擎失效还能用备用通道或者外部光模块接口顶上。可维护性下降,是CPO在商业落地中最大的隐性阻力。
3.4 落地节奏:厂商们已经到了哪一步
CPO并不是纸上谈兵。博通的Tomahawk系列已经有CPO版本在跟客户测试;Marvell、Ranovus、Ayar Labs这些公司在共封装光学上各有布局;英伟达的NVLink互联和Google的自研光交换系统,也在从不同角度推进光引擎和芯片的紧耦合。
不过要注意一个区别:宣传进度和实际规模交付是两回事。2024到2025年,CPO更多是行业头部客户的小范围验证,真正放量预计要到2026年以后。而且前期大概率首先出现在超大节点互联、Scale-up网络这类对功耗和带宽密度极其敏感的场景,而不是通用数据中心交换。
如果让我给一个预判:CPO会在AI超节点里先落地,再随着良率爬升逐步下沉到普通数据中心。这不是“能不能”的问题,而是“什么时候成本上算得过账”的问题。
4. LPO:不重定时,让交换芯片直接“开”光
4.1 LPO的“线性”是什么意思
LPO全称Linear Pluggable Optics,线性可插拔光学。很多人第一次听这名字会觉得绕,我先拆开解释。
传统可插拔光模块里有一颗DSP,负责把信号重新定时、重新均衡,修整好了再输出。LPO模块做的改动非常直接:把模块里的DSP拿掉,只保留线性驱动器和线性跨阻放大器(TIA),进来什么信号我线性放大,不做重定时。所以叫“线性”,本质上就是一颗透明功放。
但问题来了:没有DSP修信号,信号质量靠谁保证?答案是靠交换芯片自己的SerDes。现在的交换芯片DSP能力很强,可以承担更多均衡和时钟恢复任务,前提是模块得配合。所以LPO链路能否工作,高度依赖交换芯片和光模块的联合调优,不能再像传统模块那样“随便插哪个交换机都能用”。
这也是LPO被称为“把DSP上移”的原因。它在逻辑上跟CPO是同一个思路——把重定时功能从模块搬回主机侧,只不过LPO还保留着可插拔的外形和独立模块形态。
4.2 LPO能省多少功耗和成本
LPO最吸引人的就是功耗。800G模块如果去掉DSP,功耗可以直接从15到20瓦降到10瓦左右,某些短距离场景甚至可以更低。这个数字放在大规模AI集群里是非常惊人的:一台交换机几十个端口,一个机柜上百个端口,仅仅是把模块里的DSP拿掉,整机散热量就能肉眼可见地降一截。
成本上,LPO模块不再采购那颗昂贵的DSP芯片,BOM成本下降,模块价格理论上能比带DSP版本便宜一截。对于大规模部署的数据中心来说,这不只是省买模块的钱,还连带省电费、省散热、省PUE指标。
延迟同样有优势。传统模块里的CDR重定时会引入几十纳秒级别的延迟,LPO直接跳过这一环,对AI训练这类高度依赖低时延同步的应用,蚊子腿再小也是肉。
4.3 LPO的代价:系统级联调与距离折损
天下没有只赚不亏的买卖。LPO把所有重定时工作丢给主机侧SerDes,意味着它对链路余量的要求更高。
首先是距离折损。没有模块内DSP的补偿,LPO链路在长距离下很难维持良好的误码率。这就导致LPO最初的应用场景被牢牢限制在数据中心内部的短距互联,比如DR距离的500米范围,FR/MR的2公里级别就要打问号。长途、跨数据中心、DCI这些场景,还是得用带DSP的传统模块。
其次是系统级联调。LPO不是买来就能用的,光模块厂商和交换芯片厂商必须联合起来,针对特定主芯片的SerDes参数做调优,确认驱动电压、均衡系数、预加重这些参数匹配。如果你在一个旧平台上想换LPO模块,大概率会发现平台不支持或者效果不稳。这也是为什么LPO的信息发布往往都是“某某交换芯片配合某某光模块完成验证”的联合新闻。
最后是对链路清洁度要求极高。没有DSP修信号后,光纤连接器上一点灰尘导致的损耗劣化都会直接反映到误码率上。LPO部署对现场施工、跳线清洁、连接器质量的要求,明显比传统模块高一个档次。
4.4 半线性H-LPO:一个务实过渡的折中
LPO本身也不是铁板一块,业界很快就分化出“半线性”方案,也就是H-LPO或LRO(Linear Receive Optics)。简单说,发送端仍然用线性驱动,接收端保留一定的重定时或限幅放大能力;或者反过来,看哪边对系统影响更大。
半线性方案的出发点很务实:完全去掉DSP,链路预算太紧,很多客户不敢用;保留一颗功能没那么强的DSP或者只在接收端补偿,性能和功耗能找到一个更平衡的点。H-LPO在2025年后的关注度可能比纯LPO还高,因为它在不牺牲太多功耗优势的前提下,兼容性更友好,系统集成风险更低。
在我看来,纯LPO是理想方向,H-LPO是现实过渡。真正把功耗、成本、兼容性综合到最优解的,可能是“交换芯片侧DSP越来越强 + 模块侧越来越透明”这条渐进路线。
5. CPO和LPO不是非此即彼:一张表看清选型
5.1 六维对比:功耗、成本、成熟度、维护、生态、距离
这里把CPO和LPO放在一张表里看,一目了然。
| 维度 | LPO | CPO |
|---|---|---|
| 形态 | 可插拔光模块 | 光引擎与交换芯片共封装 |
| 功耗 | 比传统模块低,800G约10W级别 | 比LPO更低,路径最短、无模块DSP和连接器损耗 |
| 成本 | 模块BOM下降,但部署联调成本高 | 封装成本高,良率决定总成本 |
| 可维护性 | 好,模块可拔插更换 | 差,光引擎故障需整体处理 |
| 成熟度 | 2024-2025已有产业级验证 | 2025-2026头部客户小规模导入,放量尚早 |
| 适用场景 | 数据中心内部短距,兼容现有机房 | 超大节点Scale-up、高带宽密度场景 |
单看功耗和带宽密度,CPO毫无疑问是终极形态;单看部署灵活性和维护性,LPO明显更容易被现有运维体系接受。两者并不是同一个产品代际的竞争者,更像是“今年能用什么”和“三年后该准备什么”的问题。
5.2 谁在推LPO,谁在推CPO
从产业链位置也能看出两条路线的推力差异。
LPO的推手主要是光模块厂商和交换芯片厂商的联合。光模块厂想做差异化,交换芯片厂商想强调自家SerDes能力;集成商则看到LPO能继续沿用现有可插拔面板、现有运维流程,转型成本低。LPO更像是在不颠覆当前系统架构的前提下,把性能空间再榨一榨。
CPO的推手逻辑完全不同。最先受益的是交换芯片厂商和封装厂,因为CPO把价值从“光模块”往“芯片封装”转移。硅光引擎厂商、先进封装供应链、基板Interposer厂商都会因此获得更大的话语权。CPO与其说是光模块演进,不如说是一次芯片封装级别的产业重构,这也是为什么CPO的新闻总是伴随大厂自研芯片出现。
5.3 给不同规模数据中心的落地建议
结合我自己的工程经验,给三类读者一点建议。
如果你是在运营一个已投产的数据中心,现有交换平台已经确定,想低风险降低功耗,请优先评估LPO或H-LPO。前提是先确认当前交换芯片SerDes是否支持线性直驱、是否与候选模块完成过联调认证。不要为了省功耗把链路稳定性也搭进去。
如果你是在新建AI超节点或对带宽密度极其敏感的训练集群,功耗和空间收益远大于维护性成本,那么可以把CPO列入技术选型,但最好要求设备商同时保留可插拔光口或NPO方案作为降级路径。备好跳线面板、外部光源冗余,不要把所有鸡蛋放在共封装这一个篮子里。
如果你还在观望,我的建议很朴素:不管是LPO还是CPO,都建议先在机房做小规模链路验证,跑真实流量,测误码率、功耗、温度。厂商PPT里的数字再好看,都不如在自己机柜里测三天数据来得踏实。
6. 铜线尽头之后:互连趋势对算力架构的深层影响
6.1 “铜线尽头”的真正含义:电只在最短距离内工作
“铜线尽头”并不意味着铜从数据中心的物理世界里消失。芯片内部晶体管之间的互连、封装基板上的走线、芯片与芯片之间的极短距离互连,这些都是铜的天下,未来也不会变。
真正的变化是:电信号的有效工作范围被压缩到毫米级和厘米级,凡是超过几十厘米的物理链路,都要让位给光。CPU、GPU、HBM这些芯片内部和邻近互连继续用电,但机柜内、机柜间、集群间的数据搬运交给光互联。换句话说,电负责“算”,光负责“连”,这个分工会在下一代架构里越来越清晰。
所以“尽头”说的是铜线的应用边界,不是铜材料本身。高速SerDes从50G到112G再到224G,铜线在其中的角色越来越像一个“短跑运动员”,只能负责最后几米,长距离交付统统由光来干。
6.2 Scale-up与Scale-out:光互联决定AI集群的天花板
AI集群的网络可以粗分为两类:一类是Scale-up网络,也就是GPU和GPU之间的超高速互联,典型就是NVLink域或者类似的超节点互联;另一类是Scale-out网络,也就是把几千上万台服务器连成训练集群的以太网/RoCE后端网络。
Scale-up网络的特点是距离短、带宽极其夸张,但对延迟和功耗极度敏感。这个场景对CPO最友好,因为光引擎贴近交换芯片,能以更低功耗提供极高带宽密度。英伟达、博通在超节点里推动CPO,本质就是因为铜线在超节点内已经彻底不够用,而传统可插拔光模块又占空间、耗电、延迟偏高。
Scale-out网络的特点是节点规模大,链路数量多到惊人。一台GPU服务器配两张400G网卡,一个万卡集群光模块数量就是几万只。这里的痛点不是单链路极限功耗,而是总量功耗、维护便利性和成本。LPO/H-LPO在这个场景里更有现实意义,因为它可以用可接受的代价消化掉数万条高速光链路。
从这个角度看,CPO和LPO并不是二选一,而是分别服务两类不同架构、不同距离、不同运维诉求。未来的大型AI数据中心很可能是“Scale-up用CPO、Scale-out用LPO/传统模块”的混合形态。
6.3 从我自己的经验谈:关注链路预算,而不是追新
最后聊点个人体会。很多朋友看到CPO、LPO的热度,第一反应是“我是不是落伍了”。其实不用焦虑。我做互连验证这些年最大的心得就是:无论技术形态怎么变,链路预算永远是第一关。
LPO能不能跑,看的是交换芯片SerDes能力和模块线性度的匹配,距离、插损、回损都要一点点算;CPO能不能用,看的是热管理和良率,也不是光泡在PPT里的“封装优势”能解决的。选型之前,先把自己的场景拉清楚:端口数、距离、功耗预算、可维护性要求、设备生命周期。技术是为场景服务的,不是为了热搜服务的。
如果非要说有什么实际动作值得做,我建议两条:一是把机房里那台BER测试仪和眼图仪用好,任何新模块新链路都先做一轮完整测试再上线;二是把光纤清洁提到和服务器除尘一样高的优先级,LPO和CPO时代,链路对灰尘的容忍度只会更低。把这两件事做到位,哪怕你今天还在用传统可插拔光模块,明天切LPO甚至CPO的时候,踩坑的概率也会小很多。