☰
单通道200Gbps:PAM4、SerDes与信号完整性的工程极限挑战
2026/10/10 14:10:47 网站建设 项目流程

第一次看到200Gbps这个目标时,我的第一反应是:单条信道跑到200G,这不是在挑战协议,这是在挑战物理定律。前几年我们还在112Gbps的SerDes上反复调整均衡参数、和收发端的预加重较劲,转眼间产业界已经把目光锁死在单通道200G这条赛道上。作为常年泡在信号完整性仿真、高速背板调试和光模块测试里的人,我想把通往200G这条路的技术逻辑完整拆一遍——不是复述PPT上的漂亮话,而是把这些数字背后的物理根源、信号链路上的每一处妥协,以及业界正在铺开的出路,按我做项目时的思考顺序讲清楚。

这篇内容适合正在做高速互连设计、系统硬件架构,或者刚想进入SerDes领域但被一堆术语劝退的人。我的目标很简单:让看完的人不仅知道"200G很难",还能说清楚"难在哪里、为什么难、有哪些解、下一步往哪走"。

1. 200Gbps到底意味着什么:先感受一下5皮秒的恐怖

1.1 一个比特的生命周期只有5皮秒

先做一道简单的算术题。200Gbps串行链路,意味着每秒要传2×10¹¹个比特,折算下来每个比特占据的时间宽度只有5皮秒。5皮秒是什么概念?光在真空里1纳秒约走30厘米,5皮秒光只能走1.5毫米。换句话说,当最后一个比特还在发射端的封装基板上没来得及走完,下一个比特已经被"挤"进了通道。

这个数字在通信系统里还有一个更直接的等价换算:如果采用PAM4调制,也就是一个符号携带2个比特,那么符号率就是100GBaud,奈奎斯特频率达到50GHz;如果还在用NRZ,那就得跑到200GBaud,奈奎斯特频率直接冲到100GHz。

我把几代主流速率放到一张表里对比,感受会更直观:

通道速率调制方式符号率单位间隔奈奎斯特频率
25GbpsNRZ25GBaud40ps12.5GHz
56GbpsPAM428GBaud35.7ps14GHz
112GbpsPAM456GBaud17.8ps28GHz
200GbpsPAM4100GBaud10ps50GHz
224GbpsPAM4112GBaud8.9ps56GHz

很多人会把"200G链路"和"800G光模块"混在一起。目前800G模块常见的是8×100G或4×200G的架构,后者意味着单通道200G的光信号已经进入量产视野。我现在讨论的是"单通道承载200G"这个层面,不管它跑在背板的电接口上,还是光模块的光接口上,核心矛盾都是一样的——信号必须在一个极其苛刻的时间窗口和电压窗口里被正确识别。

1.2 物理尺度上的"宏观世界"正在失去意义

单位间隔缩短到10ps之后,一个最直观的变化是:传统的集总参数模型开始失效,信号完整性问题彻底变成了电磁场问题。

举个直观例子。50GHz奈奎斯特频率对应的自由空间波长约6毫米,在PCB板材里的有效波长还要再打个对折,大概3毫米左右。这意味着一小段过孔残桩、一个连接器的引脚、甚至一段没走好的布线拐角,其物理尺寸已经接近或超过信号波长的十分之一。在这个尺度下,任何结构都可能是谐振器、辐射体或反射源。你不能再把一段走线当成"理想的导线",它本质上是一条带有分布电感和分布电容的传输结构,任何几何突变都是阻抗边界。

我记得第一次给200G链路做链路预算时,仿真软件里连一根过孔的等效电路都复杂得让人头皮发麻,更别提旁边还有几十根平行走线的串扰耦合。用一句话总结这种状态:以前我们调的是电路的参数,现在调的是电磁场的边界条件。

2. 信道对信号做了什么:损耗、串扰与反射的三重绞杀

2.1 每毫米1分贝的"吃信号怪兽"

信号在PCB走线上传播,最直观的敌人是损耗。损耗的来源主要有三块:

  • 趋肤效应损耗:高频电流只分布在导体表面很薄的一层,有效截面积变小,电阻急剧增大。损耗随频率的平方根增长。
  • 介质损耗:电磁波在介质里反复极化,能量以热的形式耗散。损耗随频率近似线性增长,在高频段会成为绝对主导项。
  • 导体表面粗糙度损耗:铜箔表面的微观凹凸在高频下会增加有效路径长度,产生额外散射和损耗。

在50GHz这个频段,普通FR4板材的损耗已经惨不忍睹。一条普通的10英寸走线,总插入损耗可能高达30dB甚至更高,这意味着信号幅度在到达接收端时只剩原来的3%左右。而低损耗高速板材可以把同样长度的损耗压到10dB以内,代价是成本成倍上升和加工工艺更苛刻。

我用一个"开车穿浓雾"的类比来解释:NRZ时代相当于在薄雾里开60迈,还能看清路;200G的PAM4相当于在浓雾里开300迈,不仅看不清路,车本身还在抖。你必须同时修路(换成低损耗材料)、换车(优化收发端)和加装雷达(均衡和纠错),才有一丝可能安全到达终点。

2.2 串扰:旁边的信号就是你最大的噪声源

串扰分为近端串扰和远端串扰。近端串扰的幅度与攻击信号的上升沿时间密切相关,上升沿越陡,耦合进受害线的能量越大;远端串扰则与耦合长度和介质的非均匀性有关。在200G链路里,单位间隔只有10ps,信号上升沿本身就压到几皮秒量级,这意味着时域上的能量极其集中,串扰一旦发生,往往直接打在眼图张开最关键的时间窗口上。

串扰还有一层更隐蔽的麻烦:它不像热噪声那样是白噪声,它有明确的数据相关性,和受害信号本身存在复杂的相位关系。均衡器可以在一定程度内抑制线性串扰,但非线性串扰源、电源噪声与串扰的混合体往往会让自适应算法陷入混乱。我在调试一块背板时遇到过一种现象:单通道测试眼图干干净净,一旦周围高速通道全部开启,接收端误码率立刻飙升两个数量级。最后用近场探头逐一排查,发现是两个连接器引脚之间的耦合通过电源平面串进来的,这种问题的定位成本远比增加均衡抽头要高。

2.3 反射与阻抗不连续:每一处"台阶"都在消耗信号

反射的根源是阻抗不连续。连接器、过孔、封装引线、走线换层、焊盘,全都是潜在的反射点。在低频段,这些反射点产生的回波会很快衰减,对信号影响有限;但到了50GHz,反射波的延迟可能与主信号的部分频谱分量相干叠加,形成带内纹波,直接抬高误码率。

这里有一个特别容易被低估的环节:过孔残桩。四层板里一个普通的通孔,从顶层走到底层,中间如果还有一段没被利用的竖井,这段残桩在高频下等效为一个开路短截线,会在某个频率上形成强烈的谐振吸收。解决方案是背钻,把残桩钻掉。但背钻也有精度问题,钻深了会伤到有效走线,钻浅了残桩还在。200G时代对背钻深度的容忍度,在我看来基本是±50微米级别,已经非常接近普通PCB工厂的工艺极限。

3. 调制格式的残酷算术:为什么PAM4是必经之路

3.1 用信噪比换带宽,这笔账怎么算

既然铜线里的损耗随频率飙涨,最直接的破解思路就是降低符号率,让信号在更低的频段里传输。这就是PAM4存在的根本理由:一个符号携带2比特,同样的200Gbps,符号率从200GBaud降到100GBaud,奈奎斯特频率从100GHz降到50GHz,信道压力一下减少了约一半。

但天底下没有免费的午餐。N个电平的PAM调制,在相同峰值功率约束下,相邻电平之间的电压间隔会随电平数增加而急剧缩小。PAM4只有四电平,和NRZ相比,眼高理论值只有NRZ的三分之一,等效信噪比大约损失9.5dB。这9.5dB是极其昂贵的预算,几乎要动用从发射端预加重到接收端判决反馈再到FEC纠错的所有手段才能补回来。

我把几种调制方式的特征对比列在下面:

调制方式每符号比特数200Gbps所需符号率奈奎斯特频率相对SNR代价实际应用状态
NRZ1200GBaud100GHz基准单通道200G不现实
PAM42100GBaud50GHz约-9.5dB当前主流
PAM6约2.5877.5GBaud38.75GHz约-13dB以上研究阶段
相干QAM16450GBaud25GHz与实现相关长距/相干光通信

有意思的是,PAM6在理论上能用更低的符号率换更高的频谱效率,但电平数增加带来的信噪比代价和接收机复杂度增长,包括线性度、时钟恢复难度都直线上升,目前还没有什么商用方案敢在200G单通道上押注它。业界更实际的路线是在100GBaud附近把PAM4做到极致,再往224G方向做微小扩展。

3.2 PAM4眼图里的"三只眼睛",每一只都有自己的脾气

NRZ只有一个眼,PAM4却有上、中、下三个垂直堆叠的眼。这三个眼高并不相等,中间眼往往比上下两个眼更容易受共模噪声和线性度的影响。发射端驱动器的非线性、接收端放大器的饱和特性,会导致不同电平之间的间隔不均匀,也就是所谓的"眼图倾斜"和"非线性失真"。

这种非线性不是简单加一个均衡器就能拉平的。我在实验室见过一个典型的案例:用高精度采样示波器测发射端PAM4眼图时,上眼开口挺漂亮,下眼却糊成一片,明显是驱动级在低电平区域出现了非线性塌陷。后来发现是驱动电路的输出级偏置点没调好,供电电压的纹波又灌进来一部分。这类问题很难靠模型预测,基本要靠实测量产样品来迭代。

PAM4还给时钟恢复带来了额外负担。NRZ过零检测点非常清晰,时钟恢复电路可以从边沿提取出稳定的参考时钟;PAM4则没有单一过零点,三个眼对应的跳变位置混在一起,提取出的时钟边沿抖动天然更大。为了压住抖动,CDR的环路带宽设计要极其小心,既要跟得上温漂和电源噪声引起的频偏,又不能把数据里的随机抖动放大追进去。

4. 链路里的"补救系统":均衡、时钟恢复与FEC如何拧成一股绳

4.1 发射端和接收端各干一半的脏活

面对严重损耗和码间干扰,信号不可能靠裸传到达接收端。现代SerDes会在发射端做FFE预加重,把高频分量先抬起来,让它在信道里衰减之后正好被拉平;接收端则用CTLE做连续时间线性均衡,再把剩余的高频补偿交给DFE的反馈抽头逐比特纠正码间干扰。

DFE的原理通俗讲就是:在判决完当前这个比特之后,把前面若干比特对当前比特造成的干扰量估计出来,然后减掉它。这套机制在NRZ时代非常成熟,但在PAM4时代变得格外棘手,因为DFE的反馈信号本身是四电平的,判决器的阈值变成了三个,任何一个阈值上的误判都会污染后续比特的补偿值,产生错误传播。

我一般在调试200G链路时,会按这个顺序看指标:

  • 先量发射端的预加重波形,确定FFE系数没有把信号顶到非线性区;
  • 再量接收端的CTLE输出眼图,看剩余ISI的主导分量是什么;
  • 打开DFE之后观察误码率是否收敛,若误码率不降反升,多半是首抽头补偿方向反了或抽头精度不够;
  • 最后才是FEC上场,用带内误码统计来判断物理层是否已经逼近极限。
4.2 FEC不是万能药,但它是最后的守门员

前向纠错在200G链路里的地位,已经从"可选优化"上升为"强制标配"。因为物理信道的原始误码率可能已经到1e-4甚至1e-6量级,没有FEC,链路就等于残废。主流方案是KP4类RS-FEC,能够把误码率压到1e-15以下。

但FEC有好几笔隐形成本:

  • 延迟:编解码处理需要时间,对于要求低时延的计算集群互连来说,这是一笔不能忽略的开销。
  • 带宽开销:纠错校验码本身就占用通道带宽,实际的"有效数据率"会打个折扣。
  • 突发错误容忍度:RS-FEC对抗随机错误很在行,但遇到连续的长突发错误,比如DSP内部时钟抖动导致的一串误码,纠错能力会迅速击穿。

我见过不止一次这样的情况:设计人员看到FEC有纠错能力,就放松了对物理层抖动的要求,结果在实测中一旦遇到突发噪声,FEC纠正不过来,整条链路直接瘫痪。正确的姿势是把FEC当成最后一道保险,而不是用它来兜底恶劣的物理设计。

4.3 一个典型的200G链路预算框架

下面给一个简化但贴近实际的链路预算思路:

链路环节预算值说明
发射端输出幅度约-2dBV(折合摆幅)受功耗和线性度约束
PCB与连接器总插入损耗15~30dB取决于板材、长度、连接器数量
接收端灵敏度-10dBV以下含噪声、串扰、均衡后的等效能力
串扰与噪声余量3~6dB预留制造公差和温度漂移
FEC编码增益3~6dB取决于码率和纠错能力
最终链路余量0.5~2dB低于0.5dB几乎无法量产

这个表的大逻辑是:从发射端幅度里减去信道损耗,看剩下多少到接收端;再考虑串扰噪声的占用,看还能不能留出正余量;最后用FEC的编码增益把"物理余量"换回"纠错余量"。实践中,任何一个环节的估算偏差超过2dB,整个链路就要从头再来一遍。

5. 真正量产时才会懂的坑:材料、工艺、电源与散热

5.1 PCB材料的选择不是"越贵越好"

一旦进入200G设计,PCB选材几乎被锁死在超低损耗等级。这里我强调一个概念:介质损耗角正切值Df,直接决定介质损耗的大小。高速板材的Df可以做到0.002左右甚至更低,而普通FR4的Df在0.02量级,差了整整一个数量级。

但"低损耗板材"也有代价:

  • 成本极高,通常比普通板材贵数倍;
  • 机械性能更脆,钻孔和压合工艺要求更高;
  • 介电常数随温湿度变化的稳定性需要额外评估;
  • 不同批次间的Dk漂移可能导致阻抗一致性变差。

我在选型时不会只看Df越低越好,而是先做一张"全链路衰减曲线对比图",把几款候选板材在10GHz到60GHz范围内的插损S参数拉出来,再看它们的Dk温度系数和加工可行性,最后才定方案。有人在群里问过一个问题:既然200G这么难,干脆全部走光互连算了。我的回答是:光互连的终点也要经过电域转换,在很短的距离内还是会有电信号传输问题,芯片封装里、基板上、连接器到光引擎之间的那段电通道,同样要面对这些困难。

5.2 过孔、连接器与制造容差:每一件小事都是大事

200G链路的过孔设计已经精细到"每一种过孔都要做单独仿真"的程度。背钻、盘上过孔、返回地过孔的数量和位置,都会在50GHz频点上制造或宽或窄的谐振凹陷。我习惯把过孔的等效模型单独提取出来,放进整个链路里跑时域反射计仿真,确认反射系数在工作频段内低于某个阈值。

连接器是另一个隐形杀手。200G背板连接器的设计要求远远不止于"能插上、接触好",引脚的电感、相邻引脚间的耦合长度、屏蔽片的完整性,全部需要纳入三维电磁场仿真。连接器厂商给的插损曲线通常是在理想条件下测的,到了实际系统的过孔、压接和毛刺偏差叠加后,性能可能掉下去2~3dB,这几乎是致命的。

再谈制造公差。200G量产最让人头疼的是工艺漂移。蚀刻线宽偏差、介质厚度偏差、铜箔粗糙度差异都会叠加到链路损耗上。仿真里的"典型值"在产线上只能当作中位数,真正决定良率的是最差边界。所以我在设计审查时一定会要求查看材料的规格上下限,而不是盯着标称值。

5.3 电源完整性:200G链路真正的主宰者

很多人理解高速链路只盯着信号,却忘了电源噪声会直接调制到信号的幅度和时间上。200G接收端的电压窗口已经缩小到几十毫伏级别,电源纹波哪怕只有几毫伏,也可能在判决阈值附近产生无法容忍的抖动。

200G SerDes的功耗密度也在快速爬升。单通道的功耗从几毫瓦到几十毫瓦的增幅看似不大,但几百条通道叠加起来,芯片局部功耗轻松破百瓦。这时候,散热设计和信号完整性开始打架:为了散热要加铜箔、加散热过孔,但这些结构会给信号路径提供额外的寄生耦合通道。我在一次布局中为了一条关键走线,不得不牺牲一整个区域的散热过孔阵列,然后用热仿真确认芯片结温还在安全范围之内。这种"信号让位给热"和"热让位给信号"的反复拉锯,将来会越来越常见。

6. 从200G望向更远:224G、光电融合和架构重心的迁移

6.1 224G不是200G的简单升级

业界已经在定义下一代单通道224G的互连规范,核心思路还是PAM4,只不过把符号率顶到112GBaud以上。这意味着奈奎斯特频率进一步抬高到56GHz左右,信道损耗和串扰的挑战更上一层楼。

为了在224G上拿到可用的链路余量,行业正在三个方向上做文章:

  • 更先进的DSP算法:更高阶的均衡、更强的自适应能力、更精准的CDR架构;
  • 更高增益且更低时延的FEC:把纠错能力再往上推,同时控制住延迟;
  • 更靠近信号源的模拟前端:把重定时器、均衡器和光驱动电路尽量集成在封装内,减少外部路径。

有人提出"线性直驱可插拔光模块"路线,简单说就是去掉光模块里的DSP重定时芯片,用主机SerDes直接驱动光发射器。这条路能省下一大笔功耗和成本,但前提是主机端DSP能同时兼顾电信号均衡和光信号补偿。它本质上把原来分发在模块里的补偿能力全部集中到了主机芯片上,对系统设计的要求更集中也更苛刻。

6.2 共封装光与"以光代铜"的真实边界

共封装光是把光引擎和交换芯片封装在同一个基板上,大幅缩短电信号在PCB上走行的距离,把最难的信号完整性挑战限制在极小范围内。这个思路在功耗和密度上确实诱人,但它把"光模块可插拔"的灵活性也牺牲掉了,维护、升级和散热都变成整机层面的问题。

从我的角度看,未来几年既不会是"全光",也不会是"全铜",而是形成一种清晰的分层:

传输距离介质主流形式
芯片内/封装内电:极短走线、密集互连基板级SerDes、近封装光学
板内几厘米到几十厘米电:低损耗PCB+重定时器背板、线缆束
机架内、跨机柜光:可插拔模块/有源光缆800G、1.6T可插拔光模块
跨数据中心、长距光:相干DSP相干光模块、波分系统

这张表说明:电和光不是谁取代谁的竞争关系,而是在不同距离尺度上各自承担最合适的角色。200G这条线恰好处在电光交接最密集的交叉区,所以从事这个方向的人必须同时理解电域和光域。

6.3 对工程师技能树的影响

200G链路把过去分得很细的岗位重新焊到了一起。以前做数字逻辑的人不太关心模拟前端,做SI仿真的人不一定要懂DSP算法,但到了这个速率,链路性能是由均衡算法、信道特性、电源完整性和散热边界共同决定的。我看到越来越多的高校课程和行业培训,开始把"高速互连"当成一个横跨电磁场、半导体工艺、通信算法的综合方向来讲。

我也在为自己未来的学习路径做调整。以前主要精力放在S参数提取和时域仿真上,现在开始补数字信号处理里的自适应均衡和FEC算法细节,另外还在学习光模块里的驱动与接收架构。单靠某一门绝技,在200G之后会越来越不够用。

最后再分享一个很实际的建议:如果你想真正理解200G链路,不要只盯着仿真软件,一定要去找一块真实的测试板,把眼图、抖动、误码率这些指标亲手量一遍。仿真能帮你理解趋势,但只有实测能让你记住每一个设计决策背后的代价。等你亲手调过一次DFE抽头,看着误码率从爆表慢慢收敛下来,你对"200G到底有多难"的理解,会超过读十本书。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询