☰
112G/224G SerDes中CTLE为何不再需要背景自适应?
2026/9/30 5:15:00 网站建设 项目流程

如果你做过112G/224G SerDes接收链路的设计或调试,多半会碰到一个很反直觉的现象:老一代10G/25G串行链路里,CTLE(连续时间线性均衡器)背后通常都会跟一个自适应环路,实时调boost;可到了56GBaud甚至112GBaud的PAM4时代,大量商用方案却把CTLE做成“训练时扫档、跑起来固定”,有些DSP甚至连后台自适应使能位都默认关掉。为什么速率越高,越不需要CTLE做背景自适应?

这篇文章我就把背后的工程逻辑拆开讲清楚。我会先讲CTLE和背景自适应在低速链路上的经典实现,再分析112G/224G系统中均衡任务的变化,然后给出四个核心原因,最后聊一聊实际项目中怎么评估“要不要给CTLE留后台更新”。如果你正在做高速互连、SerDes调测、DSP均衡策略选型,或者只是对“固定CTLE”这种设计有疑问,这篇应该能帮你省不少踩坑时间。

1. 问题的本质:为什么112G/224G系统提出“无背景自适应”

1.1 从传统低速链路的习惯说起

先回到低速时代。所谓背景自适应,指的是接收机在正常传输数据的同时,持续根据接收信号的特征去微调均衡器参数,而不是只在初始阶段做一次校准。经典做法有两类:一类是频谱能量检测,把接收信号分成高频、低频两路分别积分,比较能量比值之后反馈控制CTLE峰值增益;另一类是基于判决误差的LMS类算法,用数据判决结果和期望电平之间的误差量去迭代滤波器系数。

在10G/25G NRZ时代,这种后台追踪很有必要。电缆被拖拽、连接器氧化、机房温度昼夜波动,都会让信道损耗实时变化个几dB,而那时的接收机结构相对简单,DFE抽头数量有限,CTLE算得上均衡主力。如果CTLE不跟着信道状态走,眼图裕量就会被吃掉一大块。低速时这个自适应环路的带宽能做到几十kHz量级,模拟实现也不复杂,一个比较器加一对电荷泵就能干活,成本和可靠性都说得过去,所以大家习惯了有自适应。

1.2 高速系统的均衡任务被重新分配

到了112G/224G时代,情况完全不同。先明确一个基础概念:112G PAM4对应的符号率是56GBaud,224G PAM4是112GBaud,换句话说,信号带宽要覆盖到28~30GHz乃至55~60GHz。这个频率下,即使是一段不到半米的PCB走线,也能轻松吃掉20~30dB的高频分量,长背板通道损耗到40dB以上并不稀奇。一台单独的CTLE就算在模拟域把高频提升拉满,也不可能把这样深的信道坑填平,否则噪声放大和群延时失真早就让电路崩掉了。

所以高速接收链路的均衡必须分层拆解:CTLE只负责大尺度的斜坡补偿,ADC后面的DSP负责精确的波形重建,DFE负责追踪残存ISI,FEC再兜底。CTLE的目标不再是“精确贴合信道每一个变化”,而是保证进入ADC/DSP的信号幅度和频谱落在理想区间。均衡角色变了,后台连续自适应的必要性自然就没了。我用一个直白的类比:低速系统里CTLE是主唱,必须实时调话筒;高速系统里它是贝斯手,提供一个稳定基调,真正精细的即兴处理全部交给后面的数字DSP。

2. 深挖背后的四个核心原因

2.1 PAM4的SNR预算经不起折腾,怕的反而是“乱跟踪”

PAM4调制的四个电平把发射摆幅分成三个眼,相对于等幅NRZ,每个电平间隔只剩原来的三分之一,等价于有效SNR直接下降约9.5dB。这意味着接收机本身的裕量非常紧张,任何均衡参数的过度波动都会直接影响误码率。

如果CTLE在后台持续爬升或降低boost,输出信号的高频分量会跟着起伏,眼图的垂直方向和水平方向都会出现“呼吸感”。呼吸感还不是最致命的,真正麻烦的是CTLE的高频提升在放大信号的同时也放大了噪声。低速系统里一两个dB的估计误差可能只是让BER从1e-15变到1e-14,同样误差在PAM4系统里完全可能让纠前BER从1e-4变成1e-3,直接击穿RS-FEC的纠错门限。所以很多芯片把CTLE设计成离散档位,boost以0.5dB或1dB为步进,就是为了让结果变得可预测、可重复。宁可让CTLE偶尔补偿不到位,也不能让它“乱动”引入随时变化的噪声增量。

2.2 模拟域自适应环路的固有代价:面积、功耗和环路耦合

要真正实现CTLE后台自适应,必须把接收信号分出一路做频谱检测或者误差检测,再把反馈结果送回CTLE的偏置电路或电容阵列。这套反馈链路在56GBaud符号率下需要有足够检测带宽,检测器寄生电容、比较器延迟、控制环路相位裕度,每一样都要重新设计。结果就是为了一个“可能用得到”的功能,模拟前端要增加一堆晶体管和走线,而这些额外结构会让最高频敏感路径的布线难度直线上升。

更大的坑在于环路耦合。一个112G/224G接收链里通常已经有AGC增益环路、CDR相位环路、DFE自适应环路。如果再叠一个CTLE调节环路,四个环路在有限的带宽内容易互相干扰,出现低频振荡或更新不同步。我遇到过很典型的现场:开了测试用的CTLE后台自适应后,误码率呈现低频毛刺,抓眼图又看不出明显塌陷,最后定位到是自适应更新节拍和CDR环路形成了差拍。工业界逐步把CTLE后台环砍掉,把面积和功耗留给数字域功能,这个选择本质上是在规避多环耦合风险。

2.3 高速系统的信道时变特性,反而比想象中稳定

背景自适应存在的意义是应对“信道时变”。低速链路常见的场景是长线缆被拖拽、连接器插拔、设备热插拔,这些都会让信道响应发生突变。但在112G/224G系统里,通道主要是板内PCB走线、背板、连接器或直接附着的电缆组件,正常工作时几乎没有机械形态变化。温度变化是相对慢的过程,时间常数通常达到分钟甚至小时级别,而且往往是整板一起温漂,不是某一个频点突然跳变几dB。

对于这种慢漂移,链路训练阶段完成一次校准,之后靠DFE慢速更新和FEC兜底,完全够用。即使温度让信道损耗偏了一两dB,DFE有额外的系数余量去跟踪,FEC还能容忍纠前误码率到1e-4左右。真的漂移到FEC都兜不住时,也可以通过SER监制触发链路重新训练。对照下来,CTLE后台自适应等于用一个高功耗、高耦合风险的机制,去跟踪一个演化得很慢的问题,性价比很低。

2.4 链路训练已经替后台完成了“自适应”

有一件事很多人容易忽略:IEEE针对高速电气接口的规范普遍支持链路训练。802.3bs面向100GE/200GE/400GE,802.3ck面向100G/200G/400G每lane 100G甚至200G,链路训练期间接收端可以主动反馈系数调整建议,发送端FFE和接收端均衡一起收敛到一组较优参数。训练完成后,发送FFE、CTLE、VGA、DFE全部锁定在寄存器里。此时链路不是没有自适应,而是把“自适应”从事中挪到了初始化和重训练阶段。

这种前台校准模式还有额外的工程可测试性:寄存器能直接读出每一档CTLE值,软件可以手动改写,工程师在一致性测试和互操作验证时能复现同一套配置。如果真采用全后台自适应,每次测试时参数都不可控,同样一条链路跑两遍可能得到两套结果,这会严重妨碍故障定位和认证测试。所以“训练定档+运行冻结”不是技术倒退,而是通盘优化的结果。

3. 工程上如何落地:CTLE“训练定档”与其余均衡的配合

3.1 典型112G/224G接收链架构

我按常见DSP接收机架构列一下关键链路:线性放大器、CTLE、VGA、高速ADC、数字FFE、DFE、CDR、FEC。CTLE位于ADC之前,它的输出幅度直接决定ADC动态范围的使用效率。芯片寄存器里通常有类似CTLE_BOOST[3:0]、CTLE_POLE[2:0]之类的字段,这就是设计留给训练算法的控制对象。

这里还要提一个ADC量化位宽的问题。112G PAM4接收机的ADC分辨率往往只有6bit左右,量化误差相当可观。如果CTLE没有把信号频谱修好,ADC的有效位数会继续浪费,后续DSP再强也弥补不了前端的量化损失。所以CTLE“定档训练”本质上是帮ADC确定一个最优工作区间,让ADC的有限精度花在刀刃上。

3.2 一次完整的“训练定档”流程怎么走

具体到项目实现,流程可以这样理解:

  1. 进入链路训练模式,发送端发送训练序列,接收端把CTLE放在一个默认中等档位。
  2. 接收端统计信号功率和噪声基底,估算当前信道在奈奎斯特频率附近的损耗,快速粗选一个boost值。
  3. 利用内置眼图监视器或者误码计数,在粗选档位附近遍历两三个boost值,找出眼高、眼宽最均衡且DFE系数不极端的组合。
  4. 把CTLE档位、VGA增益、DFE初始系数一起锁定到寄存器。
  5. 正常数据传输阶段只靠DFE做符号级后台更新;FEC和SER监控作为慢速守门员。
  6. SER接近阈值时,先尝试微调DFE;无效则触发重新训练,重走扫档流程。

注意第5步里的DFE后台更新和传统CTLE背景自适应完全是两码事。DFE是数字实现,更新环路简单可控,功耗低,而且只影响前馈波形重建的尾拖部分,不会像CTLE那样大范围改变前端频响。

3.3 DFE为什么更适合承担后台慢速更新

DFE的自适应本质是数字误差驱动,直接用判决误差做梯度下降。它可以做到逐符号更新,也可以降速到几十kHz做慢循环,实现代价是若干乘加器和状态寄存器。更重要的是,DFE系数更新不会改变前端模拟滤波器的带宽和群延时,不会给CDR带来额外相位干扰。所以在现代高速链路里,时变残余主要由DFE接管,不是由CTLE接管。

实际调试时有一个很好用的判断信号:如果DFE第一抽头系数常年贴着设定上限跑,说明前端补偿明显不足,CTLE档位偏低。这时候把CTLE提一档可能比继续抬DFE更合理。反过来说,如果CTLE一调档DFE系数就大幅波动,说明训练定档时没有给DFE留好配合空间。

3.4 FEC、重训练和其它兜底手段

400G/800G系统普遍配备RS-FEC,比如RS(544,514)的KP4。以它能容忍的纠前BER约1e-4、纠后BER 1e-15为例,链路均衡的目标从来就不是“零误码”,而是“保证误码率低于FEC纠错门限”。这个余量设计恰好让CTLE不必紧盯着微小偏差,因为残留的码间干扰可以交给FEC纠正。

当链路真的因为温度冲击、器件老化跑偏太多,接收机还会根据SER监测自动触发链路重训练。一次重训练也就是几十微秒到几百微秒的事,走完“扫档—锁定—恢复”流程后链路性能就回来了。把这套组合拳打出来,CTLE后台连续自适应在整体系统中几乎就是个多余件。

4. 常见误区与排查技巧实录

4.1 “不用自适应=参数随便配”是错的

先说一句容易被误解的话:CTLE不做后台自适应,绝不代表它不重要,更不表示可以随便填一档就完事。CTLE档位直接决定ADC动态范围、噪声放大倍数和DFE初始收敛点。我在实际项目中见过CTLE从低boost档换到高boost档后,DFE系数和误码率能差一个数量级的情况。它只是不需要在后台频繁更新,但它必须是经过训练算法认真选出来的。

4.2 判断CTLE档位是否合适的三个信号

可以看三个指标。第一,DFE第一抽头系数是否贴近极限。如果贴着最大值运行,大概率意味着CTLE boost不够。第二,SER或FEC统计是否随温度出现缓慢漂移。如果漂移趋势每次都能被某个CTLE档位改善,说明训练目标函数可能没包含温度因素。第三,PAM4三个眼的高度是否均衡。PAM4有上、中、下三个眼,不同档位对高电平眼和低电平眼的影响不同,需要找到三个眼都能接受的折中,而不是只盯着中间那个眼。

4.3 什么场景要警惕“自适应关闭”导致的隐患

虽然我认为大多数场合不需要CTLE背景自适应,但有两种场景需要额外关注。一是环境温度剧烈变化而链路无法重训练的场合,比如工业温控异常;二是运行中长距离电缆持续被弯折的场景,比如仪器探头反复移动。遇到这两类问题,排查顺序建议是:先看DFE是否在正常更新,再看FEC纠错统计是否暴涨,最后确认CTLE定档是否有误。保存一套包含CTLE boost、VGA增益、DFE各抽头、FEC计数的寄存器快照,对定位到底是哪个环节在漂移非常有用。

4.4 一套比较完整的验证步骤

如果需要最终拍板“CTLE要不要带后台更新”,可以参考下面的验证流程:

  • 建链成功后,读取并保存CTLE、VGA、DFE、FEC相关寄存器快照,当作基线。
  • 做温度循环老化测试,每隔一段温度点记录SER和寄存器变化。
  • 观察DFE系数是否保持在非边界区域,确认收缩余量。
  • 如果SER缓慢上升,手动把CTLE加一档或减一档,观察DFE系数和误码率的变化方向。
  • 确认变化方向后决定:要么靠DFE慢更新吸收温度漂移,要么在特定温度触发一次重训练。

我和团队大多数项目的最终结论是:训练定档加DFE慢更新已经能覆盖绝大多数场景。CTLE后台自适应不仅没帮上忙,反而因为环路耦合引入了低频眼图呼吸问题,属于吃力不讨好。

5. 一个让我彻底转变思路的实战案例

说一段自己的真实经历。几年前做一款56GBaud PAM4 retimer,CTLE按8档粗调设计,固件在上电训练时做一次冒泡扫描,之后完全冻结。项目早期留了一个测试位叫“CTLE自适应使能”,本来只是评估备用方案。结果在一次温度冲击测试中,误码率周期性出现毛刺,一开始我怀疑是CDR失锁,连夜抓波形没有看到明显幅度塌陷,只看到采样点有轻微低频漂移。

排查到最后才发现,CTLE自适应环路的更新节拍和CDR环路产生了差拍,两个环路在温度和电压波动下互相拉扯,损伤刚好落在FEC纠错能力边缘。把测试位关掉、改用DFE慢速更新之后,毛刺消失,链路在后续连续几个月的温循实验里都很稳定。从那以后我对高速串行链路的均衡分工有了更强的倾向性:模拟域的CTLE负责“一次校准、长期粗补偿”,数字域的DFE负责“实时细追”,两者各守边界。

回到标题的问题,所谓“112G/224G系统中CTLE无需背景自适应”,准确说并不是技术上完全无法实现,而是整个系统在设计权衡之下选择了不做。高速链路要面对的是噪声、功耗、环路稳定性、可测试性等多重约束,把自适应任务分层分配给数字域,CTLE扮演好粗补偿者的角色,才是更合理的工程解法。如果你正在纠结该不该给CTLE加后台更新,我建议先打开寄存器看三组数:CTLE档位、DFE收敛后的系数位置、FEC纠前BER趋势。数据会告诉你,到底缺不缺这一个额外的模拟自适应环。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询