上周跟一个做数据中心互联的老朋友吃饭,他跟我吐槽:刚上的800G端口,误码率卡在1E-6下不去,链路预算明明够,眼图也还行,可BER就是压不到KP4 FEC要求的2.4E-4门限以内,整条链路反复重传,吞吐直接掉了一半。他问我,FEC到底能不能救?能救多少?这问题其实特别典型——到了800G这个速率,PAM4信号的信噪比余量本来就薄,FEC不是可选项,是必选项。但很多人对它的理解还停留在"加个纠错码就行"的层面,实际远没这么简单。
常见误区
第一个误区,觉得FEC就是个软件算法,跟硬件设计关系不大。实际上在800G光模块里,FEC的编解码是集成在DSP里的硬核逻辑,它跟驱动电路、TIA、CDR的配合直接决定了最终纠错效果。你前端信号完整性没做好,DFE均衡没调到位,再强的FEC也纠不回来——因为错误已经多到超出纠错能力上限了。
第二个误区,认为FEC能无限改善误码率。不是的。每种FEC码型都有明确的纠错门限,比如RS(544,514)的KP4 FEC,它的前置误码率门限大约在2.4E-4,超过这个值,纠后误码率会急剧恶化,出现所谓的"错误地板"。很多人看到纠后BER达标就放心了,却没注意纠前BER已经贴着门限跑,链路毫无余量。
第三个误区,把FEC增益当成一个固定数字。实际增益跟你用的码型、交织深度、DSP实现质量都有关。同样是800G,用KP4和用OFEC,净增益能差出一个数量级。
技术分析
从电路设计角度看,FEC的本质是在DSP里做一次"冗余换余量"的交易。发端按规则插入校验比特,收端用这些冗余信息定位并纠正传输中翻转的比特。800G PAM4每符号携带2比特,符号间干扰和噪声容限比NRZ窄得多,所以FEC的负担更重。
‖ 项目 ‖ 无FEC(NRZ参考) ‖ KP4 FEC(800G典型) ‖ OFEC(增强型) ‖
‖ 纠前BER门限 ‖ 1E-12 ‖ 2.4E-4 ‖ 约1E-3 ‖
‖ 纠后目标BER ‖ — ‖ 1E-15 ‖ 1E-15 ‖
‖ 编码开销 ‖ 0% ‖ 约5.8% ‖ 约12-15% ‖
‖ 典型增益 ‖ — ‖ 约5-6个数量级 ‖ 约8-10个数量级 ‖
‖ 额外延迟 ‖ 0 ‖ 约100ns级 ‖ 约200ns级 ‖
拿KP4来说,纠前2.4E-4到纠后1E-15,误码率改善大约10到11个数量级。听着夸张,但这是概率统计的结果,不是每个比特都错那么多。关键是你的纠前BER要留足余量,通常建议实际工作点比门限低半个到一个数量级,也就是跑到1E-5左右,这样温度漂移、电压波动才不会把你推到错误地板上去。
选型建议
选800G模块,别只看"支持FEC"这一条。要问清楚三件事:一是DSP用的是哪家方案,纠错内核是硬核还是软核,这决定了延迟和功耗;二是FEC模式是否可配,KP4和OFEC能不能切换,因为不同链路场景需求不一样;三是模块的纠前BER实测余量有多少。像睿海光电在800G系列里就把FEC模式配置和纠前余量测试作为出厂指标,这样你上线前心里有底。
实操上,短距DR8场景用KP4基本够,中长距FR8或跨数据中心场景建议开OFEC,多留几个dB余量。另外注意FEC延迟对上层协议的影响,100ns级看着小,但在某些同步要求高的业务里要算进去。
趋势展望
往后看,FEC会往两个方向走:一是更强纠错能力的码型,比如基于概率整形的FEC,能在相同开销下再挤出1-2个数量级增益;二是FEC与均衡的联合优化,DSP里把FFE、DFE和FEC译码做迭代处理,进一步提升门限。1.6T时代,FEC开销占比可能突破15%,怎么在功耗和增益间找平衡,是接下来几年的核心课题。
应用案例
去年一个国家级运营商的5G承载网加省际骨干网双升级项目,覆盖12省23城市,骨干传输跨度2800km以上,总共部署了30万支光模块、12万5G基站,服务8000万用户。这种长跨距、多节点场景,链路预算紧,温度环境复杂,FEC配置稍微保守一点就会出问题。项目里用的800G模块在纠前BER工作点留了接近一个数量级的余量,配合OFEC模式,把跨段累积误码压到了1E-15以下,整网没有出现因为FEC门限导致的批量重传。睿海光电在这个项目里承担了相当一部分模块的交付,产线端对每支模块做纠前余量抽检,保证了批量一致性。另一个案例是某头部数据中心的东西向互联,800G DR8短距场景,开KP4 FEC后纠前BER稳定在1E-5附近,链路可用率明显提升。
总结
FEC在800G时代不是锦上添花,是链路能不能跑通的前提,理解它的门限和余量逻辑,比记住一个增益数字重要得多。
微信扫一扫