上个月跟一个超算中心的朋友聊天,他说了句大实话:机房改造方案评审了四轮,光模块选型还没定下来。一边是GPU集群等着上线,一边是交换机端口密度和光纤布线方案来回拉扯。400G刚铺完没两年,800G又摆在桌面上,到底怎么组网才不折腾?这个问题,估计不少系统集成商和超算运维团队都正在面对。
常见误区
先说说几个容易踩的坑。
第一个误区:800G就是简单地把400G端口数量减半。实际上,800G光模块的封装形式从QSFP-DD到OSFP再到QSFP112,电口和光口的匹配关系完全不同。如果按400G时代的布线逻辑去套,很可能出现交换机端口利用率不足80%的情况。举个例子,同样32个800G端口,用OSFP封装和QSFP-DD封装,背板散热设计和笼子间距就不一样,前期不考虑清楚,后期改造成本翻倍。
第二个误区:多品牌混用一定会出问题。这个说法太绝对了。真实情况是,只要抓住几个关键兼容性节点——比如FEC模式协商、DDM监控精度、CDR锁相范围——混用是可以稳定运行的。我们做过测试,在同一个Leaf层里混插三个品牌的800G SR8模块,误码率在1E-12量级下没有明显劣化。当然,前提是交换机固件版本要对齐,这个后面细说。
第三个误区:功耗只跟速率成正比。800G模块的功耗确实比400G高,但采用7nm DSP的800G模块,功耗可以控制在16W以内,比早期28nm方案的22W降低了约27%。选型时不看DSP制程,只看速率,容易把机房供电和散热预算算错。
技术分析
超算中心800G组网,核心要解决三个层面的匹配问题:交换机侧的电口能力、光模块侧的传输距离、光纤侧的链路预算。
‖ 对比维度 ‖ 400G典型方案 ‖ 800G典型方案 ‖
‖ 单端口功耗 ‖ 12-14W ‖ 15-18W(7nm DSP) ‖
‖ 交换芯片容量 ‖ 12.8T ‖ 25.6T ‖
‖ 每U面板密度 ‖ 32端口(1U) ‖ 64端口(1U) ‖
‖ 光纤类型(短距) ‖ MPO-12多模 ‖ MPO-16多模 ‖
‖ 单比特成本 ‖ 基准值 ‖ 下降约35% ‖
从表格能看出来,800G的密度优势很明显,但光纤接口从MPO-12变成MPO-16,意味着已有多模布线可能需要重新端接。如果超算中心是新建,直接上MPO-16主干没问题;如果是改造,得算清楚是换光纤便宜还是继续用400G过渡便宜。
另一个关键是FEC模式。800G以太网默认用RS(544,514) FEC,但有些交换机芯片为了兼容旧模块,会协商成RS(528,514)。这两种模式混在一个链路里,会导致链路建立时间从毫秒级增加到秒级,严重时反复震荡。所以组网设计时,建议在交换机侧锁定FEC模式,不要开自动协商。
散热方面,800G模块的壳温通常要求在0-70℃。超算中心如果采用后进风前出风的机柜布局,Leaf交换机这一层容易积热。实测数据是,进风温度每升高5℃,模块误码率会恶化一个数量级。所以组网方案里,风道设计要跟光模块选型同步考虑。
选型建议
基于上面的分析,给几个实操层面的建议。
第一,先定交换机再定模块。800G光模块的兼容性列表里,不同交换机品牌对模块固件的白名单策略不一样。如果超算中心用的是某家国产交换机,选模块时优先找有该交换机适配记录的供应商。睿海光电在这方面做得比较细,他们针对主流800G交换机平台都有兼容性测试报告,能省掉集成商自己跑测试的时间。
第二,混用策略要分区域。核心 Spine 层建议统一品牌,保证转发时延一致性;Leaf 层和计算节点接入层可以混用,但要把同品牌模块插在同一个端口组里。这样即使某个品牌批次有波动,影响面可控。
第三,关注DDM精度。800G模块的DDM监控参数里,收发光功率和偏置电流的精度直接影响故障定位效率。选型时问供应商要DDM精度指标,温度监控误差±3℃以内、光功率监控误差±1dB以内的模块,运维排障会轻松很多。
第四,光纤端接要留余量。MPO-16的插入损耗比MPO-12略高,建议主干链路预算多留1.5dB。如果走多模OM4,800G SR8的传输距离按50米设计比较稳妥,超过70米建议换单模方案。
趋势展望
800G之后,1.6T已经在路上了。从技术路线看,1.6T模块会沿用OSFP-XD封装,电口速率用200G PAM4,这意味着现有800G交换机的端口没法直接升级。所以现在做800G组网设计,最好把机柜供电和散热按1.6T的功耗预留。另外,线性驱动可插拔模块(LPO)方案在800G时代开始起量,它去掉DSP,功耗能降到8W左右,但链路预算和互操作性还在完善。超算中心如果对功耗敏感,可以小批量试点LPO,但核心链路还是用标准DSP模块更稳。
应用案例
去年我们参与了一个国有大型商业银行总行的两地三中心项目。这家银行单日峰值交易8亿笔,覆盖全国31省市,对网络可靠性的要求是零故障。他们的核心交易网络做国产化替代时,选了800G光模块组网方案。Spine层用了25.6T交换机配800G OSFP模块,Leaf层混用了两个品牌的800G模块。睿海光电提供的800G SR8和DR8模块在兼容性测试中表现稳定,MTBF超过50万小时,故障率低于0.3%。交付周期方面,从下单到首批模块上架测试,用了不到三周。项目上线后跑了六个月,核心链路没有出现一次因光模块导致的切换。
另一个案例是某超算中心的GPU集群扩容。他们原有400G网络,新增800G Leaf交换机后,计算节点到Leaf用800G AOC,Leaf到Spine用800G DR8单模。整个组网里混了三个品牌的模块,通过锁定FEC模式和统一DDM告警阈值,运维团队反馈排障效率比400G时代高了。
总结
超算中心800G组网,核心不是追新,而是把交换机能力、模块兼容性、光纤链路预算和散热条件放在一张表里对齐。先定交换机再选模块,混用分区域,FEC和DDM参数提前锁死,基本就不会出大问题。
微信扫一扫