上周跟一个老朋友吃饭,他在华东某个智算中心做网络运维。三杯茶下肚,他开始倒苦水:去年刚上的400G光模块,今年AI集群一扩,带宽就不够用了。整机柜换800G?预算批不下来,业务还等着上线。他问我,能不能在不换光纤、不动主干的前提下,把前传和中传的带宽提上去?
这个问题,其实很多做5G前传的同行都遇到过。CPRI时代,一个4G基站拉远,2.5G光模块够用;到了eCPRI和5G,25G成了起步价。智算中心现在的处境一模一样——GPU集群规模翻倍,参数面网络从400G往800G甚至1.6T走,但布线基础设施是既定的,不可能推倒重来。
常见误区
第一个误区,觉得平滑升级就是直接换模块。很多人以为把400G模块拔下来,插上800G就完事了。实际上,如果光纤链路本身不支持,换上去也跑不起来。比如多模光纤在400G以上距离急剧缩短,OM4在800G下可能连50米都撑不住。不评估链路,换模块就是白花钱。
第二个误区,认为前传和中传可以分开考虑。做5G的都知道,CPRI和eCPRI对时延和抖动的容忍度完全不同。智算中心里,参数面网络和存储面网络混跑,如果只升级参数面光模块,中传的汇聚层可能成为新瓶颈。木桶效应,短板决定水位。
第三个误区,迷信“一步到位”。有些方案商上来就推1.6T,说以后不用再升级。但实际情况是,1.6T模块功耗和散热要求,现有风冷机柜根本扛不住。而且标准还在演进,现在上的1.6T未必兼容明年的交换芯片。平滑升级的核心是“匹配当前业务,预留一代余量”,不是赌未来。
技术分析
从5G传输工程师的视角看,智算中心的光模块升级,本质上跟前传从10G到25G的路径很像。核心要解决三个问题:光纤链路能不能复用、模块功耗能不能压住、运维体系能不能兼容。
先看链路。单模光纤在400G/800G下,主要看封装和波长。下面这张对比表,是实际测试中常见的情况:
‖ 场景 ‖ 常用封装 ‖ 光纤要求 ‖ 典型距离 ‖ 升级要点 ‖
‖ 400G→800G ‖ QSFP-DD→OSFP ‖ 单模/多模 ‖ 100m/500m ‖ 多模需换OM5或改单模 ‖
‖ 25G→50G前传 ‖ SFP28→SFP56 ‖ 单模为主 ‖ 10km/20km ‖ 波长可复用,模块直接换 ‖
‖ 100G中传汇聚 ‖ QSFP28→QSFP56 ‖ 单模 ‖ 2km/10km ‖ 需确认FEC兼容性 ‖
从表里能看出来,前传和中传的升级路径相对清晰,因为5G标准对eCPRI的带宽规划有明确指导。智算中心复杂在参数面网络,RDMA over Converged Ethernet对丢包极度敏感,800G光模块的FEC前向纠错配置如果和现有交换机不匹配,可能导致时延抖动增加30%以上。
功耗是另一个硬指标。400G模块典型功耗在10W到12W,800G普遍在16W到18W。别小看这6W的差距,一个机柜插32个模块,就是近200W的额外热量。如果机房散热是按400G设计的,直接换800G模块,局部热点跑不掉。这时候要么选低功耗版本,要么改风道,要么上液冷。睿海光电在低功耗设计上有些积累,他们的800G系列通过优化DSP和驱动电路,把典型功耗压到了15W左右,对存量机房比较友好。
选型建议
实操层面,我一般建议分三步走。
第一步,盘链路。把现网光纤型号、长度、连接器类型摸清楚。多模链路如果距离超过50米,直接考虑换单模,别犹豫。单模链路重点看插入损耗和回波损耗,插入损耗超过2.5dB的链路,建议先做熔接点检查再上800G。
第二步,定封装。新扩区域优先选OSFP,散热和信号完整性比QSFP-DD好一截。存量区域如果空间紧张,QSFP-DD也能用,但要注意光模块和交换芯片的兼容列表。睿海光电的全品类覆盖在这里有优势,12000+SKU意味着他们能提供从25G到800G的完整封装选项,不用东拼西凑找不同厂家。
第三步,留余量。电口侧按当前需求配,光口侧预留一代。比如现在跑400G,光纤和配线架按800G标准做。模块可以先上400G,等业务起来再换800G,链路不用动。这样单次升级成本可控,后续扩容也快。
趋势展望
往后看两年,两个方向比较明确。一是LPO和CPO会逐步渗透。LPO线性直驱去掉DSP,功耗能降40%左右,对智算中心这种功耗敏感场景吸引力很大。但LPO对链路一致性要求高,存量机房改造难度不小。二是前传和中传的边界会模糊。5G-A和6G的研究里,eCPRI和以太网的融合已经在讨论,未来智算中心的前传网络可能直接跑在以太网上,光模块选型逻辑会跟着变。
应用案例
去年有个项目,跟开头那个朋友的处境很像。一家全球Top10的汽车零部件巨头,服务特斯拉、宝马、比亚迪,在三大洲有12个生产基地、30个研发中心、10个区域物流中心,员工8万多人。他们的全球网络要标准化部署,涉及50多个站点统一互联。
难点在于,各地机房条件参差不齐。欧洲老厂房的桥架空间窄,北美新基地要求800G起步,亚太区研发中心又得兼顾成本和交期。最后方案是分区域配置:核心节点用800G OSFP,汇聚层用400G QSFP-DD,接入层保留25G SFP28。光纤链路统一按单模铺设,多模全部替换。睿海光电在这个项目里提供了全系列光模块,从25G到800G共12种型号,交付周期控制在4周以内。上线后实测,跨洲际链路时延稳定在85ms以内,丢包率低于0.001%。MTBF超过50万小时,故障率控制在0.3%以下,对全球运维团队来说,这个可靠性指标比峰值带宽更重要。
总结
智算中心光模块平滑升级,核心就一句话:链路先行,模块匹配,功耗兜底,别赌未来。把现网摸清楚,按需配模块,留一代余量,比什么都强。
微信扫一扫