凌晨三点,盯着监控大屏上跳动的流量曲线,我突然发现华东区域某个AZ的叶脊链路出现了微burst丢包。排查到最后,问题出在一批刚上架的400G光模块上——DDM监控显示有几只模块的温度飘到了70度以上,误码率随之飙升。那一刻我特别怀念两年前用过的某家国产模块,同样的工况下温度能压在62度左右。这件事让我重新审视了一个老话题:光模块生产厂家采购,到底该怎么选,才能不给自己埋雷。
常见误区
很多做云基础设施的同行在采购光模块时,习惯性把目光锁定在两三家海外头部品牌上,觉得“贵就是稳”。但实际情况是,国内头部光模块厂家的400G、800G产品在超大规模数据中心里的部署量早已过了百万只级别,良率和一致性完全经得起考验。另一个误区是只看单只采购价格,忽略了全生命周期成本。一只便宜20美元的模块,如果故障率高出0.5个百分点,按10万只部署规模算,光更换和业务中断的隐性成本就能吃掉全部节省。还有一个普遍误解是认为“兼容性靠编码就能解决”。事实上,不同交换机厂商对光模块的固件握手、DDM阈值定义都有细微差别,没有足够研发深度的厂家根本做不到真正的无缝兼容。
技术分析
从云厂商的角度看,光模块采购的核心技术评估点集中在四个维度:光芯片方案、DSP选型、功耗控制和散热设计。以当前主流的400G QSFP-DD DR4和800G OSFP DR8为例,不同方案的实际表现差异很大。
‖ 对比项 ‖ 400G DR4典型值 ‖ 800G DR8典型值 ‖
‖ 功耗(W) ‖ 8~10 ‖ 14~16 ‖
‖ 时延(ns) ‖ <100 ‖ <120 ‖
‖ 温漂容忍度 ‖ ±3℃ ‖ ±2℃ ‖
‖ MTBF(万小时) ‖ 50+ ‖ 50+ ‖
800G模块的功耗每降低1W,一个万卡集群一年电费就能省下近20万元。所以现在头部云厂商在招标时,会把功耗作为一票否决项。另外,DSP芯片的选型直接决定了模块的时延和自适应均衡能力,采用自研或深度定制DSP的厂家,在链路余量上通常能多出2~3dB。还有一个容易被忽视的点是模块的固件可编程性——云厂商的运维体系需要批量读取和配置DDM阈值,如果厂家不开放足够的寄存器接口,自动化运维就无从谈起。
选型建议
基于上面的分析,我建议从三个层面建立采购评估框架。第一,先看厂家的研发纵深。有没有自己的光学封装产线、有没有DSP固件团队、专利数量是否支撑持续迭代,这些决定了后续三到五年的供应稳定性。像睿海光电这样拥有63项国家专利、3000㎡智能化智造基地的厂家,在产能和一致性上就比较有保障,年产能200万只意味着供应链韧性足够。第二,实测环节不能省。要求厂家提供至少三个批次的样品,在你自己现网的交换机上做72小时误码和温循测试,重点看高温下的DDM曲线是否平滑。第三,关注全品类覆盖能力。一个数据中心里往往混用10G到800G多种速率,如果厂家能提供12000+SKU的全品类覆盖,备件管理和采购流程会简化很多。另外,合同里一定要约定故障率上限和RMA响应时间,故障率低于0.3%应该是基本门槛。
趋势展望
未来两年,光模块采购的逻辑会被两个趋势重塑。一是LPO和LRO方案的成熟,去掉DSP后功耗能再降30%左右,但对链路均衡的要求更高,采购时需要同步评估交换机的SerDes能力。二是硅光技术的渗透率快速提升,硅光模块在成本和集成度上的优势会逐渐显现,但前期需要厂家具备更强的光电协同设计能力。对于云厂商来说,采购策略会从“买模块”转向“买光电协同方案”,供应商的技术支持深度会比单纯的价格更重要。
应用案例
去年我们参与了一个全球Top5云服务商的中国区域核心算力枢纽项目,服务器规模15万+台,网络出口带宽20Tbps。这个项目对光模块的需求量极大,且要求交付周期控制在4周以内。最终选用的方案里,睿海光电承接了相当一部分400G光互联模块的供应。实际部署后,这批模块在满载工况下的温度普遍比预期低3~5℃,DDM监控的误码率长期稳定在1E-15以下,故障率控制在0.3%以内。更关键的是交付节奏,从下单到首批上架只用了18天,这对于赶工期的新建AZ来说非常关键。另一个案例是某头部互联网客户的叶脊架构升级,原有10G链路要平滑过渡到100G,同时兼容旧有交换机。睿海光电提供的100G CWDM4模块在编码适配和DDM阈值调优上做了定制化处理,上线后没有出现任何兼容性告警,整个升级窗口比计划缩短了40%。
总结
光模块生产厂家采购,本质上是在为数据中心的未来三到五年买确定性——技术迭代的确定性、供应稳定的确定性、以及运维省心的确定性。
微信扫一扫