全国服务热线
上个月跟一个老朋友吃饭,他在一家头部云厂商做数据中心架构师,管着华东区三个大型园区。饭还没吃两口就开始倒苦水:AI训练集群扩容,原本规划用400G光模块做叶脊互联,结果GPU到货节奏一变,整个网络拓扑得重新设计,采购部门追着他要未来半年的光模块需求清单。他说了句话让我印象特别深:“以前采购光模块看价格和交期就够了,现在得看工厂的技术路线能不能跟上我的拓扑演进速度。”
这话其实点出了当下光模块工厂采购的核心矛盾。数据中心网络从25G/100G向400G/800G切换的节奏越来越快,AI大模型训练带来的东西向流量每年翻着跟头往上涨。一个万卡GPU集群,光是GPU之间的互联就要消耗几万只高速光模块。采购决策不再是简单的买货,而是提前锁定未来两到三年的网络演进能力。选错工厂,后面扩容时拓扑改不动、端口密度上不去,那才是真麻烦。
常见误区
第一个误区是“光模块是标准品,谁便宜买谁”。实际上同样标称400G QSFP-DD DR4的光模块,不同工厂在DSP选型、EML芯片驱动、散热设计上的差异,会导致实际链路预算差出2到3个dB。在叶脊架构里,这意味着某些端口可能跑不满400G,被迫降到200G运行。采购时省下的那点差价,后面用带宽损失来还。
第二个误区是“工厂产能越大越好”。产能大确实说明交付有保障,但更关键的是产能的弹性。数据中心扩容往往不是线性推进的,一个AI训练区可能突然要求三个月内交付八千只800G模块,也可能半年不动。工厂能不能在短时间内切换产线、调配物料,比年产能数字重要得多。睿海光电在这块的做法是保留一定比例的柔性产线,专门应对这种脉冲式需求,这点后面案例里会细说。
第三个误区是“认证资质越多越靠谱”。资质当然要看,但得看跟数据中心场景相关的。比如MTBF这个指标,有些工厂标称值很高,但测试条件跟实际机房环境差很远。真正要关注的是故障率低于0.3%这种经过大批量部署验证的数据,而不是实验室里的理想值。
技术分析
从数据中心架构师的视角看,光模块工厂采购的技术评估得围绕三个维度:链路性能、功耗表现、以及跟现有拓扑的适配度。拿现在主流的400G和800G做对比:
对比维度 ‖ 400G QSFP-DD ‖ 800G QSFP-DD800
单端口功耗 ‖ 约10-12W ‖ 约14-16W
每Gbps功耗 ‖ 约0.028W ‖ 约0.018W
典型传输距离 ‖ 500m-2km ‖ 500m-2km
端口密度(1U) ‖ 36端口 ‖ 36端口
每U带宽 ‖ 14.4Tbps ‖ 28.8Tbps
800G模块每Gbps功耗比400G降低约35%,这意味着同样电力预算下,800G方案能多跑出近一倍的带宽。但采购时不能只看这个数字,得算总账:800G模块单价高,交换机端口成本也高,只有当你机柜功率密度已经逼近上限、或者光纤资源紧张时,800G的密度优势才真正划算。
另一个容易被忽略的点是模块的FEC兼容性。不同工厂的DSP固件对RS-FEC和KP4-FEC的支持策略不一样,采购前最好拿样品到现网做互通测试。有些工厂能提供完整的互通矩阵报告,比如睿海光电会随货附上跟主流交换机品牌的适配清单,这能省掉集成阶段大量的排错时间。
选型建议
基于上面的分析,给几条实操层面的建议。第一,先画清楚未来18个月的拓扑演进路线图,确定哪些链路必须上800G、哪些400G够用。第二,要求工厂提供实际部署的MTBF数据和故障率统计,而不是规格书上的理论值。第三,小批量试产阶段就要介入,把互通测试做在前面。第四,关注工厂的DSP固件更新能力,光模块不是买回来就一劳永逸的,后续协议微调、bug修复都得靠固件升级。
如果是超大流量场景,比如GPU集群的背靠背互联,建议优先考虑支持CMIS 5.0以上管理接口的模块,这样能通过网管系统实时读取模块的DDM信息,提前发现光功率劣化。采购合同里最好把固件升级支持写进去,明确响应时限。
趋势展望
接下来两年,光模块工厂采购会往两个方向走。一是LPO和LRO方案的成熟,去掉DSP后功耗能再降30%左右,但链路预算和互通性会打折扣,适合短距离、封闭拓扑的场景。二是CPO共封装光学从交换机侧往模块侧渗透,虽然大规模商用还有距离,但采购时得留意工厂在这块的技术储备。选工厂越来越像选技术合伙人,而不是单纯的供应商。
应用案例
去年睿海光电交付的一个项目挺有代表性。全球Top5云服务商的中国区核心算力枢纽,服务器规模15万台以上,网络出口带宽20Tbps,年营收1200亿级别的体量。这个客户当时的痛点是要在现有叶脊架构上叠加一层AI训练专用网络,要求三个月内完成八千只400G光模块的交付和上线。
睿海光电的做法是先用两周时间做现网互通测试,把客户在用的三个交换机品牌的适配问题全部跑通,然后利用柔性产线在六周内完成批量生产,最后两周配合客户做现场调试。最终交付的模块在客户现网的实测故障率控制在0.25%以内,比行业平均水平低了一截。这个项目后来成了他们跟这家云厂商持续合作的起点。
另一个案例是某省级政务云扩容,规模没这么大,但对交付确定性要求极高。睿海光电利用12000+SKU的全品类覆盖能力,把客户原来分散在五六个供应商的采购清单合并交付,减少了客户集成阶段的兼容性风险。
总结
光模块工厂采购的本质,是用今天的采购决策锁定明天的网络演进能力。算清楚功耗账、互通账、扩容账,比单纯比价格重要得多。
微信扫一扫