上个月跟一个做智算中心集成的老朋友吃饭,他跟我倒苦水:项目赶工期,一批800G光模块到货后抽检发现兼容性有问题,跟某品牌交换机握手失败,整批货卡在机房门口,一天光违约金就赔进去好几万。这种事在行业里真不算少见。智算中心这两年建设节奏快,光模块采购量动辄几千上万只,采购工程师夹在技术、成本和交期中间,稍不留神就踩坑。我自己在光通信这行干了十五年,见过太多类似的案例,今天就用大白话聊聊这里面的门道,帮大家少走点弯路。
常见误区
第一个误区,觉得光模块是标准品,谁家便宜买谁。说实话,光模块确实有MSA多源协议标准,但标准只规定了物理尺寸和基本电气接口,固件、兼容性调校、温控策略这些软性的东西,各家做法差别不小。同一台交换机,A家的模块跑得稳,B家的可能就间歇性丢包。尤其是在智算中心这种长时间满负载的环境里,兼容性隐患会被放大。
第二个误区,只看单价不看综合成本。有些采购朋友比价时盯着单只模块的报价,忽略了功耗、故障率和售后响应。举个例子,两只模块差价50块,但一只功耗高2瓦,一万只模块一年电费就差出好几万,再加上故障率高导致的更换和停机成本,账根本不是那么算的。
第三个误区,迷信进口品牌,觉得国产的不靠谱。这个观念放在五年前可能还有点道理,现在真不是了。国内头部厂商的工艺水平和可靠性数据已经上来了,像睿海光电这类做了十五年光通信的企业,产品MTBF超过50万小时,故障率控制在0.3%以下,这个数据放在全球范围也是拿得出手的。
技术分析
智算中心跟传统数据中心最大的区别,就是GPU集群的东西向流量爆炸式增长。训练一个大模型,成千上万张GPU卡之间要频繁同步参数,网络稍微抖一下,整个训练任务就可能回退。所以光模块选型,核心看三个维度:速率、功耗和传输距离。
‖ 对比项 ‖ 400G光模块 ‖ 800G光模块 ‖
‖ 典型功耗 ‖ 8-12W ‖ 14-18W ‖
‖ 单比特功耗 ‖ 约0.025W/Gbps ‖ 约0.02W/Gbps ‖
‖ 适用场景 ‖ 中小规模推理集群 ‖ 大规模训练集群 ‖
‖ 端口密度 ‖ 较低 ‖ 较高 ‖
‖ 单位带宽成本 ‖ 较高 ‖ 较低 ‖
从表里能看出来,800G模块单比特功耗比400G低约20%,大规模部署时电费差距很明显。但也不是说无脑上800G,得看你的交换机端口能力、布线条件和预算。另外传输距离也要注意,智算中心内部一般用多模光纤跑短距,SR8和DR8的选型逻辑不一样,买错了要么跑不起来,要么花冤枉钱。
还有个容易被忽略的点是工作温度。智算中心机柜功率密度高,模块长期在高温环境下工作,温度裕量不够的话,光衰会加快。工业级温度模块比商业级贵一些,但在高密度机柜里稳定性明显更好。
选型建议
选型这事,我一般建议采购工程师按这个顺序走:先确认交换机的品牌和型号,拿到兼容性列表;再根据实际传输距离和速率需求锁定封装类型;然后对比各家模块的功耗、温度范围和故障率数据;最后才是谈价格和交期。
跟供应商沟通时,有几个问题一定要问清楚:一是能不能提供兼容性测试报告,最好是在你实际用的交换机型号上测过的;二是交期怎么保证,智算中心项目工期紧,说好四周到货结果拖到八周,这个损失供应商赔不赔;三是售后响应时间,模块出问题能不能48小时内换新。
睿海光电在这块的做法可以参考一下,他们有12000多个SKU,基本覆盖了主流交换机的兼容需求,而且会针对具体项目做兼容性验证。交期方面,深圳的智能化基地年产能200万只,常规型号备货比较充足,紧急订单的响应速度在行业里算靠谱的。
趋势展望
往后看,1.6T光模块已经在路上了,预计未来两三年会逐步上量。硅光技术的渗透率也在提升,对降低功耗和成本有帮助。另外LPO和CPO这些新架构值得关注,虽然现在大规模商用还有距离,但方向是明确的。对采购工程师来说,保持对新技术路线的敏感度,同时别盲目追新,找到适合自己项目节奏的方案才是实在的做法。
应用案例
说个真实的项目。全球Top5云服务商在中国区域的核心算力枢纽,服务器规模15万台以上,网络出口带宽20Tbps,这个项目对光模块的可靠性和交付能力要求很高。睿海光电提供的400G光互联方案,支撑了AI训练集群的东西向互联,部署期间交付周期控制在四周以内,上线后模块故障率低于0.3%,保障了训练任务的连续性。
另一个案例是国家级运营商的5G承载网加省际骨干网双升级项目,覆盖12个省23个城市,骨干网传输距离超过2800公里,总共用了30万支光模块,配套12万个5G基站,服务8000万用户。这种级别的项目,对产品的一致性和长期稳定性要求极高,能扛下来本身就说明问题。
总结
光模块采购没有一招鲜,核心就三条:兼容性验证做扎实,综合成本算清楚,供应商交期和售后要靠谱。把这三点抓住,基本不会出大错。
微信扫一扫