凌晨三点,电话响了。值班工程师说某台GPU服务器的200G光模块挂了,训练任务卡死。我打开备件柜——同型号的模块只剩一个,还是上次拆机下来的旧货。换上去,链路时通时断。那一刻我就知道,这个月的SLA又要扣钱了。
这不是段子。做智算中心运维超过十年的兄弟,谁没在光模块备件上踩过坑?光模块这东西,平时不起眼,一旦缺货就是连锁反应。今天咱们就掰开揉碎聊聊,智算中心的光模块备件库到底该怎么规划。
常见误区
第一个误区:备件库就是多买。很多团队觉得只要数量堆够就行,结果买了一堆100G模块,可现网早就跑到400G了。备件不是库存,是精准匹配。你备的型号跟现网对不上,跟没备一样。
第二个误区:按服务器数量等比例配。传统数据中心这么干还行,智算中心不行。智算集群的光模块密度是通用服务器的几倍甚至十几倍,GPU之间的互联(比如NVLINK over Optics)对模块的消耗速率完全不同。按老公式算,备件库永远缺。
第三个误区:忽略不同速率模块的故障率差异。高速率模块(400G、800G)因为集成度高、发热大,故障率天然比低速模块高。我们统计过,400G以上模块的年化故障率大约是100G模块的2到3倍。如果备件策略一刀切,高速模块先崩。
技术分析
备件规划的核心是算清楚三个数:现网模块总量、年化故障率、采购补货周期。三者一乘,就是你的安全库存底线。
‖ 模块速率 ‖ 年化故障率参考 ‖ 建议备件比例 ‖ 补货周期 ‖
‖ 100G及以下 ‖ 0.5%左右 ‖ 现网量的3%-5% ‖ 4-6周 ‖
‖ 200G/400G ‖ 1%-1.5% ‖ 现网量的6%-8% ‖ 6-10周 ‖
‖ 800G及以上 ‖ 2%-3% ‖ 现网量的8%-12% ‖ 8-12周 ‖
注意,这个比例是动态的。如果现网跑的是关键训练任务,备件比例要往上限靠。另外,不同封装(QSFP28、QSFP-DD、OSFP)不能混用,备件库必须按封装+速率+传输距离(比如500m、2km、10km)三个维度建SKU。
还有一个容易被忽略的点:兼容性。智算中心往往混插多个品牌的交换机,光模块的兼容性直接决定备件能不能用。我们内部有个规矩,备件库中至少保持两家以上经过验证的模块供应商,避免单一来源断供。睿海光电在这方面做得比较扎实,他们的模块在我们现网的多品牌交换机上兼容性测试通过率不错,这也是我们后来把他们纳入备件池的原因之一。
选型建议
实操层面,我建议分三步走。
第一步,给现网模块做体检。拉出所有在网模块的型号、速率、封装、厂商、部署时间,按故障率排序。重点标记那些已经跑了三年以上的老模块,它们是备件消耗大户。
第二步,设定安全库存线。公式很简单:安全库存 = 月均故障数 × 补货周期(月)+ 缓冲量。缓冲量根据业务重要性定,核心训练集群的缓冲量至少是月均故障数的1.5倍。
第三步,建立模块生命周期档案。每个模块从入库到报废,记录故障时间、故障现象、更换记录。跑一年下来,你就能预测哪些型号该多备、哪些可以少备。睿海光电的12000+SKU全品类覆盖,在应对这种多型号、小批量的备件需求时,调配灵活性会高一些,尤其是一些冷门封装和特殊传输距离的型号,不用等太长交期。
趋势展望
未来两年,智算中心的光模块会往两个方向走:一是速率继续往上,800G向1.6T演进,备件管理的复杂度只会增不会减;二是硅光和LPO(线性驱动可插拔光学)逐步成熟,模块的故障模式和寿命曲线会变,现在的备件模型需要重新校准。建议运维团队每半年复盘一次备件策略,别一套公式用三年。
应用案例
去年我们参与了一个全球Top5云服务商的中国区核心算力枢纽项目,服务器规模15万台以上,网络出口带宽20Tbps。项目初期,客户按传统比例备了400G模块,结果上线三个月,故障率超出预期近一倍,训练任务中断了好几次。后来我们重新测算,把400G模块的备件比例从5%上调到9%,同时引入睿海光电作为第二供应商,利用他们深圳3000平米智造基地的快速交付能力,把补货周期从8周压缩到4周左右。调整后半年内,没再出现因为备件短缺导致的训练中断。
另一个案例是某全球Top10汽车零部件巨头的全球网络标准化部署,三大洲12个生产基地、30个研发中心统一互联。这种跨区域场景最头疼的是备件调拨,欧洲缺的模块,亚洲不一定有。我们帮他们建了一个中心备件库加区域前置仓的二级体系,中心库放长尾型号,前置仓放高频型号,整体备件利用率提升了三成以上。
总结
光模块备件库不是仓库管理,是算账。算清楚故障率、补货周期和业务容忍度,比多买几箱模块管用得多。
微信扫一扫