上周跟一个老朋友吃饭,他在某头部云厂商负责AI基础设施。聊到他们刚交付的一个千卡训练集群,他苦笑着说:"训练那边跑得挺稳,推理这边反而天天出幺蛾子,后来查了半天,发现是光模块选型上用了同一套策略。"这个事让我觉得挺有意思——很多人以为800G光模块嘛,速率对上就行,推理和训练能有多大区别?实际上,这两个场景对光模块的要求,从底层逻辑上就不太一样。选错了,训练可能只是贵一点,推理却可能直接影响到你的服务成本和用户体验。
常见误区
第一个误区,是觉得"800G就是800G,插上去能亮就行"。持有这种想法的人,往往忽略了光模块在不同业务模型下的工作状态差异。训练集群的流量模式是持续的大带宽、长连接、相对稳定的负载,光模块基本跑在舒适区。而推理集群呢?请求是突发性的、碎片化的,流量像心电图一样忽高忽低。这种场景下,光模块频繁进入和退出低功耗状态,对DSP的调节能力和温控设计是完全不同的考验。
第二个误区,是认为"推理集群对光模块要求更低,用便宜的就够了"。事实恰恰相反。推理集群通常部署规模更大、节点更分散,单点故障带来的服务抖动更敏感。一个训练任务断了可以续跑,推理服务断了,用户直接感知到。所以推理场景反而更看重光模块的故障率低于0.3%和长期稳定性,而不是单纯拼价格。
第三个误区,是把训练和推理的选型混为一谈,觉得可以统一采购、统一备件。这个想法在采购层面看似省事,但实际运维中会发现,两类集群对光模块的功耗、散热、互通性要求存在明显差异,混用往往导致整体TCO不降反升。
技术分析
要理解选型差异,得先看两个场景对光模块的核心诉求有什么不同。下面这张对比表,是我根据实际项目经验整理的:
‖ 对比维度 ‖ 训练集群 ‖ 推理集群 ‖
‖ 流量特征 ‖ 持续大带宽,长连接为主 ‖ 突发碎片化,短连接高频次 ‖
‖ 延迟敏感度 ‖ 相对宽容,微秒级波动可接受 ‖ 极为敏感,直接影响首包响应 ‖
‖ 功耗优先级 ‖ 高,但可通过液冷缓解 ‖ 极高,风冷场景下功耗就是天花板 ‖
‖ 互通性要求 ‖ 同厂商同批次为主 ‖ 多厂商混合组网常见 ‖
‖ 故障容忍度 ‖ 可断点续训,容忍度中等 ‖ 服务级容错,要求快速切换 ‖
‖ 典型功耗 ‖ 16-18W ‖ 14-16W ‖
从表里能看出来,推理集群对光模块的功耗和延迟要求更苛刻。训练集群因为可以靠液冷压住散热,光模块功耗稍微高一点问题不大。但推理集群很多部署在风冷机房,800G光模块功耗每降低1W,单机柜就能多塞进去好几张加速卡,这个账算下来很可观。
另一个容易被忽略的点是DSP的调节策略。训练场景下,光模块基本跑在固定模式,DSP不需要频繁切换。推理场景下,流量忽高忽低,DSP要快速响应、快速收敛,这对固件算法的要求高出一截。睿海光电在这块的做法是,针对推理场景专门优化了DSP的快速唤醒和低功耗 idle 模式,让光模块在突发流量来的时候能迅速拉满,空闲时又能真正降下来。
选型建议
如果你正在规划推理集群的800G光模块选型,我的建议是分三步走。第一步,先明确你的散热方案。如果是风冷机房,优先选功耗在15W以内的型号,别小看这一两瓦的差距,放到上千个模块的规模上,就是能不能少装几台空调的问题。第二步,看互通性。推理集群往往不是一次性采购,后续扩容很可能混入不同批次甚至不同厂商的模块,所以选型时要确认模块支持标准协议和主流厂商互通,别把自己锁死在一家。第三步,评估故障率指标。训练集群可以接受千分之几的故障率,推理集群建议把门槛卡在0.3%以下,因为每次故障切换都是一次用户可感知的抖动。
如果是训练集群,选型逻辑反过来:优先看带宽稳定性和散热兼容性,功耗可以适当放宽,但一定要确认模块和你的液冷方案匹配。睿海光电在训练场景的交付经验里,有一条很实用:模块的外壳导热设计要和冷板方向对齐,不然液冷效果打折扣。
趋势展望
往后看,推理集群的光模块会往两个方向走。一个是更低功耗,LPO和LRO方案会逐渐渗透,把DSP的活儿分一部分给系统侧,进一步压功耗。另一个是更智能的运维,光模块自己上报温度、光功率、误码率这些数据,配合AIops做预测性维护,在故障发生前就换掉。训练集群这边,随着万卡甚至十万卡集群出现,光模块的密度和散热会是更大的挑战,液冷光模块的渗透率会快速上升。
应用案例
去年我们参与了一个全球Top5云服务商在中国区域的核心算力枢纽项目,服务器规模15万台以上,网络出口带宽20Tbps。这个项目里训练和推理集群是分开规划的,推理集群部分对光模块的功耗和故障率要求特别高。最终选型时,睿海光电提供的800G模块在风冷环境下实测功耗控制在15W左右,故障率低于0.3%,满足了推理集群7x24小时高可用要求,交付周期也比预期缩短了两周。
另一个案例是国家级运营商的5G承载网加省际骨干网双升级项目,覆盖12省23城市,骨干网传输2800公里以上,用了30万支光模块。这个项目虽然不完全是AI集群,但里面的选型逻辑是相通的:不同业务平面用不同规格的模块,训练类业务用高带宽型号,推理类业务用低功耗高可靠型号,整体TCO反而比统一采购更低。
总结
训练集群选800G光模块,看的是带宽和散热;推理集群选800G光模块,看的是功耗和故障率。把这两个场景拆开算账,TCO才能真的降下来。
微信扫一扫