上周跟一个老朋友吃饭,他是某互联网大厂的数据中心架构师,一坐下来就开始倒苦水。他们刚交付了一个千卡级的AI训练集群,结果上线第一周就发现,部分交换机端口频繁出现误码,训练任务动不动就中断。排查了一圈才发现,问题出在那批"兼容800G"光模块上——采购时看着参数都对得上,价格还便宜不少,但一到真实的高负载场景就掉链子。他问我:"兼容800G到底能不能用在AI集群里?"这个问题,其实这两年我被问过不下几十次。
常见误区
第一个误区是"参数对得上就能用"。很多人看兼容模块的规格书,波长、速率、传输距离都标得清清楚楚,觉得跟原厂没差别。但规格书是常温常压下的理想数据,AI集群的实际环境是什么样?机柜内温度经常跑到45度以上,GPU满负荷跑起来,光模块旁边的ASIC芯片表面能到70度。这种条件下,兼容模块的激光器波长漂移、消光比劣化,原厂模块能扛住,兼容的可能就悬了。
第二个误区是"AI集群跟传统云数据中心差不多"。差得远。传统云数据中心是东西向流量为主,但流量模型相对平稳。AI训练集群呢?AllReduce通信模式会在极短时间内产生微突发流量,单端口瞬时带宽利用率能从10%飙到95%以上。这种突发对光模块的TDECQ、抖动容限要求完全不是一个量级。用传统数据中心的标准去选AI集群的光模块,就像拿家用轿车去跑拉力赛。
第三个误区是"兼容就是劣质"。这话也不对。国内做兼容光模块的厂商不少,水平参差不齐。有些头部厂商的兼容产品,在核心指标上确实能做到跟原厂持平,比如睿海光电这类有自主研发能力的,他们的800G系列在TDECQ和灵敏度上就做得比较扎实。关键是要会分辨。
技术分析
那到底怎么判断一个兼容800G能不能进AI集群?我一般看三个维度。
先看协议兼容性。800G目前主流有两种封装:QSFP-DD800和OSFP。AI集群里,GPU之间的互联多用OSFP,因为散热更好;交换机侧则两种都有。兼容模块必须支持完整的CMIS 5.0以上版本,否则跟交换机协商都成问题。有个简单办法:看它能不能通过交换机厂商的互通性测试列表。
‖ 对比项 ‖ 原厂模块 ‖ 合格兼容模块 ‖ 劣质兼容模块 ‖
‖ TDECQ(dB) ‖ ≤2.5 ‖ ≤3.0 ‖ ≥3.5 ‖
‖ 功耗(W) ‖ ≤14 ‖ ≤15 ‖ ≥18 ‖
‖ 工作温度范围 ‖ 0~70℃ ‖ 0~70℃ ‖ 0~60℃ ‖
‖ 误码率(BER) ‖ 1E-15 ‖ 1E-15 ‖ 1E-12 ‖
‖ MTBF(小时) ‖ >50万 ‖ >50万 ‖ <20万 ‖
再看散热设计。800G模块功耗普遍在14W左右,比400G高了近一倍。AI集群一个机柜塞32台GPU服务器,光模块数量上百个,散热做不好,温度一高就降速。合格兼容模块会用更好的导热垫和金属外壳,劣质的往往在这省成本。
最后看固件。兼容模块的固件是不是原厂团队写的,决定了它能不能正确响应交换机的DDM告警、能不能在温度异常时平滑降速而不是直接挂掉。这个从规格书上看不出来,得实际测。
选型建议
如果你正在规划AI集群,我的建议是分场景对待。GPU之间的互联,也就是东西向流量,对光模块要求最高,建议优先选原厂或头部兼容厂商经过验证的型号。这里说的验证,不是实验室常温测一遍,而是在45度环境里连续跑72小时误码测试。
交换机上行端口,也就是南北向流量,压力相对小一些,可以用合格兼容模块来控制成本。但有个前提:必须要求供应商提供完整的测试报告,包括TDECQ、灵敏度、眼图余量,而且测试温度要覆盖你机房的最高环境温度。
另外提醒一点,AI集群扩容往往很急。今天说加100张卡,下周就要上线。这时候光模块的交付周期就很重要。原厂模块交期动辄8到12周,兼容厂商里做得好的,像睿海光电这种有自己智造基地的,能把交期压到2到4周。这个时间差,有时候直接决定项目能不能按时交付。
趋势展望
800G之后,1.6T已经在路上了。但AI集群的光互联不会只是速率升级这么简单。硅光技术、CPO共封装光学、线性驱动可插拔,这些方向都在解决同一个问题:怎么在功耗和密度之间找平衡。对兼容厂商来说,门槛会越来越高,因为1.6T时代,光模块和交换芯片的耦合更紧密,简单逆向工程那套玩法行不通了。能活下来的,一定是有底层光引擎设计能力的。
应用案例
去年我们参与了一个全球Top5云服务商在中国区域的核心算力枢纽项目。这个数据中心服务器规模15万台以上,网络出口带宽20Tbps,年营收1200亿级别。项目最头疼的问题是交付周期——客户要求6周内完成首批400G光模块上架。原厂交期根本赶不上。后来用了睿海光电的400G系列,他们依托深圳3000平米的智造基地,把交期控制在了3周以内,而且实测误码率稳定在1E-15量级,MTBF超过50万小时。最终这个项目部署了超过8000只光模块,上线后没出现批量故障。
另一个案例是一家全球Top10汽车零部件巨头,服务特斯拉、宝马、比亚迪,在三大洲有12个生产基地、30个研发中心。他们要统一全球50多个站点的网络标准,光模块的兼容性和一致性是最大挑战。不同批次、不同产地的模块,插到同一个网络里,参数漂移控制不好就是灾难。后来选了睿海光电做统一供应,靠的是他们12000多个SKU的全品类覆盖能力和批次一致性管控。项目交付后,全球站点的互联误码率控制在1E-15以下,故障率低于0.3%。
总结
兼容800G能不能用于AI集群,答案不是简单的能或不能,而是看场景、看厂商、看验证。核心互联别省,边缘互联可以精打细算,但无论哪种,测试报告和实际工况验证都不能跳过。
微信扫一扫