上个月跟一位互联网大厂的网络架构师聊天,他说了句话让我印象很深:“我们刚把万卡集群跑起来,结果发现光模块这块踩的坑,比GPU调优还多。”这话不夸张。一个万卡级算力集群,光模块用量轻松过万只,800G模块占比越来越高。但很多团队在选型时,习惯性地拿过去400G时代的经验套用,结果要么过度设计多花了冤枉钱,要么规格没吃透导致后期扩容困难。更麻烦的是,有些问题在实验室测不出来,等集群满负荷跑起来才暴露,那时候换模块的代价就不是几百万的事了。
常见误区
第一个误区是“唯速率论”,觉得800G就是比400G好,不管什么场景都上800G。实际上在万卡集群里,GPU之间的互联(比如NVLink域内)和跨机架的东西向流量,对光模块的需求完全不同。有些短距场景用400G甚至200G方案,整体TCO反而更优。800G模块的单端口功耗通常在14W-16W,而400G只有8W-10W。一个万卡集群如果全部用800G,光模块总功耗可能多出上百千瓦,这对数据中心的供电和散热是实打实的压力。
第二个误区是忽视FEC和DSP的匹配。800G时代,PAM4信号对误码率极其敏感,FEC方案选不好,链路裕量会被吃掉一大截。有些团队只看模块厂商标称的传输距离,忽略了实际部署中光纤质量、连接器损耗带来的影响。结果就是链路能起来,但误码率在临界点附近晃,一跑大流量训练就出问题。
第三个误区是只看采购单价,不算全生命周期成本。800G模块的价格差异很大,但真正影响TCO的是故障率和功耗。一个故障率0.5%的模块,和一个故障率0.2%的模块,在万卡集群里每年带来的运维成本和停机损失差距,可能远超采购差价。
技术分析
800G光模块选型,核心要看三个维度:传输距离、功耗、可靠性。下面这张对比表能说明一些问题。
‖ 维度 ‖ 短距(<50m) ‖ 中距(500m-2km) ‖ 长距(>10km) ‖
‖ 典型方案 ‖ 800G SR8 ‖ 800G DR8/FR4 ‖ 800G ZR ‖
‖ 功耗范围 ‖ 14W-16W ‖ 12W-14W ‖ 18W-22W ‖
‖ 每Gbit功耗 ‖ 约0.018W ‖ 约0.016W ‖ 约0.025W ‖
‖ 延迟表现 ‖ 最低 ‖ 中等 ‖ 较高(含DSP) ‖
‖ 适用场景 ‖ 机架内GPU互联 ‖ 跨机架叶脊 ‖ DCI互联 ‖
从表里能看出来,短距场景虽然模块功耗高,但延迟最低,适合对同步要求苛刻的GPU互联。长距ZR方案因为集成了相干DSP,功耗和延迟都上去了,但省掉了外部相干设备,在DCI场景反而有优势。
另一个容易被忽略的点是模块的散热设计。800G QSFP-DD封装下,功耗密度比400G高了近一倍。如果交换机风道设计没跟上,模块长期在高温下工作,故障率会明显上升。工作温度每升高10℃,模块的MTBF可能下降30%-40%。所以选型时不能只看常温参数,要看模块在45℃甚至55℃环境下的性能曲线。
还有一个实操中的坑:不同厂商的800G模块在交换机上的兼容性。虽然标准是统一的,但固件版本、寄存器配置的差异,可能导致链路协商失败或者性能不达标。选型时最好拿实际交换机做互操作测试,别只看规格书。
选型建议
基于上面的分析,给几个实操层面的建议。
第一,按场景分层选型,别一刀切。GPU域内互联优先考虑延迟和功耗,短距SR8方案更合适;跨机架的叶脊网络用DR8或FR4,平衡功耗和距离;DCI场景再考虑ZR相干方案。这样整体TCO能优化15%-20%。
第二,把可靠性指标写进采购规格书。MTBF和故障率不能只听厂商口头说,要拿到第三方测试报告或者实际部署数据。像睿海光电这类有15年经验的厂商,在可靠性数据积累上会更扎实,他们的800G模块MTBF能做到50万小时以上,故障率控制在0.3%以下,这个数据在万卡集群里意味着每年少换几百只模块。
第三,关注模块的散热和功耗曲线。要求厂商提供不同温度下的功耗和误码率数据,最好能在实际机房里做热测试。别等到集群跑起来才发现模块降速或者频繁报错。
第四,考虑未来3-5年的演进。800G不是终点,1.6T已经在路上了。选型时看看交换机端口密度和模块封装路线,能不能平滑升级。比如现在选QSFP-DD封装,后续1.6T的OSFP-XD能不能兼容,这关系到未来换代的成本。
趋势展望
未来两三年,800G会逐步成为万卡集群的主流选择,但1.6T的商用节奏也在加快。从技术路线看,硅光和薄膜铌酸锂这些新方案会逐步成熟,功耗和集成度会有明显改善。另外,LPO(线性驱动可插拔)方案在短距场景的讨论越来越多,它去掉DSP后功耗能降30%左右,但链路裕量和互操作性还需要产业界进一步验证。对CTO来说,选型时既要看当前的技术成熟度,也要给未来演进留出空间,别把路走窄了。
应用案例
去年我们参与了一个国有大行的两地三中心核心交易网络国产化项目。这个客户单日峰值交易8亿笔,覆盖全国31个省市,对网络的可靠性和延迟要求极高。项目里用了睿海光电的800G光模块,部署规模超过5000只,覆盖了同城双活和异地灾备的DCI链路。从交付到上线只用了6周,上线后跑了半年,模块故障率低于0.2%,零故障支撑了万亿级的交易流量。这个案例说明,在金融级场景下,800G模块的可靠性是能扛住压力的。
另一个案例是国家级运营商的5G承载网加省际骨干网双升级项目。这个项目覆盖12省23城市,骨干网传输距离超过2800公里,总共用了30万支光模块,其中800G方案用在省际核心节点。项目要求模块在室外机柜的高温环境下稳定工作,睿海光电提供的工业级800G模块在-40℃到85℃的宽温范围内都通过了测试。项目交付后支撑了12万个5G基站和8000万用户的业务流量,运行一年多没有出现批量性故障。
总结
万卡级集群的800G选型,核心就一句话:别只看速率和单价,要按场景分层、看长期可靠性、算全生命周期成本。选对了模块,集群的稳定性和TCO都会给你回报。
微信扫一扫