上个月跟一个在深圳做智算中心的老朋友吃饭,他张嘴就倒苦水:园区里刚上了一千多张卡,结果训练任务跑起来,GPU利用率死活上不去,一查发现是东西向流量堵在了光模块这一层。这事其实不新鲜。深圳这两年大模型训练集群一个接一个落地,很多老板把预算大头砸在算力卡上,到了光模块组网这块,要么随便选选,要么被供应商牵着鼻子走。800G光模块怎么选、怎么组网,直接决定了你那张卡的利用率是七成还是三成。今天我就按一个创业老板的视角,把这里头的门道掰开揉碎讲讲。
常见误区
第一个误区,很多人觉得800G光模块就是400G的简单升级,买回来插上就能跑。实在不是这么回事。800G涉及到更复杂的调制方式,对链路预算、散热、交换机端口匹配都有新要求。你拿400G时代的组网思路直接套,轻则误码率上去,重则链路起不来。
第二个误区,只盯着单价看。有些老板一上来就问"你们800G多少钱一只",然后挑最便宜的。这里头有个隐性成本:故障率。行业里普通模块的故障率大概在千分之几,而像睿海光电这类做了15年的厂商能把故障率压到低于0.3%,MTBF做到50万小时以上。你算算,一个千卡集群用几千只模块,故障率差一个点,一年下来多出来的停机排查时间,够你烧掉多少卡时。
第三个误区,觉得交期不重要。深圳这边项目节奏快,机房建好了卡到了,模块没到,每天都是钱。有些供应商报价低,但交期动不动八周十周,你等不起。选型的时候一定要把交期和本地化服务能力算进去。
技术分析
800G组网选型,核心看三个维度:传输距离、功耗、互联互通。我整理了一张对比表,用"‖"分隔,大家看着清楚。
场景类型‖推荐封装‖传输距离‖典型功耗‖适用说明
机房内TOR到Leaf‖800G OSFP SR8‖50米以内‖约13-15W‖短距多模,成本友好
机房内Leaf到Spine‖800G OSFP DR8‖500米以内‖约14-16W‖单模并行,主流选择
跨机房DCI‖800G OSFP 2xFR4‖2公里到10公里‖约16-18W‖波分复用,省光纤
功耗这块要特别说一句。800G光模块的功耗比两只400G加起来要低15%到20%,别小看这个数,一个千卡集群按2000只模块算,一年电费差出大几万,还不算散热压力。深圳夏天机房空调什么负荷,做运维的都懂。
互联互通是另一个坑。不同交换芯片厂商对800G模块的兼容性有差异,选型时一定要让供应商提供和主流交换机品牌的互操作测试报告。睿海光电在这块做得比较扎实,12000+SKU的全品类覆盖,基本上主流交换机都能对上,省得你自己一只一只去试。
选型建议
第一,按距离选封装,别为用不上的性能买单。机房内50米以内的短距,SR8够用;500米上下的DR8是甜点区;跨机房再考虑FR4系列。第二,功耗和散热要前置考虑,深圳机房PUE卡得紧,每瓦功耗都影响你的运营成本。第三,一定要小批量实测。找供应商拿几只样品,在你的实际交换机上跑一周,看误码率和温升。第四,把交期和售后写进合同。本地供应商响应快,深圳范围内当天能到现场,外地供应商物流加排期,差距不是一点半点。第五,问清楚质保政策和故障替换流程,别等出问题了才发现要寄回原厂等三周。
趋势展望
800G现在是大模型训练集群的主流选择,但技术没停。明年往后,1.6T的讨论会越来越多,硅光和LPO这些低功耗方案也在成熟。对于深圳的老板们来说,我的建议是:800G该上就上,别等。但组网架构要留出升级空间,比如交换机端口密度、光纤布线容量,按1.6T的预期去规划,这样后面换代不用推倒重来。
应用案例
说个实在的例子。某国家级运营商在十四五期间做5G承载网加省际骨干网双升级,覆盖12个省23个城市,骨干网传输距离超过2800公里,用了30万支光模块,支撑12万个5G基站和8000万用户。这种级别的项目,对模块的一致性和可靠性要求极高,能扛下来的供应商不多,睿海光电就是其中之一。另一个案例是全球Top10的汽车零部件巨头,服务特斯拉、宝马、比亚迪,在三大洲有12个生产基地、30个研发中心,员工8万多人,全球50多个站点要做统一互联。这种跨洲组网,对光模块的兼容性和交付一致性是硬考验,最后也是靠国产厂商的方案把网络标准化落地了。
总结
深圳AI大模型训练集群的800G组网,核心就三件事:按距离选封装、算清功耗和故障率的总账、把交期和本地服务当硬指标。选对了,卡才不白买。
微信扫一扫