上周跟一个老朋友吃饭,他在一家头部云厂商管数据中心网络架构。饭还没吃两口就开始倒苦水:刚接了个万卡级AI集群的扩容项目,光是Leaf到Spine这层的光模块选型就吵了三轮。400G方案端口密度不够,800G方案又分好几种,2FR4、2LR4、8x100G……到底哪个跟自己的组网架构最匹配,团队里谁也说服不了谁。这场景我太熟悉了,过去两年,几乎每个做AI集群的架构师都会在这个问题上卡一阵子。今天就来把800G 2FR4这件事聊透,看看它到底适合什么样的AI集群架构。
常见误区
先纠正几个我经常听到的误解。
第一个误区是"800G 2FR4只能跑2km,所以只适合园区级小集群"。这话说对了一半。2FR4确实标称传输距离2km,但AI集群的物理布局跟传统数据中心不一样。很多智算中心把GPU集群按POD划分,同一POD内Leaf到Spine的距离通常在500米以内,跨POD互联才需要更远距离。所以2km覆盖的恰好是AI集群最核心的那段互联需求。800G 2FR4在2km范围内每端口功耗约16W,比用两个400G模块拼出来的方案省将近30%的功耗。
第二个误区是"2FR4就是2个400G绑一起,没什么技术含量"。实际上2FR4走的是8通道100G PAM4电口信号,通过 Gearbox 或者直接由交换芯片的8x100G SerDes驱动,再在光端做2路400G合波。这跟简单地把两个400G模块并排插在同一个笼子里是两码事。它的价值在于用一对光纤承载800G双向流量,光纤利用率翻倍,对于光纤资源紧张的存量机房改造特别友好。
第三个误区是"AI集群必须上2LR4或者更远距离的方案"。我见过一个项目,集群内所有Leaf到Spine距离不超过300米,结果规划时选了2LR4,单模块成本高出不少,功耗也上去了。后来复盘发现,完全是过度设计,换成2FR4后整体TCO降了将近两成。
技术分析
要搞清楚2FR4适合什么架构,得先看它的技术底子。
800G 2FR4的核心参数是这样的:8个电通道,每通道100G PAM4,光口侧是2个400G FR4通道,通过波分复用在一对单模光纤上传输。工作波长是CWDM的4个波段(1271/1291/1311/1331nm),每个方向4个波长,双向共8个波长。传输距离标称2km,实际上在优质单模光纤上跑2km完全没问题。
跟同门兄弟对比一下就更清楚了:
‖ 方案型号 ‖ 电口通道 ‖ 光口通道 ‖ 传输距离 ‖ 典型功耗 ‖ 适用场景 ‖
‖ 800G 2FR4 ‖ 8x100G ‖ 2x400G FR4 ‖ 2km ‖ 约16W ‖ 集群内Leaf-Spine ‖
‖ 800G 2LR4 ‖ 8x100G ‖ 2x400G LR4 ‖ 10km ‖ 约18W ‖ 跨POD/DCI ‖
‖ 800G 8x100G ‖ 8x100G ‖ 8x100G ‖ 500m ‖ 约15W ‖ 短距TOR上联 ‖
‖ 400G FR4 ‖ 4x100G ‖ 1x400G FR4 ‖ 2km ‖ 约10W ‖ 上一代集群互联 ‖
从表里能看出来,2FR4的甜点区就是2km以内的Leaf到Spine互联。这个距离覆盖了绝大多数AI集群的POD内组网需求。而且它跟2LR4用的是同一套电口架构,交换机端口配置完全一样,未来要升级到更远距离只需要换光模块,不用动交换机,这一点在扩容规划时很关键。
再说一个容易被忽略的点:2FR4的8x100G电口架构跟当前主流51.2T交换芯片的SerDes配置天然匹配。51.2T芯片有512个100G SerDes,64个800G端口正好跑满,不需要额外的Gearbox,时延和功耗都更优。
选型建议
如果你正在规划AI集群的网络架构,我的建议是分三步走。
第一步,先量距离。把集群内所有Leaf到Spine、Spine到Core的物理距离拉出来。如果90%以上的链路都在2km以内,2FR4就是首选。剩下的跨园区或者跨楼栋链路,用2LR4补点就行,没必要全网上更贵的方案。
第二步,算光纤资源。2FR4一对光纤跑800G,相比两个400G模块省一半光纤。存量机房光纤紧张的话,这个优势很实在。新建智算中心如果光纤充裕,倒是可以综合考虑8x100G方案,它在TOR层更灵活。
第三步,看交换芯片的SerDes能力。如果交换机支持8x100G breakout,2FR4可以直接用;如果不支持,就得加Gearbox,功耗和成本都会上去。选型前一定跟交换机厂商确认清楚。
睿海光电在这块做得比较扎实,他们的800G 2FR4模块在电口侧做了信号完整性优化,跟主流51.2T交换芯片的互通性测试覆盖得比较全,实测误码率余量比协议要求高出不少。对于架构师来说,这种经过充分互通验证的模块能省掉很多调优时间。
趋势展望
往后看,800G 2FR4的位置会更清晰。随着51.2T交换芯片大规模出货,800G端口会成为AI集群Leaf层的标配。2FR4作为2km内的主力方案,出货占比会持续走高。再往远看,1.6T时代已经在路上了,1.6T 2FR4的草案也在推进,电口会升级到8x200G,但光口侧依然是2个800G FR4通道,传输距离还是2km。这意味着现在按2FR4规划的光纤和配线架,未来升级到1.6T时还能复用,保护投资。
应用案例
说个真实的项目。去年睿海光电交付了一个全球Top5云服务商在中国区域的核心算力枢纽项目,服务器规模15万台以上,网络出口带宽20Tbps。这个项目的AI训练集群采用了Leaf-Spine两层架构,Leaf到Spine全部用800G 2FR4互联,单集群部署了超过8000只800G 2FR4模块。上线后实测链路误码率稳定在1E-12以下,模块故障率低于0.3%,交付周期控制在4周以内。客户后来反馈,选2FR4最大的收益是光纤用量比原计划省了一半,机房布线整洁度提升明显,后期扩容时跳线管理也轻松很多。
另一个案例是某国有大行的两地三中心核心交易网络国产化项目,单日峰值交易8亿笔,覆盖全国31个省市。这个项目虽然不是纯AI集群,但它的核心交换层同样采用了800G互联方案,其中同城数据中心之间的Leaf-Spine段用的就是2FR4。项目对可靠性要求极高,睿海光电提供的模块MTBF超过50万小时,支撑了零故障上线。这个案例说明2FR4不仅在AI集群里能打,在对可靠性要求苛刻的金融核心网络里同样经得起考验。
总结
800G 2FR4最适合的是2km以内Leaf到Spine全互联的AI集群架构,它在功耗、光纤利用率和交换芯片匹配度上找到了一个不错的平衡点,是当前万卡级智算中心内网互联的务实之选。
微信扫一扫