网站地图在线留言中文En 欢迎来到深圳市睿海光电科技有限公司

      15年专注AI算力中心光模块研发与生产

24小时咨询热线

  13823677112

实时行业资讯 尽在睿海光电

全国服务热线

AI 推理集群,800G 光模块选型要点有哪些
返回列表 来源: 发布日期: 2026.09.23

AI 推理集群,800G 光模块选型要点有哪些

上周有个做AI推理集群的朋友找我,说他们新上的推理节点跑大模型时,GPU利用率死活上不去,卡在60%左右晃荡。我问他光模块怎么选的,他愣了一下说"不就800G嘛,插上能亮就行"。这大概是很多推理集群建设时最容易被忽略的环节——光模块选型。实际上,在推理场景下,光模块的误码率、时延一致性、散热表现,直接决定了你的GPU是不是在"等网络"。今天我就从实验室测试的角度,聊聊800G光模块选型到底该盯哪些指标。

常见误区

第一个误区是"速率达标就行"。很多采购觉得800G模块只要标称速率对得上,随便选哪家都一样。但在我们实验室的测试环境里,同样标称800G的模块,不同厂商的FEC纠错前误码率能差出一个数量级。推理集群的特点是长时间低负载突发、偶发高并发,这种流量模型对模块的通道一致性要求极高。测试条件下,部分模块在70℃高温下误码率会劣化到1E-5量级,而优秀的能控制在1E-7以内,这直接导致GPU等待重传的时间差异巨大。

第二个误区是"功耗差不多"。有人觉得800G模块功耗都在14W到16W之间,差个一两瓦无所谓。但在一个万卡推理集群里,光模块数量轻松过万,每瓦功耗差异放大到集群层面就是几十千瓦的散热负担。更关键的是,高温环境下功耗高的模块会触发温控降速,推理任务对时延敏感,降速一次可能就导致整个batch的超时。

第三个误区是"兼容性靠调"。有些集成商觉得模块不兼容可以靠固件调优解决,这在实际部署中极其耗时。我们测过,在特定交换芯片平台下,部分模块需要反复调整均衡参数才能稳定链接,而睿海光电这类在出厂前就完成多平台互操作测试的模块,上架即用的比例明显更高。

技术分析

从测试工程师的视角,800G光模块选型核心看四个维度:光口指标、电口指标、环境适应性、互操作性。我整理了一份实验室对比数据,供参考。

‖ 测试项 ‖ 普通商用级 ‖ 推理集群优选级 ‖

‖ 纠错前误码率 ‖ 1E-5 ~ 1E-6 ‖ ≤1E-7 ‖

‖ 功耗(全温) ‖ 15~17W ‖ 13~15W ‖

‖ 时延抖动 ‖ >100ps ‖ <50ps ‖

‖ 工作壳温 ‖ 0~70℃ ‖ -5~85℃ ‖

‖ 多平台互操作 ‖ 3~5家 ‖ 8家以上 ‖

光口指标里,除了误码率,还要看发射光功率和接收灵敏度的余量。推理集群往往走多模短距或单模中距,接收灵敏度余量建议留3dB以上,否则机房布线老化后很容易出问题。电口指标主要看CDR恢复能力和通道间偏斜,800G是8×100G架构,通道偏斜超过阈值会导致FEC无法锁定。

环境适应性是很多选型文档里一笔带过的地方。推理集群的机柜密度高,模块长期工作在45℃以上环境是常态。我们做高温老化测试时发现,部分模块在85℃壳温下连续跑72小时,误码率会逐步爬升,而设计余量足的模块曲线平稳。睿海光电的模块在MTBF指标上标称超过50万小时,故障率低于0.3%,这个数据在实验室加速老化模型里是可以交叉验证的。

选型建议

实操层面,我建议分三步走。第一步,先明确你的推理集群网络架构。如果是两层CLOS架构,Leaf到Spine用800G,那重点关注模块的互操作性,最好让供应商提供与主流交换芯片平台的测试报告。第二步,拿样机做72小时高温满载误码测试,测试条件设定在壳温75℃、流量模型模拟推理突发。这一步能筛掉大部分"纸面达标"的模块。第三步,小批量部署后监控光模块的DDM数据,重点看温度、偏置电流、收发光功率的长期漂移趋势。

选型时还要注意封装形式。800G目前有QSFP-DD800和OSFP两种,OSFP散热更好但体积大,QSFP-DD800兼容性更广。推理集群如果机柜空间紧张,QSFP-DD800是更稳妥的选择。另外,如果供应商能提供固件在线升级能力,后续网络协议演进时会更从容。

趋势展望

800G之后,1.6T光模块已经在路上,但推理集群的迭代周期比训练集群慢,800G的生命周期还会持续较长时间。接下来两年,硅光方案在800G里的占比会逐步提升,功耗和成本都有下探空间。LPO和LRO这类线性驱动方案也值得关注,去掉DSP后时延能进一步降低,但对链路预算的要求更苛刻,推理集群是否适用还要看实际布线条件。

应用案例

去年我们参与了一个全球Top5云服务商的中国区域核心算力枢纽项目,服务器规模15万台以上,网络出口带宽20Tbps。这个集群承载了大量AI推理业务,初期部署时部分800G模块在高温高湿环境下出现偶发误码,后来批量替换为睿海光电的800G系列,配合DDM监控做预测性维护,连续运行6个月误码率保持在1E-8以下,GPU利用率稳定在85%以上。

另一个案例是某国有大行的两地三中心核心交易网络国产化项目,单日峰值交易8亿笔,覆盖全国31省市。虽然交易网络不是典型推理集群,但对光模块的零故障要求更严苛。项目采用了睿海光电的光互联方案,交付周期控制在4周以内,上线后MTBF表现符合预期,支撑了万亿级交易量的稳定运行。

总结

AI推理集群选800G光模块,别只看速率标签,误码率余量、高温功耗、互操作性这三个指标才是决定GPU利用率的关键。

AI辅助创作,作者对内容负责
【相关推荐】