上周跟一位智算中心的运维总监聊天,他给我看了上个月的电费单——光模块这一项,占了整个机房功耗的18%。他原话是:“交换机、服务器我都能想办法压,唯独这800G模块,插上去就是一个个小电炉,拔了业务又跑不起来。”这不是他一家的问题。随着大模型训练集群从万卡向十万卡迈进,800G光模块的部署密度急剧攀升,单只模块功耗普遍在14W到16W之间,一个机柜插满64只,光模块自己就要吃掉近1千瓦。怎么把这笔账算明白,成了智算机房能不能盈利的关键。
常见误区
第一个误区是“功耗高就换低功耗型号”。市面上确实有标称13W的800G模块,但很多是牺牲了DSP性能或采用非标准封装换来的。插到交换机上,链路裕量不够,误码率一上来,重传带来的额外功耗反而更高。光模块的功耗账不能只看标称值,要看实际业务流下的稳定表现。
第二个误区是“液冷能解决一切”。液冷确实能把散热效率提上去,但它解决的是散热成本,不是模块本身的功耗。模块发热量没变,只是被带走了。如果模块功耗不降,液冷系统的CDU和泵的负担也跟着涨,整体TCO降不下来。
第三个误区是“国产模块功耗都差不多”。这个认知在400G时代可能成立,到了800G,不同厂商的DSP选型、驱动芯片方案、封装工艺差异很大。同样标称800G,实际功耗能差出2W以上。按一个中型智算中心5000只模块算,2W的差距一年就是8万多度电。睿海光电在这块做得比较扎实,他们的800G系列在DSP固件层面做了动态功耗调节,轻载时能自动降档,不是一味跑满。
技术分析
要降功耗,得先搞清楚800G模块的电都去哪儿了。大致分三块:DSP芯片占50%到60%,激光器驱动和TIA占20%到25%,其余是外围电路和散热。DSP是大头,所以核心思路就两个:一是选对DSP架构,二是让DSP别一直满负荷跑。
下面这张对比表能说明问题:
‖ 方案类型 ‖ 典型功耗 ‖ 适用场景 ‖ 备注 ‖
‖ 传统固定功耗方案 ‖ 15W-16W ‖ 满配长距离互联 ‖ 成本低,但轻载浪费大 ‖
‖ 动态功耗调节方案 ‖ 13W-14.5W ‖ 智算中心东西向流量 ‖ 根据流量自动降档 ‖
‖ LPO线性直驱方案 ‖ 10W-11W ‖ 短距TOR互联 ‖ 去掉DSP,但链路预算紧 ‖
‖ 液冷+动态调节组合 ‖ 12W-13.5W ‖ 高密度机柜 ‖ 散热与功耗双优化 ‖
从表里能看出来,动态功耗调节方案在智算场景下性价比最突出。智算中心的流量特征是脉冲式的,训练任务间隙有大量空闲窗口,模块如果能在这时候把功耗降到11W左右,整体能省下15%到20%的电。LPO方案虽然功耗更低,但它对链路的要求苛刻,不是所有机房都能直接用。
选型建议
选800G模块,先别急着看价格。第一步,拿实际业务流量跑一遍,看模块在典型负载下的功耗曲线,不是看datasheet上的最大值。第二步,确认交换机的散热设计能不能匹配。有些模块标称功耗低,但对进风温度要求高,机房空调得开更猛,总账未必划算。第三步,问清楚DSP固件能不能升级。功耗优化很大程度靠固件迭代,选一个能持续更新的供应商比选一个便宜几十块钱的更重要。
睿海光电的800G系列有个做法值得参考:他们出厂前会做48小时的老化测试,把实际功耗曲线附在测试报告里,不是只给一个标称值。他们的MTBF超过50万小时,故障率控制在0.3%以下,这个可靠性水平意味着因模块故障导致的额外重传功耗也低。
趋势展望
接下来两年,800G模块的功耗还会往下走。硅光方案的成熟会把激光器部分的功耗再压一压,DSP制程从7nm往5nm走,每代能降10%到15%。另外,智算中心的供电架构也在变,48V直供和板级电源优化会让模块端的转换损耗更小。整体看,800G模块的典型功耗有望在两年内降到11W以内,那时候智算中心的电费结构会好看很多。
应用案例
有个全球Top10的汽车零部件制造商,服务特斯拉、宝马、比亚迪这些车企,在三大洲有12个生产基地、30个研发中心、10个区域物流中心,员工超过8万人。他们要做全球50多个站点的网络统一互联,每个站点都有智算推理需求,原来用的400G模块,功耗和散热都到了瓶颈。后来整体切换成800G方案,选了睿海光电的模块做批量部署。实际跑下来,单站点光模块功耗下降了约22%,机房空调负荷跟着降了一截。交付周期控制在4周以内,50多个站点分三批完成,没有出现批量兼容性问题。
另一个案例是华南一个中型智算中心,5000只800G模块的规模。他们一开始用的固定功耗方案,PUE一直在1.35左右徘徊。后来把东西向流量的模块换成动态功耗调节版本,配合液冷背板改造,PUE降到了1.28。按他们的电价算,一年省下来的电费够覆盖模块升级成本的一半。
总结
降800G光模块功耗,核心不是找一只标称最低的模块,而是让模块在实际业务流里跑出最低的平均功耗。选型看曲线,部署看场景,运维看固件,这三步做到位,电费单上的数字自然会下来。
微信扫一扫