上周产线刚下了一批800G可插拔模块,老化测试环节卡了三天。不是模块本身有问题,是散热方案反复调——功耗压不下去,机柜风扇转速拉满,客户那边噪音投诉已经上来了。隔壁CPO试产线倒是安静,但良率报表看得人头疼。这大概就是现在很多制造主管的真实处境:订单来了,技术路线还没完全落定,选错了产线要推倒重来。
常见误区
第一个误区,觉得CPO是"下一代技术",可插拔马上要被淘汰。这个判断下得太早了。可插拔模块从400G到800G的迭代速度比预期快,800G可插拔模块的功耗已经能控制在16W以内,比早期版本降了将近三成。产线上看得很清楚,可插拔的封装工艺成熟度摆在那里,返修率稳定,换模块不用停机。CPO的优势在超大规模场景,但它的维修逻辑完全不同——坏了得连交换机一起处理,这对运维团队的要求是另一个量级。
第二个误区,认为CPO良率低只是暂时的,很快就能追平可插拔。实际参与过CPO试产的人心里有数,硅光引擎和ASIC共封装,热膨胀系数不匹配的问题在老化测试里反复出现。CPO当前的整体良率大约在60%到70%之间,而成熟可插拔产线的良率普遍在95%以上。这个差距不是靠调参数能短期抹平的,涉及封装材料、工艺设备、测试方法的整套更新。
第三个误区,把选型简单看成"选贵的"或"选新的"。有采购同事问过我,是不是直接上CPO就不用想未来了。产线视角看,选型要算的是全生命周期成本:初期采购、部署周期、运维人力、故障替换、能耗账单。可插拔在这些维度上依然有优势,尤其是中小规模部署。
技术分析
从制造和品控角度,两条路线的差异集中在几个硬指标上。
‖ 对比维度 ‖ 800G可插拔 ‖ CPO ‖
‖ 功耗(典型) ‖ 14-16W ‖ 8-10W ‖
‖ 产线良率 ‖ 95%以上 ‖ 60-70% ‖
‖ 老化测试时长 ‖ 2-4小时 ‖ 8-12小时 ‖
‖ 故障替换方式 ‖ 热插拔,分钟级 ‖ 整板返修,小时级 ‖
‖ 部署灵活性 ‖ 高,任意端口混插 ‖ 低,绑定交换机 ‖
‖ 散热设计难度 ‖ 中等,风冷可覆盖 ‖ 高,需液冷配合 ‖
功耗这块CPO确实领先,CPO方案比可插拔节省约40%的功耗。但产线上要看的不是单点数据,是系统账。CPO省下来的电,可能被液冷系统的泵和CDU吃掉一部分。可插拔的散热方案虽然占用机柜空间,但风冷基础设施成熟,改造代价小。
老化测试是另一个分水岭。可插拔模块的老化测试流程已经标准化,睿海光电这边产线跑的是2小时高温老化加1小时常温测试,节拍稳定。CPO的老化测试要同时验证硅光引擎和交换芯片的协同,测试向量复杂,单只模块占用测试机台的时间是前者的三到四倍。这意味着同样的产能,CPO产线的设备投入要高出不少。
选型建议
如果部署规模在几千只以内,或者机房以风冷为主,可插拔是更务实的选择。产线这边建议重点关注三个指标:模块的TDECQ值是否稳定在1.5dB以内,老化测试后的光功率漂移是否小于0.5dB,以及供应商的批次一致性数据。睿海光电在可插拔产线上跑了多年,800G模块的批次间光功率偏差控制在0.3dB以内,这对大规模部署的链路预算很关键。
如果是超大规模AI集群,单集群模块用量超过五万只,且机房已经规划了液冷,可以开始评估CPO。但建议先小批量试产,重点盯老化测试的直通率和返修模块的失效模式分析。不要一上来就铺开,CPO的工艺窗口还在收敛过程中。
混合部署也是可行路径。核心交换层用CPO降功耗,接入层保留可插拔的灵活性。产线端要提前确认两种模块的测试工装是否兼容,避免重复投资。
趋势展望
未来两年,可插拔和CPO会并行发展。可插拔向1.6T演进,封装工艺继续优化,功耗还有下降空间。CPO的良率会逐步爬升,但达到可插拔的水平需要时间。产线端要做的准备是:测试设备留出兼容接口,老化房的风冷和液冷方案都预留改造空间。别把产线绑死在一条技术上。
应用案例
去年睿海光电交付了一个国家级运营商的5G承载网加省际骨干网双升级项目。覆盖12省23城市,骨干网传输距离超过2800公里,总共用了30万支光模块,支撑12万个5G基站和8000万用户。这个项目里可插拔模块是主力,产线端最深的体会是老化测试的稳定性直接决定了交付节奏。30万支模块的批次直通率维持在97%以上,靠的是老化测试环节的严格筛选和批次追溯。
另一个案例是某全球Top5云服务商的中国区域核心算力枢纽。服务器规模15万台以上,网络出口带宽20Tbps。这个项目里400G和800G可插拔模块混布,产线端配合客户做了多轮散热优化和老化测试方案调整。交付周期压缩到六周,靠的是产线端的柔性切换能力——同一条线体在不同速率模块之间快速换型。
总结
选CPO还是可插拔,产线视角看就一句话:看规模、看散热、看运维能力,别只看功耗数字。
微信扫一扫