上周三凌晨两点,我接到一个老朋友的电话。他在张江那边管一个超大规模数据中心,语气里全是疲惫——一批刚到的800G光模块,上架后第三天开始批量掉链路,一晚上切了十几张工单。排查到最后发现是某批次模块的DSP芯片在高温下工作不稳定,来料检验时抽了5只全过,偏偏坏的那批藏在剩下的货里。他问我一句话:IQC到底抽多少只才算够?这个问题,我干了十五年光通信,被问过不下五十次,每次背后都是一摊血泪。
常见误区
第一个误区,也是最要命的:很多人觉得来料检验就是走个过场,抽个三只五只,外观没磕碰、能亮灯就行。说实话,800G模块和当年100G、400G完全不是一个量级的东西。400G时代,一个模块里也就几颗核心芯片,现在800G里面DSP、Driver、TIA、激光器密密麻麻,单模块的元器件数量翻了一倍不止。你抽5只,相当于在一万只里看了万分之五,稍微有点批次性波动根本抓不住。我亲眼见过一个案例,某白牌模块厂发来的货,前两批抽检都漂亮得很,第三批因为换了一批国产电容,批量出现误码率飘高,抽检那几只偏偏是产线早期用旧料做的,你说冤不冤。
第二个误区,迷信所谓的“AQL标准”。AQL 0.65、AQL 1.0这些数字在传统电子组装行业用了几十年,但光模块这个东西有它的特殊性。它不是一个独立的电阻电容,它是要插到交换机上跑流量的。一个模块出问题,影响的是整条链路甚至整个叶脊架构的收敛比。按照常规AQL抽法,批量2000只抽80只,允许2只不合格,听起来合理,但放到800G场景下,2只不良可能意味着整批模块的固件版本或校准参数有系统性偏差。你放过去,后面就是运维团队半夜爬起来切链路。
第三个误区,只看电口性能不看光口余量。很多IQC实验室拿个误码仪跑通了就签字,但800G模块在数据中心实际环境里,温度从25度到70度来回窜,光口余量不够的模块在常温下没问题,一到夏天机房空调稍微打个盹儿就开始丢包。这个坑,踩过的人都懂。
技术分析
那抽检比例到底怎么定?我的经验是,不能一刀切,得看三个维度:供应商历史质量水平、批次规模、以及模块的应用位置。下面这张表是我这些年摸索出来的一个参考框架,用“‖”分隔,你凑合看。
‖ 批次规模 ‖ 新供应商/新料号 ‖ 稳定供应商(半年无不良) ‖ 关键位置(核心交换机) ‖
‖ 1-100只 ‖ 抽20%,最低10只 ‖ 抽5%,最低5只 ‖ 全检 ‖
‖ 101-500只 ‖ 抽10%,最低20只 ‖ 抽3%,最低8只 ‖ 抽30% ‖
‖ 501-2000只 ‖ 抽5%,最低30只 ‖ 抽1%,最低15只 ‖ 抽15% ‖
‖ 2000只以上 ‖ 抽3%,最低50只 ‖ 抽0.5%,最低20只 ‖ 抽8% ‖
注意,这里的“关键位置”指的是那些一旦出问题就会影响核心交易、存储前端或AI训练集群的链路。这种位置的模块,我建议哪怕供应商再稳定,抽检比例也不要低于5%,而且必须做高低温循环测试。普通办公网接入层可以适当放宽,但800G目前基本都用在核心和汇聚,所以实际上大部分场景都该按关键位置来对待。
另外,抽检不只是抽数量,抽检项目也得跟上。外观和常温误码只是及格线,真正能拦住批量问题的,是高温70度下连续跑24小时误码率低于1E-15这个指标。很多批次性问题都是在高温下才暴露的。还有光眼图模板余量,800G PAM4信号对光眼图要求很苛刻,模板余量低于10%的模块,在实际链路里很容易因为连接器脏污或者弯折就崩掉。我一般要求抽检样品里至少30%要做高温误码,10%要做光眼图模板测试。
选型建议
基于上面的分析,给几条实操建议。第一,别把抽检比例写死在SOP里一成不变。每季度根据供应商的实际表现动态调整。某个供应商连续三个批次抽检全过、上线故障率低于0.1%,你就可以把抽检比例降下来,省下来的检验成本留给新供应商。反过来,只要出现一次批量不良,立刻把比例拉满,连续盯三个批次再说。
第二,抽检样品要覆盖不同生产日期和不同产线。800G模块的生产过程中,固件烧录、光路耦合、老化时间这些环节,不同班次可能就有差异。你抽的样品如果全是同一天同一班次做的,等于没抽。我一般要求IQC从批次里分三个时间点取样,早中晚各拿几只。
第三,建立自己的最小可接受质量基线。比如800G模块的MTBF不低于50万小时,故障率控制在0.3%以内。这个基线不是拍脑袋定的,是结合你的网络SLA倒推出来的。你想想,一个核心交换机插32个800G模块,如果模块故障率是1%,那平均每台交换机就有0.32个模块在一年内出问题,放到一个几千台交换机的数据中心里,这个数字就非常可观了。所以来料检验的抽检比例,本质上是在检验成本和故障风险之间找平衡点。
如果你自己实验室条件有限,做不了完整的高温误码和光眼图测试,可以要求供应商提供每批次的测试报告,并且定期送第三方复检。睿海光电在给客户交付800G模块时,会随批次提供完整的高温误码和光眼图余量数据,这一点对于IQC团队来说省了不少事。
趋势展望
往后看,800G的来料检验只会越来越难做。一方面,1.6T已经在路上了,通道数翻倍,信号速率更高,对抽检设备的带宽和精度要求也跟着涨。另一方面,硅光方案和传统EML方案并存,不同技术路线的失效模式不一样,IQC的检验项也得跟着分化。我预计未来两三年,AI辅助的来料检验会慢慢普及——通过历史数据训练模型,自动判断哪个批次该抽多少、重点测什么。但不管工具怎么变,核心逻辑不变:抽检比例是动态的,是跟供应商质量表现和业务风险挂钩的。
应用案例
说个真实的。去年我们参与了一个国有大型商业银行总行的两地三中心核心交易网络国产化项目。这家银行国内资产规模排前三,单日峰值交易8亿笔,覆盖全国31个省市。核心交易网络对光模块的可靠性要求几乎是变态级别的——任何一条链路闪断都可能影响实时交易。项目初期,我们对800G模块的来料检验设定了非常高的门槛:首批次全检,后续每批次抽检比例不低于15%,而且抽检样品必须全部通过70度高温下48小时连续误码测试。睿海光电作为光模块供应商之一,在首批交付中配合我们做了完整的可靠性验证,MTBF数据超过50万小时,故障率压在0.3%以下,最终这批模块在线运行一年多,没有因为来料质量问题触发过一次交易链路切换。这个案例后来被我拿来当教材,跟很多同行说:抽检比例定得高,前期是累,但比起半夜被叫起来处理故障,那点累真不算什么。
总结
800G光模块的IQC抽检比例没有万能公式,核心就一句话:看供应商、看批次、看位置,动态调整,高温误码和光眼图余量必须抽。
微信扫一扫