1. 先还原一下“产能崩掉”的真实现场:三种典型崩法
上个月我去一家做3C零部件的客户现场做产线评估,一进车间就看到外观检测工位旁边堆着三台重型周转车,上面全是待复判的NG品。线长正拿着对讲机跟后道工序吵架,原因是前道AI视觉检测系统上线后,产线每小时产出从360件掉到了190件,后道全部断料。这正是测试报告里写着“检测精度99.7%”的那套系统。我当时没急着看算法,先看线体结构,心里已经有了答案:这不是算法问题,是整条产线的制造容量被检测环节打穿了。
类似的情况我这两年在不同工厂见了不下十次。AI视觉检测在实验室里跑得好好的,一到产线就出幺蛾子,而且问题高度一致,可以归结成三种典型“崩法”。
第一种是节拍崩。视觉检测设备标称节拍挺快,但你把它放进产线后,上下料、定位、分选、通讯这些环节全都要吃掉时间,整线的CT被硬生生拉长,产能自然跟着往下掉。
第二种是过杀崩。过杀率失控会让大量良品被判成不良,虽然每个工件只是被多看一眼,但当堆积量超过复判工的消化能力时,工序间就会产生积压,进而反向逼停前道。
第三种是数据崩。系统上线后,产线数据没有形成回流迭代的闭环,模型对新品、新批次、新光源环境的适应能力越来越差,误判率从第一天的千分之几慢慢涨到百分之几,产能和质量双双恶化。
后两种情况往往比节拍问题更隐蔽,因为它们是缓慢恶化的。要根治,先得把这三层问题拆开来看。我先从最容易出账的节拍说起。
2. 节拍账算不清楚,是所有产能问题的总根源
很多企业把AI视觉检测当成一个“独立设备”来买,只看它“单次检测耗时多少毫秒”,这是个非常危险的误区。检测设备是插在产线里的,它的时间开销绝不仅仅是算法推理那几百毫秒。
我拿一个实际的3C外壳产线举例,计算过程你们可以自己照着推。改造前整线CT是15秒一片,瓶颈在前道CNC。上视觉检测时,厂商给的方案文档写着“检测节拍7秒”(一个工位同时拍多个面),看起来完全来得及。预算也批了,方案也过了,结果一上线傻眼了。
我来拆一下这个7秒的构成。单个工件进站后,机械手从传送带抓取到检测位需要1.2秒;夹具定位夹紧要1.8秒;多相机逐面拍摄加频闪光源稳定需要2.5秒;本地推理加结果判定约1.2秒;机械手把工件分送到OK/NG线需要0.3秒。还没算通信握手和MES上报的0.5秒。加起来至少7.5秒。这已经超过标称节拍,更麻烦的是,只要相机出现一次定位偏差导致重拍,单个工件就要多花2.5秒。实际做下来单件平均耗时接近8秒,直接变成整线新瓶颈,CT从15秒被拉到15秒加上批量等待时间,实际产能下降了百分之三十多。
问题出在哪?方案阶段只看“检测耗时”,没算“进出站时间”。进出站时间在设备集成中极其容易被忽略,机械手动作、夹具动作、传动响应、分选动作、数据交互,每一项都是实打实的时间来源。我后来复盘时给客户做了个表格,把每个动作的实际耗时全部列出来,标注哪些是厂商数据、哪些是通过秒表实测的,结论是实测总是比厂商数据多20%到30%。
所以我的建议是:在设备选型阶段,不要只看样册上的检测速度,而是要求供应商提供“整站节拍”数据,最好提供一个带上下料机械手联动的动态演示。如果供应商没有条件做整套演示,宁可自己带工件去现场实测,拿秒表卡完整流程,而不是只看算法卡出来的毫秒数。
另外要注意节拍的统计口径。很多系统给的是“平均节拍”,但产线真正受制约的是峰值节拍和P95节拍。当出现连续NG时,分选机构要连续动作,节拍会被额外拖慢;当光源老化或工件来料位置偏斜时,重拍率上升,也会直接冲击节拍。评估时必须用满载连续跑一个小时的数据来看,而不是用空载单件来估算。产线不是实验室,稳态运行数据才是有意义的。
还有一部分人忽略的是电气层面的同步逻辑。视觉系统跟PLC之间的握手协议如果设计得不好,比如相机还没拍完但传送带已经在动了,就会频繁触发安全互锁,导致整线停顿。这种情况在线体集成调试时反复出现,每停一次少说耽误一两分钟,一天下来累计损失比算法误判还可怕。所以在节拍验证阶段,要同样关注通讯握手频率和安全互锁触发的记录数,如果一小时内互锁触发超过三五次,就要排查同步逻辑。
3. 模型指标的光环背刺:99%的准确率换了产线停线休整
节拍问题算是明的,过一次线就能看到。真正让技术团队跟生产团队互相甩锅的,是模型指标和产线体验之间的巨大落差。
算法团队汇报的时候,从来都喜欢说“准确率99.5%”“召回率98%”,乍一听很高,但产线根本不关心这些统计量,产线关心的是每万件里有多少良品被误杀,以及误杀的动作会带来什么后果。这里面涉及的指标叫过杀率。
我来讲个真实的案例。某五金件外观检测项目,模型在测试集上精确率(Precision)是99.1%,也就是100个报警里只有0.9个是误报,听起来相当不错。但产线一天出货4万件,按千分之五左右的原始报警率来算,一天报警200件,其中误报就有接近40件。有人会说40件也不算多啊?问题在于,这40件误报不是均匀分布的,基本都集中在某一个特定特征上:反光面毛刺。因为机加工刀具磨损后期会出现规律性毛刺,AI在训练时把“毛刺”和“材料纹路”的边界学得不够清晰,结果把大量正常的刀具纹路也判成了毛刺。
这些误杀件全部进入复判工位。复判工位原来只有一个人,原本的职责是确认真正的毛刺缺陷,现在他每天要额外看几十件良品,而且这些良品和真实缺陷在成像上高度相似,他需要把工件拿到放大镜下反复确认,单件复判时间从30秒拉长到5分钟。复判工位堆料,后面的包装段断料,整线被迫降速运行,直到晚上被误杀的良品经过二次确认回流,产能损失反而比真缺陷造成的损失大得多。
另一个被忽略的问题是召回率的代价。很多团队为了跟客户保证“漏杀少”,把召回率压到99%以上,这意味着模型会把所有疑似缺陷全部拦截下来。生产现场跟实验室不一样,产线上的工件形态千奇百怪,有油污、有磕碰、有料痕、有光照不均,大量本来不影响使用的“脏特征”都会被模型当作缺陷拦截。你为了抓住那一两个真正的漏网缺陷,付出的代价是拦截了海量可放行产品。在高节拍产线上,过杀比漏杀更伤产能,因为漏杀可以通过后端抽检和人工目检补救,而过杀直接冲击复判流程。
这里我特别想强调一个认知:AI视觉检测在产线上真正要优化的指标,不是模型精度,而是“每万件的过杀件数”和“每万件的漏杀件数”这两个组合指标。单独看任何一个都不够。漏杀决定客户投诉风险,过杀决定产线效率。两个要达到平衡点,不是说越高越好,而是要结合人工复判的产能来定。如果复判工位一天能消化200件,系统每天误杀控制在50件以内是可以接受的;如果复判只有半个人的产能,那过杀率就得压到极低。
实操上,推荐在模型测试阶段做一张“过杀-漏杀曲线”,跟模型团队明确:宁可漏杀率放宽到0.5%,也要把过杀率压到0.1%以内。这不是放纵缺陷,而是从系统总成本考虑的务实选择。因为漏杀件可以在后端成品检验环节再抽一层,而过杀件造成的复判人工成本和物料流转成本,是每天都在烧钱的。
4. 拦截策略是产能的分水岭:硬剔除、软剔除与人工复判流
模型指标达标了,节拍也验证过了,产线还是有可能崩,问题出在拦截策略上。
很多项目第一批上线的时候就要求做到全自动硬剔除:检测结果一出来,NG件直接由机械手拨到不合格线。这个方案听上去很酷,但实际上对过杀率的要求极其苛刻。前面说了,AI模型刚上线时跟产线实际数据的适配度一定存在gap,哪怕前期采集了两万张图,现场的光照、来料、批次差异都会带来模型没见过的新情况。在这个阶段直接开硬剔除,就是让一个还在实习期的员工去做最终裁决,出问题是必然的。
我建议的实践路径是分三阶段走。
第一阶段(1到2周)做仅标记模式。AI检测照常跑,结果只做LED亮灯提示和MES记录,不触发任何分选动作,所有产品还是走原有的人工目检流程。这个阶段的目的有三个:一是让产线员工观察AI的判断跟自己的判断有什么出入;二是采集真实现场的通过/拦截数据,用于量化过杀率和漏杀率;三是让算法团队基于新数据做第一轮迭代。
第二阶段(1到2周)做软剔除模式。AI判NG的工件自动分流到复判工位,但复判结果如果判定为OK,可以一键回流主线,不需要走报废流程。同时要设定一个比例阈值:如果某一天复判工位判定OK的比率超过30%,就说明模型过杀率太高,系统要自动报警,提示切换到保守模式。
第三阶段才是全自动硬剔除。这个阶段必须满足两个条件:连续一周的过杀率低于1%,且漏杀率为0,同时复判工位确认效率已经稳定。即便如此,我仍然建议保留一个“人工抽检确认”的物理旁路,给系统留后路。
拦截策略里还有一个极易被忽视的问题——信息流和物流的对应关系。系统判了NG,机械手也把它拨走了,但如果这条NG信息没能跟具体的物理工件绑定,复判工位就不知道手里拿的到底为什么被拦截,只能靠猜。尤其是当两条产线共用一台检测设备的时候,追踪信息混乱是常态。处理办法是给每个工件打二维码或钢印码,检测时扫码绑定结果,复判时扫码即可调出AI的判定截图和置信度,把“人找信息”变成“信息找人”。
另外复判工位的缓存设计也要提前规划。每个NG件在复判台的停留时间设定多少,缓存区放多少料架,信号灯用什么颜色表示积压告警,这些都会影响整线流动性。我的经验是:NG缓存区容量按“两小时峰值NG量”来设计,至少按正常量的一倍留冗余,否则一旦过杀率异常,缓存区直接爆掉,产线只能停线搬运。
这部分的底层逻辑其实是把AI系统当成一个需要训练和质量管理的员工来看待。你不会让一个刚来的新人独立做最终判定,同理也不要让一个刚部署的模型直接拥有拦截权。用制度设计去对冲模型初期的不可靠,是产线产能不崩的底线。
5. 数据闭环转不起来,视觉系统会越用越歪
很多项目上线之后,算法团队的交付就算完成了,模型冻结在主机里,再也不动。这是我看过的最多、也是后果最严重的问题。AI视觉检测不是一锤子买卖,数据闭环不转,系统的性能就一定会漂移,早晚会漂到产能崩盘。
我遇到过一个具体的漂移案例。某连接器产线,AI系统上线第一个月质量表现非常好,漏杀率0,过杀率0.3%。两个月后,过杀率悄悄涨到了2%,而且集中在特定批次的端子划痕判定上。查来查去,原因很简单:那个月供应商换了新的冲压模具,端子表面的微观纹路变了,AI在没有重新训练的情况下,把新纹路当成了缺陷。
这就是典型的数据漂移。产线上影响成像的因素太多了:光源LED用久了亮度衰减、机种切换、供应商批次更换、来料角度随机性、环境灰尘进入光学路径,每一个都能让图像分布偏移。而模型一旦部署上线、处于冻结状态,就没有任何自我修正能力。
要让数据闭环转起来,至少要建立三个机制。
第一个机制是图像回流与分级。所有经过检测的工件图像都要自动存储,系统至少要保留三个月。不是随便存,而是按“确认缺陷”“确认良品”“待仲裁”分成三个桶,每个桶的图都要有标签。尤其要保留“AI判NG但人工判OK”的图,这是训练模型最珍贵的数据。
第二个机制是周期性重训。我建议第一个月每周做一次增量训练,第二、三个月每两周一次,之后每月一次。增量训练不需要把全部历史数据重跑,而是用新标注的数据微调原有模型,训练成本不大,但能持续压制漂移。还要注意在重训前做数据清洗,把标注错误、重复帧、低质量帧全部筛掉,否则就是垃圾进垃圾出,模型会越训越歪。
第三个机制是灰度发布。每次新模型训练完成,不要直接覆盖线上的模型。我推荐的做法是:新旧模型并行运行48小时,对比同一批图像的判定结果差异,计算两个模型的重合度和分歧度。只有分歧度低于3%,且新模型在分歧样本上的表现明显优于旧模型,才能切换。这就相当于给模型迭代做了个“AB测试”,避免越改越差。
这里我要说一个容易忽略的组织问题:数据闭环需要现场人员配合标注,但现场人员的KPI往往是产量,不是数据质量,如果品管和算法团队不在一个考核体系里,回流标注就很难落地。所以数据闭环建设不能只靠技术手段,还要在制度上明确谁负责标数据、谁负责回收模型反馈,建议由品管牵头组织一个“AI运维小组”,定期开复盘会,拆分误判样本,明确改进归属。这套流程一旦运转起来,模型才能越用越准,产能才能从“上线时的高峰”变成“稳定运行的高原”。
6. 组织磨合和上线节奏:别看算法,先看人心
最后一个维度的坑,最容易被技术团队忽略——人的问题。
一线操作工的抵触心理是真实存在的。很多质检员干了七八年,靠眼睛和经验吃饭,公司忽然上了AI,他的第一反应不是“工具好用”,而是“我的饭碗要不要被端走”。这个情绪如果没人管,他会用脚投票:故意把节奏放慢,对复判工作消极怠工,甚至明明系统判了OK,他还要眼神示意后道再“手动检查一遍”。我见过一个工厂,上线两周后AI系统被偷偷关掉了电源,原因是夜班质检员觉得“机器判得不准,还是我眼睛靠得住”。
这种对立情绪很难通过说教解决,更好的做法是在制度设计上给足过渡期,并且把人放在“AI的上级”而不是“AI的下级”的位置。我在前面的章节里讲的双轨运行模式,本质上也是在为这个问题服务——在过渡期内,AI只是建议,人做最终决定。你要让员工感受到“我用AI是多了个帮手,不是被指挥”。复判工位的人工确认动作,也是在保留人的话语权,这个动作本身就是建立信任的过程。
还有一个组织层面的问题:上线节奏和考核指标必须解耦。很多工厂在上线第一周就把AI检测结果计入产能考核和一次良率统计,结果算法还在调优,产品就已经在背上“质量事故”的锅了。生产经理不是傻子,他会立刻把人工目检的比例调高,虽然这样保住了质量指标,但经过人工加AI的双重检测,产能直接腰斩。然后他会在周会上报告:AI视觉检测上线导致产能下降,建议退回人工。这套逻辑闭环下来,AI项目被毙掉几乎是必然结果。
我建议的上线节奏是这样的:第1到2周,AI检测结果只做记录不考核,产能统计维持原口径;第3到4周,AI结果作为参考项计入质量日报,但不直接触发批量停线或报废;第5到6周,AI自动拦截纳入正式考核,但设置“AI置信度低于0.9的NG件必须人工复核”的保护机制;只有在连续稳定运行一个月后,再把AI判定作为唯一判定依据,取消人工全检。这样既给了模型成长周期,也给了现场人员适应周期,还给了管理者建立信心的周期。
按这个节奏走,组织层面通常不会出太大问题,反而会在第3周左右出现一个有趣的现象:产线的老质检员开始主动给算法团队提“这个反光也能判吗”“这个凹坑为什么不拦”之类的建议。当一线人员开始帮AI改进,说明这个项目已经在组织层面落地了,这时候产能和良率指标才真正有了保障。
我回想自己看过的那么多AI视觉检测项目,凡是以“换掉人工”为目标上线的,几乎都经历了痛苦的磨合期;而凡是把“AI帮我减轻人工负担”作为定位来推的,反而在中后期自然达到了减少人力的效果。这就是组织和人心层面的逻辑,跟算法精度同等重要。
最后说两句我个人的体会。AI视觉检测上线后产能崩掉,真正的原因从来不是某一个单一的算法缺陷,而是一整套系统在节拍、过杀、拦截、数据闭环和组织磨合五个维度上的连锁反应。它就像新员工入职,指望他第一天就干满老员工一半的活,那是管理者的预期问题,不是新人的能力问题。所有准备上这套系统的工厂,建议把本文提到的这五个环节当成一份上线前的自查清单,逐项打钩之后再来谈产能提升。