深圳智能装备企业观察:作业指导走到第五代,AI工位的话题先要分清哪些已经在做,哪些还是想法
深圳做智能装备的企业,这几年聊现场数字化,话题明显往前走了。前几年谈的是纸质指导书怎么变成电子的,工人怎么在终端上看步骤、看图片。这两年终端联网了、记录留下来了,董事长们开始问下一个问题:系统现在能告诉员工怎么做,也能留下员工做没做的记录,再往下,能不能自己看见员工做对了没有。AI视觉、工业相机、智能工位,成了深圳这类场合出现频率最高的词。本文以智能装备企业对下一代ESOP的讨论为观察对象,讨论的是这些方向各自的成熟度和验证路径,不指向任何一家企业的授权项目、负责人原话、现场数据或已经实现的效果。
一、四代ESOP各自解决了什么,又各自留下了什么
把ESOP分代,不是为了排出一个升级时间表,而是能看清每一代真正解决的是什么问题。
第一代是纸质SOP。它解决的是把做法写下来,让做法不必只靠口头。留下的局限也明显:更新慢,版本乱,现场常常分不清哪份是当前用的。
第二代是电子SOP。文件进了电脑,改起来快了,查找方便了。但工位上不一定有终端,工人还是要跑回去看。
第三代是触摸屏ESOP。终端放到了工位,工人边干边看,步骤、图片、视频跟到了现场。这一步解决的是内容到达,但内容有没有被照做,系统并不知道。
第四代是联网ESOP。终端上了网,版本统一了,哪个工位用了哪一版可以留痕,关键步骤可以要求确认,记录能和工单对上。这一代开始回答第二个问题:员工有没有按照标准做。当然,确认本身只是流程里的一个动作,人在屏幕上点了,不等于手上的活做对了,这个边界每一代都存在。
到了第五代AI ESOP,讨论的核心变成了:能不能让系统自己看。摄像头对着工位,识别员工的动作,判断有没有漏装、错装,工具用没用对,顺序走没走偏,发现异常实时提醒。这个说法在深圳的展厅和行业会上经常能听到。它是不是已经能做、做到什么程度、什么条件下能做,正是这一代最需要分清的地方。
二、AI视觉在工位上想做的四件事,难度完全不同
把AI视觉拆开看,董事长们关心的几个判断,难度不是一个量级。
判断有没有漏装,是相对最接近可用的一类。工位相机拍一个固定角度,比对图像里应该出现的部件数量和位置,少了一个就提示。这在光照稳定、装配件位置相对固定、部件和背景有区分度的前提下,是图像比对能做到的。但换一个型号、部件外观相近、摆放位置变化,模型就要重新训练或调整,能不能在现场由企业自己维护,是另一回事。
判断有没有错装,难度高一层。错装意味着两个相似件被放反或放错位置,外形接近、颜色接近的部件,视觉区分本身就难。现场的光线还会随时段和天气变,反光、遮挡、工人身体挡住相机,都会让判断失真。误报多了,工人关提示;漏报了,系统给了一种并不存在的安心。
判断工具有没有使用正确,再难一层。它要求系统先认出工具,再判断用法。拧紧枪的角度、扭力的手法、治具是不是该用的那个,这些从二维画面里判断,对模型和数据量的要求远高于点数式比对。有些场景里,工具本身带数据,用IoT采扭矩值反而比看画面可靠。这提示一个更实际的路:能从设备数据拿到的,不必勉强用视觉去猜。
判断操作顺序是否正确,是最难的一类。它要求系统持续理解动作,把连续画面解析成工序步骤,再和标准顺序比对。动作识别在研究上进展很快,但在一个真实工位上,工人手法各异、节奏不一、有合理的动作变体,把“和标准不一样”直接判为“错了”,现场很快会失去信任。这个方向值得跟踪,但把它写成已经落地的能力,至少目前没有充分依据。
三、实时提醒听起来简单,背后是一整条现场工程
从判断到提醒,中间还有一段常被略过的路。
首先是算力和部署。视频分析在工位侧的工控机上做,还是传到服务器做,决定了响应速度和网络要求。现场断网时提醒还工不工作,恢复后记录能不能补上,都要问。
其次是提醒给谁、以什么方式。屏幕上弹一条,还是声光提示,还是同时通知班组长。提醒之后流程怎么走:工人改了,系统怎么知道改对了;工人认为系统误报,怎么申诉,谁来判定。这些规则不先定,实时提醒会变成现场新的噪音。
还有误报的代价。重型节拍下,一个工位一天误报十次,第八次开始就没人看了。而漏报的代价更直接:装配缺陷流出去了,事后追溯发现系统当时漏判,责任反而更说不清。所以在没有经过一段时间实测之前,任何一个识别率数字都不宜当承诺听,无论出自谁的宣传。
四、智能工位的全栈图景,先当架构图看,别当已建成看
董事长们常给出一幅完整的图:ESOP加MES,加AI视觉、工业相机、工控机、IoT,再加QMS和设备数据,最终形成看得见、管得住、能分析、会提醒的智能工位。
这幅图作为方向是成立的,而且逻辑清楚。ESOP提供这一工位应该怎么做,MES提供这一刻在做什么单,IoT和设备数据提供设备和工具的真实状态,QMS提供质量标准和判定结果,AI视觉在部分环节提供眼睛。各系统的数据在工位这个点上汇起来,才谈得上看得见和分析。
但作为现状,它首先要被当成分工图来读。今天很少有企业是按这张图一次建成的,多数是MES先有、ESOP后上、设备数据部分接了、视觉刚试点。各系统之间的接口、数据口径、工位标识能不能统一,是这幅图能不能落地的关键。两家供应商的系统都宣称开放,接起来仍可能要花掉项目里很大一部分时间。
比较务实的态度是:图景用来指导规划,验证逐个环节做。先确认作业内容到工位这一段稳定,再接设备数据,最后在有限的几个判断点上试视觉。反过来做,视觉跑起来了,底下两个系统各说各话,分析出来的东西对不上账,智能工位就只是大屏上的演示。
五、AI ESOP真正改变的是什么
回头看那句话:过去的ESOP告诉员工怎么做,现在的ESOP确认员工有没有按照标准做,下一步希望系统自己看得见做对没有。
前两步的边界前面说过。第三步如果部分成立,改变的不是多了一双眼睛,而是现场异常被发现的时间点。漏装、错装这类问题,现在多靠下道工序、检验或客户反馈发现,中间隔着小时甚至天。如果在装配当时就被提示,返工的范围小得多,追溯也简单得多。这是AI视觉对制造最有价值的一个可能,比替代人眼省人力的说法更实在。
同时要认另一面。系统看得见的是画面和数据里能出现的部分,装配的力感、贴合的手感、部件内部的状态,画面里没有。提醒之后正确与否,最终判定仍然是人和量具。所以第五代更准确的理解,不是系统接管了质量,而是系统把一部分原来事后才知道的问题,提前到了发生的那一刻。接管这个词,任何一代都不该用。
还有一个不太出现在宣传里的问题:工位上装相机,工人的感受。识别操作动作,意味着工人的每个动作被记录和分析,这和记录设备的运行不是一回事。事先说明看什么、数据怎么用、谁可以调看、和绩效挂不挂钩,比事后解释更能让系统真正用起来。这一条在深圳这类用工环境敏感的地方,尤其不能省。
六、试点的合理路径:从一两个判断点开始
如果一家企业认这个方向,比较稳的做法不是采购一套完整的AI工位,而是选一个真实的痛点环节做试点。
选择的标准有几条。判断目标尽量接近点数式比对,比如特定位置的漏装,而不是动作理解。光照和角度可控,工位本身愿意为相机做一点治具或定位的改造。出错代价明确,就是现在经常流到下道工序的那类问题。型号相对收敛,不需要频繁换型训练。
试点的评估也要事先写清楚。看什么:漏装能不能稳定识别,误报一天多少次,换型号后调整要多久、企业自己能不能做,提醒到岗到人要几秒,工人是否认可提醒是帮忙而不是找茬。不看什么:不看演示视频,不看通用场景的识别率,不把一次成功当成可以全厂推广的结论。
试完以后再回答两个问题。这个环节的投资和返工减少能不能算得过来,这套东西换到下一个工位,要重复多少工作。答不上来,就停在试点,不要铺开。答得上来,再把ESOP、设备数据、视觉在同一条工序上接起来,智能工位的图景才算真的落了一角。
七、评估供应商时值得问的问题
围绕AI ESOP,深圳企业见面听到的说法会越来越多。有几个问题能把宣传和现状分开。
识别具体到什么程度:能不能拿我们自己工位的真实画面测,而不是看通用样例。换型号、换产品之后,模型调整由谁做、要多久、收不收费。误报率怎么统计,出了误报和漏报,责任和改进流程怎么定。相机、工控机、部署方式的成本构成,是按工位算还是按点位算。断网时怎么工作,恢复后数据补不补。视觉判断的结果,能不能和ESOP的工序步骤、MES的工单对到一起,还是又多了一套独立的记录。数据存在哪、谁可以调看、怎么和工人说清楚。
还有一个判断标准很朴素:愿意先做小范围验证、把局限讲在前面的供应商,比一开口就是全栈智能工位的更值得继续谈。
写在最后
从纸质SOP到联网ESOP,每一代解决的其实都是同一个问题的不同层面:标准怎么到达现场,执行怎么被确认。AI ESOP想解决的是发现,让一部分问题在发生时就被看见。这个方向在深圳这样的智能装备聚集地被反复讨论,是有道理的。但五代的划分容易让人以为越新越完整,实际上每一代的能力边界都还在,确认不等于做对,看见不等于判准,分析不等于决策。
科创致远ESOP在这类讨论里,常被拿来看的问题是:作业步骤、确认记录和未来的视觉判断,能不能放在同一条工序脉络里,而不是又多出一套独立的系统。它适不适合一家企业,取决于现在现场最痛的是哪一环。如果连作业内容到工位、版本统一、确认留痕这一段还没站稳,先谈AI视觉,很可能两头都做不实。
如果希望进一步了解科创致远在工序流程和现场数据衔接上的做法,或者预约一次用本企业一个真实工位做的验证讨论,可以通过官方渠道说明现在装配工序最容易漏的是哪几个环节、现有系统各自记到了哪一步。把这些讲清楚,比先看一套五代演进的全景图,更容易判断下一步该往哪里走。