1. 一个被忽视的真相:AI眼中的世界缺了一块
前阵子跟几个做数据标注和模型训练的朋友吃饭,席间有人抛出一个问题:现在的大模型能写代码、能画图、能分析财报,但它知不知道你楼下那家早餐店的包子是怎么从面粉变成成品的?桌上沉默了几秒,然后大家开始七嘴八舌。有人说AI可以看视频学习,有人说可以靠传感器数据,但聊到最后我们发现一个尴尬的事实:人类劳动在AI的认知体系里,几乎是隐形的。
这个判断不是拍脑袋来的。你仔细想想,互联网上关于“劳动过程”的数据有多少?一个建筑工人怎么绑扎钢筋、一个裁缝怎么量体裁衣、一个厨师怎么控制翻勺的火候,这些知识绝大多数存在于人的身体记忆和师徒传承里,根本没有被数字化。AI能抓取到的,是劳动的结果——一栋楼的照片、一件衣服的成品图、一道菜的摆盘照,但劳动的过程,那些手指的力度、身体的节奏、临场的判断,在训练数据里几乎是一片空白。
这就是“Human labour is largely invisible to AI”这个命题的核心。它说的不是AI笨,而是我们的数据世界本身就系统性地忽略了劳动过程。这件事影响的不只是AI研究,它直接关系到每一个靠手艺和实操吃饭的人——当AI越来越深地介入生产环节,那些“看不见的劳动”会面临什么?是会被更好地记录和传承,还是被进一步边缘化?我写这篇东西,就是想把这个问题的来龙去脉拆开,结合我自己在数据采集和模型训练中踩过的坑,给做AI产品、做行业数字化、做技能传承的朋友一些实在的参考。
2. 为什么劳动过程在数据世界里“查无此人”
2.1 劳动的本质是身体性的,而数据采集天然偏向符号化
我们先从根子上说。人类劳动,尤其是体力劳动和手艺劳动,它的核心特征是具身性——知识存在于身体里,通过肌肉记忆、触觉反馈、空间感知来调用。一个木工刨木头,他不需要在脑子里默念“角度15度、力度3牛顿”,他的手知道该用多大劲。这种知识叫隐性知识,是波兰尼那个经典比喻说的“我们知道的比我们能说出来的多”。
而数字世界是怎么记录东西的?靠符号。文字、数字、图像、音频,这些都是符号化的载体。问题在于,隐性知识很难被符号完整捕捉。你可以拍一个木工刨木头的视频,但视频里丢失了触觉信息、力反馈信息、木材纹理的细微变化信息。AI看这个视频,能学到“手在动”,但学不到“手为什么这么动”。
我做过一个实验,让团队用动作捕捉设备记录一个老师傅打磨玉器的过程。设备精度够高了吧?每秒120帧,手部关节角度精确到0.1度。但把数据喂给模型之后,模型能复现动作轨迹,却完全无法判断什么时候该换砂纸、什么时候该加水、什么时候力度要收。因为这些判断依赖的是师傅指尖的触感,而触感没有被采集。这就是数据采集的维度缺失——我们采了“形”,没采“感”。
2.2 互联网的内容生产逻辑天然排斥劳动过程
再往深一层看,互联网上为什么劳动过程的内容少?因为内容生产的激励机制不奖励过程。你发一个“十分钟学会换轮胎”的视频,流量大概率不如“十分钟看完一部电影”。平台算法偏好的是高完播率、高互动率的内容,而劳动过程往往冗长、重复、缺乏戏剧性。一个厨师炒一百盘同样的菜,前九十九盘都是“无效素材”,只有第一盘和第一百盘可能有看点。
这就导致了一个恶性循环:劳动过程内容少→AI训练数据里劳动过程样本少→AI对劳动过程的理解能力弱→基于AI的工具和产品对劳动过程支持差→劳动者更没动力去记录过程。我认识一个做非遗数字化保护的团队,他们花了三年时间采集了上千小时的刺绣过程视频,结果发现这些数据在公开互联网上几乎找不到,因为平台不给流量,创作者没收益,最后只能躺在硬盘里。
还有一个更隐蔽的问题:劳动过程的知识产权归属模糊。一个师傅的独门手法,拍成视频发出去,别人学了去,师傅的竞争优势就没了。所以很多真正有价值的劳动知识,是被刻意保护起来的,不会进入公共数据池。AI能学到的,往往是那些已经被标准化、去技能化的劳动过程,比如流水线拧螺丝,因为这种过程不怕被学。
2.3 标注体系的偏见:AI只认“结果”不认“过程”
就算我们采集到了劳动过程数据,还有一个标注的坎。现在的AI训练,尤其是监督学习,极度依赖标注。标注什么?标注结果。一张图里有猫,标“猫”;一段视频里有个人在走路,标“行走”。但劳动过程的标注要复杂得多——你要标“手腕发力”“重心转移”“呼吸节奏”,这些标注维度在现有的标注体系里根本没有标准。
我参与过一个工业质检AI的项目,目标是让模型判断工人操作是否规范。我们一开始让标注员标“动作是否正确”,结果标注一致性极低,不同标注员对同一个动作的判断差异超过40%。后来我们改成标“动作轨迹是否符合预设路径”,一致性上去了,但模型学到的只是“轨迹像不像”,而不是“操作好不好”。因为“好”这个判断,涉及太多隐性维度,标注员自己也说不清。
这里有个关键认知:AI的“看不见”不是技术能力问题,而是数据基础设施问题。我们建了一套以结果为导向的数据体系,劳动过程在这个体系里没有位置。
3. 看不见的劳动,正在被AI以三种方式“误伤”
3.1 自动化替代:只替代“看得见”的部分,留下更难的“看不见”部分
很多人担心AI替代人类劳动,但实际情况更微妙。AI替代的,往往是劳动过程中已经被符号化、可量化的那部分。比如一个仓库拣货员,他的工作包括“找到货架”“识别商品”“搬运”“扫码”“放置”。其中“识别商品”“扫码”是看得见的,容易被自动化;“找到货架”“搬运”“放置”涉及空间判断和身体协调,反而更难替代。
结果是什么?劳动者的工作被“切片”了。容易自动化的部分被机器拿走,剩下的部分变得更碎、更累、更难以形成完整技能。我见过一个物流仓库,上了自动分拣线之后,拣货员的工作变成了“处理机器分拣不了的异常件”。这些异常件之所以异常,往往是因为包装破损、标签模糊、形状不规则,处理起来比正常件麻烦十倍。工人的技能没有升级,反而被降级成了“异常处理工”。
3.2 绩效评估:AI用“看得见”的指标衡量“看不见”的劳动
第二个误伤来自绩效评估。现在很多企业用AI做绩效管理,采集的指标是什么?产出数量、完成时间、错误率。这些指标能反映劳动结果,但反映不了劳动过程中的隐性付出。一个客服人员,他花十分钟安抚一个愤怒的客户,和花十分钟机械回复十个标准问题,在AI的绩效系统里可能后者得分更高,因为“处理量”更大。但前者的劳动价值——维护客户关系、避免投诉升级——在数据里是看不见的。
我有个做呼叫中心的朋友,他们上线了一套AI质检系统,自动分析通话录音,给客服打分。系统上线三个月后,客服团队的整体满意度反而下降了。原因很简单:客服们发现,系统奖励的是“语速快、话术标准、通话时长短”,而不是“真正解决问题”。于是大家开始追求“快速结束通话”,把复杂问题推给下一环节。AI看不见“耐心倾听”和“共情回应”的价值,因为它没有被标注为绩效指标。
3.3 技能传承:AI学不会的,人也快忘了
第三个误伤最深远。当AI成为主要的知识载体,那些AI学不会的劳动技能,会逐渐失去传承渠道。年轻人学手艺,以前靠师傅带徒弟,现在靠看视频、查资料。但视频和资料里没有的东西——比如手感、火候、时机——AI给不了,人也给不了。
我认识一个做传统木工的老先生,他说现在来学木工的年轻人,第一句话往往是“有没有教程”。他说:“教程能教你锯直线,但教不了你什么时候该换锯条。这个‘什么时候’,我当年是看我师傅换了,我才知道。现在没人看了,因为大家都在看手机。”这句话让我想了很久。AI看不见的劳动,不只是AI的问题,它正在改变人类传承劳动的方式。当“可见”的知识被AI高效传播,“不可见”的知识反而加速流失。
4. 让劳动“可见”:三条可落地的技术路径
4.1 多模态采集:把触觉、力觉、空间感纳入数据管道
要让AI看见劳动,第一步是采集更丰富的信号。传统的视频和图像不够,需要引入多模态传感。具体来说,至少包括:
- 力觉传感:在工具或手套上安装力传感器,采集施力大小、方向、持续时间。比如打磨、拧螺丝、揉面这些动作,力觉数据是关键。
- 触觉传感:用触觉阵列传感器采集接触面积、压力分布、纹理变化。这对判断“手感”至关重要。
- 惯性测量:用IMU采集肢体加速度和角速度,还原动作的动力学特征。
- 眼动追踪:记录劳动者在操作过程中的视线焦点和转移路径,这能反映“注意力的分配”,是隐性知识的重要维度。
我参与过一个面点师技能数字化的项目,我们在擀面杖上装了力觉传感器,在案板下装了压力阵列,在师傅头上戴了眼动仪。采集了三个月数据之后,我们发现一个有意思的规律:师傅在擀面时,视线焦点不是固定在面团上,而是在面团边缘和擀面杖之间快速切换。这个“切换频率”和面皮的均匀度高度相关。这个发现靠视频是绝对看不出来的。
实操建议:多模态采集的难点不在传感器本身,而在时间同步。不同传感器的采样率不同,力觉可能1000Hz,视频只有30Hz,眼动可能60Hz。必须做硬件级的时间戳对齐,否则后期融合会出大问题。我们当时用了一个FPGA做硬件触发,所有传感器共用一个时钟源,才解决了这个问题。
4.2 过程标注:从“结果标签”转向“动作单元”
采集了数据,下一步是标注。传统的标注是给结果打标签,现在需要给过程打标签。我推荐的做法是借鉴动作单元的思路,把连续劳动过程切分成离散的动作单元,每个单元标注其功能、力度、节奏、注意事项。
具体操作流程:
- 动作分割:用算法或人工把劳动过程切分成有意义的片段。比如“拿起工具”“定位”“施力”“检查”“调整”五个单元。
- 单元标注:对每个单元标注多个维度。以“施力”为例,标注力度等级(轻/中/重)、施力方向、持续时间、身体姿态。
- 关系标注:标注单元之间的依赖关系。比如“调整”单元往往发生在“检查”单元发现偏差之后。
- 质量标注:标注这个动作单元的执行质量,是“标准”“勉强”还是“错误”。
这套标注体系我们在一家汽修厂试点过,用来训练AI判断钣金修复操作是否规范。效果比传统的结果标注好很多,因为模型能学到“哪个动作单元出了问题”,而不是只判断“最终结果好不好”。
4.3 仿真与迁移:用数字孪生补足稀缺样本
劳动过程数据有个天然问题:样本稀缺。一个师傅一天可能只做几次高难度操作,采集一年也攒不够训练数据。这时候需要数字孪生和仿真迁移来补足。
具体做法是:先基于采集到的真实数据,在仿真环境里重建劳动场景。比如一个焊接场景,仿真里可以调整电流、电压、焊速、角度、材料厚度等参数,生成大量“虚拟焊接过程”。然后把这些虚拟数据与真实数据混合训练,让模型学到更泛化的劳动过程理解能力。
这里的关键是仿真参数的标定。仿真不能瞎设参数,必须用真实数据反推。我们当时用了一个优化算法,以真实采集的焊接电流和熔池形态为目标,反向求解仿真里的热传导系数和材料参数。标定之后,仿真数据的分布和真实数据接近了,迁移效果才出来。
| 技术路径 | 核心解决的问题 | 主要难点 | 适用场景 |
|---|---|---|---|
| 多模态采集 | 数据维度缺失 | 时间同步、传感器标定 | 手工艺、精密操作 |
| 过程标注 | 标注体系缺失 | 标注一致性、标注成本 | 工业质检、技能培训 |
| 仿真迁移 | 样本稀缺 | 参数标定、仿真真实性 | 高风险、高成本操作 |
5. 实操复盘:一次劳动过程数字化的完整记录
5.1 项目背景与目标设定
去年我参与了一个陶瓷拉坯技艺的数字化项目。目标很明确:把一位从业四十年的老师傅的拉坯过程完整记录下来,训练一个AI模型,能够判断拉坯过程中哪些动作会导致器型偏差。这个项目的难点在于,拉坯是高度依赖手感的劳动,泥土的湿度、温度、可塑性都在变化,师傅的每一个动作都是实时调整的结果。
我们设定的技术指标是:采集至少200次完整拉坯过程,每次过程包含视频、手部力觉、泥料湿度、转盘转速四路数据;标注至少5000个动作单元;模型对“器型偏差”的预测准确率超过85%。
5.2 数据采集方案与现场踩坑
采集方案我们改了三次。第一版方案是在师傅手上贴力觉传感器,结果师傅说“贴了东西就不会拉了”,数据全是废的。第二版方案是在拉坯机下面装压力板,但压力板只能测总压力,测不到手指的局部施力。第三版方案是定制了一副薄手套,在指尖和掌心嵌入柔性力觉传感器,厚度控制在0.5毫米以内,师傅试了之后说“勉强能接受”。
现场踩的坑更多。最大的坑是泥料湿度变化。我们一开始没有实时监测湿度,结果发现同一批数据里,前半小时的泥料湿度和后半小时差异很大,导致模型学到的“施力模式”其实是湿度变化的混淆。后来加了一个湿度传感器,每30秒采一次,把湿度作为协变量纳入模型,效果才稳定下来。
还有一个坑是转盘转速的干扰。拉坯机的转速不是恒定的,师傅会根据器型调整转速。我们一开始把转速当成固定值处理,结果模型在转速变化时预测完全失效。后来把转速作为输入特征,并且做了归一化,才解决了问题。
5.3 标注体系的设计与迭代
标注体系我们迭代了四版。第一版是让师傅自己标,标“这一步在干什么”。师傅标得很随意,一致性很差。第二版是让三个标注员独立标,然后取多数投票。一致性上去了,但标注速度太慢,标一次拉坯要花四个小时。第三版是先用算法做预分割,标注员只做修正。速度提升到一小时,但预分割的准确率只有70%,修正工作量还是很大。
第四版我们换了个思路:让师傅和标注员一起标。师傅操作,标注员在旁边问“这一步为什么这么做”“如果泥料干一点会怎样”。师傅边做边解释,标注员记录。这样标出来的数据,不仅有了动作标签,还有了决策理由。这些理由后来成了模型解释性的重要来源。比如模型判断“器型会偏”,它会输出“因为第37个动作单元的施力方向与泥料湿度不匹配”,这个解释就是来自标注时师傅的原话。
5.4 模型训练与效果验证
模型我们用的是时空图卷积网络,输入是四路数据的融合特征,输出是器型偏差的预测。训练集用了180次拉坯过程,验证集20次。最终模型在验证集上的准确率是87.3%,比目标高了2.3个百分点。
但更有意思的是错误分析。模型预测错的那些案例,我们回看数据发现,大部分是师傅“故意做错”的——他在尝试新的器型,或者泥料本身有问题他在补救。这些“异常”过程在训练数据里很少,模型没见过,所以预测不准。这反过来印证了一个观点:劳动过程中的“异常处理”是最难数字化的部分,因为它依赖的是即时的、创造性的判断,而不是标准化的动作。
这个项目给我最大的教训是:不要试图把劳动过程“标准化”。劳动的魅力恰恰在于它的灵活性和情境依赖性。AI要学的不是“标准动作”,而是“在什么情境下做什么调整”。这需要完全不同的数据采集和标注思路。
6. 常见问题与排查技巧实录
6.1 采集阶段:传感器干扰与数据质量
问题一:传感器影响操作
这是最常见的坑。任何贴在身上的传感器,都会改变劳动者的操作习惯。我的经验是:传感器越轻、越软、越无感越好。如果实在做不到无感,就要留出足够的适应期。我们当时让师傅戴着手套练了一周,等他完全习惯了才正式开始采集。
问题二:数据漂移
长时间采集会出现数据漂移。力觉传感器会温漂,视频会有光照变化,湿度传感器会受环境影响。解决办法是定期校准和采集参考信号。我们每采集一小时,就让师傅做一个标准动作(比如空手捏一下),作为校准参考。
问题三:多设备同步失败
多模态采集最怕时间不同步。我们踩过的坑是:视频和力觉数据的时间戳差了200毫秒,导致模型学到的“施力-动作”对应关系完全错位。后来用硬件触发解决了,但前期浪费了两周数据。
6.2 标注阶段:一致性与成本控制
问题四:标注员不理解劳动过程
标注员往往没有相关劳动经验,标出来的东西“形似神不似”。解决办法是让标注员先体验。我们让标注员自己试着拉坯,拉了半天拉不出一个像样的碗,之后他们标注时明显更谨慎了。
问题五:标注成本失控
过程标注比结果标注贵十倍不止。控制成本的关键是分层标注:先粗标,把明显无意义的片段剔除;再精标,只标关键动作单元。我们最后只精标了30%的数据,模型效果已经够用了。
6.3 模型阶段:过拟合与泛化难题
问题六:模型在训练集上很好,换个人就废
这是劳动过程数据的通病。不同人的操作习惯差异太大,模型容易过拟合到特定人的风格。解决办法是多主体采集和风格归一化。我们采集了三位师傅的数据,用对抗训练让模型学“与风格无关”的特征。
问题七:模型无法解释判断依据
工业场景下,模型说“这个操作有问题”但不说为什么,工人不会服气。解决办法是引入注意力机制和决策理由标注。让模型输出“哪个动作单元导致了判断”,工人才能针对性改进。
| 问题类型 | 典型表现 | 排查思路 | 解决技巧 |
|---|---|---|---|
| 传感器干扰 | 操作变形、数据异常 | 对比无传感器时的操作 | 轻量化、适应期 |
| 数据漂移 | 模型效果随时间下降 | 检查传感器基线 | 定期校准、参考信号 |
| 同步失败 | 动作与信号错位 | 检查时间戳对齐 | 硬件触发、统一时钟 |
| 标注不一致 | 标注结果差异大 | 计算标注者间一致性 | 体验式培训、分层标注 |
| 过拟合 | 换人效果骤降 | 交叉验证不同主体 | 多主体采集、对抗训练 |
| 解释性差 | 工人不信任模型 | 检查输出可解释性 | 注意力机制、理由标注 |
7. 这件事对做AI产品和行业数字化的人意味着什么
7.1 产品设计:从“替代人”转向“增强人”
如果你在做AI产品,尤其是面向工业、服务业、手工艺领域的产品,我建议把思路从“替代人”转向“增强人”。AI看不见的劳动过程,恰恰是人的核心价值所在。产品应该做的是放大这部分价值,而不是试图用标准化动作去覆盖它。
具体来说,可以做实时过程反馈。比如在工人操作时,AI通过多模态传感实时分析动作,在关键节点给出提示:“力度偏大”“角度偏了2度”“该换工具了”。这种产品不替代工人的判断,而是辅助工人做得更好。我见过一个做焊接辅助的团队,他们的产品就是在焊工操作时,通过AR眼镜显示熔池温度和建议焊速,焊工反馈很好,因为“它不抢我的活,它帮我干得更好”。
7.2 数据战略:把劳动过程数据当成核心资产
如果你在做行业数字化,我建议把劳动过程数据列为战略资产。现在大多数企业的数据战略关注的是交易数据、客户数据、设备数据,劳动过程数据几乎没人管。但恰恰是这部分数据,包含了企业最核心的隐性知识。
我建议的做法是:建立劳动过程数据采集的常态化机制。不是搞一次项目就完了,而是把采集设备、标注流程、存储规范都固化下来,让劳动过程数据像财务数据一样被持续记录。这件事短期看不到回报,但长期价值巨大。等AI能力进一步渗透到生产环节,谁有劳动过程数据,谁就有训练行业模型的资本。
7.3 技能传承:用AI做“隐性知识的显性化”
最后说回技能传承。AI看不见劳动,但AI可以帮我们看见劳动。通过多模态采集和过程标注,那些原本只存在于师傅身体里的隐性知识,可以被部分显性化、可传承化。
我见过一个做中医推拿数字化的项目,他们用压力传感手套采集推拿师的手法,把“揉”“按”“推”“拿”这些动作的力度、频率、轨迹都记录下来,然后做成教学系统。学员戴上手套练习,系统会实时反馈“力度不够”“频率太快”。这个项目的价值不在于AI替代推拿师,而在于让推拿教学从“口传心授”变成了“数据辅助”。师傅的经验被部分保留下来了,即使师傅不在了,数据还在。
这件事的深远意义在于:当AI让劳动过程变得可见,我们实际上是在为未来的劳动建立档案。一百年后的人回看我们这个时代,他们不仅能看到我们生产了什么,还能看到我们是怎么生产的。那些原本会消失的劳动细节,被数据留住了。
我个人在实际操作中的体会是:做劳动过程数字化,最难的不是技术,而是让劳动者信任你。师傅们一开始都很警惕,怕被“偷师”,怕被“替代”。你得花大量时间跟他们泡在一起,让他们明白你做的是记录和传承,不是替代和剥夺。信任建立了,数据才真实,项目才做得下去。
最后再分享一个小技巧:如果你要开始做劳动过程采集,别一上来就搞多模态。先用最简单的单路视频,加上师傅的口述录音,把过程跑通。等师傅习惯了被记录,再逐步加传感器。我见过太多项目,一上来就堆设备,结果师傅不配合,数据全是废的。慢就是快,这句话在劳动过程数字化里特别成立。