
先说一个我陪朋友踩过的坑。某机械集团2023年立项做AI质检前后花了近四百万买了两台双卡GPU服务器部署了一个视觉大模型还搭了块数字孪生大屏。验收那天的演示效果非常漂亮缺陷识别率98.6%。但是三个月后我再问系统已经停了一周——换产线的时候老师傅调了工艺参数模型误报率直接翻倍懂算法的人离职了剩下的工人只会重启服务没人敢改参数。那笔投资最后变成了机房里的两台“AI取暖器”。这话不太好听但这就是过去几年工业AI最真实的写照项目做得越多闲置得越多。问题不在AI本身不好用而在于我们把工业AI做成了一场算力军备竞赛。动辄私有化大模型、千卡集群、高保真数字孪生大屏、无人黑灯工厂看起来方向没错实际上大部分企业连基础的数据闭环都没打通更别说让一线工人信任和使用了。我花了很长一段时间去复盘这类项目发现那些真正跑起来、能用下去的往往不是最“智能”的而是最“轻”的。这里说的轻不是功能缩水而是从算力、模型、数据、部署到业务范围每一项都精准匹配实际需求。这篇文章就想把这些经验拆开聊聊围绕“工业AI轻量化落地”这个核心讲清楚什么样的智能化才不是无效投资以及轻量化在工业现场到底怎么落地。1. 无效智能化的三个病根为什么你上了AI产线还是跑不起来想谈轻量化得先搞清楚重病出在哪儿。我接触过的失败项目基本可以归到三类原因而且这三类原因往往是叠加出现的。1.1 以“技术展示”立项而不是以“解决问题”立项这是一个非常隐蔽但杀伤力极大的病根。大量项目在立项阶段就歪了——企业客户想要一个“AI示范项目”用来向上汇报和对外参观系统集成商想要一个“灯塔案例”用来参与评奖和拿更多订单。双方目标高度一致把项目做得“看起来够先进”而不是“把某个生产痛点解决掉”。举个典型例子。有个做压铸件的工厂最初的需求其实很简单人工目检效率低漏检率高想用视觉检测代替人工。结果方案评审的时候有人提出“既然都上AI了顺便把数字孪生也做了把整条产线映射到虚拟空间里”。后来又有人说“既然要建孪生干脆把MES、ERP、PLC数据全接进来做一个生产调度大脑”。需求像滚雪球一样越滚越大预算从80万滚到300万交付周期从3个月拉到12个月。最后交付时数字孪生大屏确实漂亮但一线反馈是那个大屏除了参观的时候打开平时根本没人看质检模型因为数据太少误报率一直压不下来形同虚设。这种失败的本质是技术选型没有锚定业务问题而是被“技术叙事”带动。供应商要讲故事客户要面子唯独没人认真算一笔账——这个AI项目上线后每个月能给工厂省多少人工成本降低多少不良品损失。1.2 误以为算力等于智能被GPU服务器绑架绝大多数制造业企业根本没有把模型训练和推理分开考虑以为AI就是要买贵的算力设备。我见过太多工厂一个缺陷检测项目模型只有几MB大小推理用CPU都能跑得飞快非要买双卡A100的服务器。最后利用率不到5%平时就在机房吃灰。更麻烦的是大算力带来的是高功耗和高故障率。车间环境粉尘大、温度高、电压不稳GPU服务器在这种环境下非常娇贵。我有个做电子元器件检测的客户服务器装在产线旁边的简易机房夏天温度能到40度GPU经常过热降频推理速度忽快忽慢生产节拍直接被拖垮。最后他们不得不额外花十几万装工业空调这比服务器本身还贵。这里有个核心误区工业AI的推理任务和在云端做大模型的训练任务是两码事。工业场景绝大多数是单一任务、固定输入、固定输出比如检测一个产品有没有划痕、预测一台设备什么时候该保养、识别一个工件该放到哪个分拣箱。这种任务的模型参数量通常在几百万到几千万之间单张图片推理时间在几十到几百毫秒。对这类任务来说一台带核显的工业工控机已经绰绰有余。盲目上GPU服务器本质上是用航母运快递成本高而且不灵活。1.3 忽略产线的动态环境验收即死亡这是最扎心的一条也是所有做工业AI的人都绕不开的坎。工业现场不是静态实验室是一个持续变化的环境。以质检为例。一个模型在实验室里用固定光源、固定角度、固定工件样本测试效果当然好。但产线不停机今天的毛坯材料批次、刀具磨损状态、冷却液浓度、车间自然光照都和昨天不一样。换一个产品型号工件的形状特征、表面纹理、缺陷分布可能完全变了模型需要重新适应。问题在于大部分项目的交付方式是一锤子买卖。集成商交付完模型源码和一份操作手册就走了企业自己的团队没有算法能力遇到模型不准只能干瞪眼。我见过一家工厂的AI质检系统上线第一周误报率还能接受第二周因为换了原材料供应商表面光泽度变化误报率直接飙到30%。工人烦不胜烦直接把检测工位旁的系统显示器关了回到人工目检。这个项目从此再也没被打开过。病根很清楚项目没有设计持续迭代的机制。AI系统的生命周期和传统软件不一样模型需要持续监控、反馈、重训。没有这个闭环任何模型都会在环境漂移中慢慢失效。这三个病根加起来基本可以解释为什么中国制造业的AI项目存活率这么低。所以轻量化的第一层含义不是技术上做小了而是从立项逻辑上就先做小——小到让问题暴露得早、让团队维护得住、让投资回收得快。2. 轻量化不是阉割算力经济学下的方案设计逻辑什么是轻量化很多人的第一反应是把大模型换成小模型把服务器换成工控机把GPU换成CPU。这个理解太片面了。轻量化的本质是在一组约束条件下寻找“满足业务需求的复杂度最低的解”。2.1 先列约束再选方案我接手任何一个工业AI项目第一步永远不是选算法而是盘点约束条件。这有点像装修房子先量面积、看户型、确认水电位置再谈设计风格。工业AI的约束条件大概有这几类业务指标约束缺陷漏检率允许多少误判率允许多少检测节拍是否要跟上产线速度硬件约束现场有没有空闲工控机是否允许增加新的计算设备供电和散热条件如何人员约束现场有没有能维护模型的算法工程师还是只能靠自动化工程师和设备维护人员数据约束现有的历史数据有多少标注资源是否充足是否有数据安全要求时间约束产线改造窗口期有多长是3天还是3个月这些约束条件会直接决定技术路线。举个例子同样是外观缺陷检测如果现场有一台闲置的Intel工控机节拍要求是每分钟60件那我大概率会选择YOLOv8n这类轻量级目标检测模型用OpenVINO做推理加速跑在CPU上就够了。如果节拍要求是每分钟200件那可能需要在边缘推理卡上做优化或者考虑更小的模型变体。如果现场数据非常少只有200张缺陷图那我可能需要借助预训练权重做迁移学习配合强数据增强来压住过拟合。2.2 算力经济学为什么小模型反而更划算工业AI项目的投入远不只是硬件采购成本。算上安装调试、软件开发、模型训练、系统集成、后期维护一个项目的总持有成本非常惊人。大算力方案在这些环节上都会产生额外开销成本项大算力方案GPU服务器轻量化方案工控机CPU推理硬件采购单台8万-30万元含GPU现有设备利旧新增成本0-3万元机房环境需空调、稳压、防尘普通工业控制柜即可功耗单卡功耗200-400W整机上千WCPU推理功耗50-80W运维门槛需懂CUDA、驱动、容器安装推理引擎即可自动化工程师能上手故障影响GPU故障整机停摆多台工控机互为备份故障影响面小有人在硬件上省钱却在软件上花大钱这是典型的倒挂。轻量化方案把硬件成本压到最低的同时也把维护门槛降下来了。一个懂PLC、懂工控机的电气工程师经过短期培训就能处理大部分日常问题。这意味着企业不需要专门养一支算法团队。2.3 模型不是越大越聪明刚好才是最优解大模型在某些复杂任务上确实有优势但这不代表在所有任务上都该用大模型。工业场景大部分任务是单模态、小类别数的识别和预测问题比如区分5种缺陷、预测1台设备的剩余寿命、判断1个机械臂抓取姿态是不是正确。这类任务的信息量就那么多模型规模大到一定程度后收益会急剧衰减。我用一个粗浅的类比来解释让一个博士生做小学数学题正确率肯定高但你只需要一个会做乘法口诀的高中生就够了而且高中生招来成本低、听指挥、不容易跑路。工业AI的模型选型也是这个道理模型能力要刚好匹配任务难度留出一点点裕量应对环境波动就够了。那怎么判断“刚好”有个经验公式先用一个预训练的小模型几MB参数量跑通流程看精度离目标差多少。如果差得不多优先通过补充数据、优化增强、调参来解决而不是直接换大模型。如果差的确实多再考虑蒸馏或者扩大模型。这个顺序能避免一上来就掉进大模型的坑里。3. 模型轻量化三板斧剪枝、蒸馏、量化在车间里的正确用法如果模型确实是瓶颈需要从模型层面做轻量化那最常用的就是三件事剪枝、知识蒸馏、量化。工业现场不需要你研究这些技术的数学原理透彻到什么程度但一定要知道它们各自解决什么问题、在什么场景下用、有哪些坑。3.1 结构化剪枝砍掉不干活儿的通道神经网络训练完成后并不是所有参数都在起作用。很多通道对最终输出贡献极小剪枝就是把它们剪掉。工业场景建议做结构化剪枝也就是按通道、按层去剪而不是逐参数剪因为结构化剪枝后模型还是规整的矩阵运算可以直接放进推理引擎加速不需要额外的稀疏计算库。实际执行时常用做法是看BN层的缩放因子。BN层里的缩放系数γ如果训练后趋近于0说明这个通道的输出接近常量对后续层没什么影响剪掉它几乎不影响精度。把所有的γ按绝对值排序设定一个全局裁剪比例比如剪掉30%的通道然后微调几个epoch观察精度变化。我在实际项目中体会特别深的一点是剪枝比例不能拍脑袋定一定是基于验证集精度曲线来回试。从10%开始逐步加到20%、30%、40%看精度掉到哪个点开始肉疼然后往回调5%。工业场景我一般控制在15%-25%之间配合微调精度能恢复得不错。3.2 知识蒸馏让大模型当师傅小模型跑现场知识蒸馏是“用一个大模型教一个小模型”的技术。核心思想不是让小模型直接学大模型的输出标签而是学大模型输出的概率分布。大模型会在正确类别上给出高概率同时在其他类别上也给出一个不太高的概率这些“软标签”包含了丰富的类间相似性信息小模型学了之后能更快收敛精度也会更高。工业项目里知识蒸馏特别适合一种情况你在云端用一个大一点的模型训练好了精度满意但是模型太大部署到工控机上跑不动或者延迟太高。这时候可以用这个大模型当教师模型训练一个小的学生模型去逼近它。具体做法不复杂。把教师模型在训练集上跑一遍保存它的softmax输出温度参数调高一点比如T4可以让软标签更平滑。然后用这些软标签加上真实硬标签一起去训练学生模型。损失函数通常是两部分学生模型和软标签之间的KL散度加上学生模型和硬标签之间的交叉熵。权重比例可以根据需求调我一般从0.7和0.3开始试。蒸馏的一个额外好处是教师模型在蒸馏过程中可以把自己对某些难样本的判断“经验”传递给学生。比如某个缺陷在灰度上和背景非常接近训练集里这样的样本只有几十张小模型自己学很难学明白但教师模型已经学出了一些规律通过软标签传递小模型的结果会好很多。3.3 量化从FP32到INT8的瘦身量化是模型轻量化里见效最直接的一招。把模型的权重和激活值从32位浮点数压缩到8位整数模型体积直接变成原来的四分之一推理速度通常能提升2-4倍特别是CPU推理时提升更明显。量化有两种方式训练后量化和量化感知训练。训练后量化最省事模型训练完直接转用一小部分校准数据统计一下激活值的分布范围就能完成量化。缺点是当模型对数值变化比较敏感、或者数据分布比较宽时精度会掉得多一些。量化感知训练则是在训练过程中模拟量化的误差让模型主动适应低精度表示精度损失通常更小但需要重新训练成本高。工业现场我的建议很明确如果推理性能吃紧优先尝试训练后量化如果精度损失超过1%再切换成量化感知训练。不要一上来就做量化感知训练因为工业数据规模小反复调训练策略性价比不高。量化时有一个细节容易翻车校准集的数据分布要和真实运行的环境一致。比如你用白底工件图做校准结果现场是深色背景激活值分布对不上量化后精度会崩。所以校准集最好是现场采集的真实数据而不是实验室数据的复制。这点很多人忽略结果量化后模型精度暴跌就以为量化技术不行。3.4 三者的配合顺序实际项目里这三板斧不是单独用的而是一个配合流程。我的常规操作顺序是先用原始数据训练一个体积适中、精度满足要求的模型作为基线。做结构化剪枝把冗余通道砍掉精度掉多少都记录在案。用更大的模型做教师蒸馏剪枝后的模型把精度拉回来一部分。最后做量化把模型和激活值降到INT8推到推理引擎里测延迟。每一步操作后都要重新评估精度和速度决定下一步是否继续。这个流程的优势在于每阶段都有明确的技术目标和验收指标出了问题也容易定位。4. 部署轻量化不换服务器一台工控机跑起来的完整方案模型做小了还不够部署落地才是真正见真章的环节。这里我重点聊两件事怎么选推理引擎怎么在工控机上把推理性能榨干。4.1 推理引擎选型别让模型白优化很多团队选了轻量模型结果部署的时候随便挑了一个推理框架性能一塌糊涂。推理引擎选型和硬件强相关选对了CPU也能跑出接近GPU的效果。我的个人经验是三条路Intel CPU工业主机首选OpenVINO。它针对Intel CPU做了深度优化支持INT8量化模型在纯CPU机器上跑YOLOv8n这类模型单帧延迟能压到几十毫秒完全能满足大部分产线视觉检测的需求。NVIDIA Jetson边缘盒子首选TensorRT。它专门优化NVIDIA GPU能自动选择最优的kernel实现模型推理吞吐量可以比常规PyTorch快好几倍。国产化平台或混合硬件用ONNX Runtime。它兼容性最好各大芯片厂商都支持导出成ONNX格式后基本能跑通各种平台。虽然性能上限不如前两者但胜在通用。这里分享一个真实对比数据。某刀具外观检测项目模型是YOLOv8n量化版跑在同一台i5工控机上用PyTorch CPU推理单帧约780ms换成OpenVINO后压到160ms加上图像预处理和结果上报整链路控制在220ms。也就是说同一个模型没有做任何额外优化仅仅换了推理引擎速度提升了将近5倍。这个提升幅度靠换硬件得花多少钱换推理引擎一分钱不花。4.2 边缘算力选型够用就好 一点裕量部署计算设备的选型也有讲究。我一般这样评估先算清楚模型的峰值算力需求和IO瓶颈再选设备最后留出30%-50%的算力裕量。这里的裕量不是防模型跑不动而是防后续加了新需求、新模型变体时不用换设备。举例说明。一个目标检测模型量化后参数量约4MB单帧推理耗时想控制在100ms以内。在OpenVINO文档里查一下同代CPU的推理性能参考大概判断i5-8500T级别的工控机就够了。如果后续打算在同一台设备上加一个OCR识别模块那就得留出额外的CPU核和内存空间。选择Jetson系列的话Orin Nano和Orin NX是比较常见的两个档位。Orin Nano适合跑轻量分类、检测模型Orin NX适合跑一些稍大的模型或多个模型并行推理。硕大的Jetson AGX系列在工业场景反而不常选价格高、功耗大大部分项目用不上那么强的算力。4.3 推理管线优化把每一步都榨出汁模型推理本身只是整条链路的一部分。工业视觉检测系统的完整链路是相机采集图像、图像预处理、模型推理、结果后处理、结果上报PLC或数据库。很多项目只在模型推理上花时间优化忽略了其他环节的瓶颈结果整体延迟还是压不下来。我常用的优化手段有三招第一招是异步流水线。让采集和推理并行进行相机在采下一秒的图像时CPU在处理上一秒的图像。这样生产节拍就由“采集时间推理时间”变成“max(采集时间, 推理时间)”理论上能接近翻倍。实现起来也不复杂开两个线程中间用一个双缓冲队列传递图像注意加锁别搞出数据竞争就行。第二招是图像预处理合入模型输入流水线。不要用Python的PIL或者OpenCV的Python接口一帧一帧处理直接把resize、归一化、通道变换这些操作放到推理引擎的预处理步骤里用C或者OpenVINO的预处理API做减少内存拷贝和Python解释器开销。第三招是结果缓存与限流。如果后端的PLC或MES系统响应比较慢不要一个结果立刻上报一次可以做一个批量上报队列攒够一批或者超过一定时间再统一上报避免系统卡顿导致整个检测流程阻塞。这三招看起来不起眼但合在一起经常能把端到端的处理时间再压缩30%-50%。我从来不觉得优化到极致是炫技在这个场景里每一毫秒的缩短都意味着企业可以在相同的投资下提高生产节拍这是最实在的经济账。5. 数据轻量化几百张图片也能训练出能用的工业模型很多工业项目的痛点是数据太少。生产现场能采集到的正常样本多如牛毛但缺陷样本、故障样本寥寥无几。有人因为数据少就直接放弃AI方案其实这是一个认知误区。轻量化的数据工程策略恰恰是为小数据场景设计的。5.1 迁移学习是工业小数据的救命稻草如果从零训练一个深度神经网络确实需要大量数据。但在工业场景里我们几乎不会从零训练而是用ImageNet或COCO上预训练好的模型权重做初始值然后在小数据集上微调。预训练模型已经在海量通用图像上学到了纹理、边缘、形状、语义等基础特征这些特征在工业图像里也是通用的。比如预训练模型已经知道什么是圆形、什么是直线、什么是金属表面反光剩下的只是把这些通用特征和你的特定缺陷类型关联起来。我做过一个焊接气孔检测项目只有420张标注图片包含3种缺陷类型和一个正常类。用YOLOv8n的COCO预训练权重做迁移学习训练60个epoch后验证集mAP达到了89.7%。这个结果如果从零训练至少得几千张图才能出来。所以面对小数据第一反应不要是“数据不够做不了AI”而是“先找一个合适的预训练模型”。这里要特别注意预训练权重和目标任务的数据域差异会影响迁移效果。产品表面缺陷检测用COCO权重通常没问题因为底层特征通用性高。但如果目标是X光焊接内部缺陷检测图像和自然图像差异很大那可以考虑先在几张内窥镜或X光公开数据上做一遍预训练再迁移到你的数据上。5.2 数据增强要贴合工业场景不能胡增强数据增强是小数据集下压过拟合最有效的手段之一但工业场景的增强策略必须“讲武德”。我在一个项目中见过一个组用了水平翻转、垂直翻转、随机旋转90度、随机裁剪、颜色抖动全套增强结果把检测精度训练崩了。为什么崩因为这个项目检测的是印刷电路板上的极性电容电容是有方向性的正负极方向反了就是另一种缺陷。水平翻转直接把类别语义破坏了。同样的问题也出现在螺纹检测上螺纹的方向、纹理的旋向都是关键特征不能随便翻转。工业场景数据增强的原则是增强操作必须不改变样本的真实语义标签。具体来说位置扰动轻微平移、缩放、旋转±10度以内、裁剪这些保留语义。颜色扰动亮度、对比度、饱和度的轻微调整模拟车间光照变化这个有效。形态扰动模拟镜头畸变、模糊、噪声这对低质量成像场景有效。序列增强在训练过程中使用随机组合增强策略每次epoch看到的增强版本不同。还有就是增强强度的尺度问题。小数据集下增强太弱会过拟合增强太强会引入噪声导致欠拟合。我一般会用测试集做监控边训练边看验证集损失如果验证集损失下降后反弹就适当提升增强强度。5.3 半监督和合成数据没标注也能开工当标注数据实在不够时有两条路可以走。第一条是半监督学习。先用少量标注数据训练一个第一版模型然后用这个模型对大量未标注数据做预测把置信度高的预测结果当作伪标签加入训练集。迭代几轮后模型精度通常会逐步提升。工业场景里未标注数据往往是管够的——产线一天就能拍几万张图。只要标注了其中的几百张就可以用半监督循环把未标注数据的价值榨出来。但伪标签有个坑模型可能在错误类别上自信地给出高置信度预判一旦这些错误伪标签被加入训练集会污染后续训练。我的经验是置信度阈值设高一点比如0.95并且每轮只加入确定性的伪标签同时保持原始真实标注一直参与训练。第二条是合成数据。用三维模型渲染的方式生成缺陷样本或者利用生成式模型扩展缺陷样本。这在机械装备行业特别常用因为机械零件的CAD模型都是现成的可以渲染不同光照、不同角度、不同表面纹理下的图像。再配合缺陷模拟器自动生成缺陷样本并打上标注成本低、速度快。合成数据的风险是“domain gap”——渲染图像和真实图像的分布差异。直接拿纯合成数据训练的模型跑到真实产线上往往精度大幅下降。所以正确姿势是合成数据做预训练或数据补充真实数据始终占据训练集的主导比例。我一般控制真实数据不少于60%。6. 业务轻量化先治好一个点再谈数字孪生和机器人技术上的轻量化说完了最后补一块更重要的业务范围上的轻量化。很多项目失败不是技术上做不出来而是业务范围铺得太开什么都想做什么都没做透。6.1 场景选择四步筛选法AI在工业制造里的应用场景非常多但不是所有场景都适合“首战”。我自己有一套四步筛选的逻辑第一步看频次。这个场景是不是高频重复的比如每天几千次的外观质检、每天几十次的设备点检记录录入、每小时的参数调优。低频场景没有必要上AI人顺手就做了。第二步看人工成本密度。场景当前花费的人工工时是否足够大一条流水线需要8个人目检这是高成本密度AI替换1个人一年可能就是20万的人工成本节省ROI很快就回来了。第三步看数据可得性。现场已有的历史数据是否足够如果连一台设备的基础运行数据都没有积累那预测性维护现在不具备落地条件。第四步看环境稳定性。环境变化越少模型越容易稳定运行。先挑一个产品型号稳定、工艺相对成熟、光照和背景相对固定的工位别一上来就挑非标定制、天天换型的产线。符合这四个条件的场景大概率是一个“小而美”的切入点。这个点做成了后面再延伸才有说服力。我见过很多人一上来就想做一个“全厂AI大脑”结果困在数据治理里出不来。6.2 轻量化数字孪生不追求高保真只追求能决策数字孪生这几年在工业里被说滥了但落地的少。原因很简单大部分企业需要的数字孪生并不是一个高精度三维模型。机械装备行业的数字孪生真正核心的是状态映射和决策联动一是在虚拟空间还原设备关键状态二是根据孪生模型给出维护、调度或控制建议。轻量化的数字孪生可以这样搭用一个简化的三维模型或2.5D示意界面展示设备结构关键是挂接实时传感器数据把温度、振动、电流、压力这些关键参数映射到模型上配合规则或轻量预测模型做异常预警。视觉上不需要多逼真数据准确、预警及时才是价值所在。我参与过一个大型机械装备的远程运维项目需求是给客户现场的十几台设备做健康监测。如果做高保真三维孪生每台设备建模成本都得几万块全部场景做下来预算爆炸。后来方案改成了简化的设备结构图加实时采集的振动和温度曲线配合一个轻量的异常检测模型。部署成本低了一个数量级客户用得反而更频繁因为信息直观、响应快、不用专业培训。6.3 机抓取检测的轻量化路径机器人抓取是另一个典型的“AI制造”场景。机械臂要从料筐里抓取散乱摆放的工件需要先识别工件的位姿这用到的就是抓取检测算法。过去这类算法非常吃算力需要GPU工作站但现在通过轻量化网络设计已经可以在机器人控制器或边缘盒子侧运行。具体技术路径是用融合卷积神经网络和Transformer的轻量化检测网络CNN负责提取局部纹理特征Transformer负责捕捉全局上下文信息再进行特征融合最后回归出抓取位置和角度。相比纯Transformer结构这种混合结构在参数量上大幅缩小精度损失很小很适配机械臂侧有限的算力。这类模型经过剪枝量化后模型大小通常能控制在5MB到10MB之间在Jetson Orin Nano上单帧推理时间能到20-30ms完全够机械臂实时抓取用的。而且轻量化模型的低延迟让机械臂可以做闭环控制一边识别一边调整抓取姿态而不是识别完再机械执行抓取成功率会明显提高。这类项目的关键不在模型架构多新而在样本设计和持续调优。抓取位姿标注要统一坐标系定义抓取成功率要现场实测而不是只看mAP这些细节才是决定项目能不能用的分水岭。7. 案例复盘某机加产线轻量化质检从0到上线的90天理论讲了这么多分享一个我完整跟下来的实例。这个项目的路径非常典型覆盖了一线落地场景会遇到的大部分问题。7.1 背景和需求某机械加工厂生产某种汽车转向节产品下机后需要人工目检表面缺陷主要包括砂眼、气孔、磕碰伤和加工刀纹异常四类。原流程是两名质检员站在灯光下逐件翻转查看一人一天检查约800件劳动强度大漏检率受人员状态影响波动明显。厂里的诉求就三条第一检测速度要跟上现有节拍目标是单件检测加判定不超过500ms第二不新增GPU服务器尽量利旧现有的Intel工控机第三操作要简单现场质检工要能正常使用不需要懂算法。7.2 方案设计和技术实现约束条件列出来后技术路线很快就清晰了算法选型YOLOv8n参数量只有3.2M比标准YOLOv8s小了约4倍精度在中小数据集上依然够用硬件利旧现有的i7工控机16GB内存没有独立显卡推理引擎OpenVINO量化INT8格式数据策略现场采集正常件和缺陷件图片共1800张最终筛选标注了大约600张有效图片通过翻转这里工件无方向性翻转安全、亮度扰动、模糊模拟增强到3000多张训练策略加载COCO预训练权重迁移学习训练100个epoch用早停机制防止过拟合7.3 踩过的几个坑项目过程中有几个坑值得单独拿出来说。第一个坑是光照不统一。工厂准备了几台工业相机但不同工位的打光角度和亮度不一致。前几次模型测试时发现同一个工件在不同工位拍出来检测结果不一致漏检反而出现在低亮度图片上。后来统一了打光配置并把亮度扰动加入数据增强这个问题才解决。模拟现场光照变化不是可选项是必选项。第二个坑是量化精度波动。训练好的FP32模型验证精度91.5%量化到INT8后再测只有86.4%损失接近5个百分点。后来定位到原因校准集是从验证集里直接抽的而验证集里有些图片在现场环境下拍得不清晰分布有偏。换了现场采集的50张图片做校准后量化精度恢复到90.8%基本可以接受。第三个坑是PLC通讯。检测系统要在判定为缺陷时给PLC一个停机信号但PLC通讯的响应周期比较快如果通讯超时会卡住整个检测流程。后来做了异步上报和超时重试机制问题解决。这类问题在实验室里根本测不出来一定要在现场联调时多留几天时间。7.4 实际落地结果最终系统上线后在Intel i7工控机上用OpenVINO跑INT8量化模型单帧推理耗时约55ms加上图像采集和预处理上报单件总耗时约190ms远低于500ms的要求。缺陷识别准确率90.8%漏检率约1.7%满足工厂设定的指标。更重要的是运营层面的变化质检员从两名减少到一名另一位质检员转岗到了复检工位只处理模型判定有疑的少量工件。工厂厂长感慨最多的不是省了多少钱而是“人终于不像机器人一样干活了”。系统已经稳定运行了六个月期间因为产品型号切换做过两次模型微调和数据补充其他基本没出过大问题。8. 写在最后轻量化是工业AI 3.0的门票从工业AI 1.0的概念验证到2.0的单点应用再到3.0的系统化实效落地行业终于开始回归理性。那些真正能在车间里长时间稳定运行的系统几乎都遵循了同一条原则用最小的技术复杂度解决最明确的生产问题。我个人在实操中得到的最大感悟有两点。第一轻量化不是技术妥协而是工程智慧。知道什么该做、什么不该做、什么什么时候不做往往比知道怎么把模型做到99.9%的精度更重要。第二工业AI项目的成功从来不只是算法成功而是设备、数据、流程、人员这四者的长期磨合。一个能跟着产线一起进化的轻量系统远比一个堆满了大模型却没人能维护的“重”系统有价值。如果你正准备启动一个工业AI项目我的建议就一句话从最小的闭环开始用最低的成本跑通第一个场景让一线人员真实用起来再谈扩展。轻量化落地的路就是这么一条一条走出来的没有捷径。