
1. 先泼盆冷水PPT里的工业AI和产线上的工业AI不是一回事前两天我到一家做服装代工的老朋友厂里转了一圈。他去年咬牙上了一套AI布料瑕疵检测线说是再不数字化就要被客户淘汰了。我站在车间里看了十几分钟机器确实在跑产线末端那个工业相机识别框闪烁得挺勤快。他跟我说实话跑是跑起来了但离他当初在供应商PPT上看到的那套全流程无人化黑灯车间大概还差着一百个落地项目经理的头发。2026年了工业AI这个词已经热了七八年从概念、Demo、试点到规模化复制大家最关心的问题早就不是AI能不能用而是到底有多少真的在产线上跑起来了跑得好不好怎么跑起来的。我这一年跑了十几个工厂从3C电子、汽车零部件、纺织服装到光伏锂电实话实说跑起来的有而且比前两年多得多但跑起来和跑得好之间隔着一条由数据、工程、组织流程和管理预期共同挖出来的深沟。这篇文章我不写成行业白皮书也不写趋势预测就写两个最实际的问题第一哪些工业AI应用真的落地了靠什么落地第二大家问得最多的——工业AI检测这类系统到底用云联网还是单机AI用什么大模型才算够用。这两个问题如果能帮你少走几趟供应商的套路我觉得比什么都值。先说结论2026年真正跑起来的工业AI主力不是什么通用大模型也不是云端无所不能的超级大脑而是一批贴着产线痛点走、把模型做到足够小、足够快、足够便宜地跑在工控机里的垂直应用。其中以视觉质检为绝对核心。2. 跑起来的主力在哪几个环节又为什么是它们跑起来了2.1 视觉质检工业AI落地最大的赢家没有之一如果要给工业AI的应用场景排一个落地率排行榜视觉质检也就是AI缺陷检测是断层第一。我接触的工厂里上了AI质检并真正在产线上稳定跑超过一年的至少占到七成以上。这个数据出乎很多人意料但仔细分析一点都不奇怪。质检这件事天然适合AI。它本质上是一个看的问题而机器视觉比人眼稳定、比人眼快、不会疲劳也不会因为计件工资闹情绪。传统的机器视觉方案用规则算法面对的是标准化、模具化、特征明确的场景比如定位、测距、读码但碰上布料瑕疵、焊缝气孔、电池表面的划痕这类缺陷长什么样说不清的场景传统算法就抓瞎了。这正是深度学习模型发挥价值的地方——不需要你定义缺陷的数学特征只要给足标注过的样本模型自己就能学会什么是不正常的。我朋友那套服装检测线检测的是成卷坯布上的色斑、断经、油污和织造纹路异常。过去人工质检一个熟练验布工一天撑死看七八千米布注意力稍微不集中漏检率就上去了。现在那套AI系统在产线上以每分钟六十米的速度跑最小能识别到一毫米左右的瑕疵整体漏检率比人工低了至少两三个百分点。这个数字听起来不算惊艳但放在一年几千万米布的产能上省下的质量损失和索赔费用是百万级的。2.2 预测性维护和工艺优化跑起来了但跑得很拧巴除了视觉质检另外一个落地数量可观的方向是预测性维护——给电机、泵机、减速机、风机这类旋转设备加传感器用振动、温度、电流数据训练模型提前预判设备故障。但这个方向跑起来比视觉质检拧巴得多。原因在于视觉质检的收益是看得见的少漏检、少客诉、少返工老板愿意掏钱预测性维护的收益是看不见的——你没让设备坏掉怎么看得出是AI的功劳很多工厂上了预测性维护系统跑了大半年模型确实输出过几次注意轴承磨损的预警运维人员拆开一看也确实是那么回事但要把避免了一次非计划停机折算成项目ROI财务那边总是打一个问号。工艺优化就更靠后了。用AI做参数寻优、工艺配方调优这类项目的PoC概念验证一大堆但真正稳定在产线上闭环运行、自动调参、且被工艺工程师接受的凤毛麟角。原因也很直白工艺参数牵一发动全身AI调参一旦导致一批产品报废责任谁来担工艺老法师们嘴上不说心里对这套外来的算法是有抵触的。2.3 那些还在PPT里的场景别被供应商的Demo骗了有跑得好的就有跑不动的。我见过的供应商Demo里最漂亮、最唬人的往往是以下三类数字孪生车间那个三D大屏确实炫设备位置、物流轨迹、生产数据实时流动但背后接的通常是MES里现成的数据做了个漂亮的可视化外壳跟决策优化没半毛钱关系通用工业大脑平台号称一个平台打通所有业务环节实际落地时光数据清洗就能磨掉你三个月最后交付的往往是个定制化报告生成器基于大模型的产线问答助手能回答上个月A线的OEE为什么低但回答内容基本是把报表数据念一遍离真正定位瓶颈、给出可执行建议还差着十万八千里。判断一个工业AI项目是真落地还是面子工程我有个土办法半夜两点去车间转一圈看那套系统有没有工人真的在用、用了有没有人依赖它。产线工人是这个世界上最务实的群体如果一套系统妨碍干活第二天就会被选择性故障如果它真能帮上忙工人比老板还着急不让它停。3. 工业AI检测到底该上云还是跑单机——这个问题背后是三笔账回到最实际的问题。很多人在问工业AI检测这类系统用的是云联网还是单机的AI我直接给答案目前产线上稳定运行的工业检测AI绝大多数是单机/边缘部署也就是模型跑在产线旁边的工控机或边缘计算盒子里不依赖云端。这跟很多人的想象不一样。3.1 为什么产线AI不去云三座山压着第一座山是实时性。产线上的检测不能等。一台相机拍一张图是几毫秒模型推理必须在几十毫秒内返回结果紧接着PLC可编程逻辑控制器要接住这个结果去分流——合格的往下走不合格的踢到复检线。如果走云端一张图传上去、排队推理、结果传回来光网络来回就上百毫秒产线上这一会儿早就跑过去好几件产品了。除非你的产线速度慢到不敏感否则纯云方案从物理基础上就不合格。第二座山是数据主权与安全。之前我接触过一家做汽车热管理模块的厂商产线上的检测图片涉及产品内部结构客户明确要求一张图都不许出厂区。别说上传到公有云了就连企业内部的数据中台都过不去。涉密军工、航空航天、头部车企供应链基本都是这个要求。第三座山是网络可靠性。工厂车间的网络没有那么美好。我有一次去一家五金冲压厂车间里电磁干扰强、金属货架多无线信号烂得一批有线网络也会因为电源波动存在间歇性丢包。如果检测系统依赖网络那网络一抖产线就得停——这代价谁都不想承担。3.2 单机/边缘部署的算力到底够不够回答完为什么下一个问题就是工控机那点算力跑深度学习模型够吗答案是完全够前提是选对模型和做对优化。以目前工业界最主流的缺陷检测模型为例一类是YOLO系列这类的单阶段目标检测模型另一类是分割模型。YOLO家族里最新的几个变体像YOLOv8、YOLOv10选n/s这样的小尺寸版本在CPU上跑一张640×640的图大概需要一两百毫秒而在配备入门级GPU比如一张RTX 3060或者更便宜的Jetson Orin NX的边缘盒子上可以做到二三十毫秒甚至更快。对于大多数每分钟几十件的产线节拍来说这个速度绰绰有余。所以你在选型时会看到那些靠谱的供应商给的交付方案很少是一个大模型装在云端而是一个本地部署的推理盒子里面固化好了训练完的模型权重和推理加速逻辑。训练可以在云端做推理必须放现场。这一点方向不要搞反。3.3 什么时候真的需要上云联网当然不是所有工业AI都排斥云端。以下几种情况云联网是合理的模型需要持续迭代产线每天产生海量图片需要回传云端做半自动标注、增量训练、新缺陷类型发现模型更新后再推送到边缘设备。这是典型的云管边架构训练在云、推理在边但注意这里云上传的是图片样本和模型文件不是实时推理路径不影响检测速度。多工厂统一管理集团总部需要看所有产线的检测数据报表各分厂边缘设备把抽检的图片缩略图、检测统计结果上报到云端统一分析。上报的是一天几千条结构化汇总也不是每张图实时跑云端。少数低节拍、无隐私敏感、网络条件好的场景比如一些园区类Anomaly检测如安全帽佩戴检测、区域闯入识别节拍要求不高、涉及隐私等级不高可以接受云上推理。所以从业者嘴里的工业AI用云还是单机从来不是二选一的对立关系而是训练上云、推理在边、管理云上管的三层结构。谁把所有的推理都堆在云端谁就是在外行面前装内行。我放一个典型的边缘检测推理流程示意方便你理解实际部署时的一套思路# 伪代码边缘工控机上的检测推理主流程 import cv2 from detector import DefectModel # 支持 TensorRT/OpenVINO 加速的模型封装 model DefectModel.load( model_pathweights/v8n_defect_int8.engine, devicecuda:0, # 边缘GPU conf_thres0.45, iou_thres0.5 ) camera cv2.VideoCapture(cam://plc_trigger_01) while camera.isOpened(): image camera.grab() # 收到PLC触发信号后取帧 results model.infer(image) # 推理耗时约20ms ok results.has_defect() # 判断是否有缺陷 plc PLCInterface(plc_ip192.168.1.50) plc.write_coil(sort_actuator, ok) # 写入PLC控制分流机构 if not ok: save_reject_image(image, results.metadata) # 本地留存复检这套流程没有一行是云端调用。但同样的模型白天的训练是在云端的GPU集群上完成的晚上边缘设备加载新版权重第二天产线用新模型。这就是目前主流的落地形态。4. 用什么大模型才够用——这个问题本身就要拆开看4.1 质检这类任务真轮不到大模型出手很多客户一上来就问你们用的是ChatGPT级别的模型吗用的是哪个大模型我得说句得罪行业的话目前工业缺陷检测跑在产线上的模型绝大多数不是大模型而是专门的小模型。在模型圈子里所谓大模型动辄几十亿、几百亿参数而工业检测模型往往只有几百万到几千万参数甚至很多在几十兆字节量级。为什么不用大模型做检测原因有三。第一实时性不允许。一个十亿参数级别的视觉大模型在边缘设备上跑一次推理的时间足够产线上流水好几件产品。客户要的是一秒钟处理三十张图大模型一张图要几秒钟天差地别。第二缺陷检测是少样本、高度定制的任务。一个工厂的缺陷种类、形态、背景纹理都是特定的你不需要模型懂全世界的物体只需要它非常精通这一条产线上的这几类异常。大模型的泛化能力在这里没有用武之地反而是越小、越专用、越针对这一条线数据调优的模型越精准。第三成本不可接受。大模型需要的显存、算力、功耗、授权费用分摊到一条产线上单件检测成本会高到客户怀疑人生。而小模型一张几百块钱的推理卡就能跑得飞起。4.2 那大模型在工业里到底干什么用别急着说大模型没用。它在工业里的价值不在感知看、听而在认知理解、决策、交互。目前工业界已经出现的大模型落地场景集中在以下几块缺陷语义理解过去检测系统报CLS_007工人不知道是什么现在用多模态大模型直接把检测结果转成右下角区域有5毫米的油污建议联系清洗工序检查钢带现场处理效率大大提升文本类审核与工艺问答把老师的经验沉淀成知识库工人可以用自然语言问这个参数的区间范围是多少上次发生这个故障是什么原因大模型检索后给出有依据的回答标签自动生成与辅助标注大模型具备一定的常识理解能力能自动给可疑区域打个疑似划伤的候选标签人工只需确认修改标注效率能提升一个量级跨场景迁移同一集团下面做不同产品的分厂缺陷形态有差异但底层机理相似用大模型先从旧工厂数据里提取通用缺陷的语义表征再迁移到新分厂的模型里能明显减少新产线的冷启动数据量。所以准确的说法不是用什么大模型而是在哪个环节用哪种规模的模型。检测推理环节用高效小模型数据理解和管理环节用大模型两者配合才算是一套完整的工业AI系统。为了让你选型时心里有数我把当前工业场景常见的模型选型整理成了表格任务类型推荐模型类型典型模型示例部署形态备注缺陷检测/定位轻量目标检测YOLOv8n/s、RT-DETR-lite边缘GPU/内置NPU量化INT8可进一步提速缺陷分割/形态分析轻量分割模型DeepLabv3-lite、SAM微调版边缘GPU需标注掩码数据异常检测无足够缺陷样本自监督/单分类PatchCore、SPADE、知识蒸馏类边缘GPU只分正异常不给缺陷类别缺陷语义理解/报告生成多模态大模型7B~72B参数的本地部署版企业内部服务集群不参与产线实时推理工艺文档问答/知识检索检索增强生成RAG通用开源文生文模型私有云或内网服务器数据不出域敏感度高产线图片样本分析与模型迭代视觉模型集群预训练增量训练云端GPU集群定期把模型更新下发边缘这个表格不是我拍脑袋写的是过去两年在多个项目里实际验证过的组合。核心思想就是一句话大模型做小模型做不到的事不要让大模型去做小模型做得又快又好的事。4.3 客户真的需要大模型这个词吗——需求翻译课我经常跟销售同事说客户问用什么大模型的时候真实需求往往不是我要用大模型而是我要确认你的方案不是老掉牙的传统视觉、确实是最新AI技术、以后不会快速过时。这时候正确做法是给他翻译一下需求而不是顺着话术往技术方向上塞大模型。具体可以这样拆如果担心误检率→ 谈数据量、标注质量、模型迭代闭环周期而不是参数规模如果担心未来扩展新缺陷种类→ 谈增量学习能力和数据回流机制真正的产品能力是今天部署模型明天来了新缺陷需要多久能更新模型如果担心过时→ 谈架构的开放性边缘设备能不能支持将来换成更强模型云管边架构能不能平滑升级如果只是想要一个汇报给老板的AI亮点→ 才考虑在报表中心、知识问答等非实时环节引入大模型相关的应用做故事包装。这四种情形我给供应商和甲方都建议过。大多数情况下你真正需要的是第一种和第二种能力——而这恰恰和大模型没关系。5. 上产线前必须想清楚的几个隐形杀手5.1 数据标注的一致性陷阱很多项目死在训练数据上而训练数据的头号问题不是不够多而是标注不一致。同样的一个轻微划痕A标注员说是缺陷B标注员认为不算C标注员今天算明天又觉得不算。模型学的不是缺陷长什么样而是三个人的观点平均值长什么样结果就是上线后漏检、误检同时高。行业里靠谱的做法是标注标准先行三人互审抽检每批次标注后做一致性计算比如用Cohens Kappa系数评估。缺陷标准要落到样品照片和文字说明而不是停留在口头讨论。这一条谁做到了谁的项目就成功了一半。5.2 误检率的真实压力PoC阶段算法团队喜欢报准确率99%。但产线客户真正关心的唯一指标是误检率——在大量合格品里AI只有千分之三的误杀率一天也会砍掉几十件好产品。每件好产品的价值乘以数量客户很快就会发现AI比人工更能惹事。所以我在交付时一定会做的事是给AI设置人工复审通道和置信度分级。高置信度的缺陷直接自动剔除低置信度的可疑缺陷打标分流到人工复检线。这样既保留了AI的减负价值又把误杀风险控制在小范围内。这套机制比单纯调模型参数有效得多。5.3 产线环境的脏乱差现实实验室里的测试图片是干干净净的工厂里的真实图是有灰尘、有水汽、有光照变化、有震动模糊的。同一个模型白天晚上识别率不一样大棚顶的光线变化会让拍照效果忽阴忽晴。这个坑几乎每一个初次落地AI质检的项目都会踩。破解方法无非两条一是把工业相机、光源、暗箱做成标准化的物理环境尽量消除环境干扰——这一步花的是硬件钱比花在模型调参上的钱值多了二是在训练数据里故意加入现场环境的干扰样本让模型学会无视灰尘和水汽。如果你连这个都想到了说明你已经不是新手。5.4 ROI核算别被智能制造四个字冲昏头最后说个掏心窝的话。工业AI这个圈子里忽悠人的项目太多但并不意味着该投入的不投入。我今天还在跟那个做服装代工的朋友说你们上AI质检这步棋走得是对的——订单量、人力成本、质量索赔都算得过账。但如果当初跟着某些规划院的方案走把几百万砸在全流程数字孪生通用工业大模型上说不定这会儿正在为画饼买单。我的建议是任何工业AI项目立项之前先把ROI算到具体的钱、具体的良率变化、具体的人工替代数。算不清楚账的项目再炫的技术也只是个好看的演示算得清账的项目哪怕技术朴素一点也是真正跑起来的好项目。我自己这些年最深的体会是工业AI从来不缺算法缺的是能把算法精准嵌进产线的人。技术方案从来都不是最难的最难的是让一个老师傅愿意相信机器让一条老产线愿意给新技术一个机会。把这件事做成了哪怕模型参数只有几百万也是2026年真正跑起来的工业AI。