1. 从一条产线改造说起:工业大模型到底在工厂里干什么
去年下半年,我跟着一个做汽车零部件冲压的团队,在他们位于华东的工厂里蹲了将近两个月。任务很明确:把一条已经跑了七八年的老产线,用工业大模型的能力重新“武装”一遍,然后拿出可验证的落地数据。这条线当时的状态很典型——PLC逻辑稳定、机械结构没大毛病,但质检靠人眼、排产靠老师傅经验、设备维护靠定期停机,良率卡在92%上下,怎么都上不去。
我们最后交出的成绩单是:外观缺陷检出率从人工的约88%提到99.2%,误报率压到1.5%以内,换型排产时间从平均40分钟缩到6分钟,非计划停机每月减少约11小时。这些数字不是实验室跑出来的,是产线上真实跑出来的。这篇内容就把整个改造过程、技术选型逻辑、踩过的坑,以及“工业AI检测到底用云端还是单机、用什么模型”这类被问烂了的问题,一次性讲透。
如果你正在做智能工厂改造、工业质检、设备预测性维护,或者只是想知道工业大模型落地到底靠不靠谱,这篇应该能给你省下不少试错成本。我会尽量说人话,把每个决策背后的“为什么”讲清楚,而不是甩一堆架构图让你自己猜。
2. 改造前的整体设计:为什么不是“上个模型就完事”
2.1 先搞清楚老产线的真实瓶颈在哪
很多人一提智能工厂改造,第一反应就是“上AI质检”。但我到现场第一周啥都没动,就是跟着班组长、质检员、设备工程师各跟了三天班。结果发现,质检只是表象,真正的瓶颈有三个:一是冲压件表面缺陷(划痕、压伤、麻点)种类多、边界模糊,人眼连续看4小时后漏检率飙升;二是换型时模具参数、压力曲线、送料速度全靠老师傅调,新人根本接不住;三是关键设备(液压机、送料机)的故障前兆没有量化手段,往往是“坏了才修”。
这三个瓶颈对应三种不同的AI能力:视觉检测、工艺参数优化、时序预测。如果只做视觉检测,良率能提一点,但整体OEE(设备综合效率)上不去。所以我们的整体设计从一开始就是“三线并行”,而不是单点突破。
2.2 工业大模型在这里扮演什么角色
这里要澄清一个概念:工业大模型不是指“一个模型干所有事”。它更像一个能力底座,包含预训练的视觉 backbone、时序基础模型、以及一个能理解工艺文本和参数关系的语言模型。具体到这条产线,我们用的是“基础模型 + 小样本微调 + 边缘部署”的组合。
为什么不用一个超大模型直接端到端?因为工业场景对延迟、稳定性、可解释性的要求远高于互联网场景。一个冲压件从拍照到判定,节拍要求是800毫秒以内,你不可能把图像传到很远的地方再等结果。所以最终架构是:边缘侧跑轻量化检测模型,厂级服务器跑工艺优化和预测模型,云端只做模型训练和版本管理。这个分层逻辑后面会详细讲。
2.3 方案选型的三个硬约束
选型时我们给自己定了三条硬约束,后来证明这三条救了整个项目:
- 延迟约束:质检环节端到端延迟必须小于1秒,否则影响产线节拍。
- 数据不出厂:所有原始图像和工艺数据留在厂内,只有脱敏后的特征和模型更新包可以外传。
- 可回滚:任何AI决策必须能一键切回人工或规则模式,不能让产线停摆。
这三条直接决定了后面所有的技术选择。比如为什么不用纯云端推理?因为延迟和网络抖动不可控。为什么模型要轻量化?因为边缘设备算力有限。为什么要有规则兜底?因为AI再准也有边界,产线不能赌。
3. 核心细节拆解:视觉检测、工艺优化、预测维护怎么落地
3.1 视觉检测:从“云还是单机”说起
这是被问得最多的问题:工业AI检测到底用云端还是单机?我的答案是——训练在云(或厂级服务器),推理在边缘。纯云端推理在工业质检里基本不可行,原因很简单:一条产线每分钟过几十个件,每个件拍4到8张图,4K分辨率,你算算带宽和延迟。更别说很多工厂的网络环境根本不稳定。
我们用的是边缘盒子(带GPU的小型工控机)部署量化后的检测模型,单台覆盖2到3个工位。模型方面,底座用的是开源的视觉大模型做预训练,然后在厂内用约3000张缺陷样本做微调。这里有个关键点:缺陷样本极其不平衡,正常件几万张,某种罕见缺陷可能只有几十张。我们的做法是用基础模型的零样本能力先做粗筛,再用少量样本做精细分类,最后用规则引擎做后处理。
实测下来,单张4K图像的推理时间在120毫秒左右(INT8量化后),加上拍照和传输,端到端约600毫秒,满足节拍要求。误报率从初版的8%降到1.5%,靠的是持续把误报样本回流训练,这个闭环很重要。
3.2 工艺参数优化:让模型学会老师傅的“手感”
换型排产是另一个大头。原来老师傅调一套模具参数要试冲十几次,每次几分钟,加起来40分钟很正常。我们做的事情是:把历史换型记录(材料批次、模具编号、环境温湿度、压力曲线、送料速度、最终良率)整理成结构化数据,训练一个回归模型来预测最优初始参数。
这里用的不是那种千亿参数的大模型,而是一个梯度提升树加时序特征工程的组合。为什么?因为工艺参数优化本质是结构化数据的回归问题,大模型在这里性价比不高。但我们会用语言模型来解析工艺文档和老师傅的操作笔记,把非结构化的经验转成特征。这个“大模型读文档、小模型做预测”的分工,实测最稳。
效果是初始参数一次命中率从原来的约60%提到87%,剩下的13%再微调一两次就能到位。换型时间从40分钟压到6分钟,靠的就是这个。
3.3 预测性维护:时序模型比阈值报警强在哪
设备维护原来靠定期停机和阈值报警。阈值报警的问题是:等报警响了,往往已经晚了。我们用的是时序基础模型做异常检测,输入是液压机的压力、流量、油温、振动等十几路信号,采样频率100Hz。
模型学的是正常工况下的信号模式,一旦偏离就给出异常分数。关键是提前量:实测能在故障前平均4到6小时给出预警,最长的提前了将近两天。这个提前量足够安排计划性停机,而不是被动抢修。
这里有个坑:初期我们直接用阈值加简单统计,误报太多,工程师直接把报警关了。后来换成时序模型加自适应阈值,误报降到每周不到一次,工程师才愿意用。任何预测性维护系统,如果误报率高,一线人员一定会弃用,这是血泪教训。
4. 实操过程全记录:从数据采集到产线验证
4.1 数据采集与标注:最脏最累但最关键的环节
整个项目里,数据采集和标注占了将近40%的工作量。视觉这边,我们在产线上加了工业相机和光源,每个工位拍了约两周,积累了近8万张图像。标注是个大问题:缺陷边界模糊,不同质检员标出来的结果不一致。我们的做法是制定详细的标注规范,每个缺陷类型配示例图,然后让三个人独立标,取多数一致的结果,不一致的再讨论。
工艺数据这边,从PLC和SCADA系统里抽历史记录,但发现很多关键参数根本没记录,比如模具的具体磨损状态。后来补装了传感器,又跑了三周才攒够可用的数据。如果你打算做类似改造,一定要先盘数据家底,别假设数据都在。
4.2 模型训练与微调:小样本怎么做出高精度
视觉模型微调时,我们用了数据增强(旋转、亮度扰动、局部遮挡)来扩充稀有缺陷样本。另外用了Focal Loss来处理类别不平衡。训练在厂级服务器上跑,单卡A100,一轮约2小时,总共跑了约15轮。
工艺优化模型相对轻量,用XGBoost加特征工程,训练几分钟就完事。但特征工程花了大量时间,比如把压力曲线做分段统计、提取上升沿斜率等。这些特征的质量直接决定模型上限。
预测维护模型用的是时序Transformer的轻量版,输入窗口是过去30分钟的信号,预测未来4小时的异常概率。训练数据里正常样本远多于异常样本,我们用了自监督预训练加少量标注微调的方式。
4.3 产线验证:怎么证明“真的有用”
验证阶段我们设计了A/B测试:同一产线,单数小时用AI辅助,双数小时用人工。连续跑了两周,收集了足够的数据做统计检验。结果前面说了,检出率和误报率都有明显改善。
但更重要的是稳定性验证:连续跑30天,看模型性能有没有衰减。实测发现,视觉模型在换了一批原材料后,误报率会短期上升,需要回流样本重新微调。这说明模型不是一劳永逸的,得有持续运营的机制。
5. 常见问题与排查技巧实录
5.1 工业AI检测到底用什么模型、云还是单机
这个问题值得单独说。我的经验是:
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 质检推理 | 边缘单机 | 延迟低、数据不出厂、网络无关 |
| 模型训练 | 厂级服务器或云端 | 算力需求大,训练可以离线 |
| 工艺优化 | 厂级服务器 | 数据量不大,结构化模型轻量 |
| 预测维护 | 边缘或厂级 | 取决于信号路数和实时性要求 |
模型方面,视觉用开源视觉大模型做底座微调,工艺用梯度提升树,时序用轻量Transformer。没有哪个模型是万能的,关键是匹配场景。
5.2 常见问题速查表
| 问题 | 可能原因 | 排查方向 |
|---|---|---|
| 误报率突然升高 | 原材料批次变化、光源老化 | 检查来料和光源,回流样本微调 |
| 推理延迟变大 | 边缘设备过热降频、模型未量化 | 检查散热,确认量化部署 |
| 预测维护误报多 | 阈值太敏感、工况变化 | 调整自适应阈值,加入工况标签 |
| 换型参数不准 | 历史数据覆盖不足 | 补充稀有组合的试冲数据 |
| 模型性能衰减 | 数据分布漂移 | 建立定期回流和再训练机制 |
5.3 几条踩坑换来的经验
第一,别追求一步到位。我们初期想做一个大而全的系统,结果啥都做不好。后来拆成三个独立模块,各自验证,反而推进更快。
第二,一线人员的信任比精度更重要。质检员一开始很抵触,觉得AI是来替代他们的。后来我们把系统定位成“辅助”,AI标出可疑件,人工复核,他们的工作从“找缺陷”变成“确认缺陷”,反而轻松了,接受度就上来了。
第三,数据闭环是生命线。没有持续的数据回流和模型更新,再好的模型三个月后也会退化。我们专门建了一个回流流程,每天把误报和漏报样本整理出来,每周微调一次。
第四,边缘设备的散热和防护别省钱。工厂环境粉尘大、温度高,普通工控机扛不住。我们第一批边缘盒子就因为散热问题挂了两台,后来换了工业级带风扇的机箱才稳定。
6. 关于成本、周期和适用性的实在话
6.1 这套改造大概要花多少钱、多长时间
以我们这条产线为例,硬件(相机、光源、边缘盒子、传感器)约占总成本的40%,软件和模型开发占35%,剩下的25%是集成、调试和培训。总周期从进场到稳定运行约4个月,其中数据采集和标注占了近6周。
如果产线规模更大,单工位成本会摊薄。但要注意,不同产线的改造难度差异极大。冲压件相对标准,如果是服装检测这种柔性材料,难度会高不少,因为缺陷形态更不规则,标注一致性更难保证。
6.2 什么情况下不建议上工业大模型
说句实在话,不是所有厂都适合。如果产线节拍很慢、缺陷种类极少、人工成本很低,那用传统视觉算法甚至人工可能更划算。工业大模型的优势在于处理多品种、小批量、缺陷边界模糊的场景。如果你的场景是单一品种、大批量、缺陷规则明确,传统方法足够。
另外,如果厂里连基本的数据采集都没做好,PLC数据都不全,那第一步应该是补数据基础设施,而不是直接上模型。我们见过太多“为了AI而AI”的项目,最后都烂尾了。
6.3 后续还能怎么扩展
这套架构搭好之后,扩展性其实不错。比如可以把视觉检测的能力复制到其他工位,把工艺优化的思路用到注塑或焊接,把预测维护扩展到更多设备。关键是底层的“边缘推理+厂级训练+数据闭环”这套机制是通用的。
我个人在实际操作中的体会是:工业大模型落地,技术只占三成,七成是工程细节和人的问题。模型选型、参数调优这些,网上资料很多,但怎么让一线愿意用、怎么保证数据持续回流、怎么在产线不停的情况下灰度上线,这些才是真正决定成败的地方。最后再分享一个小技巧:上线初期一定要保留人工复核通道,并且把AI的判定结果和人工结果都记录下来,这不仅是兜底,更是最宝贵的数据来源。