1. 工厂生产 ERP 选型的底层逻辑变了
干了十几年制造业信息化,我最大的感受是:2026 年再去聊工厂生产 ERP 的选型,如果还停留在“哪家功能列表长、哪家报价低”这个层面,基本就输在起跑线上了。过去我们选 ERP,核心是看它能不能把进销存、生产工单、物料清单(BOM)、财务这几块管起来,本质是一个“记录系统”。但现在工厂面临的问题完全不一样了——订单碎片化、插单频繁、物料齐套率算不准、设备数据孤岛、老师傅经验留不下来。这些问题靠传统 ERP 的固定表单和人工录入,根本解不了。
所以这一轮选型的核心变量,是AI 驱动的智能管理能力。注意,我不是说让 AI 去替你开机器,而是让 ERP 从一个“事后记账”的工具,变成一个“事前预测、事中调度、事后复盘”的智能中枢。比如销售订单进来,系统能不能自动判断产能瓶颈、自动算出物料缺口、自动给出排产建议?设备突然报警,系统能不能关联到当前在制的工单、自动触发质量拦截?这些才是 2026 年工厂真正愿意掏钱的能力。
这篇文章我打算把话说透一点。我会从选型的底层逻辑讲起,拆解 AI 在 ERP 里到底落在哪些具体场景,然后给出一套可操作的对比框架和实操步骤,最后把我自己踩过的坑、见过的翻车案例整理成排查清单。不管你是年产值几千万的中小厂信息化负责人,还是集团层面的 IT 总监,只要你在 2026 年有换 ERP 或者上智能模块的打算,这篇内容应该能帮你少走至少半年的弯路。
1.1 传统 ERP 为什么在车间里“跑不动”
先说个真实场景。我见过一家做精密五金件的厂,上了某老牌 ERP 三年,生产模块基本闲置。原因很简单:车间报工靠班组长下班前回忆着填,填完数据第二天才进系统,计划员看到的永远是昨天的进度。销售问“这个单能不能提前三天交”,计划员只能拍脑袋。这不是 ERP 软件不好,而是它的数据采集粒度和反馈速度,跟车间的实际节奏脱节了。
传统 ERP 的架构是“人驱动系统”:人录入、人审核、人排产、人跟催。它的表单是固定的,流程是预设的,一旦遇到非标订单或者临时插单,要么走线下,要么在系统里绕一大圈。更麻烦的是,它积累了大量数据,但不会用。比如历史工单的工时数据、不良品数据、设备停机数据,都躺在数据库里,没人有精力去分析。这就是为什么很多工厂觉得 ERP“上了跟没上一样”——它只完成了记录,没有完成决策辅助。
AI 要解决的,恰恰是这个断层。大模型和机器学习模型擅长从历史数据里找规律,擅长处理非结构化信息(比如图纸、工艺卡、质检报告),也擅长做多约束条件下的优化计算。当这些能力嵌进 ERP 的生产模块,系统就能从“你告诉我怎么做”变成“我建议你这么做,并且告诉你为什么”。
1.2 2026 年工厂真正需要的三类智能能力
我把市面上号称 AI ERP 的产品捋了一遍,发现真正能落地、工厂愿意买单的智能能力,集中在三个方向。
第一类是需求与产能的智能匹配。销售订单进来,系统自动做 ATP(可承诺量)计算,结合当前在制工单、设备可用产能、物料在途情况,给出一个可交付日期。如果交期冲突,系统自动给出几个调整方案:哪些单可以合并、哪些单可以外协、哪些设备需要加班。这个能力背后是运筹优化算法加实时数据采集,不是简单查个库存表。
第二类是物料与库存的智能预警。工厂最怕的是停线待料,但库存压太高又占资金。AI 在这里的作用是动态安全库存:根据历史消耗波动、供应商交期稳定性、季节性因素,自动调整每个物料的安全库存水位。同时结合 BOM 展开和工单排程,提前 N 天预警缺料风险,并给出替代料建议。我见过做得好的系统,能把齐套率从 70% 拉到 92% 以上。
第三类是质量与设备的智能诊断。设备振动、温度、电流这些时序数据,通过边缘网关采集上来,AI 模型做异常检测,提前预测刀具磨损或主轴故障。质量方面,把历史不良品数据和工艺参数关联,找出导致不良的关键参数组合,反向优化工艺。这个方向对数据基础要求高,但一旦跑通,ROI 非常明显。
注意:不要被厂商的“AI 概念”忽悠。真正要问的是:你的 AI 模型是用我工厂的历史数据训练的,还是通用模型?模型更新频率是多少?预测结果可解释吗?如果答不上来,基本就是套壳。
2. AI 驱动 ERP 的核心技术点拆解
选型的时候,销售嘴里蹦出来的词一个比一个高级:大模型、Agent、RAG、向量数据库、时序预测。但你得知道这些技术到底在 ERP 的哪个环节起作用,否则很容易为用不上的功能买单。我按技术栈从底层到应用层,把关键点拆开讲。
2.1 数据底座:没有高质量数据,AI 就是空中楼阁
这是最容易被忽略、也最致命的一环。很多工厂上 AI ERP 失败,不是算法不行,是数据太脏。工单的工时数据是估的,物料编码一物多码,BOM 版本混乱,设备数据根本没采集。这种情况下,再强的模型也学不出东西。
2026 年比较务实的做法是,先做数据治理,再上 AI 模块。具体来说,主数据(物料、BOM、工艺路线、供应商)必须统一编码和版本管理。生产过程中的报工数据,尽量用扫码或设备自动采集替代手工填报。设备数据通过 OPC UA、Modbus 等协议接入边缘网关,做初步清洗后上传。
这里有个技术选型点:时序数据库。设备数据是高频写入的,用传统关系库存会拖垮 ERP 主库。常见方案是 TDengine、InfluxDB 或者云厂商的时序服务。选型时看写入吞吐、压缩率、和现有 ERP 的集成难度。我一般建议中小厂直接用 ERP 厂商自带的时序模块,省得集成麻烦;大厂可以独立选型,但要做好数据同步。
另一个关键是向量数据库。当你要做工艺文档检索、质检报告语义搜索、历史工单相似匹配时,需要把文本转成向量存储。Milvus、Chroma、Qdrant 这几个我都用过。Milvus 适合大规模、高并发的场景,运维复杂度高一些;Chroma 轻量,适合快速验证;Qdrant 在过滤和混合检索上比较顺手。选型时重点看你的数据量级和查询延迟要求,别一上来就上最重的。
2.2 大模型与 Agent:从“问答”到“执行”的跨越
2026 年 ERP 里的大模型应用,已经过了“聊天机器人”阶段。真正有价值的是Agent 架构:大模型作为推理核心,调用 ERP 的各种 API 和工具,完成具体任务。
举个例子。计划员说“把下周 A 产线的排产调整一下,优先保证 X 客户的订单”,Agent 会拆解任务:先查 X 客户订单的交期和数量,再查 A 产线当前排程和产能,然后调用排产优化工具重新计算,最后把调整方案呈现给计划员确认。整个过程,大模型负责理解意图和编排工具,具体的计算还是交给专业算法。
这里的技术选型点在于:大模型是本地部署还是调用云端 API。本地部署的好处是数据不出厂,适合对数据安全敏感的工厂,但需要 GPU 服务器,成本高,模型能力也受限于开源模型水平。云端 API 能力强、成本低,但数据要出公网。我的建议是分场景:涉及核心工艺和客户数据的,走本地模型;通用问答和文档处理,可以走云端。混合架构是 2026 年比较主流的做法。
Agent 的记忆框架也很关键。短期记忆用对话上下文,长期记忆需要向量数据库存储历史交互和业务知识。选型时问清楚:Agent 能不能记住上次排产调整的偏好?能不能根据历史决策不断优化建议?这决定了它是“一次性工具”还是“越用越聪明”。
2.3 排产与优化算法:AI ERP 的硬核战场
排产是生产 ERP 最核心、也最难做的模块。传统 ERP 的排产基本是“有限产能+优先级规则”,遇到多约束、多目标就歇菜。AI 排产用的是约束满足+启发式算法+机器学习预测的组合。
具体来说,约束条件包括:设备可用时间、模具寿命、人员技能矩阵、物料齐套时间、换型时间、交期优先级。目标函数可能是最小化延期订单数、最大化设备利用率、最小化换型次数。这是一个 NP-hard 问题,精确求解不现实,所以用遗传算法、模拟退火、禁忌搜索等启发式方法找近似最优解。
机器学习在这里的作用是预测参数。比如换型时间,传统 ERP 用固定值,但实际换型时间跟产品组合、班组、设备状态都有关。用历史数据训练一个回归模型,预测每次换型的实际耗时,排产结果会准很多。再比如设备故障预测,把预测的停机时间纳入排产约束,避免排了产但设备趴窝。
选型时怎么判断排产能力?别听销售吹,直接给一个真实场景让他们现场跑:20 台设备、50 个工单、30 种物料、交期各不同,看系统多久能给出排产结果,结果是否可解释,调整是否方便。这个测试能筛掉 80% 的伪 AI 产品。
2.4 集成能力:ERP 不是孤岛
工厂里除了 ERP,还有 MES、WMS、QMS、SCADA、PLM 一堆系统。AI ERP 如果集成能力差,数据流不通,智能就是空谈。2026 年主流的集成方式是 API 优先+事件驱动。
API 优先意味着所有功能都有 RESTful 或 GraphQL 接口,方便外部系统调用。事件驱动意味着当工单状态变更、库存低于阈值、设备报警时,系统能主动推送事件,触发下游动作。技术栈上,消息队列(Kafka、RabbitMQ)和流处理(Flink)是常见选择。
选型时要重点看:有没有预置的 MES、WMS 连接器?支持哪些工业协议?数据同步是实时的还是批量的?我见过一个项目,ERP 和 MES 之间用定时任务每 15 分钟同步一次,结果车间报工后计划员看到的还是旧数据,智能排产直接失效。这种坑,选型阶段就要避开。
3. 实操:一套可复现的 AI ERP 选型流程
理论讲完了,下面是我自己总结的一套选型流程,前后大概需要 8 到 12 周。你可以根据工厂规模压缩或扩展,但核心步骤别省。
3.1 第一步:内部需求盘点与数据成熟度评估
别急着找厂商,先把自己摸清楚。我一般会组织三场访谈:生产计划、车间管理、IT 负责人。问的问题很具体:当前排产靠什么?插单频率多高?齐套率多少?设备数据采集了没有?历史数据存了几年?
然后做一个数据成熟度打分表,从主数据质量、过程数据采集、历史数据积累、IT 基础设施四个维度评估。如果主数据都一塌糊涂,先别上 AI,老老实实做数据治理。这个阶段大概花 1 到 2 周。
| 评估维度 | 关键问题 | 成熟度低的表现 | 建议动作 |
|---|---|---|---|
| 主数据质量 | 物料/BOM 是否一物一码、版本统一 | 一物多码、BOM 版本混乱 | 先做主数据治理 |
| 过程数据采集 | 报工/质检/设备数据是否自动采集 | 手工填报、滞后一天以上 | 上扫码或边缘网关 |
| 历史数据积累 | 是否有 2 年以上工单/质量/设备数据 | 数据缺失或不可用 | 先补数据再谈 AI |
| IT 基础设施 | 网络、服务器、安全是否达标 | 车间网络不稳定 | 先做基础设施改造 |
3.2 第二步:厂商初筛与场景化 Demo
拿着需求清单去找厂商,第一轮筛掉那些连基本生产模块都不完整的。剩下的,要求他们做场景化 Demo,不是标准产品演示,而是用你提供的脱敏数据跑你的真实场景。
我通常会准备三个场景:一个紧急插单场景,看排产调整能力;一个缺料预警场景,看物料齐套计算;一个设备异常场景,看质量联动。每个场景给厂商 30 分钟现场操作,重点看响应速度、结果可解释性、操作便捷度。
这个阶段要特别警惕“演示环境特调”。有些厂商的 Demo 数据是精心准备的,跑得飞快,一到真实环境就拉胯。对策是要求现场导入你的数据,哪怕只有一部分。如果厂商找借口推脱,基本可以 pass。
3.3 第三步:POC 验证与量化评估
Demo 过了,进入 POC(概念验证)阶段。选 1 到 2 家厂商,在真实环境跑 4 到 6 周。POC 的目标不是全面上线,而是验证核心 AI 能力是否达标。
我会设定几个量化指标:排产计算时间(比如 50 个工单在 5 分钟内出结果)、齐套率提升幅度(比如从 75% 到 90%)、预测准确率(比如设备故障预测准确率 85% 以上)。POC 结束后,用数据说话,别凭感觉。
提示:POC 阶段一定要让车间一线人员参与。我见过 IT 部门觉得好用的系统,车间工人嫌操作麻烦,上线后直接抵制。让班组长、计划员亲自试用,他们的反馈比任何评估报告都真实。
3.4 第四步:总拥有成本与长期演进评估
最后算账。AI ERP 的成本不只是 license 费用,还包括实施费、数据治理费、硬件(GPU 服务器、边缘网关)、培训费、每年的维护费和模型更新费。我一般按 5 年 TCO 来算,把隐性成本都摊进去。
长期演进能力也很重要。工厂的业务在变,今天做五金件,明天可能做组件。ERP 的 AI 模型能不能持续学习?能不能低代码扩展新场景?厂商的研发投入和路线图是否清晰?这些决定了你三年后会不会又被套牢。
4. 常见问题与避坑指南
这一块是我最想写的,因为踩过的坑实在太多。下面这些问题是工厂上 AI ERP 时高频出现的,我按严重程度排个序。
4.1 为什么 AI 排产结果“看起来很美,用起来很糟”
最常见的原因是约束条件没建全。系统只考虑了设备和交期,没考虑模具寿命、人员技能、物料齐套,排出来的计划理论上最优,实际根本执行不了。对策是在 POC 阶段就把所有硬约束列出来,逐条验证系统是否支持。
另一个原因是数据延迟。排产依赖实时工单进度和设备状态,如果数据是几小时前的,排产结果必然失真。这个要在集成方案里解决,确保关键数据实时同步。
还有一个隐蔽原因是计划员不信任。AI 给出一个排产方案,计划员凭经验觉得不对,但又说不清哪里不对。这时候需要系统提供可解释性:为什么这么排?哪个约束是瓶颈?调整某个参数会有什么影响?没有可解释性的 AI 排产,最终都会被弃用。
4.2 物料齐套率上不去,问题出在哪
齐套率低,表面看是缺料,根子往往在 BOM 不准和库存不准。BOM 里漏了辅料,或者用量写错,系统算出来的需求就是错的。库存账实不符,系统显示有料,实际仓库找不到。这两个问题不解决,AI 预警再准也没用。
我的经验是,上 AI 物料模块之前,先做一轮 BOM 和库存的专项治理。BOM 准确率要到 98% 以上,库存准确率要到 95% 以上。然后 AI 的动态安全库存和缺料预警才能发挥作用。
4.3 设备数据采集了,但 AI 预测不准
设备预测性维护是 AI ERP 的热门场景,但很多工厂采集了数据却做不出准确预测。原因通常是:数据质量差(传感器漂移、采样频率不够)、故障样本少(设备很少坏,模型学不到故障模式)、工况变化大(不同产品对设备负载影响不同)。
对策是:先做异常检测而不是故障预测。异常检测只需要正常工况数据,容易落地。等积累了一定故障样本,再做分类预测。另外,把工况参数(产品类型、转速、负载)作为特征输入,能显著提升准确率。
4.4 常见问题速查表
| 问题现象 | 可能原因 | 排查方向 | 解决建议 |
|---|---|---|---|
| 排产结果不可执行 | 约束条件缺失 | 检查模具/人员/物料约束 | 补全硬约束,重新验证 |
| 齐套率预警滞后 | 数据同步延迟 | 检查 ERP 与 MES/WMS 同步频率 | 改为实时或准实时同步 |
| AI 建议被计划员忽略 | 缺乏可解释性 | 查看系统是否提供决策依据 | 要求厂商增加解释模块 |
| 设备预测误报多 | 数据质量差/工况未区分 | 检查传感器和特征工程 | 先做异常检测,再逐步升级 |
| 模型效果随时间下降 | 未持续更新 | 检查模型更新机制 | 建立定期再训练流程 |
| 一线员工抵触 | 操作复杂/未参与选型 | 收集车间反馈 | 让一线参与 POC 和培训 |
4.5 几个血泪教训
第一个教训:别为了 AI 而 AI。我见过一个厂,花大价钱上了 AI 质检,结果发现他们的质量问题主要是来料不良,跟工艺参数关系不大。AI 模型再准,也解决不了供应商的问题。选型前先做根因分析,确认 AI 能解决核心痛点。
第二个教训:厂商的行业经验比算法更重要。同样是排产算法,做过离散制造和做过流程制造的厂商,对约束的理解完全不同。选型时优先选有你所在行业案例的厂商,哪怕它的 AI 技术不是最先进的。
第三个教训:留好退出机制。ERP 是长周期项目,万一厂商服务跟不上或者产品路线变了,你得能平滑迁移。合同里要明确数据导出格式、接口开放程度、源代码托管(如果是私有化部署)。别让自己被锁死。
5. 2026 年选型的一个务实建议
写了这么多,最后说点实在的。2026 年的 AI ERP 市场,概念满天飞,但真正能落地的产品不多。我的建议是:小步快跑,场景切入。
别一上来就搞全厂 AI 升级,先选一个痛点最明确、数据基础最好的场景,比如排产优化或者物料齐套预警,用 3 到 6 个月做出效果。有了成功案例,再逐步扩展到质量、设备、能耗等场景。这样投入可控,风险可控,团队也能逐步建立对 AI 的信任。
选型时,把“AI 能力”拆成具体问题去问:你的排产算法支持哪些约束?模型多久更新一次?能不能用我的数据做 POC?预测结果怎么解释?这些问题答得清楚的厂商,才值得深入合作。
我在这个领域摸爬滚打这么多年,最大的体会是:技术永远在变,但工厂的核心诉求没变——按时交付、降低成本、保证质量。AI 也好,大模型也好,都是手段。选型的时候,盯着业务价值看,别被技术名词带偏。一个能帮你把齐套率提升 10 个点、把排产时间从 4 小时压缩到 10 分钟的系统,比一百个花哨的 AI 功能都值钱。