制造企业在生产环节部署大语言模型(LLM)与机器学习(ML)的意愿持续上升,工业物联网项目普遍已完成协议打通与点位汇聚。
但进入建模阶段后,多数项目发现既有数据无法直接使用,须回溯梳理点位与业务对象的对应关系,形成计划外的二次投入。
生产环节的 AI 应用究竟需要何种数据基础?
本文的结论是:制约条件不在算法,而在数据标签化——即生产过程数据是否已与业务属性数据、业务结果数据建立绑定。未完成标签化的数据可用于可视化展示,但不构成可训练的样本。
一、多数企业的瓶颈不是数据缺失,而是数据未标签化
按数据基础成熟度,制造企业可分为三类。其中第二类分布最广,且最易被误判为具备建模条件。
| 成熟度 | 具体表现 | 对 AI 应用的含义 |
|---|---|---|
| 尚未采集 | 关键工序无表计或未联网;质量判定纸质流转;工艺参数手工抄录 | 不具备建模前提,须先补采集 |
| 已采集,未标签化 | 点位数以万计、频率可达秒级,但数据以「点位号+时间戳+数值」独立存在,未与任何业务对象绑定 | 可用于可视化展示,不可用于建模 |
| 已采集,已标签化 | 过程数据与业务属性、业务结果均已建立绑定关系 | 具备规模化建模条件 |
标签化的定义是:将生产过程数据与两类数据建立绑定关系。其一为业务属性数据,包括产品牌号、订单、批次、班组、设备与工艺路线;其二为业务结果数据,包括质量判定、产量、成本与能耗。两类绑定均已建立,一条时序曲线方构成可用于训练的样本。
第二类企业数量众多,源于工业物联网项目的交付边界。此类项目的验收标准通常是「数据可实时显示」,而非「数据可用于建模」;标签化不在合同范围内,因而不会被交付。企业在验收时无从察觉,问题在两至三年后启动 AI 项目时才显现。
未完成标签化的三项后果:
其一,数据可展示而不可计算——监控看板呈现实时曲线,却无法回答「该批次为何判废」;
其二,二次投入不可避免——建模立项后须回溯梳理点位与业务对象的对应关系;
其三,存量数据贬值——未标注的历史数据难以复用,等同于重新开始积累样本。
三者叠加,使得「已完成数采」的企业在启动 AI 项目时,实际进度并不领先于尚未采集的企业。
二、LLM 与 ML 的数据前提不同,须分别评估、分别立项
两类技术在生产环节承担的职能不同,对数据基础的要求亦不同。将两者笼统归为「引入 AI」并合并立项,是选型阶段最常见的判断失误——其后果通常是其中一项因基础条件不足而中止。
| 对比维度 | 机器学习(ML) | 大语言模型(LLM) |
|---|---|---|
| 承担职能 | 数值预测与模式识别 | 语义理解、知识检索与人机交互 |
| 典型任务 | 终点成分预测、质量判定、设备劣化识别、参数寻优 | 工艺问答、处置建议检索、报告生成、文档语义检索 |
| 依赖的数据 | 带标签的历史样本 | 已归集的非结构化文档,及可调用的系统接口 |
| 能力边界 | 不处理非结构化文本与语义任务 | 不直接推算数值结果 |
1. 机器学习依赖四项数据前提
- 时间对齐:同一时刻的工艺参数与质量结果,可对应至同一业务对象。
- 样本覆盖:历史数据覆盖主要工况与主要牌号,而非仅覆盖稳态工况。
- 标签准确:质量判定与缺陷代码的口径,在各产线、各班组之间保持一致。
- 目标明确:预测的目标变量可被稳定测量,且业务上具备相应处置手段。
2. 大语言模型依赖另外四项前提
- 文档归集:工艺规程、点检记录、故障报告、交接班日志已电子化并集中存放。
- 术语统一:设备名称、缺陷代码、工序称谓在文档与系统之间保持一致。
- 接口可用:可通过工具调用读取实时数据与业务系统,而非仅依赖文本推理。
- 边界清晰:权限范围、可执行动作与审计留痕,已于部署前完成定义。
3. 两者构成分工关系,而非替代关系
成熟的生产环节应用通常由两者组合构成:ML 承担数值计算,LLM 承担语义转述与知识检索。ML 输出终点预测与异常判别,LLM 将结果转述为操作人员可执行的处置建议,并检索对应的工艺规程条款。
该分工关系的实践含义是:LLM 无法替代 ML 的数值能力,而 ML 的输出若缺少语义层承接,现场人员难以理解,亦难以执行。二者的立项顺序应依据各自的基础条件分别判断,而非因预算或供应商归属而捆绑。
三、LLM 由自监督预训练而来,但企业侧仍须依赖有监督学习
由前一节可引出一个常见推论:既然大模型的训练不依赖人工标注,企业引入 LLM 后即可绕开标签化。该推论混淆了三个层面——模型的训练方式、模型的内部结构,以及模型在企业场景中的调用方式。
1. 训练层面:自监督是出厂工艺,不是使用方式
大模型的预训练确实属于自监督学习——从海量文本中预测下一个词元(token),全程无人工标注;其后叠加监督微调(SFT)与基于人类反馈的强化学习(RLHF)。就此而言,「自监督是大模型的出厂工艺」这一表述成立。
但出厂工艺所说明的,是模型如何获得通用语言能力,而非企业如何获得可用的预测能力。前者由模型厂商在通用语料上一次性完成,后者须由企业在自有数据上重新建立。二者不可互相替代。
2. 结构层面:模型内部不存在可调用的无监督算法库
大模型的参数中并不存在名为 K-means 或 PCA 的模块等待调用。模型生成回答的过程是前向传播,而非执行聚类。学术界关于 Transformer 在上下文学习中是否隐式实现了某种优化过程,目前仍有争议。
其实践含义是:不应将 LLM 视为一个内置的无监督学习工具箱。当业务问题为「将该批设备按故障模式分群」时,真正执行聚类的必须是外部算法库,而非模型参数本身。
3. 调用层面:LLM 的定位是工具编排者,而非算法替代者
现代 LLM 部署通常配有代码执行环境。将供应商清单、设备运行日志或售后工单交付模型后,模型可在沙箱中安装 scikit-learn,运行 K-means、DBSCAN 或孤立森林(Isolation Forest),并输出结果与图表。此时算法确有实际运行,但运行于容器之中,而非模型参数之内。
该机制决定了 LLM 在生产环节的定位:设备故障预测这类基于数值的推理任务,计算仍由 ML 模型完成,LLM 承担的是调用、解释与呈现。
三个层面须分别理解,不可混为一谈:
训练方式——自监督预训练 + 监督微调 + 人类反馈强化学习;
内部结构——前向传播生成,无独立的聚类或降维模块;
调用方式——需要数值计算时,由 LLM 调用外部工具执行。
4. 企业侧结论:样本有限时,有监督显著优于无监督
通用大模型的自监督训练之所以可行,前提是语料规模达到万亿词元量级。在该量级下,数据自身的统计规律足以支撑通用表征的学习。
企业生产数据不具备该条件。单条产线的年产出通常为数万至数十万个业务对象,特征维度数十至数百。在此样本规模下,无监督方法只能给出分群与异常度排序,无法回答「该批次是否会判废」「该轴承将于何时失效」这类具体问题。
| 对比维度 | 无监督(无标签) | 有监督(有标签) |
|---|---|---|
| 所需样本量 | 通用表征须万亿词元级语料 | 数万至数十万个已标注对象即可建模 |
| 输出形态 | 分群结果与异常度排序 | 可直接执行的预测值与置信区间 |
| 验证方式 | 结果须由人工判断是否合理 | 可用留出集直接量化误差 |
| 业务对接 | 分群难以与质量判定、成本口径对齐 | 预测值可直接进入考核与决策流程 |
由此可见,企业侧的路径与模型厂商的路径方向相反:模型厂商以海量无标注语料换取通用能力;企业以有限但已标注的样本换取专用预测能力。
标签的作用,正是以监督信号弥补样本量的不足——每一个标签都以人工判定的方式,向模型注入了一条本须由海量数据自行归纳的信息。
这是标签化数据优于无标签数据的根本原因,也是企业无法复制模型厂商训练路径的原因。
四、钢铁产线的实证表明:点位齐备不等于样本可用
以热轧板卷产线为例。自炼钢至卷取的六道主要工序,采集点位分布如下:
图 1:钢铁热轧产线的三级追溯主键与工序采集点位(炉号→板坯号→卷号 · 点位为行业通用示意)
上述点位在多数钢厂均已接入,实时曲线于中控室可随时调阅。就采集覆盖度而言,此类企业已属行业前列。
但只要以下四个问题无法回答,这些点位即不构成可用样本:该条曲线对应哪一块板坯?该板坯属于何种钢种、何种规格、哪一张订单?其最终质量判定与缺陷类型为何?该炉次的能耗与成本为何?
四个问题指向同一件事:时序数据与业务对象之间缺少绑定关系。缺少该绑定,工艺偏差与质量结果之间无法建立对应,监督学习所需的「输入—标签」配对亦无从构造。
同一条加热炉温度曲线,标签化前后的差异:
标签化前,可获取的信息为「1 号加热炉三段温度于 08:15 出现波动」;
标签化后,可获取的信息为「板坯 B2503112、SPHC 钢种、订单 SO-2026-0417、在炉 142 分钟、终轧温度偏低 12℃、判定为表面翘皮降级」。
前者的用途止于触发报警,后者方可用于建模——将工艺偏差与质量结果关联,进而支持参数寻优。
五、标签化的核心是确立主键,并完成三类绑定
1. 主键的选取决定标签体系的骨架
标签须挂载于明确的业务对象。离散行业通常选取工单、序列号或托盘号;流程行业选取批次、炉次或卷号。钢铁行业的特殊性在于对象随工序变化,须建立炉号 → 板坯号 → 卷号的三级追溯链,并确保上一级属性可向下继承。
主键一经确定,后续所有绑定关系均以其为锚点。因此该项决策应在标签体系设计之初完成,中途变更将导致已完成的绑定关系全部失效。
2. 三类绑定缺一不可
图 2:标签化的三类绑定(时间对齐 · 属性绑定 · 结果绑定)
| 绑定类型 | 内容 | 缺失的后果 |
|---|---|---|
| 时间对齐 | 按起止时间将连续时序数据切分至具体对象,如板坯进出加热炉的时刻 | 曲线归属不明,无法构造样本 |
| 属性绑定 | 将对象与钢种、规格、订单、客户、班组、设备、工艺路线关联 | 无法按牌号或产线分组建模 |
| 结果绑定 | 将对象与质量判定、缺陷代码、成材率、能耗、成本关联 | 缺少标签值,监督学习无从建立 |
3. 标签质量须满足四项要求
- 唯一性:一个对象对应一个主键,跨系统写法一致,不出现同物异码。
- 完整性:关键工序不得断链,任一环节缺失均将导致整条追溯中断。
- 时序准确:各系统时钟统一,采集与传输延迟已知并可校正。
- 口径统一:同一缺陷代码在各产线、各班组的判定标准保持一致。
四项要求中,口径统一最易被低估。同一缺陷在不同班组判定标准不一致时,模型习得的将是班组差异而非工艺规律,其预测结果在换班后即失效。
4. 实施顺序:先增量后存量,先关键工序后全流程
成本最低的路径,是令新产生的数据在采集环节即完成标签写入,而非事后回溯。存量历史数据按价值择要处理:与当前主力牌号、主力产线相关的部分优先回补,其余暂缓。
工序覆盖亦无须一次完成。建议先覆盖对质量结果影响最大的两至三道关键工序,形成一条可运行的最小追溯链,验证样本可用性后再逐步延伸。该路径可将首个可建模样本集的形成周期,由全流程铺开所需的数月压缩至数周。
六、离散与流程行业的场景清单不同,起步动作一致
| 行业类型 | 生产特征 | ML 典型场景 | LLM 典型场景 |
|---|---|---|---|
| 流程行业 | 连续生产、参数耦合强、质量由工艺窗口决定(钢铁、化工、水泥、造纸) | 终点成分预测、配料寻优、质量在线判定、能耗优化、设备劣化预警 | 工艺知识问答、异常工况处置建议检索、班组交接与生产报告生成、规程与标准语义检索 |
| 离散行业 | 工序离散、可追溯至单件、质量由加工精度与装配一致性决定(汽车零部件、机械、电子) | 视觉缺陷检测、刀具寿命预测、装配尺寸链分析、排程优化 | 作业指导书生成与更新、故障工单语义归类、图纸与供应商文档检索、质量根因辅助分析 |
场景清单存在差异,起步动作完全一致,差别仅在主键取值:离散行业取单件或工单,流程行业取批次或炉次。
两类行业均须先完成同三件事:确立对象主键与追溯链、将工艺过程数据与质量结果绑定、统一术语与编码口径。
因此,行业差异不构成推迟标签化的理由——场景选型可以延后,数据基础不能。
写在最后
第一,生产环节 AI 的规模化条件不在模型侧,而在数据侧。数据侧的关键指标并非是否已采集,而是是否已与业务对象建立绑定。点位数量常被用作数据基础的衡量标准,但该指标仅反映采集广度,不反映可用性。
第二,LLM 与 ML 的前提条件不同,应分别评估、分别立项。ML 依赖带标签的历史样本,LLM 依赖已归集的文档与可调用的接口。合并立项的结果,通常是其中一项因基础不足而中止,并连带影响另一项的推进。
第三,标签化应前置至采集环节。在数采项目立项时即将标签化写入交付范围,其增量成本远低于两至三年后的回溯梳理。对已完成数采的企业而言,该窗口已经关闭,但仍可通过增量优先的方式控制补课成本。
对已完成数采、正在规划 AI 应用的企业,建议先执行一次数据可用性盘点:
抽取近三个月内的一批产品,检验能否完整还原其工艺过程与质量结果。若不能,则应先补齐追溯链,再讨论模型选型。
该项盘点通常可在两周内完成,其结论直接决定 AI 项目的可行范围与排期。
点位数量反映采集广度,
标签完整度决定数据可用性——
未与业务对象绑定的数据,可用于展示,不可用于计算。
先完成标签化,再讨论模型选型。
说明:本文为数匠科技基于制造业项目实践整理的方法性观点。第四节钢铁热轧产线的设备与采集点位为行业通用示意,非特定企业数据;文中板坯号、订单号与缺陷判定均为举例说明。实际实施中,主键层级、点位清单与标签字段须依据企业自身的产线结构与系统现状确定。