工业AI项目常见的第一句话是“我们有很多数据”。再追问一步,答案可能是几块移动硬盘里的图片、MES导出的表格、设备日志、维修工单和散落在共享盘里的SOP。文件确实很多,但很难回答:每条数据来自哪台设备、哪种工况、哪个产品版本?标签依据是什么?模型上线后出现的误报和漏报,怎样回到下一版数据?
这正是“有数据”和“有可用数据集”的区别。国家数据局2026年6月发布的行业高质量数据集实施方案,把原则概括为需求牵引、急用先行、应用验证、安全保障,并提出从采集、清洗、加工、标注、质检到测评、迭代、审计的全生命周期管理。工信部关于工业互联网与人工智能融合的部署,也把数据清洗、标注、合成、评估和分类分级安全管理放在同一条链路上。
白泽的判断是:工业AI数据集的最小单位不是一个文件,而是一条可追溯的业务证据。它至少要带着对象身份、采集上下文、标签证据、版本关系和现场反馈。没有这些信息,模型即使在离线测试中表现很好,也很难进入真实流程,更无法解释为什么在换线、换班、换供应商或设备老化后失效。
先从场景和验收倒推,不要先建设“数据湖”
数据集建设的起点应是一张场景验收单。以焊缝视觉检测为例,先写清业务对象、缺陷类型、错判代价、节拍、允许延迟、人工复核方式和模型失效后的降级路径,再决定需要采集什么。若目标是降低漏检,就要优先覆盖难发现的缺陷、边界样本和误判代价高的工况,而不是只追求图片数量。
同一个工厂里,不同AI任务需要的证据并不相同。工业视觉需要原图、相机参数、光源、工位、批次和缺陷依据;预测维护需要传感器时序、负载、维护动作与故障结果;RAG研发需要文档版本、适用设备、审批状态与失效时间;工业Agent还需要工具调用、输入参数、授权人、执行结果与人工接管记录。把它们统称为“生产数据”,会在项目后期造成无法复现和无法验收。
一条样本至少要有五类信息
一、业务身份
样本要关联产品、批次、设备、工位、工单或文档对象,并尽量使用企业已有主数据编码。这样才能把模型输出与MES、QMS、EAM等权威系统中的业务结果对上。
二、采集上下文
时间、班次、工艺配方、设备状态、相机与传感器配置、环境变化都可能影响模型。只保存裁剪后的图片或聚合后的曲线,会丢掉判断漂移原因所需的上下文。
三、标签证据
标签不应只有“合格/不合格”。还要记录标签规范版本、标注人或审核角色、证据来源、争议状态以及最终裁决。对于专家知识密集的场景,可以使用模型预标注加人工校准,但不能把模型自己的猜测直接当成真值。
四、版本与用途
训练集、验证集、测试集、回归集和现场监控样本要有明确边界。数据集版本必须能对应模型版本、参数、部署设备和上线时间,避免一次更新后无法重现结果。
五、现场反馈
误报、漏报、人工改判、设备异常、流程退回和执行失败,都是下一轮最有价值的数据。若反馈只留在微信群或纸质交接本里,数据集就永远停在项目交付当天。
建立“四层数据合同”
制造企业可以用一份数据合同固定跨部门共识。对象层说明数据对应什么业务实体、谁是权威来源;采集层规定频率、精度、时间同步、保存原始数据还是派生数据;语义层规定标签、本体、单位和异常码;治理层规定权限、脱敏、保留周期、审计和删除流程。
数据合同不是为了增加文档,而是避免设备团队、工艺团队、质量团队和AI团队使用同一个词却指向不同对象。例如“停机”可能是PLC信号、MES状态,也可能是人工判定;“缺陷”可能是表面纹理,也可能是影响功能的质量结论。只有定义清楚,模型的输出才能进入后续决策。
训练集与测试集要按生产现实隔离
工业数据很容易发生“看似高分”的泄漏。相邻视频帧被随机分到训练集和测试集,模型记住了同一个零件;同一批次、同一供应商、同一设备的样本跨集合出现,测试结果无法代表新批次;人工返修后的照片仍带着明显标记,模型学到的是标记而非缺陷。
更稳妥的切分方式是按时间窗口、批次、设备、产线或供应商进行分组,并保留从未参与调参的独立验收集。测试中除了平均准确率,还要看关键缺陷召回率、误报造成的人工复核量、不同工况下的稳定性以及置信度下降时能否转人工。
对于稀缺缺陷,可以使用仿真或合成数据扩充覆盖,但合成样本必须标明来源、生成方法和用途,并通过真实数据验证。合成数据解决“看没看过”,不能替代现场对光照、磨损、遮挡和异常工况的验证。
用“数据飞轮”连接模型与现场
国家数据局提出“场景—数据—模型”的协同循环。落实到企业里,可以做成一条受控反馈链:边缘端记录模型输入、输出、置信度和设备状态;业务系统记录人工复核与最终结果;数据服务按规则抽取失败样本和分布变化;专家完成复核;新版本经过离线回归、小流量或影子运行,再决定是否替换旧模型。
这里要防止两个极端。一是所有现场数据全量回传,带来带宽、隐私与存储压力;二是只保留模型判断结果,失去复盘证据。应按风险分层:高风险错判、低置信度、分布漂移和新工况优先保留完整证据,普通稳定样本则抽样或汇总。任务放置与数据回传还需要结合工业边缘AI云边端架构设计。
一个12周内可启动的最小路径
前两周确定单一场景、业务负责人和验收指标,同时建立数据资源清单与需求清单。第三至第四周定义样本身份、数据合同、标签规范和安全分级,打通最小采集链。第五至第八周完成首版清洗标注,按批次或设备隔离训练、验证和测试,并建立争议样本池。第九至第十周在现场影子运行,记录模型与人工结果而不直接改变生产控制。第十一至第十二周复盘误报、漏报、延迟、人工工作量和数据缺口,决定继续、调整或停止。
项目验收不要只写“模型准确率达到某个数”。至少同时检查数据覆盖、标签一致性、关键风险指标、运行性能、追溯完整性和业务结果。每个指标必须写清分母、采集窗口、数据来源和责任人。
哪些情况下不应急着训练模型
如果业务对象没有统一编码、标签标准频繁变化、现场没有可靠真值、关键数据无法合法使用,或模型输出没有明确的接收流程,先训练通常只会更快制造返工。此时应先补主数据、采集、流程和权限。对于低频且规则清楚的问题,规则引擎或人工清单也可能比机器学习更经济。
对重庆制造企业而言,建设工业AI数据集不等于从零搭建庞大平台。更实际的做法,是选一个高价值场景,把工业视觉、IoT、文档知识和现场结果组织成可追溯闭环,再逐步复用到更多产线。选择重庆AI开发、工业视觉或RAG研发服务团队时,也应要求交付数据字典、标签规范、版本记录、评测集、现场反馈和退出方案,而不仅是模型文件。
AI只有进入真实流程、产生可验证结果才算落地。数据集的价值也一样:不是文件数量,而是它能否让模型的每次判断有证据、每次更新可复现、每次失败能回流。相关执行边界可继续阅读工业智能体受控闭环与工业视觉平台化。
FAQ
工业AI数据集是不是越大越好?
不是。覆盖关键工况、边界样本和高风险错误比单纯增加相似数据更重要,应根据场景验收指标判断数据是否有用。
没有大量缺陷样本,能不能做工业视觉?
可以先采用规则、异常检测、仿真或合成数据辅助,但必须用真实现场样本验证,并建立上线后的低置信度与误判回流机制。
RAG知识库也需要数据集版本吗?
需要。文档适用设备、审批状态、生效与失效时间会直接影响回答。知识切片、解析器、索引与评测集应共同版本化。
如何避免训练集与测试集数据泄漏?
不要只做随机切分。应按批次、时间、设备、产线或供应商分组隔离,并保留从未参与调参的独立验收集。
第一批数据应该采多少?
没有通用数字。先覆盖已知正常工况、主要异常、边界条件和关键风险,再用学习曲线与现场错误分布决定是否继续采集。
参考来源
1. 国家数据局,2026-06-08:《关于推进行业高质量数据集建设行动的实施方案》 →
2. 工业和信息化部信息通信管理局,2026-01-06:《四问+一图,读懂〈工业互联网和人工智能融合赋能行动方案〉》 →
3. 工业和信息化部办公厅、国务院国资委办公厅,2026-06-08:《2026年度人形机器人与具身智能实景实训专项行动》 →

