把一条故障注入演练写在白板上:模型接口超时,AI Agent已经生成三条采购补单,其中一条写入ERP、两条仍在队列。值班员按下“停用”,页面变灰了,谁来判断已执行到哪一步、怎样避免重复下单、多久恢复人工流程?如果这些问题没有答案,系统关掉了,业务风险仍在。
AI上线验收常盯准确率、时延和成本,却把人工接管留成一句“异常时转人工”。可执行系统还要明确触发器、接管人、在途任务、回滚版本、对账方法和恢复时限。NIST生成式AI风险管理建议为第三方AI建立事件响应计划并定期演练,测试rollover与fallback,人工处理也可以作为fallback;其MANAGE部分还要求为偏离预期用途的系统建立替代、脱离或停用机制。
先冻结人工路径与恢复基线
回滚前要知道“安全状态”长什么样。上线前连续记录一个完整业务周期,至少保留人工处理量、P50与P95时长、积压速度、错单与重复提交、人工接管耗时、最大可容忍中断时间。换型、月结或促销造成明显波动时,观察窗口应覆盖这些工况。
输入包括SOP、MES/ERP/WMS工单、接口日志、账号权限和排班;输出是四项签字结果:人工流程图、最大可容忍中断时间、最低人工吞吐能力、数据对账口径。人工班组每小时只能处理40单,而异常期间每小时涌入100单,所谓“转人工”只会把故障变成积压。
建议把恢复目标拆成三个时钟:发现时间MTTD,从异常发生到触发告警;接管时间MTTA,从告警到人工开始处理;恢复时间RTO,从触发降级到业务进入安全可持续状态。页面恢复访问不等于业务恢复,订单、库存、工单和设备状态仍需对账。
用风险成本决定降级速度
一条可复算的风险式可以写成:
期望异常损失 = 异常逃逸概率 × 暴露动作数 × 单次处置损失 + 中断损失 + 恢复人工 + 数据对账成本。
方法推演:某Agent每天发起500次写动作,测试阶段假设异常逃逸率0.4%,单次修复800元;一次异常还可能带来5000元停机与1000元对账人工。期望暴露为2次,风险成本为7600元。数字只是演示,企业必须替换为自己的样本、停线成本、错单成本和人工费。
公式的用途是分配权限。单次后果高、动作频率高或缺少幂等保护时,降级触发应更敏感;低风险、可撤销、全程留痕的动作可以先进入小范围Canary。Google SRE把Canary定义为局部、限时部署,并与控制组比较后决定是否扩大。AI Agent的发布单元还应包含模型、提示词、工具定义、权限策略、RAG索引和业务规则,缺少任一版本都无法完整回滚。
四级运行状态要写进系统
建议把运行权限固化为四级状态:
- L3受控自动执行:仅执行白名单动作,金额、对象、时间窗和频率均受规则限制。
- L2人工确认执行:AI生成计划,授权人员逐单或按批次确认后写入系统。
- L1只读建议:AI可以读取批准的数据并给出建议,不写MES、ERP、WMS或设备控制层。
- L0完全下线:切断工具凭据和任务入口,业务按已签字的人工SOP运行。
降级触发器分四类:权限类,如越权写入、凭据异常、白名单外工具调用;质量类,如关键字段缺失、连续错单、回执与目标不一致;性能类,如P95时延越过工艺窗口、队列积压持续上升;可观测性类,如关键日志断链、版本不可识别、业务回执丢失。
阈值没有统一答案。高风险越权和关键日志断链可以直接进入L0;一般性能退化可先进入L2或L1。阈值、观察窗和恢复条件必须由业务负责人、现场、IT安全共同签字,供应商不能单独修改。

回滚要覆盖六个动作
第一,冻结新任务并吊销高风险工具令牌。第二,标记在途任务:未执行、执行中、已提交待回执、已完成,禁止用“全部重试”处理。第三,切换到人工或只读入口。第四,恢复最后已知可用版本,版本包要同时包含代码、模型端点、提示词、工具Schema、权限策略、知识库快照和规则。第五,通过幂等键和业务回执对账,找出重复、遗漏与悬挂事务。第六,验证人工吞吐、核心数据一致性和审计链,再决定是否恢复L2。
Google Cloud的生成式AI运行指南要求对提示模板、链定义、外部数据集和适配器进行版本管理,并端到端记录整体输入输出及每个组件。对企业RAG研发和Agent项目,这意味着“回滚模型”远远不够;检索索引、提示词、工具参数和权限策略都可能改变最终动作。
用故障注入验收接管能力
上线前安排一次90分钟演练,依次注入六类故障:模型超时、RAG返回旧版本、工具接口重复回执、权限策略误配、消息队列堆积、关键日志缺失。演练不改真实生产数据,采用沙箱、影子流量或经过批准的测试对象。
每次演练输出一张记录:故障时间、告警时间、降级时间、接管人、在途任务数、重复/遗漏数、恢复版本、对账结论和复盘责任人。NIST AI 600-1明确建议按固定节奏演练第三方生成式AI事件响应,并依据复盘结果改进计划;工信部NVDB对智能体风险的提示也强调最小权限、访问控制和安全审计。
Go/No-go要过五道门
建议把上线门槛写成可签字条件:高风险写动作全部经过确定性规则或人工批准;每个动作可追溯到输入、模型、提示词、工具、权限和业务回执;RTO不超过业务允许上限,并在两次独立演练中达成;对账没有无法解释的重复与遗漏;人工班组能在降级窗口内承接积压。
以下任一项触发No-go:没有最后已知可用版本;高风险凭据无法一键吊销;在途任务状态不可见;人工SOP未排班;回滚后无法完成业务对账;关键日志缺失仍允许自动执行。系统先停在L1或L0,修复并重新演练后再申请升级。
四类角色分别签字
业务负责人签最大损失、RTO和恢复优先级;现场主管签人工SOP、排班与产能;IT安全负责人签凭据、日志、版本、降级开关和恢复权限;供应商签组件清单、已知边界、修复时限和演练证据。财务提供停线、错单和处置成本,法务与合规在涉及个人信息、对外发送或关键生产动作时加入评审。
白泽判断:制造企业需要把“可退出性”列为AI验收的一等指标。重庆AI开发、RAG研发、工业视觉和智能体项目都可以从只读建议起步,再按证据升级权限。明天先做两件事:画出四级状态,安排一次不触碰真实生产数据的故障注入。如果团队无法在约定时间内恢复人工业务并完成对账,停止开放自动执行。
可直接使用的上线清单
- 是否冻结人工基线、积压速度与最大可容忍中断时间?
- 是否为模型、提示词、工具、权限、知识库和规则建立同一发布编号?
- 是否能一键阻断新任务和高风险凭据?
- 在途任务能否区分未执行、执行中、待回执和已完成?
- 人工接管人、备份人、联系方式和排班是否明确?
- 是否通过两次独立演练验证RTO、对账和日志完整性?
- 任何一项失败时,是否自动停在L1或L0?
FAQ
“关闭Agent”为什么不算完成回滚?
关闭只能阻止部分新请求。队列中的任务、已经写入的业务数据、外部系统回执和凭据仍需处理。完成回滚要让业务进入一致、可持续、可审计的安全状态。
人工接管会不会拖慢AI收益?
会增加显性成本,所以要计入ROI。高风险动作先保留确认,样本和演练证据充分后再缩小人工范围;无法承受复核成本的场景不应直接扩大权限。
多久演练一次?
模型、提示词、工具、权限或知识库重大变更后应重新演练。稳定期可按季度或企业风险周期安排,频率由后果与变化速度决定。
工业控制场景能直接用这套方法吗?
可以作为管理骨架,但设备安全仍须服从PLC、SIS、联锁和行业安全规范。大模型不能替代确定性保护层。
延伸阅读与服务
可继续阅读制造企业AI项目的30天基线与Go/No-go方法,补齐价值证据;参考可控企业Agent的权限设计,细化白名单与审计。需要把RAG、Agent、工业视觉、IoT与MES、ERP或设备流程接成可接管、可回滚的系统,可查看白泽AI落地服务或联系重庆本地团队。
参考来源
- NIST,2024-07-26:Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile(NIST AI 600-1)。https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.600-1.pdf
- 工业和信息化部网络安全威胁和漏洞信息共享平台,2026-03-13:《关于防范OpenClaw开源AI智能体安全风险的提示》。https://hubca.miit.gov.cn/zwgk/wlaqgl/art/2026/art_638f3543616745d2bd58915c18aa4d37.html
- Google SRE:Canarying Releases。https://sre.google/workbook/canarying-releases/
- Google Cloud Architecture Center,2024-11-19:Deploy and operate generative AI applications。https://docs.cloud.google.com/architecture/deploy-operate-generative-ai-applications

