AI技术解读 · AI日报 · 2026-09-30

AI日报|OpenAI发布常驻Agent/NVIDIA推出Agent安全平台/中国生成式AI用户破7亿

执行型AI的成本继续下降,企业的工程瓶颈转向授权、中止、留证与恢复。本文核验过去24–48小时的一手发布,并给出常驻Agent进入生产流程前的验证动作。

企业Agent在工作站执行任务,并由独立网络安全设备监控权限边界
常驻Agent扩大执行面,也要求进程外权限与独立监控同步到位

早会里最容易被忽略的一笔账,是Agent替人点击系统之后,错误会变得更快。一次错误查询可能只浪费几十秒;一个拿到写权限、连续运行数小时的Agent,可能批量修改工单、发送邮件、下载文件,甚至触发外部系统。过去24小时的多项发布把这件事推到了企业面前:模型更便宜、执行入口更多、运行时间更长,控制层却必须同步补齐。

今日重点

1. Dots把Agent从一次对话推向持续职责

发生了什么: OpenAI在9月29日DevDay发布Dots,定位为持续运行、能承担长期职责的Agent。官方说明显示,Pro和Business Premium用户可在符合条件的市场使用;Enterprise、Edu和Healthcare可由管理员启用测试,默认关闭。

已确认: Dots强调持续了解用户关注事项并代表用户工作。官方没有给出适用于所有企业的任务成功率、最大连续运行时长或跨系统故障恢复指标。

边界与影响: 常驻并不等于无人监管。企业应先限定任务类型、工作时间、可访问系统和写入范围,再决定能否进入采购、客服、研发或运营流程。默认关闭的企业测试机制本身也是一个信号:管理员授权仍是部署入口。

2. GPT-6.1 Sol降低复杂工作流的模型预算

发生了什么: GPT-6.1 Sol面向Agent编码、计算机使用和专业工作。OpenAI称其接近Astra智能水平,而标准输入输出价格为Astra的五分之一。API变更日志给出的标准价是每百万token输入2美元、缓存输入0.10美元、缓存写入2.50美元、输出10美元,并提供Multi-agent beta。

已确认: 价格和可用接口已有官方数字。不同任务上的真实总成本仍取决于重试、工具调用、上下文长度、缓存命中率和人工复核。

边界与影响: 企业做成本测算时应使用“每个成功任务成本”,而非每百万token单价。建议在同一批真实任务上记录一次成功率、平均调用次数、P95时延、人工接管比例和失败补偿成本,再比较模型。

3. Agents API获得浏览器执行能力

发生了什么: Agents API新增computer use,Agent可在OpenAI托管浏览器中完成软件操作;网站访问审批与登录由应用处理。该API还汇入多Agent、工具检索、工具调用和上下文压缩。

已确认: 官方明确了托管浏览器与审批责任的分工。浏览器能操作页面,不代表页面行为有稳定API语义;布局改变、弹窗、超时和权限提示都会造成执行偏差。

边界与影响: 有正式API的企业系统,优先使用API并保留幂等键;只有缺少接口的遗留系统才考虑UI操作。涉及提交订单、删除记录、付款、发送外部消息等动作,必须在最后一步设置确定性的人工确认或策略网关。

4. Ultrafast出售速度,企业仍要单独购买“确定性”

发生了什么: OpenAI称Ultrafast在Codex中最高可达300 token/s、最多8倍,在API中最多6倍。GPT-6 Astra Ultrafast已开放,GPT-6.1 Sol对应速度层尚未开放。

已确认: 这是付费服务层和最高值描述。官方没有声称所有任务固定达到该速度,也没有说明速度会提高事实正确率或工具执行成功率。

边界与影响: 速度适合交互式编码、客服辅助和等待时间敏感的流程。对于设备控制、财务审批和批量数据变更,瓶颈通常位于验证、授权和回滚。不要用更快的token输出跳过这些步骤。

5. Private Intelligence把数据处理边界写进产品

发生了什么: OpenAI发布Private Intelligence。其零数据保留方案结合Private Safety Processing,用自动安全审查降低人员接触底层内容的需要;Private Inference计划在秋季预览,目标是结合机密计算与可验证控制。

已确认: 零数据保留方案已经被正式描述,Private Inference仍是未来计划。企业在合同、部署区域、日志、备份、事故响应和管理员权限上的实际配置,需要逐项核对。

边界与影响: “模型服务不保留数据”只覆盖一部分链路。浏览器下载、本地缓存、连接器日志、向量库、工单附件和下游系统同样可能保存敏感信息。采购评审应画出端到端数据流,并标注每个副本的责任人和删除机制。

6. Space、Pages与事件触发把Agent带进团队协作面

发生了什么: ChatGPT Space允许团队、ChatGPT和dot基于共享知识协作;Pages提供人机共同编辑的文档;OpenAI还宣布对拟议MCP Events规范的支持,让插件在任务、邮件等事件到来时触发自动化。

已确认: Space和Pages面向指定套餐开放;MCP Events仍是拟议规范,具体连接器和权限取决于管理员与用户配置。

边界与影响: 事件触发会把风险从“用户主动点击”扩展到“系统自动启动”。每个自动化至少需要触发条件、去重键、最大执行次数、超时状态、人工接管入口和结果回写。没有这些字段,重复事件可能造成重复发文、重复建单或重复通知。

7. NVIDIA把Agent约束放到模型进程之外

发生了什么: NVIDIA在9月28日发布Open Agent Safety Platform。OpenShell提供沙箱、受控资源访问、凭据保护和形式化策略验证;Supervisor在Agent工作负载之外检查网络请求。Sentry参考设计运行在BlueField-4 DPU上,独立监控Agent行为,并可在毫秒级隔离越界Agent。

已确认: OpenShell已广泛可用,并能扩展到Arm和Intel等第三方计算平台。Sentry是参考系统设计,企业可根据需求部署其中部分组件。官方列举了生态合作,但这不等于所有集成已经完成同一等级的生产验证。

边界与影响: 这套架构不能判断业务目标是否正确,也不能消除模型幻觉。它解决的是另一类问题:即使Agent生成了危险指令,文件、网络、凭据和工具权限仍由外部机制裁决。对于连接MES、ERP、代码仓库、云账户或机器人系统的Agent,这类控制应进入验收清单。

8. 国内生成式AI用户破7亿,企业不能把普及率当ROI

发生了什么: 中国互联网络信息中心9月29日发布的报告显示,截至2026年上半年,我国生成式AI用户规模突破7亿、普及率超过50%;智能算力规模达到2185 EFLOPS,同比增长177%;高质量数据集超过12万个。

已确认: 这些是全国范围的测算与基础设施数据。报告还称AI综合助手、AI效率办公等应用使用次数同比增长均超过100%。

边界与影响: 用户增长不能直接推导某家企业的效率、利润或咨询转化。企业仍要从基线任务出发,用处理时长、一次成功率、错误损失、人工复核量和可归因业务结果验收。全国算力增速也不意味着某个具体场景应该购买更多GPU。

白泽重点拆解:把执行权拆成四道可验证的门

NVIDIA本轮发布最值得工程团队关注的部分,是策略执行位置。提示词中的“请勿访问某目录”会和Agent处在同一认知链路里;一旦模型误解、被注入或生成代码绕过约束,软性指令可能失效。OpenShell的思路是让文件、网络和凭据访问经过Agent进程外的Supervisor检查;Sentry再提供独立监控域。

企业可以把这套机制抽象成四层:第一层是任务授权,明确Agent此次能做什么;第二层是工具许可,把读、写、删除、外发拆成不同权限;第三层是执行监控,记录每次调用的主体、参数、策略结果和业务回执;第四层是中止与恢复,在越界、超时、重复或业务校验失败时暂停任务,并从幂等检查点恢复。

适用条件包括长时间运行、跨系统调用、接触敏感数据或能影响物理世界的任务。只做公开资料摘要的低风险助手,不必直接采购DPU级方案,但仍应使用最小权限、凭据隔离和审计日志。连接PLC、机器人或自动化设备时,Agent只能提出计划或参数建议,安全PLC、机器人控制器和现场联锁继续负责确定性执行。

建议用四组故障注入验收:向Agent提供带提示注入的网页,检查写权限是否仍被阻断;令外部接口超时,检查是否产生重复提交;撤销凭据,检查任务能否安全停止;人为制造高风险参数,检查是否进入人工审批。任何一项无法留证或恢复,都不应开放无人值守运行。

今日企业行动清单

  1. 选一条现有Agent流程,画出模型、浏览器、工具、凭据和目标系统的数据流,标记每个写操作的批准者与回滚点。
  2. 用20个真实任务比较GPT-6.1 Sol或现有模型,记录每个成功任务成本、P95时延、重试次数和人工接管比例;未达到基线就停止扩大范围。
  3. 对长期运行Agent做一次提示注入、重复事件、凭据撤销和高风险参数测试;缺少进程外阻断或完整审计时,保持只读或人工确认模式。

FAQ

Dots已经适合企业无人值守运行吗?

官方强调持续职责,但没有给出适用于所有企业的成功率和恢复指标。企业应从只读、低风险、可回滚任务开始,并保留管理员开关与人工接管。

GPT-6.1 Sol价格下降后,是否应该立即替换现有模型?

先在真实任务集上比较。单价下降可能被更多重试、更长上下文或更高复核成本抵消,决策指标应是每个成功任务的总成本。

OpenShell能防止模型幻觉吗?

不能。它可以隔离工作负载、保护凭据并执行访问策略,但业务目标、事实正确性和决策质量仍需要评测与人工责任边界。

浏览器操作与正式API如何选择?

有稳定API时优先API,便于幂等、审计和错误处理。浏览器操作适合遗留系统或无接口页面,高风险写操作必须增加确认门。

参考来源

  1. OpenAI,2026-09-29:DevDay 2026 Recap
  2. OpenAI Developers,2026-09-29:API Changelog
  3. NVIDIA,2026-09-28:Open Agent Safety Platform
  4. NVIDIA:OpenShell Architecture
  5. 新华社转引中国互联网络信息中心报告,2026-09-29:我国生成式人工智能用户规模突破7亿人

相关服务与延伸阅读: 重庆AI开发 · RAG研发 · 工业智能体受控执行 · 企业可控Agent

知其然,知其所以然,知其应然,使之然。

让人工智能从“能回答”走向“能创造结果”