智能体 AI 上线前怎么审:把 Anthropic 的四个问题落成风险字段

发布时间:2026/7/21 23:29:08
智能体 AI 上线前怎么审:把 Anthropic 的四个问题落成风险字段 核心判断智能体审批的对象应是一条具体任务链而不是模型名称或一张笼统的工具清单。四问可以落成输入信任、动作身份、影响范围、观测证据四组字段并进入发布门禁。模型升级、连接器变化和权限扩大都会使旧审批失效需要用同一套高风险样本重新回归。四个问题不是安全口号而是审批输入企业开始把大模型接入工单、代码仓库、告警平台和内部知识库后传统的“能不能用这个模型”已经不够用了。真正需要审批的是一条具体任务链它会读到什么内容以谁的身份调用什么工具最坏情况下能影响多少对象以及出事后能不能还原全过程。Anthropic 在 2026 年 7 月 17 日发布的 CISO 指南中把智能体风险压缩为四个问题它会摄入哪些不可信内容它能执行哪些动作、代表谁执行行为偏离目标时的影响半径有多大组织具备什么可观测性。这四问适合直接变成上线评审表而不是停在会议里的原则讨论。第一个问题要记录输入来源和信任级别。网页、外部邮件、用户上传附件、Slack 消息都可能夹带诱导指令内部文档也不能天然视为可信。字段至少包括source_type、trust_level、content_owner和是否经过隔离解析。第二个问题要拆开“可调用工具”和“实际动作”同样是接入工单系统读取状态、创建草稿、修改优先级、关闭工单对应的风险完全不同。身份也不能只写“已授权”。官方文章把常见方式放在一条光谱上一端是系统服务账号动作明确归属于智能体另一端是使用个人凭据智能体像用户本人一样行动。最危险的往往是中间地带系统既说不清谁承担责任也无法从日志判断权限来自人、群组还是代理委托。用最小智能体权限定义可执行边界Anthropic 提出的“最小智能体权限”可以理解为最小权限原则的任务化版本只授予完成目标所需的最窄能力。它不是简单地减少工具数量而是同时约束数据范围、动作类型、持续时间和可影响对象。官方给出的事件响应智能体示例很具体。它可以读取不含个人信息的生产日志可以在 Slack 创建和管理事件频道也可以起草 Google Docs 复盘文档但它不能编辑或删除生产数据不能修改权限也不能访问外部端点所有动作都进入 SIEM。这样的边界比“允许访问日志和协作工具”更容易审计因为每项能力都能对应允许动作与禁止动作。工程团队可以把动作拆成read、draft、create、update、delete、grant和external_send再为每项记录资源范围、身份、有效期、是否需要人工确认。高风险动作不一定全部禁用但应进入单独的审批门例如提交变更只能生成 PR不能直接合并。Anthropic 也提到一次模型升级后出现了智能体之间新的协同行为不过代码改动仍然进入 PR由人审查后才可能落地。这说明能力提升不应自动扩大执行权限。若团队还要比较不同 API 模型在同类任务上的稳定性可先按 147AI 的 API 接口文档完成认证、模型标识和返回字段映射再按任务编号保留实际模型、失败原因、成本和复核结论。这个外部调用评测台账不控制 Cowork 的连接器、身份、沙箱或权限策略。可观测性要能回答一次事故发生了什么日志数量多不等于可观测。一次任务至少要串起请求人、输入来源、智能体身份、模型版本、工具调用、参数摘要、动作结果、人工批准和最终影响对象。若这些事件散落在聊天记录、云日志和业务系统中又没有统一任务 ID事故复盘仍然只能靠人工拼接。Anthropic 在 Cowork 控制说明中提到 OTel/OTLP 遥测、连接器令牌经反向代理注入、远程临时沙箱和出站网络白名单等机制。这里有两个容易忽略的边界Cowork 的提示内容默认会进入 OTel 输出组织需要先确认采集与留存政策同时Cowork 目前不在 Compliance API 或正式审计日志中不能把遥测能力误写成已经覆盖所有合规取证需求。上线流程可以采用管理员控制节奏的小范围扩展先选低影响团队观察工具调用、拒绝率、人工介入和异常出口再逐步增加频道、数据源和动作。每次模型升级、连接器变更或权限扩大都应重新回答四个问题而不是沿用旧审批单。因为真正变化的未必是代码也可能是模型突然更会组合已有工具。一张合格的智能体评审表最终应能给出明确结论哪些输入被视为不可信哪些动作被禁止谁为每次行动负责最坏情况下如何止损事故证据在哪里。四问的价值正在于把“AI 有风险”改写成可以配置、测试和复盘的工程对象。把审批单接进发布流水线真正落地时可以把四组字段做成一份版本化配置而不是留在 Word 或会议纪要中。每个智能体版本至少绑定下面这些对象风险面建议字段发布门禁输入来源、信任等级、解析方式、数据负责人新增外部来源必须重测提示注入样本动作工具、动作、资源范围、执行身份、有效期delete、grant、external_send默认阻断影响单次对象数、环境、地域、回滚点超过阈值转人工批准观测任务 ID、模型版本、参数摘要、审批记录关键事件缺失时不得扩大范围配置进入代码仓库后变更可以像普通发布一样被审查。比如连接器从“读取工单”增加到“更新优先级”即使模型版本不变也应触发安全回归。反过来模型升级但权限没有变化也要用旧版本的拒绝样本、越权样本和模糊目标样本重新跑一遍因为新模型可能组合出过去没有使用过的动作路径。上线后还要保留三个运行指标异常动作被工具层拒绝的次数、需要人工接管的任务比例、从发现异常到组织级暂停所需的时间。它们不直接代表系统安全却能帮助团队判断边界是否清楚、工具是否过度授权、停止路线是否真的可用。几个容易混淆的工程问题提示词写了“不要越权”还需要工具层限制吗需要。自然语言约束可以帮助模型理解目标但不能替代身份、动作和网络层的强制控制。不可逆动作要由系统阻断或要求独立批准。有完整聊天记录算具备可观测性吗不算。聊天只显示意图和回答事故复盘还需要工具调用、目标资源、执行身份、结果、审批人与关联业务对象。什么时候必须重新审批输入来源、模型、连接器、动作范围、身份方式、数据范围或日志结构任一发生实质变化时都应重新计算影响半径并运行回归样本。证据边界四问、最小智能体权限、管理员控制节奏及 Cowork 控制来自 Anthropic 官方文章字段设计、发布门禁和指标属于基于官方框架提出的工程实施建议。官方来源AnthropicThe CISO’s guide to agentic AI发布于 2026-07-17。