最长运行两小时的网络调查 Agent,怎样避免在恶意页面里跑偏

发布时间:2026/7/24 1:23:16
最长运行两小时的网络调查 Agent,怎样避免在恶意页面里跑偏 工程上的答案长时间调查 Agent 不能只靠更大的上下文窗口。先定义证据、图谱、时间线和停止条件再把状态写入可恢复文件系统固定动作由 harness 强制未知页面和工具故障才留给模型判断。质量 eval 与安全 eval 还要分开通过。先定义调查产物再决定 Agent 能用哪些工具Claude 官方在 2026 年 7 月 22 日发布 Outtake 的 Recon Agent 案例。Outtake 用 Claude Code 和 Claude Agent SDK 构建长时间运行的网络调查 Agent从仿冒登录页出发收集和分类证据继续追踪关联域名、账号与基础设施形成攻击网络图最后输出调查过程、威胁主体画像和时间线。官方披露Outtake 的 Agent 会话中位数为 16 分钟常常持续一小时以上最长一次运行了两小时。长会话的问题不只在上下文长度而在每一步新线索都会改变后续方向。若“调查完成”没有固定定义Agent 可能不断探索也可能过早停在一个仿冒页面上。Outtake 的第一步不是写 Agent而是工程师亲自完成真实调查并从客户和设计伙伴那里整理领域经验定义什么证据有价值、怎样组织、可行动结论与猜测有何区别。这套标准成为后续原型、评测和生产迭代的固定参照。工程实现时可以先定义交付 schema初始事件、证据节点、关联边、来源与抓取时间、可信级别、未验证假设、时间线和建议动作。Agent 每发现一个新对象就写入文件系统中的结构化记录压缩上下文或重启会话后调查状态仍可恢复。图谱去重不能只依赖名称。域名、证书、IP、账号和页面模板的关系需要分别保存关联边带上证据类型和可信状态。相同字符串可能属于不同主体同一攻击者也可能频繁更换基础设施grader 应检查是否存在无证据合并而不是奖励节点越多越好。停止条件可以写成状态机主要线索已覆盖且新增证据价值下降时生成报告需要主动提交表单、接触敏感数据、风险评分超过阈值或预算耗尽时暂停证据冲突则进入人工复核。这样“继续调查”是可解释决定而不是 Agent 只要还能找到链接就一直运行。检查点可以采用追加写而不是反复覆盖。每一阶段保存任务版本、当前目标、已确认节点、新增关联、待验证假设、工具错误和下一步恢复时先校验快照哈希再从最后一个完整阶段继续。这样既能回放错误路径也能避免损坏文件让 Agent 带着不完整状态重新运行。证据节点与模型判断要分开存储。网页内容、请求时间和页面哈希属于原始证据实体归属与攻击者画像属于分析。后续模型升级时可以重算分析而不改变原始记录也能看出结果差异来自证据变化还是判断变化。orchestration 写死步骤判断空间留给 AgentOuttake 先在 Claude Code 中验证假设再转向 Agent SDK以便更细控制 memory、context 和 filesystem。团队形成的原则是在编排层强制每次调查都执行的动作例如保存证据、更新图谱、检查停止条件遇到新页面、失效工具或未知基础设施时允许 Agent 自己写代码和选择路径。官方文章提到文件系统加 bash 让 Agent 在工具遇到网络故障时寻找替代办法继续工作。开放能力也带来风险。允许读写文件和执行代码不代表可以接触内部密钥、任意网络或生产系统。工具适配器应限定目录、网络出口、进程资源和运行时间每次访问恶意页面前经过风险检查点。模型选择可以在 147AI 中用脱敏调查图、静态页面快照和固定线索集进行对照记录证据遗漏、错误关联、修订轮次、用量和人工评分。真实恶意域名、客户暴露面、Claude Agent SDK 会话和处置权限仍留在隔离调查系统。稳定规则不要只写在 system prompt。Outtake 的经验是长时间 Agent 可能忽略提示中的某些词必须每次执行的要求应进入 harness证据落盘、来源标记、禁止提交真实凭据、达到风险阈值后暂停以及向外部页面发送数据前的检查。Prompt 留给需要判断的空间硬边界由系统执行。错误类型同样进入 harness。临时网络失败允许有限重试和替代工具策略拒绝、未批准目标和敏感信息请求只能生成待处理事项。若所有失败都返回同一错误Agent 可能把安全边界误认为普通技术障碍并继续寻找绕过路径。每次运行绑定模型、harness、工具、策略和页面快照版本。实时网页持续变化事故后只重新访问目标无法证明旧问题保留原输入和状态才能复现提示注入、错误关联或工具行为。出站请求应经过独立代理。代理不仅判断域名能否访问还检查请求方法、payload 和当前任务身份。普通公开页面可以只读获取表单提交、文件上传、携带客户标识或访问新目标时默认暂停并等待批准。Agent 看到的是策略结果没有权限修改白名单。命令执行也需要产物清单。脚本读取了哪些文件、创建了哪些临时工具、产生哪些网络请求都与当前检查点绑定。任务结束后临时程序不会自动进入共享工具层要复用必须补齐测试、负责人和权限审查。评测要缩短开发循环也要验证隔离边界早期每次运行后工程师人工阅读约 30 分钟的完整轨迹成本很高。Outtake 将这些人工 reflection 逐步写成自动 eval让 grader Agent 根据固定标准检查调查是否完整、证据是否支持结论、图谱是否错误合并、停止点是否合理。模型升级和 memory 重构时多场景并行回归能更快暴露变化。评测还驱动工具改进。Recon Agent 会报告自己缺少什么工具另一个 coding Agent 读取建议、编写工具并建立测试场景最后由人判断新工具是否让调查更好。这个链条必须限制自动发布工具先在固定样本和沙箱中运行检查权限、输入输出和失败路径再决定是否进入调查 harness。安全边界采用“可能被劫持”的假设。Outtake 构建 blastbox将 Agent 与敏感内部信息隔离并在它接触互联网的具体节点评估页面是否仿冒、包含恶意代码或试图提示注入。企业参考这套思路时可以再用网络白名单、短期身份、文件系统快照和工具日志限制并回放影响。新工具也不能从 Agent 建议直接进入生产。独立 coding 流程生成实现和测试先在历史页面与失败样本中运行检查权限、网络和状态写入再由人批准进入只读工具层。当前会话的临时脚本任务结束后自动归档。生产指标分成质量与控制两组。质量看证据覆盖、错误关联、报告采纳和人工修订控制看越界请求、风险拒绝、状态恢复和资源消耗。两组都通过才能扩大运行时间或网络范围。回归集至少包含顺利调查、工具超时、页面格式变化、无价值线索、错误关联和提示注入。grader 检查最终报告时还要读取命令、网络和文件轨迹确认固定步骤确实执行。只评最终文本可能让中途越界但最后写出正确报告的版本获得高分。上线可以分三段先使用静态页面与脱敏图谱验证 schema 和恢复再开放经过代理的受限互联网只读访问少量目标最后才增加运行时长和临时脚本能力。每段都设置回退条件出现证据丢失、无法解释的关联或越界请求就退回前一层。最小验收清单中断后能从检查点恢复每个结论能回到来源错误关联可被固定样本发现策略拒绝不会被当成工具故障重试人接管时不必重读完整轨迹新模型在质量和控制两套回归中都通过。最终验收不能只看是否找到更多域名。还要看每个结论能否回到证据错误关联能否被发现长会话中固定步骤是否执行恶意输入能否突破隔离以及人工是否能在高风险节点接管。长时间 Agent 的可靠性来自领域标准、可恢复状态、自动评测和硬边界共同作用。官方来源ClaudeHow Outtake built a cyber investigator on Claude发布于 2026-07-22。