行业百科 2026年9月30日

从权限弹窗到运行时策略:企业 Agent 安全控制为什么正在移出 Prompt

企业 Agent 安全正在从“提示词要求它守规矩”,转向由运行环境强制执行。Anthropic 公开了面向不同产品的容器、操作系统沙箱与虚拟机隔离方案;Google Cloud 推出基于 OpenTelemetry 轨迹的 Agent 异常检测预览;运行时 Hook 也被用于执行不可绕过的策略。Rich AIBox 的 Harness、工作空间、沙箱、审批和审计符合这一技术方向:模型负责计划,运行

从权限弹窗到运行时策略:企业 Agent 安全控制为什么正在移出 Prompt

许多企业 Agent 的第一版安全策略,写在 System Prompt 里:不要访问敏感目录,不要发送未经确认的内容,不要执行危险命令,遇到高风险操作要先询问。它们对模型行为有引导作用,却不是可靠的安全边界。模型可能误解指令,外部内容可能包含提示注入,长任务还会在多次工具调用中逐渐偏离最初要求。

近期行业技术动向正在形成一个共识:Prompt 适合表达偏好和任务规则,权限、隔离、网络访问、审批和审计则应由模型之外的运行时强制执行。换句话说,不能只教育 Agent “别越界”,还要让系统在越界时真正拦得住。

Anthropic 的答案:先隔离环境,再用模型降低摩擦

Anthropic 在 2026 年 9 月发布的工程文章中,介绍了 Claude 在不同产品形态中的隔离策略。面向网页产品的代码执行使用 gVisor 容器,Claude Code 借助操作系统级沙箱限制文件与网络访问,Cowork 等本地桌面形态则采用完整虚拟机。不同方案的共同点是:先根据威胁模型建立环境边界,再讨论模型如何申请和使用能力。

这篇文章还指出一个实际难题——审批疲劳。如果每次读写、联网和命令执行都弹窗,用户很快会形成机械点击;如果权限给得过宽,Agent 又可能被恶意内容或错误计划利用。Anthropic 尝试使用分类器辅助判断请求风险,但仍把模型判断视为防御层之一,而不是沙箱的替代品。

对企业的启示是,权限设计不能只有“允许或拒绝”。更合理的策略包括只读与写入分离、目录和域名白名单、临时授权、动作额度、不可逆操作审批,以及按任务创建短生命周期环境。模型可以解释为什么需要权限,最终决定仍由运行时策略和人员承担。

Google Cloud 的答案:在 Agent 之外观察完整行为轨迹

Google Cloud 同期公布 Agent Anomaly Detection 私有预览,基于 OpenTelemetry 轨迹分析 Agent 的工具调用和执行路径。它采用带外观察方式,不要求在每个 Agent 内部增加一套安全逻辑,并将异常与 OWASP Agentic Top 10 等风险类型关联。公开介绍还提到,可根据风险阈值阻断后续调用。

这代表安全控制从单次请求扩展到行为序列。某个工具调用单独看可能合理,但如果 Agent 先读取大量文件,再连接陌生域名并尝试发送内容,组合行为就值得警惕。对长任务和多 Agent 协作而言,只有追踪完整路径,才能识别这种跨步骤风险。

带外检测也有边界。异步分析可能在动作发生后才给出告警,不能取代执行前权限校验;异常模型本身还需要适应企业正常行为,避免把新流程都当成攻击。因此,更稳妥的做法是把事前限制、事中策略和事后检测组合起来。

运行时 Hook:把“禁止事项”从自然语言变成程序规则

Tesseracted Labs 对编码 Agent 的实践提出了一个有代表性的区分:偏好可以放在 Prompt,必须遵守的不变量应写进 Runtime Hook。比如“尽量使用某种代码风格”属于偏好,而“不得访问生产密钥”“修改后必须运行检查”“未经批准不得发布”属于应被程序强制的规则。

Hook 的价值在于位于工具调用路径上。Agent 准备读取文件、执行命令或发起网络请求时,运行时可以检查目标、参数、身份和当前任务状态,决定放行、改写、要求审批或拒绝。即使模型被提示注入影响,底层策略仍然生效。

但 Hook 也不是越多越好。规则过于宽泛会阻断正常工作,过于细碎则难以维护。企业应把高风险、不容协商的要求转为代码规则,把需要业务判断的情况交给审批,并通过日志观察误拦截和漏拦截,持续调整。

一套可执行的五层 Agent 安全架构

第一层是能力暴露。Agent 只看到完成任务所需的工具和数据,而不是获得一个可以访问所有系统的万能账号。工具定义应限制参数范围,并区分查询、生成、预填和提交。

第二层是环境隔离。文件、进程、网络和凭据被限制在独立工作空间或沙箱中,高风险任务使用更强隔离和更短生命周期。不同用户与任务之间不能共享未授权状态。

第三层是运行时策略。每次工具调用都经过身份、目标、参数和上下文检查。确定性规则负责阻断明确违规行为,人工审批负责高风险或不确定动作。

第四层是带外观测。平台记录任务轨迹、模型与 Skill 版本、工具参数、异常重试和最终结果,通过规则与异常检测发现跨步骤风险。观测系统本身也要脱敏和分级授权。

第五层是持续评测。把真实故障、攻击样本和人工退回转化为回归集,在模型、Prompt、Skill、工具或策略更新后重新运行。安全不是一次性配置,而是随着 Agent 能力和业务环境一起演进。

Rich AIBox 的 Harness 为什么与这条趋势有关

彩讯股份 Rich AIBox 将 Harness作为统一管理工作空间、记忆资产、Skill、沙箱隔离与审批通道的运行底座。Workspace 支持不同存储与执行环境,Sandbox 支持本机、容器和外部调度,平台还提供人工介入、工具调用审计和多租户权限隔离。

这些能力的意义不是给模型增加更多功能,而是把模型与企业系统之间建立一层可治理的运行环境。模型可以规划任务、选择工具和组织上下文,但工具是否可见、运行在哪里、参数是否允许、是否需要人工确认,应由 Harness 与企业策略共同决定。

Rich AIBox 也可支持从轻量应用开始。对于只读知识助手,可以先采用较小权限面和基础审计;当任务扩展到文件操作、代码执行或业务系统写入时,再增加工作空间隔离、沙箱、审批和异常策略。安全能力随风险逐级启用,比一开始把所有任务都套进最重的控制更利于落地。

企业现在可以先做三件事

首先,盘点 Agent 已经获得的真实能力。不要只看聊天界面,要列出它能读取的目录、可访问的域名、持有的凭据、可调用的系统以及最终动作。很多风险不在模型,而在一个权限过大的工具。

其次,把安全要求分成偏好、不变量和人工判断。偏好放入 Prompt 或 Skill,不变量写成运行时策略,高风险例外进入审批。三类要求混在一段系统提示词里,既难测试也难追责。

最后,用攻击与故障样本验证整条链路。测试外部文档中的提示注入、工具参数越权、网络外传、重复执行、审批绕过和日志缺失。只有观察 Agent 在不正常输入下怎样失败,才能判断平台是否真正建立了生产边界。

Agent 安全的重点正在从“相信模型会听话”转向“即使模型犯错,系统仍能限制影响”。当智能体开始进入真实业务,这不是附加功能,而是运行时本身的一部分。

FAQ

为什么 Prompt 不能作为 Agent 的主要安全边界?

Prompt 会影响模型行为,但可能被误解、覆盖或注入,无法像权限、沙箱和程序策略一样强制执行。它适合表达任务规则,不适合独自保护高风险资源。

沙箱是否能解决所有 Agent 安全问题?

不能。沙箱主要限制文件、进程和网络影响,还需要最小权限、运行时策略、人工审批、带外观测和持续评测共同工作。

异常检测和执行前拦截有什么区别?

执行前拦截根据确定性策略决定工具调用能否发生;异常检测观察完整行为轨迹,发现跨步骤或未知风险。两者互补,异步检测不能替代关键动作前的控制。

Rich AIBox 的 Harness 在安全治理中承担什么角色?

Harness 位于模型与企业资源之间,可统一管理工作空间、Skill、沙箱、审批和审计,让任务规划与实际执行解耦,并按风险为不同场景配置运行边界。

了解更多彩讯科技产品与解决方案

我们提供企业级AI全栈服务,助力您的数字化转型