检测器库提示注入

提示注入

页面变成了指令。

识别智能体读取内容中的类指令文本。

发现问题,理解检测结果。

英语旁白,含字幕。

容易被忽视的原因

您让智能体总结一个页面,页面却指示智能体先做别的事。这就是信任边界所在:外部内容试图在您的任务中成为指令。

设想一个抓取的评论页面包含一条声称具有权威性的消息,要求智能体在完成摘要前先运行安装程序。这条指令夹杂在有用的资料中,人工审查者很容易忽略。

ClawMetry 检测什么

ClawMetry 检查已记录的工具结果和用户提供的文本中是否存在已声明的提示注入特征。匹配的工具结果会触发警告,注明特征名称和来源工具,发现中无需复制匹配文本。

影响检测结果的关键差异

触发示例

页面指示智能体执行操作

警告发现

静默对比

普通页面内容

此检测器无发现。

检查示例在抓取的页面中植入伪造指令,触发警告。普通酒店介绍保持静默。同一轮次中后续的高风险工具调用可能提升严重级别,因此事件顺序值得审查。

检查检测器结果
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
下载输入和完整结果(JSON)
示例的检查方式

这些示例使用预设事件数据或一次性配置文件评估已发布的检测器。视频展示了相应行为,并非真实智能体或产品界面的录屏。示例中的命令均未实际执行。

结果仅反映这些输入的行为,不代表运行时摄取、防护或真实的攻击场景。 查看固定源合约.

接下来检查什么

检查提供内容的来源及后续操作。对照原始任务,判断智能体是将外部文本视为权威指令还是仅引用了它。利用发现,结合实际记录的活动调查该边界。

  1. 定位内容来源
  2. 检查后续操作
  3. 与原始任务对比

此信号说明什么

这些是有限的特征检查。改写和其他未匹配形式可能被遗漏;匹配不代表智能体遵从了注入指令。

让重要时刻始终可见。

跟踪智能体活动,检查发现结果,决定哪些需要关注。