检测器库操作不一致

操作不一致

步骤失败,智能体已继续执行。

注意失败后跟随不同操作的情况。

发现问题,理解检测结果。

英语旁白,含字幕。

容易被忽视的原因

构建失败,但智能体已开始撰写摘要。它是否已恢复,还是一个重要的失败在两个步骤之间悄然消失?下一步操作往往才是展开有效审查的起点。

在繁忙的会话中,一个错误可能在下一次工具调用之前被忽略。智能体可能有合理的恢复策略,也可能在未处理失败的情况下继续执行。无论哪种情况,你都需要查看完整的执行序列才能做出判断。

ClawMetry 检测什么

ClawMetry 会标记工具调用失败后、在未出现已识别的重试或确认的情况下继续执行的情形,并生成信息级的操作差异发现。较低的严重级别是有意为之:这是提示你检查过渡过程的信号,而非对智能体意图的定论。

影响检测结果的关键差异

触发示例

失败,调用了不同工具

信息级发现

静默对比

失败,同一工具重试

此检测器无发现。

被检查的示例中,shell 构建失败后调用了不同的工具,触发了信息级发现。失败后再次调用相同工具会被视为重试,不会触发此检测器。

检查检测器结果
{
  "kind": "action_discrepancy",
  "severity": "info",
  "evidence": {
    "failed_tool": "Bash",
    "continued_as": "tool_call"
  }
}
下载输入和完整结果(JSON)
示例的检查方式

这些示例使用预设事件数据或一次性配置文件评估已发布的检测器。视频展示了相应行为,并非真实智能体或产品界面的录屏。示例中的命令均未实际执行。

结果仅反映这些输入的行为,不代表运行时摄取、防护或真实的攻击场景。 查看固定源合约.

接下来检查什么

将失败步骤与后续操作进行对比。新操作是恢复路径吗?错误是否在其他地方得到了确认?在依赖完成报告之前,请核实失败操作本应产生的实际结果。

  1. 检查失败结果
  2. 检查恢复路径
  3. 核实声称的结果

此信号说明什么

此检测器不验证最终完成声明。通过其他工具进行的合理恢复也可能匹配此规则。

让重要时刻始终可见。

跟踪智能体活动,检查发现结果,决定哪些需要关注。