检测器库重复工具失败

重复工具失败

同一工具,又一次失败。

找出被反复重试掩盖的失败步骤。

发现问题,理解检测结果。

英语旁白,含字幕。

容易被忽视的原因

构建失败,智能体重试,再次失败。每次重试都会产生更多输出,但根本问题依然存在。如果只检查会话是否活跃,你很可能会错过反复出现的失败。

设想一个智能体在准备变更时,其 shell 工具反复返回错误。原因可能是缺少依赖项、命令无效或访问不可用。关键问题是哪个工具持续失败,以及失败了多少次。

ClawMetry 检测什么

ClawMetry 统计事件窗口中归因于同一工具的错误次数。当次数超过适用阈值时,触发重复工具失败警告。检测结果会指出工具名称、失败次数和所用阈值。

影响检测结果的关键差异

触发示例

Bash 产生 4 次错误

警告发现

静默对比

Bash 产生 1 次错误

此检测器无发现。

在所检查的示例中,四次 shell 失败结果触发警告。单次失败低于阈值。这与相同调用循环不同:命令可以改变,而同一工具仍持续返回错误。

检查检测器结果
{
  "kind": "repeated_tool_failure",
  "severity": "warning",
  "evidence": {
    "tool": "Bash",
    "failures": 4,
    "threshold": 3,
    "threshold_source": "static"
  }
}
下载输入和完整结果(JSON)
示例的检查方式

这些示例使用预设事件数据或一次性配置文件评估已发布的检测器。视频展示了相应行为,并非真实智能体或产品界面的录屏。示例中的命令均未实际执行。

结果仅反映这些输入的行为,不代表运行时摄取、防护或真实的攻击场景。 查看固定源合约.

接下来检查什么

查看失败结果,寻找共同原因。修复环境或访问问题,或在允许重试继续累积之前缩小智能体任务范围。然后验证下一次工具调用确实成功。

  1. 读取错误结果
  2. 修复共同原因
  3. 验证下一次结果

此信号说明什么

这是一个可靠性信号,不诊断根本原因,也不证明智能体正在受到攻击。

让重要时刻始终可见。

跟踪智能体活动,检查发现结果,决定哪些需要关注。