容易被忽视的原因
构建失败,智能体重试,再次失败。每次重试都会产生更多输出,但根本问题依然存在。如果只检查会话是否活跃,你很可能会错过反复出现的失败。
设想一个智能体在准备变更时,其 shell 工具反复返回错误。原因可能是缺少依赖项、命令无效或访问不可用。关键问题是哪个工具持续失败,以及失败了多少次。
ClawMetry 检测什么
ClawMetry 统计事件窗口中归因于同一工具的错误次数。当次数超过适用阈值时,触发重复工具失败警告。检测结果会指出工具名称、失败次数和所用阈值。
影响检测结果的关键差异
触发示例
Bash 产生 4 次错误
警告发现
静默对比
Bash 产生 1 次错误
此检测器无发现。
在所检查的示例中,四次 shell 失败结果触发警告。单次失败低于阈值。这与相同调用循环不同:命令可以改变,而同一工具仍持续返回错误。
检查检测器结果
{
"kind": "repeated_tool_failure",
"severity": "warning",
"evidence": {
"tool": "Bash",
"failures": 4,
"threshold": 3,
"threshold_source": "static"
}
}下载输入和完整结果(JSON)示例的检查方式
这些示例使用预设事件数据或一次性配置文件评估已发布的检测器。视频展示了相应行为,并非真实智能体或产品界面的录屏。示例中的命令均未实际执行。
结果仅反映这些输入的行为,不代表运行时摄取、防护或真实的攻击场景。 查看固定源合约.
接下来检查什么
查看失败结果,寻找共同原因。修复环境或访问问题,或在允许重试继续累积之前缩小智能体任务范围。然后验证下一次工具调用确实成功。
- 读取错误结果
- 修复共同原因
- 验证下一次结果
此信号说明什么
这是一个可靠性信号,不诊断根本原因,也不证明智能体正在受到攻击。