容易被忽视的原因
构建失败,但智能体已开始撰写摘要。它是否已恢复,还是一个重要的失败在两个步骤之间悄然消失?下一步操作往往才是展开有效审查的起点。
在繁忙的会话中,一个错误可能在下一次工具调用之前被忽略。智能体可能有合理的恢复策略,也可能在未处理失败的情况下继续执行。无论哪种情况,你都需要查看完整的执行序列才能做出判断。
ClawMetry 检测什么
ClawMetry 会标记工具调用失败后、在未出现已识别的重试或确认的情况下继续执行的情形,并生成信息级的操作差异发现。较低的严重级别是有意为之:这是提示你检查过渡过程的信号,而非对智能体意图的定论。
影响检测结果的关键差异
触发示例
失败,调用了不同工具
信息级发现
静默对比
失败,同一工具重试
此检测器无发现。
被检查的示例中,shell 构建失败后调用了不同的工具,触发了信息级发现。失败后再次调用相同工具会被视为重试,不会触发此检测器。
检查检测器结果
{
"kind": "action_discrepancy",
"severity": "info",
"evidence": {
"failed_tool": "Bash",
"continued_as": "tool_call"
}
}下载输入和完整结果(JSON)示例的检查方式
这些示例使用预设事件数据或一次性配置文件评估已发布的检测器。视频展示了相应行为,并非真实智能体或产品界面的录屏。示例中的命令均未实际执行。
结果仅反映这些输入的行为,不代表运行时摄取、防护或真实的攻击场景。 查看固定源合约.
接下来检查什么
将失败步骤与后续操作进行对比。新操作是恢复路径吗?错误是否在其他地方得到了确认?在依赖完成报告之前,请核实失败操作本应产生的实际结果。
- 检查失败结果
- 检查恢复路径
- 核实声称的结果
此信号说明什么
此检测器不验证最终完成声明。通过其他工具进行的合理恢复也可能匹配此规则。