Come viene trascurato
Una build fallisce. L'agente riprova. Fallisce di nuovo. Ogni tentativo aggiunge altro output, ma il problema di fondo è ancora lì. Se controlli solo se la sessione è attiva, puoi perdere il fallimento che continua a ripetersi.
Considera un agente che prepara una modifica mentre il suo strumento shell continua a restituire un errore. La causa potrebbe essere una dipendenza mancante, un comando non valido o un accesso non disponibile. La domanda utile è quale strumento continua a fallire e con quale frequenza.
Cosa rileva ClawMetry
ClawMetry conta gli errori attribuiti allo stesso strumento nella finestra di eventi. Quando il conteggio supera la soglia applicabile, genera un avvertimento di fallimento ripetuto dello strumento. Il rilevamento indica lo strumento, il numero di fallimenti e la soglia utilizzata.
La differenza che cambia il rilevamento
Esempio che innesca il rilevamento
4 errori da Bash
Rilevamento di avvertenza
Confronto silenzioso
1 errore da Bash
Nessun rilevamento per questo detector.
Nell'esempio verificato, quattro risultati shell falliti generano un avvertimento. Un singolo fallimento rimane sotto la soglia. Questo è diverso da un loop di chiamate identiche: i comandi possono cambiare mentre lo stesso strumento continua a restituire errori.
Ispeziona il risultato del detector
{
"kind": "repeated_tool_failure",
"severity": "warning",
"evidence": {
"tool": "Bash",
"failures": 4,
"threshold": 3,
"threshold_source": "static"
}
}Scarica input e risultati completi (JSON)Come è stato verificato l'esempio
Questi esempi valutano il detector pubblicato con dati di eventi creati o file di configurazione temporanei. I video illustrano tali comportamenti. Non sono registrazioni di agenti reali o dell'interfaccia del prodotto. Nessun comando negli esempi è stato eseguito.
Il risultato stabilisce il comportamento per questi input. Non stabilisce l'acquisizione in runtime, la prevenzione o una compromissione reale. Ispeziona il contratto sorgente fissato.
Cosa verificare dopo
Apri i risultati falliti e cerca la causa comune. Risolvi il problema di ambiente o di accesso, o limita il task dell'agente prima di lasciare che i tentativi si accumulino. Poi verifica che il prossimo risultato dello strumento abbia effettivamente successo.
- Leggi i risultati degli errori
- Risolvi la causa comune
- Verifica il risultato successivo
Cosa stabilisce questo segnale
Questo è un segnale di affidabilità. Non diagnostica la causa principale né prova che l'agente sia sotto attacco.