Libreria detectorPrompt injection

Prompt injection

Una pagina è diventata un'istruzione.

Individua contenuti simili a istruzioni in ciò che un agente legge.

Vedi il problema. Comprendi il rilevamento.

Narrazione in inglese con sottotitoli.

Come viene trascurato

Hai chiesto a un agente di riassumere una pagina. La pagina ordina all'agente di fare prima qualcos'altro. Questo è il confine di fiducia: un contenuto esterno cerca di diventare un'istruzione all'interno del tuo compito.

Immagina una pagina di recensione scaricata che contiene un messaggio che rivendica autorità e chiede all'agente di eseguire un programma di installazione prima di completare il riepilogo. In mezzo a materiale sorgente utile, l'istruzione può essere facile da ignorare per un revisore umano.

Cosa rileva ClawMetry

ClawMetry controlla i risultati degli strumenti registrati e il testo proveniente dall'utente per rilevare firme dichiarate di prompt injection. Un risultato corrispondente genera un avviso che nomina la firma e lo strumento sorgente. La segnalazione non deve ripetere il testo corrispondente.

La differenza che cambia il rilevamento

Esempio che innesca il rilevamento

La pagina ordina all'agente di agire

Segnalazione di avviso

Confronto silenzioso

Contenuto ordinario della pagina

Nessun rilevamento per questo detector.

L'esempio verificato inserisce un'istruzione contraffatta in una pagina scaricata e genera un avviso. Una descrizione ordinaria di un hotel resta silenziosa. Una chiamata successiva a uno strumento ad alto rischio nello stesso turno può aumentare la gravità, il che rende l'ordine degli eventi degno di esame.

Ispeziona il risultato del detector
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Scarica input e risultati completi (JSON)
Come è stato verificato l'esempio

Questi esempi valutano il detector pubblicato con dati di eventi creati o file di configurazione temporanei. I video illustrano tali comportamenti. Non sono registrazioni di agenti reali o dell'interfaccia del prodotto. Nessun comando negli esempi è stato eseguito.

Il risultato stabilisce il comportamento per questi input. Non stabilisce l'acquisizione in runtime, la prevenzione o una compromissione reale. Ispeziona il contratto sorgente fissato.

Cosa verificare dopo

Ispeziona la fonte che ha fornito il contenuto e le azioni che ne sono seguite. Tieni presente l'attività originale. L'agente ha trattato il testo esterno come un'autorità o lo ha semplicemente citato? Usa la segnalazione per esaminare quel confine con l'attività registrata effettiva.

  1. Identifica la fonte del contenuto
  2. Ispeziona le azioni successive
  3. Confronta con l'attività originale

Cosa stabilisce questo segnale

Questi sono controlli basati su firme delimitate. Parafrasi e altre forme non corrispondenti possono essere mancate; una corrispondenza non prova che l'agente abbia obbedito.

Tieni visibili i momenti importanti.

Segui l'attività degli agenti, ispeziona i rilevamenti e decidi cosa richiede la tua attenzione.