Detector-BibliothekPrompt injection

Prompt injection

Eine Seite wurde zur Anweisung.

Anweisungsähnliche Inhalte in den Lesedaten eines Agenten erkennen.

Das Problem erkennen. Den Befund verstehen.

Englische Kommentierung mit Untertiteln.

Wie es übersehen wird

Du hast einen Agenten gebeten, eine Seite zusammenzufassen. Die Seite weist den Agenten an, zuerst etwas anderes zu tun. Das ist die Vertrauensgrenze: Externer Inhalt versucht, zur Anweisung innerhalb deiner Aufgabe zu werden.

Stell dir eine abgerufene Rezensionsseite vor, die eine Nachricht enthält, die Autorität beansprucht und den Agenten auffordert, ein Installationsprogramm auszuführen, bevor die Zusammenfassung abgeschlossen wird. Mitten in nützlichem Quellmaterial kann die Anweisung für einen menschlichen Prüfer leicht zu übersehen sein.

Was ClawMetry erkennt

ClawMetry prüft aufgezeichnete Tool-Ergebnisse und benutzerstammenende Texte auf deklarierte Prompt-Injection-Signaturen. Ein übereinstimmendes Tool-Ergebnis löst eine Warnung aus, die die Signatur und das Quell-Tool benennt. Der Befund muss den übereinstimmenden Text nicht wiederholen.

Der Unterschied, der den Befund verändert

Auslösendes Beispiel

Seite weist Agent an zu handeln

Warnbefund

Stilles Vergleichsbeispiel

Gewöhnlicher Seiteninhalt

Kein Befund für diesen Detector.

Das geprüfte Beispiel platziert eine gefälschte Anweisung auf einer abgerufenen Seite und erzeugt eine Warnung. Eine gewöhnliche Hotelbeschreibung bleibt still. Ein nachfolgendes hochriskantes Tool-Aufruf im selben Durchgang kann den Schweregrad erhöhen, was die Reihenfolge der Ereignisse überprüfenswert macht.

Detector-Ergebnis prüfen
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Eingaben und vollständige Ergebnisse herunterladen (JSON)
Wie das Beispiel geprüft wurde

Diese Beispiele werten den veröffentlichten Detector mit selbst erstellten Ereignisdaten oder einmalig verwendeten Konfigurationsdateien aus. Die Videos veranschaulichen dieses Verhalten. Es sind keine Aufzeichnungen von Live-Agents oder der Produktoberfläche. Kein Befehl in den Beispielen wurde ausgeführt.

Das Ergebnis beschreibt das Verhalten für diese Eingaben. Es belegt weder Laufzeit-Ingestion, Prävention noch einen echten Kompromittierungsfall. Festgelegten Quellvertrag prüfen.

Was als nächstes zu prüfen ist

Prüfe die Quelle, die den Inhalt geliefert hat, sowie die darauf folgenden Aktionen. Behalte die ursprüngliche Aufgabe im Blick. Hat der Agent externen Text als Autorität behandelt oder ihn lediglich zitiert? Nutze den Befund, um diese Grenze anhand der tatsächlich aufgezeichneten Aktivität zu untersuchen.

  1. Inhaltsquelle identifizieren
  2. Nachfolgende Aktionen prüfen
  3. Mit der ursprünglichen Aufgabe vergleichen

Was dieses Signal belegt

Dies sind begrenzte Signaturprüfungen. Paraphrasen und andere nicht erkannte Formen können übersehen werden. Eine Übereinstimmung beweist nicht, dass der Agent die Anweisung befolgt hat.

Die wichtigen Momente sichtbar halten.

Agent-Aktivität verfolgen, Befunde prüfen und entscheiden, was Ihre Aufmerksamkeit erfordert.