DetektorbibliotekPromptinjektion

Promptinjektion

En sida blev en instruktion.

Upptäck instruktionsliknande innehåll i det en agent läser.

Se problemet. Förstå fyndet.

Engelsk berättarröst med undertexter.

Hur det förbises

Du bad en agent sammanfatta en sida. Sidan instruerar agenten att göra något annat först. Det är förtroensgränsen: externt innehåll försöker bli en instruktion i din uppgift.

Föreställ dig en hämtad recensionssida som innehåller ett meddelande som gör anspråk på auktoritet och ber agenten köra ett installationsprogram innan sammanfattningen är klar. Mitt bland användbart källmaterial kan instruktionen vara lätt för en mänsklig granskare att förbise.

Vad ClawMetry identifierar

ClawMetry kontrollerar inspelade verktygsresultat och användarinmatat text efter deklarerade prompt injection-signaturer. Ett matchande verktygsresultat skapar en varning som namnger signaturen och källverktyget. Fyundet behöver inte upprepa den matchade texten.

Skillnaden som förändrar fyndet

Utlösande exempel

Sida instruerar agenten att agera

Varningsfynd

Tyst jämförelse

Vanligt sidinnehåll

Inget fynd för den här detektorn.

Det kontrollerade exemplet placerar en falsk instruktion på en hämtad sida och får en varning. En vanlig hotellbeskrivning förblir tyst. Ett senare högriskverktygsanrop i samma tur kan öka allvarlighetsgraden, vilket gör att händelseordningen är värd att granska.

Granska detektorresultatet
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Ladda ner indata och fullständiga resultat (JSON)
Hur exemplet kontrollerades

De här exemplen utvärderar den publicerade detektorn med skapade händelsedata eller tillfälliga konfigurationsfiler. Videorna illustrerar dessa beteenden. De är inte inspelningar av aktiva agenter eller produktgränssnittet. Inget kommando i exemplen utfördes.

Resultatet fastställer beteende för dessa indata. Det fastställer inte körtidsinmatning, förebyggande eller ett verkligt intrång. Granska det fästa källkontraktet.

Vad du kontrollerar härnäst

Inspektera källan som tillhandahöll innehållet och åtgärderna som följde. Håll den ursprungliga uppgiften i sikte. Behandlade agenten extern text som auktoritet, eller citerade den bara? Använd fyundet för att undersöka den gränsen med den faktiska inspelade aktiviteten.

  1. Identifiera innehållskällan
  2. Granska efterföljande åtgärder
  3. Jämför med den ursprungliga uppgiften

Vad den här signalen fastställer

Det här är avgränsade signaturkontroller. Omformuleringar och andra omatchade former kan missas; en matchning bevisar inte att agenten lydde.

Håll de viktiga ögonblicken synliga.

Följ agentaktivitet, granska fynd och bestäm vad som behöver din uppmärksamhet.