DetectorbibliotheekPrompt injection

Prompt injection

Een pagina werd een instructie.

Herken instructie-achtige inhoud in wat een agent leest.

Zie het probleem. Begrijp de bevinding.

Engelse vertelling met ondertitels.

Hoe het over het hoofd wordt gezien

Je vroeg een agent een pagina samen te vatten. De pagina vertelt de agent eerst iets anders te doen. Dat is de vertrouwensgrens: externe inhoud probeert een instructie te worden binnen jouw taak.

Stel dat een opgehaalde beoordelingspagina een bericht bevat dat gezag claimt en de agent vraagt een installatieprogramma uit te voeren voordat de samenvatting klaar is. Midden in nuttig bronmateriaal kan de instructie gemakkelijk over het hoofd worden gezien.

Wat ClawMetry detecteert

ClawMetry controleert geregistreerde toolresultaten en gebruikersbrontekst op gedeclareerde prompt injection-handtekeningen. Een overeenkomend toolresultaat geeft een waarschuwing met de naam van de handtekening en het brontool. De bevinding hoeft de overeenkomende tekst niet te herhalen.

Het verschil dat de bevinding bepaalt

Triggering voorbeeld

Pagina instrueert agent te handelen

Waarschuwing

Rustige vergelijking

Gewone pagina-inhoud

Geen bevinding voor deze detector.

Het gecontroleerde voorbeeld plaatst een vervalsde instructie in een opgehaalde pagina en krijgt een waarschuwing. Een gewone hotelbeschrijving blijft stil. Een latere risicovolle toolaanroep in dezelfde beurt kan de ernst verhogen, waardoor de volgorde van gebeurtenissen de moeite waard is om te bekijken.

Inspecteer het detectorresultaat
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Download invoer en volledige resultaten (JSON)
Hoe het voorbeeld werd gecontroleerd

Deze voorbeelden evalueren de gepubliceerde detector met geschreven gebeurtenisgegevens of wegwerpbare configuratiebestanden. De video's illustreren dat gedrag. Het zijn geen opnames van live agents of de productinterface. Geen enkel commando in de voorbeelden werd uitgevoerd.

Het resultaat stelt gedrag vast voor deze invoer. Het stelt geen runtime-opname, preventie of een echte compromittering vast. Inspecteer het vastgezette broncontract.

Wat u vervolgens kunt controleren

Inspecteer de bron die de inhoud leverde en de acties die volgden. Houd de oorspronkelijke taak in beeld. Behandelde de agent externe tekst als autoriteit, of citeerde hij het slechts? Gebruik de bevinding om die grens te onderzoeken met de werkelijke geregistreerde activiteit.

  1. Identificeer de inhoudsbron
  2. Inspecteer de daaropvolgende acties
  3. Vergelijk met de oorspronkelijke taak

Wat dit signaal vaststelt

Dit zijn afgebakende handtekeningcontroles. Parafrasen en andere niet-overeenkomende vormen kunnen worden gemist; een overeenkomst bewijst niet dat de agent gehoorzaamde.

Houd de belangrijke momenten zichtbaar.

Volg agentactiviteit, inspecteer bevindingen en besluit wat uw aandacht vereist.