Bibliothèque de détecteursInjection de prompt

Injection de prompt

Une page est devenue une instruction.

Repérez un contenu ressemblant à une instruction dans ce que lit un agent.

Visualisez le problème. Comprenez la détection.

Narration en anglais avec sous-titres.

Comment ça passe inaperçu

Vous avez demandé à un agent de résumer une page. La page demande à l'agent de faire autre chose d'abord. C'est la frontière de confiance : un contenu externe tente de devenir une instruction dans votre tâche.

Imaginez une page de revue récupérée contenant un message qui revendique une autorité et demande à l'agent d'exécuter un installateur avant de terminer le résumé. Au milieu d'un contenu source utile, l'instruction peut être facile à ignorer pour un réviseur humain.

Ce que ClawMetry détecte

ClawMetry vérifie les résultats d'outils enregistrés et les textes provenant de l'utilisateur pour les signatures d'injection de prompt déclarées. Un résultat d'outil correspondant lève une alerte qui nomme la signature et l'outil source. La détection n'a pas besoin de reproduire le texte correspondant.

La différence qui change tout

Exemple déclencheur

La page demande à l'agent d'agir

Alerte

Comparaison silencieuse

Contenu de page ordinaire

Aucune détection pour ce détecteur.

L'exemple vérifié place une instruction forgée dans une page récupérée et obtient une alerte. Une description d'hôtel ordinaire reste silencieuse. Un appel d'outil à haut risque ultérieur dans le même tour peut augmenter la sévérité, ce qui rend l'ordre des événements important à examiner.

Inspecter le résultat du détecteur
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Télécharger les entrées et résultats complets (JSON)
Comment l'exemple a été vérifié

Ces exemples évaluent le détecteur publié avec des données d'événements créées pour l'occasion ou des fichiers de configuration jetables. Les vidéos illustrent ces comportements. Il ne s'agit pas d'enregistrements d'agents réels ni de l'interface du produit. Aucune commande dans les exemples n'a été exécutée.

Le résultat établit le comportement pour ces entrées. Il n'établit pas l'ingestion en temps réel, la prévention ni un véritable compromis. Inspecter le contrat source épinglé.

Que vérifier ensuite

Inspectez la source qui a fourni le contenu et les actions qui ont suivi. Gardez la tâche originale en vue. L'agent a-t-il traité le texte externe comme une autorité, ou l'a-t-il simplement cité? Utilisez la détection pour investiguer cette frontière avec l'activité enregistrée réelle.

  1. Identifier la source du contenu
  2. Inspecter les actions suivantes
  3. Comparer avec la tâche originale

Ce que ce signal établit

Il s'agit de vérifications de signatures délimitées. Les paraphrases et autres formes non correspondantes peuvent être manquées ; une correspondance ne prouve pas que l'agent a obéi.

Gardez les moments importants visibles.

Suivez l'activité des agents, inspectez les détections et décidez ce qui nécessite votre attention.