Detector libraryPrompt injection

Prompt injection

एक पेज निर्देश बन गया।

एजेंट जो पढ़ता है उसमें निर्देश जैसा कंटेंट पहचानें।

समस्या देखें। finding समझें।

अंग्रेज़ी नैरेशन, कैप्शन सहित।

यह कैसे नज़रअंदाज़ हो जाता है

आपने एजेंट को एक पेज का सारांश बनाने को कहा। पेज एजेंट को पहले कुछ और करने को कहता है। यही विश्वास की सीमा है: बाहरी कंटेंट आपके कार्य के अंदर निर्देश बनने की कोशिश कर रहा है।

मान लीजिए एक फेच किए गए रिव्यू पेज में एक संदेश है जो अधिकार का दावा करता है और एजेंट को सारांश पूरा करने से पहले एक इंस्टॉलर चलाने को कहता है। उपयोगी स्रोत सामग्री के बीच यह निर्देश मानव समीक्षक को आसानी से नज़रअंदाज़ हो सकता है।

ClawMetry क्या डिटेक्ट करता है

ClawMetry रिकॉर्ड किए गए टूल परिणामों और उपयोगकर्ता-स्रोत टेक्स्ट में prompt injection के घोषित हस्ताक्षरों की जाँच करता है। मिलान होने पर चेतावनी उठती है जो हस्ताक्षर और स्रोत टूल का नाम देती है।

वह अंतर जो finding बदल देता है

Trigger करने वाला उदाहरण

पेज एजेंट को कार्य करने के लिए कहता है

चेतावनी

शांत तुलना

सामान्य पेज कंटेंट

इस detector के लिए कोई finding नहीं।

जाँचे गए उदाहरण में एक फेच किए गए पेज में जाली निर्देश रखने पर चेतावनी मिलती है। सामान्य होटल विवरण शांत रहता है। उसी टर्न में बाद की उच्च जोखिम वाली टूल कॉल गंभीरता बढ़ा सकती है।

Detector result की जांच करें
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Inputs और पूरे results डाउनलोड करें (JSON)
उदाहरण कैसे जांचा गया

ये उदाहरण published detector को authored event data या disposable configuration files के साथ evaluate करते हैं। वीडियो उन behaviors को दर्शाते हैं। ये live agents या product interface की recordings नहीं हैं। उदाहरणों में कोई command execute नहीं किया गया।

परिणाम इन inputs के लिए व्यवहार स्थापित करता है। यह runtime ingestion, prevention या वास्तविक compromise स्थापित नहीं करता। Pinned source contract की जांच करें.

आगे क्या जांचें

कंटेंट देने वाले स्रोत और उसके बाद की कार्रवाइयाँ जाँचें। मूल कार्य सामने रखें। क्या एजेंट ने बाहरी टेक्स्ट को अधिकार माना, या सिर्फ उद्धृत किया? वास्तविक रिकॉर्ड की गई गतिविधि के साथ उस सीमा की जाँच करें।

  1. कंटेंट का स्रोत पहचानें
  2. बाद की कार्रवाइयाँ जाँचें
  3. मूल कार्य से तुलना करें

यह signal क्या स्थापित करता है

ये सीमित हस्ताक्षर जाँचें हैं। पैराफ्रेज़ और अन्य अमिलान रूप छूट सकते हैं; मिलान यह साबित नहीं करता कि एजेंट ने पालन किया।

महत्वपूर्ण क्षण दिखते रहें।

एजेंट गतिविधि फॉलो करें, findings जांचें और तय करें कि किस पर ध्यान देना है।