Detector libraryPrompt injection

Prompt injection

ഒരു പേജ് ഒരു നിർദ്ദേശമായി.

ഒരു ഏജന്റ് വായിക്കുന്നതിൽ നിർദ്ദേശ സദൃശ ഉള്ളടക്കം കണ്ടെത്തുക.

പ്രശ്നം കാണുക. Finding മനസ്സിലാക്കുക.

ഇംഗ്ലീഷ് narration, captions സഹിതം.

ഇത് എങ്ങനെ ശ്രദ്ധിക്കപ്പെടാതെ പോകുന്നു

ഒരു പേജ് സംഗ്രഹിക്കാൻ നിങ്ങൾ ഏജന്റിനോട് ആവശ്യപ്പെട്ടു. ആ പേജ് ഏജന്റിനോട് ആദ്യം മറ്റെന്തെങ്കിലും ചെയ്യാൻ പറയുന്നു. ഇതാണ് ട്രസ്റ്റ് അതിർത്തി: ബാഹ്യ ഉള്ളടക്കം നിങ്ങളുടെ ടാസ്കിനുള്ളിൽ ഒരു നിർദ്ദേശമാകാൻ ശ്രമിക്കുന്നു.

ഒരു ഫെച്ച് ചെയ്ത റിവ്യൂ പേജ് അധികാരം അവകാശപ്പെടുന്ന ഒരു സന്ദേശം അടങ്ങിയിരിക്കുകയും സംഗ്രഹം പൂർത്തിയാക്കുന്നതിന് മുൻപ് ഒരു ഇൻസ്റ്റാളർ പ്രവർത്തിപ്പിക്കാൻ ഏജന്റിനോട് ആവശ്യപ്പെടുകയും ചെയ്യുന്നു. ഉപയോഗപ്രദമായ ഉറവിട മെറ്റീരിയലിനിടയിൽ, നിർദ്ദേശം ഒരു മനുഷ്യ അവലോകനകർക്ക് ശ്രദ്ധിക്കാതെ പോകാൻ എളുപ്പമാണ്.

ClawMetry എന്ത് detect ചെയ്യുന്നു

ClawMetry പ്രഖ്യാപിത prompt injection ഒപ്പുകൾക്കായി രേഖപ്പെടുത്തിയ ടൂൾ ഫലങ്ങളും ഉപയോക്താവ് നൽകിയ ടെക്സ്റ്റും പരിശോധിക്കുന്നു. ഒരു പൊരുത്തമുള്ള ടൂൾ ഫലം ഒപ്പും ഉറവിട ടൂളും പേരിടുന്ന ഒരു മുന്നറിയിപ്പ് ഉയർത്തുന്നു. കണ്ടെത്തലിൽ പൊരുത്തിയ ടെക്സ്റ്റ് പകർത്തേണ്ടതില്ല.

Finding മാറ്റുന്ന വ്യത്യാസം

Trigger ആകുന്ന ഉദാഹരണം

പേജ് ഏജന്റിനോട് നടപടി ആവശ്യപ്പെടുന്നു

മുന്നറിയിപ്പ് കണ്ടെത്തൽ

നിശബ്ദ താരതമ്യം

സാധാരണ പേജ് ഉള്ളടക്കം

ഈ detector-ന് finding ഇല്ല.

പരിശോധിത ഉദാഹരണം ഒരു ഫെച്ച് ചെയ്ത പേജിൽ ഒരു വ്യാജ നിർദ്ദേശം സ്ഥാപിക്കുകയും ഒരു മുന്നറിയിപ്പ് ലഭിക്കുകയും ചെയ്യുന്നു. ഒരു സാധാരണ ഹോട്ടൽ വിവരണം നിശബ്ദമായി തുടരുന്നു. അതേ ടേണിൽ ഒരു ഉയർന്ന അപകടസാധ്യതാ ടൂൾ കോൾ ഗൗരവം വർദ്ധിപ്പിക്കും, ഇത് ഇവന്റുകളുടെ ക്രമം അവലോകനം ചെയ്യേണ്ടതാക്കുന്നു.

Detector result പരിശോധിക്കുക
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Inputs-ഉം complete results-ഉം download ചെയ്യുക (JSON)
ഉദാഹരണം എങ്ങനെ പരിശോധിച്ചു

ഈ ഉദാഹരണങ്ങൾ authored event data-യോ disposable configuration files-ഓ ഉപയോഗിച്ച് published detector evaluate ചെയ്യുന്നു. Videos ആ behaviors ചിത്രീകരിക്കുന്നു. ഇവ live agents-ന്റെയോ product interface-ന്റെയോ recordings അല്ല. ഉദാഹരണങ്ങളിലെ ഒരു command-ഉം execute ചെയ്തിട്ടില്ല.

Result ഈ inputs-നുള്ള behavior സ്ഥാപിക്കുന്നു. Runtime ingestion, prevention, അല്ലെങ്കിൽ real compromise സ്ഥാപിക്കുന്നില്ല. Pinned source contract പരിശോധിക്കുക.

അടുത്തതായി എന്ത് പരിശോധിക്കണം

ഉള്ളടക്കം നൽകിയ ഉറവിടവും അതിനുശേഷം ഉണ്ടായ നടപടികളും പരിശോധിക്കുക. യഥാർഥ ടാസ്ക് ദൃശ്യത്തിൽ സൂക്ഷിക്കുക. ഏജന്റ് ബാഹ്യ ടെക്സ്റ്റ് അധികാരമായി കണക്കാക്കിയോ, ഉദ്ധരിക്കുക മാത്രം ചെയ്തോ? യഥാർഥ രേഖപ്പെടുത്തിയ പ്രവർത്തനത്തോടൊപ്പം ആ അതിർത്തി അന്വേഷിക്കാൻ കണ്ടെത്തൽ ഉപയോഗിക്കുക.

  1. ഉള്ളടക്ക ഉറവിടം തിരിച്ചറിയുക
  2. തുടർ നടപടികൾ പരിശോധിക്കുക
  3. യഥാർഥ ടാസ്കുമായി താരതമ്യം ചെയ്യുക

ഈ signal എന്ത് സ്ഥാപിക്കുന്നു

ഇവ നിശ്ചിത ഒപ്പ് പരിശോധനകളാണ്. പദ പരിഭാഷകളും മറ്റ് പൊരുത്തമില്ലാത്ത രൂപങ്ങളും നഷ്ടമാകാം; ഒരു പൊരുത്തം ഏജന്റ് അനുസരിച്ചു എന്ന് തെളിയിക്കുന്നില്ല.

പ്രധാനപ്പെട്ട നിമിഷങ്ങൾ ദൃശ്യമായി നിലനിർത്തുക.

Agent activity follow ചെയ്യുക, findings പരിശോധിക്കുക, ശ്രദ്ധ ആവശ്യമുള്ളത് തീരുമാനിക്കുക.