偵測器資料庫提示注入

提示注入

一個頁面變成了指令。

偵測代理程式讀取內容中類似指令的文字。

看見問題,理解發現。

英語旁白附字幕。

為何容易被忽略

您要求代理程式摘要一個頁面,但頁面卻指示代理程式先做別的事。這就是信任邊界所在:外部內容試圖在您的任務中變成指令。

想像一個擷取的評論頁面包含一段聲稱具有權威性的訊息,要求代理程式在完成摘要前先執行安裝程式。在大量有用的來源資料中,這樣的指令很容易被人工審閱者忽略。

ClawMetry 偵測的內容

ClawMetry 檢查已記錄的工具結果和使用者提供的文字,比對已宣告的提示注入特徵。符合的工具結果會產生警告,並說明特徵名稱與來源工具,無需將符合的文字複製到發現結果中。

改變發現結果的關鍵差異

觸發範例

頁面指示代理程式採取行動

警告發現

靜默對比

一般頁面內容

此偵測器無發現。

受檢範例在擷取的頁面中放置偽造指令,產生警告。一般飯店描述則保持靜默。同一輪中後續的高風險工具呼叫可能提高嚴重性,因此事件順序值得審閱。

檢查偵測器結果
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
下載輸入及完整結果 (JSON)
範例的檢查方式

這些範例使用已撰寫的事件資料或一次性設定檔來評估已發布的偵測器。影片說明這些行為,並非即時代理或產品介面的錄製內容。範例中沒有任何指令被實際執行。

結果確立了這些輸入的行為,並不確立執行時期擷取、預防或實際入侵。 檢查已固定的原始碼合約.

接下來要檢查什麼

檢查提供內容的來源及其後的動作,同時對照原始任務。代理程式是將外部文字視為權威,還是單純引用?以發現結果為依據,結合實際記錄的活動來調查該邊界。

  1. 識別內容來源
  2. 檢查後續動作
  3. 與原始任務比對

此訊號確立的範圍

這些是有限的特徵檢查,改述或其他未符合形式可能被遺漏;符合特徵不代表代理程式已遵從指令。

讓重要時刻保持可見。

追蹤代理活動、檢查發現結果,決定哪些需要您的關注。