ディテクターライブラリプロンプトインジェクション

プロンプトインジェクション

ページが命令になった。

エージェントが読むものの中に命令のようなコンテンツを検出する。

問題を見て、検出結果を理解する。

英語のナレーション、キャプション付き。

なぜ見落とされるのか

エージェントにページを要約するよう頼みました。ページはエージェントに最初に別のことをするよう指示します。これが信頼の境界です。外部のコンテンツがタスク内部の命令になろうとしています。

フェッチされたレビューページに権限を主張し、サマリーを完了する前にインストーラーを実行するよう求めるメッセージが含まれていると想像してください。有用なソース資料の真ん中に、命令は人間のレビュアーが見逃しやすいです。

ClawMetryが検出するもの

ClawMetryは記録されたツール結果とユーザーが提供したテキストで宣言されたプロンプトインジェクションのシグネチャを確認します。一致するツール結果はシグネチャとソースツールを名前付きの警告を発します。検出結果は一致したテキストをコピーする必要はありません。

検出結果を左右する違い

トリガーの例

ページがエージェントに行動を指示

警告の検出結果

静かな比較例

通常のページコンテンツ

このディテクターの検出結果はありません。

確認した例では、フェッチされたページに偽造された命令が置かれ、警告が生成されます。通常のホテルの説明は静かなままです。同じターンで後から危険なツール呼び出しが発生すると重大度が上がるため、イベントの順序は確認する価値があります。

ディテクターの結果を確認する
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
入力と完全な結果をダウンロードする(JSON)
例の確認方法

これらの例は、作成されたイベントデータまたは使い捨ての設定ファイルを使って公開済みディテクターを評価します。動画はこれらの動作を説明しています。ライブエージェントや製品インターフェイスの録画ではありません。例のコマンドは実行されていません。

この結果はこれらの入力に対する動作を示すものです。ランタイムへの取り込み、防止、または実際の侵害を証明するものではありません。 固定されたソースコントラクトを確認する.

次に確認すること

コンテンツを提供したソースとその後のアクションを確認してください。元のタスクを念頭に置いてください。エージェントは外部のテキストを権威として扱いましたか、それとも単に引用しましたか?検出結果を使って、実際の記録されたアクティビティとともにその境界を調査してください。

  1. コンテンツソースを特定する
  2. 後続のアクションを確認する
  3. 元のタスクと比較する

このシグナルが示すもの

これらは制限されたシグネチャチェックです。言い換えや他の一致しない形式は見逃される可能性があります。一致はエージェントが従ったことを証明しません。

重要な瞬間を見逃さない。

エージェントのアクティビティを追跡し、検出結果を確認して、注意が必要なものを判断してください。