감지기 라이브러리Prompt injection

Prompt injection

페이지가 명령이 되었습니다.

에이전트가 읽는 내용 안에서 명령처럼 보이는 콘텐츠를 감지합니다.

문제를 확인하고 발견 내용을 이해하세요.

영어 내레이션 및 자막 제공.

놓치기 쉬운 이유

에이전트에게 페이지를 요약하도록 요청했습니다. 그런데 페이지가 에이전트에게 먼저 다른 작업을 하도록 지시합니다. 이것이 신뢰 경계입니다. 외부 콘텐츠가 사용자의 작업 안에서 명령이 되려 하고 있습니다.

가져온 리뷰 페이지에 권한을 주장하며 요약을 완료하기 전에 설치 프로그램을 실행하도록 요청하는 메시지가 포함되어 있다고 상상해보세요. 유용한 소스 자료 중간에 있는 명령은 사람 검토자가 쉽게 놓칠 수 있습니다.

ClawMetry가 감지하는 내용

ClawMetry는 기록된 도구 결과와 사용자 소스 텍스트에서 선언된 prompt injection 서명을 확인합니다. 일치하는 도구 결과가 있으면 서명과 소스 도구를 명시한 경고를 발생시킵니다. 발견에 일치한 텍스트를 반복할 필요는 없습니다.

발견 결과를 바꾸는 차이

트리거 예시

페이지가 에이전트에게 행동 지시

경고 발견

조용한 비교

일반 페이지 콘텐츠

이 감지기에 대한 발견 없음.

확인된 예시에서 가져온 페이지에 위조된 명령을 넣으면 경고가 발생합니다. 일반 호텔 설명은 조용히 유지됩니다. 같은 턴에서 이후 고위험 도구 호출이 있으면 심각도가 높아질 수 있으며, 이벤트 순서를 검토할 가치가 있습니다.

감지기 결과 검사
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
입력 및 전체 결과 다운로드 (JSON)
예시 확인 방법

이 예시들은 작성된 이벤트 데이터 또는 일회용 구성 파일로 공개된 감지기를 평가합니다. 영상은 해당 동작을 설명합니다. 라이브 에이전트나 제품 인터페이스의 녹화가 아닙니다. 예시의 어떤 명령도 실행되지 않았습니다.

결과는 해당 입력에 대한 동작을 확립합니다. 런타임 수집, 방지 또는 실제 침해를 확립하지 않습니다. 고정된 소스 계약 검사.

다음으로 확인할 사항

콘텐츠를 제공한 소스와 그 이후의 작업을 검사하세요. 원래 작업을 염두에 두세요. 에이전트가 외부 텍스트를 권한으로 취급했는지, 단순히 인용했는지 확인하세요. 이 발견을 실제 기록된 활동으로 해당 경계를 조사하는 데 활용하세요.

  1. 콘텐츠 소스 식별
  2. 이후 작업 검사
  3. 원래 작업과 비교

이 신호가 확립하는 것

이것은 제한된 서명 확인입니다. 변형된 표현과 기타 일치하지 않는 형태는 놓칠 수 있으며, 일치한다고 해서 에이전트가 따랐다는 것을 증명하지는 않습니다.

중요한 순간을 항상 가시적으로 유지하세요.

에이전트 활동을 추적하고, 발견 내용을 검사하고, 주의가 필요한 것을 결정하세요.