Thư viện detectorPrompt injection

Prompt injection

Một trang trở thành một lệnh.

Phát hiện nội dung có dạng lệnh trong những gì agent đọc.

Thấy vấn đề. Hiểu kết quả phát hiện.

Giọng kể tiếng Anh có phụ đề.

Tại sao dễ bị bỏ qua

Bạn yêu cầu tác nhân tóm tắt một trang. Trang đó lại yêu cầu tác nhân làm việc khác trước. Đây là ranh giới tin cậy: nội dung bên ngoài đang cố trở thành lệnh bên trong nhiệm vụ của bạn.

Hãy tưởng tượng một trang đánh giá được tải về chứa thông điệp tự nhận quyền hạn và yêu cầu tác nhân chạy trình cài đặt trước khi hoàn thành bản tóm tắt. Giữa nguồn tài liệu hữu ích, lệnh đó dễ bị người đánh giá bỏ qua.

ClawMetry phát hiện gì

ClawMetry kiểm tra kết quả công cụ đã ghi lại và văn bản do người dùng cung cấp để tìm chữ ký prompt injection đã khai báo. Kết quả công cụ khớp sẽ tạo ra cảnh báo ghi rõ chữ ký và công cụ nguồn. Phát hiện không cần lặp lại văn bản đã khớp.

Sự khác biệt thay đổi kết quả phát hiện

Ví dụ kích hoạt

Trang yêu cầu tác nhân hành động

Phát hiện cảnh báo

So sánh im lặng

Nội dung trang thông thường

Không có kết quả phát hiện cho detector này.

Ví dụ được kiểm tra đặt một lệnh giả mạo trong trang tải về và nhận được cảnh báo. Mô tả khách sạn thông thường thì không. Một lần gọi công cụ rủi ro cao hơn trong cùng lượt có thể tăng mức nghiêm trọng, khiến thứ tự sự kiện đáng xem xét thêm.

Kiểm tra kết quả detector
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Tải đầu vào và kết quả đầy đủ (JSON)
Cách ví dụ được kiểm tra

Các ví dụ này đánh giá detector đã xuất bản bằng dữ liệu sự kiện được soạn thảo hoặc tệp cấu hình dùng một lần. Video minh họa các hành vi đó. Đây không phải là bản ghi của agent thực hoặc giao diện sản phẩm. Không có lệnh nào trong ví dụ được thực thi.

Kết quả xác lập hành vi cho các đầu vào này. Nó không xác lập việc thu thập runtime, ngăn chặn hay một sự xâm phạm thực sự. Kiểm tra hợp đồng nguồn đã ghim.

Những gì cần kiểm tra tiếp theo

Kiểm tra nguồn cung cấp nội dung và các hành động tiếp theo. Giữ nguyên nhiệm vụ ban đầu trong tầm nhìn. Tác nhân có coi văn bản bên ngoài là quyền hạn hay chỉ trích dẫn nó? Dùng phát hiện này để điều tra ranh giới đó qua hoạt động thực tế đã ghi lại.

  1. Xác định nguồn nội dung
  2. Kiểm tra các hành động tiếp theo
  3. So sánh với tác vụ ban đầu

Tín hiệu này xác lập điều gì

Đây là các kiểm tra chữ ký có giới hạn. Các diễn đạt khác và dạng không khớp có thể bị bỏ sót; khớp không chứng minh tác nhân đã tuân theo.

Giữ những khoảnh khắc quan trọng luôn hiển thị.

Theo dõi hoạt động agent, kiểm tra kết quả phát hiện và quyết định điều gì cần sự chú ý của bạn.