Prompt injection

หน้าเว็บกลายเป็นคำสั่ง

ตรวจจับเนื้อหาที่มีลักษณะเหมือนคำสั่งภายในสิ่งที่ agent อ่าน

เห็นปัญหา เข้าใจผลการตรวจสอบ

บรรยายภาษาอังกฤษพร้อมคำบรรยาย

เหตุใดจึงมองข้ามได้ง่าย

คุณขอให้ agent สรุปเนื้อหาหน้าเพจ แต่หน้าเพจนั้นสั่งให้ agent ทำสิ่งอื่นก่อน นี่คือขอบเขตความไว้วางใจ เนื้อหาจากภายนอกกำลังพยายามแปลงตัวเองเป็นคำสั่งในงานของคุณ

ลองนึกภาพหน้าเพจรีวิวที่ดึงมาและมีข้อความอ้างสิทธิ์อำนาจ พร้อมขอให้ agent รันตัวติดตั้งก่อนจบการสรุป ท่ามกลางเนื้อหาต้นฉบับที่มีประโยชน์ คำสั่งดังกล่าวอาจถูกมองข้ามได้ง่ายโดยผู้ตรวจสอบ

สิ่งที่ ClawMetry ตรวจจับ

ClawMetry ตรวจสอบผลลัพธ์ของเครื่องมือที่บันทึกไว้และข้อความจากผู้ใช้เพื่อหาสัญญาณ prompt injection ที่ประกาศไว้ หากพบผลลัพธ์ที่ตรงกัน จะแสดงคำเตือนพร้อมระบุสัญญาณและเครื่องมือต้นทาง ผลการค้นพบไม่จำเป็นต้องแสดงข้อความที่ตรงกันซ้ำ

ความแตกต่างที่เปลี่ยนผลการตรวจสอบ

ตัวอย่างที่ทริกเกอร์

หน้าเพจสั่งให้ agent ทำงาน

ผลการค้นพบระดับคำเตือน

การเปรียบเทียบที่เงียบ

เนื้อหาหน้าเพจทั่วไป

ไม่มีผลการตรวจสอบสำหรับตัวตรวจจับนี้

ตัวอย่างที่ตรวจสอบนำคำสั่งปลอมใส่ในหน้าเพจที่ดึงมาและได้รับคำเตือน คำอธิบายโรงแรมทั่วไปไม่ก่อให้เกิดการแจ้งเตือน การเรียกใช้เครื่องมือที่มีความเสี่ยงสูงในภายหลังในรอบเดียวกันอาจเพิ่มระดับความรุนแรง ทำให้ลำดับเหตุการณ์ควรได้รับการตรวจสอบ

ตรวจสอบผลลัพธ์ของตัวตรวจจับ
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
ดาวน์โหลดข้อมูลนำเข้าและผลลัพธ์ทั้งหมด (JSON)
วิธีการตรวจสอบตัวอย่าง

ตัวอย่างเหล่านี้ประเมินตัวตรวจจับที่เผยแพร่ด้วยข้อมูลเหตุการณ์ที่สร้างขึ้นหรือไฟล์คอนฟิกที่ใช้แล้วทิ้ง วิดีโออธิบายพฤติกรรมเหล่านั้น ไม่ใช่การบันทึก agent จริงหรืออินเทอร์เฟซผลิตภัณฑ์ ไม่มีคำสั่งใดในตัวอย่างถูกเรียกใช้จริง

ผลลัพธ์พิสูจน์พฤติกรรมสำหรับข้อมูลนำเข้าเหล่านี้เท่านั้น ไม่ได้พิสูจน์การรับข้อมูล runtime การป้องกัน หรือการโจมตีจริง ตรวจสอบสัญญาต้นฉบับที่ปักหมุดไว้.

สิ่งที่ควรตรวจสอบต่อไป

ตรวจสอบแหล่งที่มาของเนื้อหาและการกระทำที่เกิดขึ้นตามมา อย่าลืมงานเดิมไว้ agent ถือว่าข้อความจากภายนอกมีอำนาจสั่งการ หรือเพียงแค่อ้างอิงมันเท่านั้น ใช้ผลการค้นพบนี้เพื่อตรวจสอบขอบเขตดังกล่าวร่วมกับกิจกรรมที่บันทึกไว้จริง

  1. ระบุแหล่งที่มาของเนื้อหา
  2. ตรวจสอบการกระทำที่ตามมา
  3. เปรียบเทียบกับงานต้นฉบับ

สิ่งที่สัญญาณนี้พิสูจน์

นี่คือการตรวจสอบสัญญาณแบบจำกัด การถอดความและรูปแบบที่ไม่ตรงกันอาจถูกมองข้าม การตรงกันไม่ได้พิสูจน์ว่า agent ปฏิบัติตาม

ให้ช่วงเวลาสำคัญมองเห็นได้เสมอ

ติดตามกิจกรรม agent ตรวจสอบผลการค้นพบ และตัดสินใจว่าสิ่งใดต้องการความสนใจ