เหตุใดจึงมองข้ามได้ง่าย
คุณขอให้ agent สรุปเนื้อหาหน้าเพจ แต่หน้าเพจนั้นสั่งให้ agent ทำสิ่งอื่นก่อน นี่คือขอบเขตความไว้วางใจ เนื้อหาจากภายนอกกำลังพยายามแปลงตัวเองเป็นคำสั่งในงานของคุณ
ลองนึกภาพหน้าเพจรีวิวที่ดึงมาและมีข้อความอ้างสิทธิ์อำนาจ พร้อมขอให้ agent รันตัวติดตั้งก่อนจบการสรุป ท่ามกลางเนื้อหาต้นฉบับที่มีประโยชน์ คำสั่งดังกล่าวอาจถูกมองข้ามได้ง่ายโดยผู้ตรวจสอบ
สิ่งที่ ClawMetry ตรวจจับ
ClawMetry ตรวจสอบผลลัพธ์ของเครื่องมือที่บันทึกไว้และข้อความจากผู้ใช้เพื่อหาสัญญาณ prompt injection ที่ประกาศไว้ หากพบผลลัพธ์ที่ตรงกัน จะแสดงคำเตือนพร้อมระบุสัญญาณและเครื่องมือต้นทาง ผลการค้นพบไม่จำเป็นต้องแสดงข้อความที่ตรงกันซ้ำ
ความแตกต่างที่เปลี่ยนผลการตรวจสอบ
ตัวอย่างที่ทริกเกอร์
หน้าเพจสั่งให้ agent ทำงาน
ผลการค้นพบระดับคำเตือน
การเปรียบเทียบที่เงียบ
เนื้อหาหน้าเพจทั่วไป
ไม่มีผลการตรวจสอบสำหรับตัวตรวจจับนี้
ตัวอย่างที่ตรวจสอบนำคำสั่งปลอมใส่ในหน้าเพจที่ดึงมาและได้รับคำเตือน คำอธิบายโรงแรมทั่วไปไม่ก่อให้เกิดการแจ้งเตือน การเรียกใช้เครื่องมือที่มีความเสี่ยงสูงในภายหลังในรอบเดียวกันอาจเพิ่มระดับความรุนแรง ทำให้ลำดับเหตุการณ์ควรได้รับการตรวจสอบ
ตรวจสอบผลลัพธ์ของตัวตรวจจับ
{
"kind": "prompt_injection",
"severity": "warning",
"evidence": {
"source": "tool_result",
"tool": "WebFetch",
"signatures": [
"forged_authority",
"task_handoff"
],
"signature_labels": [
"imitates a system or authority message",
"asks the agent to do something else before the user's task"
],
"tool_result_matches": 1,
"user_message_matches": 0,
"followed_by_tool": null,
"followed_by_risk": null,
"threshold": 1,
"threshold_source": "static",
"observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
}
}ดาวน์โหลดข้อมูลนำเข้าและผลลัพธ์ทั้งหมด (JSON)วิธีการตรวจสอบตัวอย่าง
ตัวอย่างเหล่านี้ประเมินตัวตรวจจับที่เผยแพร่ด้วยข้อมูลเหตุการณ์ที่สร้างขึ้นหรือไฟล์คอนฟิกที่ใช้แล้วทิ้ง วิดีโออธิบายพฤติกรรมเหล่านั้น ไม่ใช่การบันทึก agent จริงหรืออินเทอร์เฟซผลิตภัณฑ์ ไม่มีคำสั่งใดในตัวอย่างถูกเรียกใช้จริง
ผลลัพธ์พิสูจน์พฤติกรรมสำหรับข้อมูลนำเข้าเหล่านี้เท่านั้น ไม่ได้พิสูจน์การรับข้อมูล runtime การป้องกัน หรือการโจมตีจริง ตรวจสอบสัญญาต้นฉบับที่ปักหมุดไว้.
สิ่งที่ควรตรวจสอบต่อไป
ตรวจสอบแหล่งที่มาของเนื้อหาและการกระทำที่เกิดขึ้นตามมา อย่าลืมงานเดิมไว้ agent ถือว่าข้อความจากภายนอกมีอำนาจสั่งการ หรือเพียงแค่อ้างอิงมันเท่านั้น ใช้ผลการค้นพบนี้เพื่อตรวจสอบขอบเขตดังกล่าวร่วมกับกิจกรรมที่บันทึกไว้จริง
- ระบุแหล่งที่มาของเนื้อหา
- ตรวจสอบการกระทำที่ตามมา
- เปรียบเทียบกับงานต้นฉบับ
สิ่งที่สัญญาณนี้พิสูจน์
นี่คือการตรวจสอบสัญญาณแบบจำกัด การถอดความและรูปแบบที่ไม่ตรงกันอาจถูกมองข้าม การตรงกันไม่ได้พิสูจน์ว่า agent ปฏิบัติตาม