เหตุใดจึงมองข้ามได้ง่าย
การ build ล้มเหลว Agent ลองอีกครั้ง แล้วก็ล้มเหลวอีก การลองซ้ำแต่ละครั้งเพิ่ม output แต่ปัญหาพื้นฐานยังอยู่ หากคุณตรวจสอบแค่ว่าเซสชันยังทำงานอยู่ คุณอาจพลาดความล้มเหลวที่ยังคงซ้ำ
ลองนึกถึง agent ที่เตรียมการเปลี่ยนแปลงขณะที่เครื่องมือ shell ส่งคืนข้อผิดพลาดซ้ำๆ สาเหตุอาจเป็น dependency ที่หายไป คำสั่งที่ไม่ถูกต้อง หรือการเข้าถึงที่ไม่มี คำถามที่มีประโยชน์คือเครื่องมือใดที่ยังคงล้มเหลวและบ่อยแค่ไหน
สิ่งที่ ClawMetry ตรวจจับ
ClawMetry นับข้อผิดพลาดที่นำมาให้กับเครื่องมือเดียวกันในหน้าต่างเหตุการณ์ เมื่อจำนวนเกินเกณฑ์ที่กำหนด ระบบจะแจ้งเตือนเครื่องมือล้มเหลวซ้ำ ผลการตรวจสอบระบุชื่อเครื่องมือ จำนวนความล้มเหลว และเกณฑ์ที่ใช้
ความแตกต่างที่เปลี่ยนผลการตรวจสอบ
ตัวอย่างที่ทริกเกอร์
4 ข้อผิดพลาดจาก Bash
ผลการตรวจสอบระดับเตือน
การเปรียบเทียบที่เงียบ
1 ข้อผิดพลาดจาก Bash
ไม่มีผลการตรวจสอบสำหรับตัวตรวจจับนี้
ในตัวอย่างที่ตรวจสอบ ผลลัพธ์ shell ที่ล้มเหลวสี่ครั้งสร้างการเตือน ความล้มเหลวครั้งเดียวอยู่ต่ำกว่าเกณฑ์ ซึ่งแตกต่างจากลูปการเรียกที่เหมือนกัน คำสั่งอาจเปลี่ยนในขณะที่เครื่องมือเดิมยังคงส่งคืนข้อผิดพลาด
ตรวจสอบผลลัพธ์ของตัวตรวจจับ
{
"kind": "repeated_tool_failure",
"severity": "warning",
"evidence": {
"tool": "Bash",
"failures": 4,
"threshold": 3,
"threshold_source": "static"
}
}ดาวน์โหลดข้อมูลนำเข้าและผลลัพธ์ทั้งหมด (JSON)วิธีการตรวจสอบตัวอย่าง
ตัวอย่างเหล่านี้ประเมินตัวตรวจจับที่เผยแพร่ด้วยข้อมูลเหตุการณ์ที่สร้างขึ้นหรือไฟล์คอนฟิกที่ใช้แล้วทิ้ง วิดีโออธิบายพฤติกรรมเหล่านั้น ไม่ใช่การบันทึก agent จริงหรืออินเทอร์เฟซผลิตภัณฑ์ ไม่มีคำสั่งใดในตัวอย่างถูกเรียกใช้จริง
ผลลัพธ์พิสูจน์พฤติกรรมสำหรับข้อมูลนำเข้าเหล่านี้เท่านั้น ไม่ได้พิสูจน์การรับข้อมูล runtime การป้องกัน หรือการโจมตีจริง ตรวจสอบสัญญาต้นฉบับที่ปักหมุดไว้.
สิ่งที่ควรตรวจสอบต่อไป
เปิดผลลัพธ์ที่ล้มเหลวและค้นหาสาเหตุร่วม แก้ไขปัญหา environment หรือการเข้าถึง หรือจำกัดงาน agent ก่อนให้การลองซ้ำสะสม จากนั้นตรวจสอบว่าผลลัพธ์เครื่องมือถัดไปสำเร็จจริง
- อ่านผลลัพธ์ข้อผิดพลาด
- แก้ไขสาเหตุร่วม
- ตรวจสอบผลลัพธ์ถัดไป
สิ่งที่สัญญาณนี้พิสูจน์
นี่คือสัญญาณความน่าเชื่อถือ ไม่ได้วินิจฉัยสาเหตุที่แท้จริงหรือพิสูจน์ว่า agent ถูกโจมตี