คลังตัวตรวจจับเครื่องมือล้มเหลวซ้ำ

เครื่องมือล้มเหลวซ้ำ

เครื่องมือเดิม ล้มเหลวอีกครั้ง

ค้นหาขั้นตอนที่ล้มเหลวซึ่งการลองซ้ำฝังเอาไว้

เห็นปัญหา เข้าใจผลการตรวจสอบ

บรรยายภาษาอังกฤษพร้อมคำบรรยาย

เหตุใดจึงมองข้ามได้ง่าย

การ build ล้มเหลว Agent ลองอีกครั้ง แล้วก็ล้มเหลวอีก การลองซ้ำแต่ละครั้งเพิ่ม output แต่ปัญหาพื้นฐานยังอยู่ หากคุณตรวจสอบแค่ว่าเซสชันยังทำงานอยู่ คุณอาจพลาดความล้มเหลวที่ยังคงซ้ำ

ลองนึกถึง agent ที่เตรียมการเปลี่ยนแปลงขณะที่เครื่องมือ shell ส่งคืนข้อผิดพลาดซ้ำๆ สาเหตุอาจเป็น dependency ที่หายไป คำสั่งที่ไม่ถูกต้อง หรือการเข้าถึงที่ไม่มี คำถามที่มีประโยชน์คือเครื่องมือใดที่ยังคงล้มเหลวและบ่อยแค่ไหน

สิ่งที่ ClawMetry ตรวจจับ

ClawMetry นับข้อผิดพลาดที่นำมาให้กับเครื่องมือเดียวกันในหน้าต่างเหตุการณ์ เมื่อจำนวนเกินเกณฑ์ที่กำหนด ระบบจะแจ้งเตือนเครื่องมือล้มเหลวซ้ำ ผลการตรวจสอบระบุชื่อเครื่องมือ จำนวนความล้มเหลว และเกณฑ์ที่ใช้

ความแตกต่างที่เปลี่ยนผลการตรวจสอบ

ตัวอย่างที่ทริกเกอร์

4 ข้อผิดพลาดจาก Bash

ผลการตรวจสอบระดับเตือน

การเปรียบเทียบที่เงียบ

1 ข้อผิดพลาดจาก Bash

ไม่มีผลการตรวจสอบสำหรับตัวตรวจจับนี้

ในตัวอย่างที่ตรวจสอบ ผลลัพธ์ shell ที่ล้มเหลวสี่ครั้งสร้างการเตือน ความล้มเหลวครั้งเดียวอยู่ต่ำกว่าเกณฑ์ ซึ่งแตกต่างจากลูปการเรียกที่เหมือนกัน คำสั่งอาจเปลี่ยนในขณะที่เครื่องมือเดิมยังคงส่งคืนข้อผิดพลาด

ตรวจสอบผลลัพธ์ของตัวตรวจจับ
{
  "kind": "repeated_tool_failure",
  "severity": "warning",
  "evidence": {
    "tool": "Bash",
    "failures": 4,
    "threshold": 3,
    "threshold_source": "static"
  }
}
ดาวน์โหลดข้อมูลนำเข้าและผลลัพธ์ทั้งหมด (JSON)
วิธีการตรวจสอบตัวอย่าง

ตัวอย่างเหล่านี้ประเมินตัวตรวจจับที่เผยแพร่ด้วยข้อมูลเหตุการณ์ที่สร้างขึ้นหรือไฟล์คอนฟิกที่ใช้แล้วทิ้ง วิดีโออธิบายพฤติกรรมเหล่านั้น ไม่ใช่การบันทึก agent จริงหรืออินเทอร์เฟซผลิตภัณฑ์ ไม่มีคำสั่งใดในตัวอย่างถูกเรียกใช้จริง

ผลลัพธ์พิสูจน์พฤติกรรมสำหรับข้อมูลนำเข้าเหล่านี้เท่านั้น ไม่ได้พิสูจน์การรับข้อมูล runtime การป้องกัน หรือการโจมตีจริง ตรวจสอบสัญญาต้นฉบับที่ปักหมุดไว้.

สิ่งที่ควรตรวจสอบต่อไป

เปิดผลลัพธ์ที่ล้มเหลวและค้นหาสาเหตุร่วม แก้ไขปัญหา environment หรือการเข้าถึง หรือจำกัดงาน agent ก่อนให้การลองซ้ำสะสม จากนั้นตรวจสอบว่าผลลัพธ์เครื่องมือถัดไปสำเร็จจริง

  1. อ่านผลลัพธ์ข้อผิดพลาด
  2. แก้ไขสาเหตุร่วม
  3. ตรวจสอบผลลัพธ์ถัดไป

สิ่งที่สัญญาณนี้พิสูจน์

นี่คือสัญญาณความน่าเชื่อถือ ไม่ได้วินิจฉัยสาเหตุที่แท้จริงหรือพิสูจน์ว่า agent ถูกโจมตี

ให้ช่วงเวลาสำคัญมองเห็นได้เสมอ

ติดตามกิจกรรม agent ตรวจสอบผลการค้นพบ และตัดสินใจว่าสิ่งใดต้องการความสนใจ