איך זה נעלם מהעין
ביקשת תיקון קטן. הסוכן מתחיל לגעת בקבצים בכל הפרויקט. שכתוב רחב יכול להיות נכון, אך הוא מצדיק רמת תשומת לב שונה משינוי של שורה אחת.
הסיכון קל לפספס כשפעולות הקבצים מופיעות אחת אחת. כל עריכה נראית קטנה בנפרד. יחד, הן עשויות להשפיע על חלק גדול בהרבה מהפרויקט ממה שהמשימה המקורית רמזה.
מה ClawMetry מזהה
ClawMetry בוחן ארגומנטים של כלים שנלכדו לצורך היקף שינויי קבצים ודפוסי פקודות הרסניים. עריכה רחבה עשויה להעלות אזהרת רדיוס פגיעה בקבצים. מחיקה רקורסיבית מזוהה שמכוונת למיקום שורש עשויה להעלות ממצא קריטי.
ההבדל שמשנה את הממצא
דוגמה מפעילה
30 כתיבות קבצים שונות
ממצא אזהרה
השוואה שקטה
4 כתיבות לקבצים נפרדים
אין ממצא לגלאי זה.
בהשוואה שנבדקה, כתיבות לשלושים קבצים נפרדים מעלות אזהרה. כתיבות לארבעה קבצים נשארות שקטות. סף העריכה הרחבה עשוי להשתנות עם סביבת הריצה והבסיס שלה. הממצא מספק לך ספירה וראיות מוגבלות להתמקדות הבדיקה.
בדוק את תוצאת הגלאי
{
"kind": "file_blast_radius",
"severity": "warning",
"evidence": {
"distinct_files": 30,
"write_calls": 30,
"threshold": 25,
"threshold_source": "static",
"baseline": null,
"outside_workspace": 0,
"destructive": [],
"samples": [
"example/f0.py",
"example/f1.py",
"example/f2.py"
],
"observed": "tool_arguments"
}
}הורד קלטים ותוצאות מלאות (JSON)איך הדוגמה נבדקה
דוגמאות אלה מעריכות את הגלאי שפורסם עם נתוני אירועים שנוצרו או קבצי תצורה חד פעמיים. הסרטונים ממחישים את ההתנהגויות הללו. אינם הקלטות של סוכנים חיים או ממשק המוצר. אף פקודה בדוגמאות לא בוצעה.
התוצאה מבססת התנהגות עבור קלטים אלה. אינה מבססת קליטת זמן ריצה, מניעה או פגיעה אמיתית. בדוק את חוזה המקור המצומד.
מה לבדוק בהמשך
השווה את ההיקף המושפע עם הבקשה. בדוק את ה-diff בפועל, במיוחד שינויים שנוצרו ומחיקות. ודא שהבדיקות מכסות את הקבצים המעורבים לפני אישור התוצאה. המטרה היא לתפוס שינוי רחב בלתי צפוי בעוד שיש לך הקשר.
- השווה היקף למשימה
- בדוק את ה-diff בפועל
- בדוק בדיקות ומחיקות
מה אות זה מבסס
זה קורא ארגומנטים של כלים, לא קריאות מערכת של מערכת הקבצים. זה מדווח לאחר הפעולה ולא מוכיח שכל שינוי שנקרא הצליח.