Как это остаётся незамеченным
Вы попросили агента резюмировать страницу. Страница говорит агенту сначала сделать что-то другое. Вот граница доверия: внешний контент пытается стать инструкцией внутри вашей задачи.
Представьте загруженную страницу с отзывом, содержащую сообщение, претендующее на авторитет и просящее агента запустить установщик перед завершением резюме. Среди полезного исходного материала такую инструкцию легко не заметить.
Что обнаруживает ClawMetry
ClawMetry проверяет зафиксированные результаты инструментов и текст от пользователя на наличие известных сигнатур prompt injection. Совпадающий результат инструмента вызывает предупреждение с указанием сигнатуры и источника. Совпавший текст не нужно копировать в находку.
Различие, меняющее результат
Пример срабатывания
Страница даёт агенту команду
Предупреждение
Тихое сравнение
Обычный контент страницы
Для этого детектора нет находки.
В проверяемом примере поддельная инструкция на загруженной странице вызывает предупреждение. Обычное описание отеля остаётся без реакции. Последующий высокорисковый вызов инструмента в том же ходу может повысить серьёзность, поэтому порядок событий стоит изучить.
Изучить результат детектора
{
"kind": "prompt_injection",
"severity": "warning",
"evidence": {
"source": "tool_result",
"tool": "WebFetch",
"signatures": [
"forged_authority",
"task_handoff"
],
"signature_labels": [
"imitates a system or authority message",
"asks the agent to do something else before the user's task"
],
"tool_result_matches": 1,
"user_message_matches": 0,
"followed_by_tool": null,
"followed_by_risk": null,
"threshold": 1,
"threshold_source": "static",
"observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
}
}Скачать входные данные и полные результаты (JSON)Как проверялся пример
Эти примеры оценивают опубликованный детектор с авторскими данными событий или одноразовыми файлами конфигурации. Видео иллюстрируют это поведение. Они не являются записями живых агентов или интерфейса продукта. Ни одна команда в примерах не была выполнена.
Результат устанавливает поведение для этих входных данных. Он не устанавливает приём в реальном времени, предотвращение или реальную компрометацию. Изучить закреплённый исходный контракт.
Что проверить дальше
Изучите источник контента и последующие действия. Держите исходную задачу в поле зрения. Агент воспринял внешний текст как команду или просто процитировал его? Используйте находку для изучения этой границы с реальной зафиксированной активностью.
- Определите источник контента
- Изучите последующие действия
- Сравните с исходной задачей
Что устанавливает этот сигнал
Это ограниченные проверки сигнатур. Перефразировки и другие несовпадающие формы могут быть пропущены; совпадение не доказывает, что агент подчинился.