Prompt injection

Страница стала инструкцией.

Обнаружьте содержимое, похожее на инструкцию, в материалах, которые читает агент.

Увидеть проблему. Понять находку.

Повествование на английском с субтитрами.

Как это остаётся незамеченным

Вы попросили агента резюмировать страницу. Страница говорит агенту сначала сделать что-то другое. Вот граница доверия: внешний контент пытается стать инструкцией внутри вашей задачи.

Представьте загруженную страницу с отзывом, содержащую сообщение, претендующее на авторитет и просящее агента запустить установщик перед завершением резюме. Среди полезного исходного материала такую инструкцию легко не заметить.

Что обнаруживает ClawMetry

ClawMetry проверяет зафиксированные результаты инструментов и текст от пользователя на наличие известных сигнатур prompt injection. Совпадающий результат инструмента вызывает предупреждение с указанием сигнатуры и источника. Совпавший текст не нужно копировать в находку.

Различие, меняющее результат

Пример срабатывания

Страница даёт агенту команду

Предупреждение

Тихое сравнение

Обычный контент страницы

Для этого детектора нет находки.

В проверяемом примере поддельная инструкция на загруженной странице вызывает предупреждение. Обычное описание отеля остаётся без реакции. Последующий высокорисковый вызов инструмента в том же ходу может повысить серьёзность, поэтому порядок событий стоит изучить.

Изучить результат детектора
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Скачать входные данные и полные результаты (JSON)
Как проверялся пример

Эти примеры оценивают опубликованный детектор с авторскими данными событий или одноразовыми файлами конфигурации. Видео иллюстрируют это поведение. Они не являются записями живых агентов или интерфейса продукта. Ни одна команда в примерах не была выполнена.

Результат устанавливает поведение для этих входных данных. Он не устанавливает приём в реальном времени, предотвращение или реальную компрометацию. Изучить закреплённый исходный контракт.

Что проверить дальше

Изучите источник контента и последующие действия. Держите исходную задачу в поле зрения. Агент воспринял внешний текст как команду или просто процитировал его? Используйте находку для изучения этой границы с реальной зафиксированной активностью.

  1. Определите источник контента
  2. Изучите последующие действия
  3. Сравните с исходной задачей

Что устанавливает этот сигнал

Это ограниченные проверки сигнатур. Перефразировки и другие несовпадающие формы могут быть пропущены; совпадение не доказывает, что агент подчинился.

Держите важные моменты на виду.

Следите за активностью агента, изучайте находки и решайте, что требует вашего внимания.