Biblioteka detektorówPrompt injection

Prompt injection

Strona stała się instrukcją.

Wykryj treści podobne do instrukcji w tym, co czyta agent.

Zobacz problem. Zrozum znalezisko.

Narracja w języku angielskim z napisami.

Jak to umyka uwadze

Poprosiłeś agenta o podsumowanie strony. Strona nakazuje agentowi najpierw zrobić coś innego. To jest granica zaufania: zewnętrzna treść próbuje stać się instrukcją wewnątrz Twojego zadania.

Wyobraź sobie pobraną stronę z recenzją zawierającą wiadomość, która rości sobie autorytet i prosi agenta o uruchomienie instalatora przed zakończeniem podsumowania. Pośród przydatnych materiałów źródłowych instrukcja może być łatwa do przeoczenia przez ludzkiego recenzenta.

Co wykrywa ClawMetry

ClawMetry sprawdza zarejestrowane wyniki narzędzi i tekst pochodzący od użytkownika pod kątem zadeklarowanych sygnatur prompt injection. Pasujący wynik narzędzia generuje ostrzeżenie wskazujące sygnaturę i narzędzie źródłowe. Znalezisko nie musi kopiować dopasowanego tekstu.

Różnica zmieniająca wynik

Przykład wyzwalający

Strona nakazuje agentowi działać

Ostrzeżenie

Porównanie bez alarmu

Zwykła treść strony

Brak znaleziska dla tego detektora.

Sprawdzany przykład umieszcza sfałszowaną instrukcję na pobranej stronie i generuje ostrzeżenie. Zwykły opis hotelu pozostaje cichy. Późniejsze wywołanie narzędzia wysokiego ryzyka w tej samej turze może zwiększyć poziom ważności, co sprawia, że kolejność zdarzeń warto przejrzeć.

Sprawdź wynik detektora
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Pobierz dane wejściowe i pełne wyniki (JSON)
Jak sprawdzono przykład

Te przykłady oceniają opublikowany detektor z autorskimi danymi zdarzeń lub jednorazowymi plikami konfiguracyjnymi. Filmy ilustrują te zachowania. Nie są nagraniami działających agentów ani interfejsu produktu. Żadne polecenie z przykładów nie zostało wykonane.

Wynik określa zachowanie dla tych danych wejściowych. Nie ustala pozyskiwania danych w czasie rzeczywistym, zapobiegania ani rzeczywistego naruszenia. Sprawdź przypiętą umowę źródłową.

Co sprawdzić dalej

Sprawdź źródło, które dostarczyło treść, i akcje, które po nim nastąpiły. Miej na uwadze pierwotne zadanie. Czy agent potraktował zewnętrzny tekst jako autorytet, czy go tylko zacytował? Użyj znaleziska, aby zbadać tę granicę z rzeczywistą zarejestrowaną aktywnością.

  1. Zidentyfikuj źródło treści
  2. Sprawdź kolejne akcje
  3. Porównaj z pierwotnym zadaniem

Co ustala ten sygnał

To ograniczone sprawdzenia sygnatur. Parafrazy i inne niedopasowane formy mogą być pominięte; dopasowanie nie dowodzi, że agent był posłuszny.

Utrzymaj ważne momenty w zasięgu wzroku.

Śledź aktywność agenta, sprawdzaj znaleziska i decyduj, co wymaga Twojej uwagi.