Biblioteca de detectoresInjeção de prompt

Injeção de prompt

Uma página tornou-se uma instrução.

Detete conteúdo semelhante a instruções dentro do que um agente lê.

Veja o problema. Entenda o resultado.

Narração em inglês com legendas.

Como passa despercebido

Você pediu a um agente para resumir uma página. A página diz ao agente para fazer outra coisa primeiro. Essa é a fronteira de confiança: conteúdo externo está a tentar tornar-se uma instrução dentro da sua tarefa.

Imagine uma página de avaliação obtida que contém uma mensagem a reivindicar autoridade e a pedir ao agente que execute um instalador antes de terminar o resumo. No meio de material-fonte útil, a instrução pode ser fácil de ignorar por um revisor humano.

O que o ClawMetry deteta

O ClawMetry verifica resultados de ferramentas registados e texto de origem do utilizador em busca de assinaturas declaradas de injeção de prompt. Um resultado de ferramenta correspondente gera um aviso que identifica a assinatura e a ferramenta de origem. O achado não precisa de repetir o texto correspondido.

A diferença que muda o resultado

Exemplo de acionamento

Página instrui o agente a agir

Achado de aviso

Comparação silenciosa

Conteúdo de página comum

Sem resultado para este detetor.

O exemplo verificado coloca uma instrução forjada numa página obtida e gera um aviso. Uma descrição de hotel comum permanece silenciosa. Uma chamada de ferramenta de alto risco posterior no mesmo turno pode aumentar a gravidade, o que torna a ordem dos eventos relevante para revisão.

Inspecionar o resultado do detetor
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Descarregar entradas e resultados completos (JSON)
Como o exemplo foi verificado

Estes exemplos avaliam o detetor publicado com dados de eventos criados ou ficheiros de configuração descartáveis. Os vídeos ilustram esses comportamentos. Não são gravações de agentes reais ou da interface do produto. Nenhum comando nos exemplos foi executado.

O resultado estabelece o comportamento para estas entradas. Não estabelece ingestão em runtime, prevenção ou um compromisso real. Inspecionar o contrato de fonte fixado.

O que verificar a seguir

Inspecione a fonte que forneceu o conteúdo e as ações que se seguiram. Mantenha a tarefa original em vista. O agente tratou o texto externo como autoridade, ou simplesmente o citou? Use o achado para investigar essa fronteira com a atividade registada real.

  1. Identifique a fonte do conteúdo
  2. Inspecione as ações subsequentes
  3. Compare com a tarefa original

O que este sinal estabelece

São verificações de assinatura delimitadas. Paráfrases e outras formas sem correspondência podem ser ignoradas; uma correspondência não prova que o agente obedeceu.

Mantenha os momentos importantes visíveis.

Acompanhe a atividade do agente, inspecione os resultados e decida o que precisa da sua atenção.