Biblioteca de detectoresInjeção de prompt

Injeção de prompt

Uma página se tornou uma instrução.

Identifique conteúdo parecido com instrução dentro do que um agente lê.

Veja o problema. Entenda o achado.

Narração em inglês com legendas.

Como isso passa despercebido

Você pediu a um agente para resumir uma página. A página diz ao agente para fazer outra coisa primeiro. Esse é o limite de confiança: conteúdo externo está tentando se tornar uma instrução dentro da sua tarefa.

Imagine uma página de avaliação obtida contendo uma mensagem que reivindica autoridade e pede ao agente para executar um instalador antes de terminar o resumo. No meio de material-fonte útil, a instrução pode ser fácil de passar despercebida por um revisor humano.

O que o ClawMetry detecta

ClawMetry verifica resultados de ferramentas registrados e texto de origem do usuário em busca de assinaturas declaradas de injeção de prompt. Um resultado de ferramenta correspondente gera um aviso que identifica a assinatura e a ferramenta de origem. O alerta não precisa repetir o texto correspondido.

A diferença que muda o achado

Exemplo que aciona o detector

Página manda o agente agir

Alerta de aviso

Comparação silenciosa

Conteúdo de página comum

Nenhum achado para este detector.

O exemplo verificado coloca uma instrução forjada em uma página obtida e gera um aviso. Uma descrição comum de hotel permanece silenciosa. Uma chamada de ferramenta de alto risco posterior no mesmo turno pode aumentar a severidade, o que torna a ordem dos eventos relevante para revisão.

Inspecionar o resultado do detector
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Baixar entradas e resultados completos (JSON)
Como o exemplo foi verificado

Estes exemplos avaliam o detector publicado com dados de eventos criados ou arquivos de configuração descartáveis. Os vídeos ilustram esses comportamentos. Não são gravações de agentes reais ou da interface do produto. Nenhum comando nos exemplos foi executado.

O resultado estabelece o comportamento para essas entradas. Não estabelece ingestão em tempo real, prevenção ou um comprometimento real. Inspecionar o contrato de fonte fixado.

O que verificar a seguir

Inspecione a fonte que forneceu o conteúdo e as ações que se seguiram. Mantenha a tarefa original em vista. O agente tratou o texto externo como autoridade, ou simplesmente o citou? Use o alerta para investigar esse limite com a atividade registrada real.

  1. Identifique a fonte do conteúdo
  2. Inspecione as ações subsequentes
  3. Compare com a tarefa original

O que este sinal estabelece

Estas são verificações de assinatura delimitadas. Paráfrases e outras formas sem correspondência podem passar despercebidas; uma correspondência não prova que o agente obedeceu.

Mantenha os momentos importantes visíveis.

Acompanhe a atividade do agente, inspecione os achados e decida o que precisa da sua atenção.