Biblioteca de detectoresInyección de prompt

Inyección de prompt

Una página se convirtió en una instrucción.

Detecta contenido similar a instrucciones dentro de lo que lee un agente.

Ve el problema. Entiende el hallazgo.

Narración en inglés con subtítulos.

Cómo pasa desapercibido

Le pediste a un agente que resumiera una página. La página le indica al agente que haga otra cosa primero. Ese es el límite de confianza: el contenido externo intenta convertirse en una instrucción dentro de tu tarea.

Imagina una página de reseña obtenida que contiene un mensaje que reclama autoridad y pide al agente ejecutar un instalador antes de terminar el resumen. En medio de material útil, la instrucción puede ser fácil de pasar por alto para un revisor humano.

Qué detecta ClawMetry

ClawMetry verifica los resultados de herramientas registrados y el texto originado por el usuario en busca de firmas declaradas de inyección de prompt. Un resultado de herramienta coincidente genera una advertencia que nombra la firma y la herramienta fuente. El hallazgo no necesita reproducir el texto coincidente.

La diferencia que cambia el hallazgo

Ejemplo que activa el detector

La página indica al agente que actúe

Hallazgo de advertencia

Comparación sin hallazgo

Contenido ordinario de página

Sin hallazgo para este detector.

El ejemplo verificado coloca una instrucción falsa en una página obtenida y genera una advertencia. Una descripción de hotel ordinaria permanece en silencio. Una llamada de herramienta de alto riesgo posterior en el mismo turno puede aumentar la severidad, lo que hace que valga la pena revisar el orden de los eventos.

Inspeccionar el resultado del detector
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Descargar entradas y resultados completos (JSON)
Cómo se verificó el ejemplo

Estos ejemplos evalúan el detector publicado con datos de eventos elaborados o archivos de configuración desechables. Los videos ilustran esos comportamientos. No son grabaciones de agentes en vivo ni de la interfaz del producto. Ningún comando de los ejemplos fue ejecutado.

El resultado establece el comportamiento para estas entradas. No establece la ingesta en tiempo de ejecución, la prevención ni un compromiso real. Inspeccionar el contrato de fuente fijado.

Qué revisar a continuación

Inspecciona la fuente que proporcionó el contenido y las acciones que siguieron. Mantén en mente la tarea original. ¿El agente trató el texto externo como autoridad o simplemente lo citó? Usa el hallazgo para investigar ese límite con la actividad registrada real.

  1. Identifica la fuente del contenido
  2. Inspecciona las acciones posteriores
  3. Compara con la tarea original

Qué establece esta señal

Estas son verificaciones de firmas acotadas. Las paráfrasis y otras formas no coincidentes pueden omitirse; una coincidencia no prueba que el agente obedeció.

Mantén visibles los momentos importantes.

Sigue la actividad del agente, inspecciona hallazgos y decide qué necesita tu atención.