Biblioteca de detectoresInyección de prompt

Inyección de prompt

Una página se convirtió en una instrucción.

Detecta contenido con forma de instrucción dentro de lo que lee un agente.

Ve el problema. Comprende el hallazgo.

Narración en inglés con subtítulos.

Cómo pasa desapercibido

Le pediste a un agente que resumiera una página. La página le dice al agente que haga otra cosa primero. Ese es el límite de confianza: contenido externo intenta convertirse en una instrucción dentro de tu tarea.

Imagina una página de reseñas con un mensaje que reclama autoridad y le pide al agente ejecutar un instalador antes de terminar el resumen. En medio de material útil, la instrucción puede ser fácil de pasar por alto para un revisor humano.

Qué detecta ClawMetry

ClawMetry verifica los resultados de herramientas registrados y el texto de origen del usuario en busca de firmas declaradas de inyección de prompt. Un resultado de herramienta coincidente genera una advertencia que nombra la firma y la herramienta de origen. El hallazgo no necesita reproducir el texto coincidente.

La diferencia que cambia el hallazgo

Ejemplo que activa el detector

La página le ordena al agente actuar

Hallazgo de advertencia

Comparación sin hallazgo

Contenido de página ordinario

Sin hallazgo para este detector.

El ejemplo verificado coloca una instrucción falsificada en una página obtenida y genera una advertencia. Una descripción normal de hotel permanece en silencio. Una llamada de herramienta de alto riesgo posterior en el mismo turno puede aumentar la severidad, lo que hace que el orden de los eventos valga la pena revisar.

Inspeccionar el resultado del detector
{
  "kind": "prompt_injection",
  "severity": "warning",
  "evidence": {
    "source": "tool_result",
    "tool": "WebFetch",
    "signatures": [
      "forged_authority",
      "task_handoff"
    ],
    "signature_labels": [
      "imitates a system or authority message",
      "asks the agent to do something else before the user's task"
    ],
    "tool_result_matches": 1,
    "user_message_matches": 0,
    "followed_by_tool": null,
    "followed_by_risk": null,
    "threshold": 1,
    "threshold_source": "static",
    "observed": "declared injection signatures in the text of tool results and user-sourced messages; matched text is not kept"
  }
}
Descargar entradas y resultados completos (JSON)
Cómo se verificó el ejemplo

Estos ejemplos evalúan el detector publicado con datos de eventos creados o archivos de configuración desechables. Los videos ilustran esos comportamientos. No son grabaciones de agentes en uso ni de la interfaz del producto. Ningún comando de los ejemplos fue ejecutado.

El resultado establece el comportamiento para estas entradas. No establece ingesta en tiempo real, prevención ni un compromiso real. Inspeccionar el contrato de código fuente fijado.

Qué revisar a continuación

Inspecciona la fuente que proporcionó el contenido y las acciones que siguieron. Mantén en mente la tarea original. ¿El agente trató el texto externo como autoridad o simplemente lo citó? Usa el hallazgo para investigar ese límite con la actividad registrada real.

  1. Identifica la fuente del contenido
  2. Inspecciona las acciones posteriores
  3. Compara con la tarea original

Qué establece esta señal

Estas son verificaciones de firmas delimitadas. Las paráfrasis y otras formas no coincidentes pueden pasarse por alto; una coincidencia no prueba que el agente obedeció.

Mantén los momentos importantes visibles.

Sigue la actividad del agente, inspecciona los hallazgos y decide qué requiere tu atención.