Todas las lecciones Read in English

Seguridad a fondo · Unidad 27 · Lección 1 de 11

Inyección de instrucciones y límites de autoridad

Comprende por qué un documento no es una instrucción del usuario y dónde debe imponer esa distinción una aplicación de IA.

9 minlista

MITRE ATLAS

Para prepararteOfensiva de IA

Después de esta lección puedes

  • Distinguir solicitudes directas de instrucciones incluidas en contenido recuperado.
  • Explicar por qué la orientación al modelo ayuda, pero no sustituye la autorización de la aplicación.
  • Identificar impacto y control sin confundir todos los errores de IA con ejecución de código.

Supón que pides a un asistente un resumen de un documento. El documento puede contener hechos, opiniones, citas y afirmaciones sobre lo que alguien debería hacer. Son material que interpretar; no son nuevas instrucciones tuyas.

La inyección de instrucciones ocurre cuando contenido no fiable cambia el comportamiento de la IA al tratarse como instrucciones contrarias a la tarea o política prevista. La pregunta no es si el texto resulta convincente, sino si pasó de “material para analizar” a “autoridad para decidir”.

Inyección de instrucciones y límites de autoridadEl modelo recibe una tarea y material de referencia. La aplicación debe controlar por separado qué datos y acciones puede alcanzar esa interpretación.Tarea del usuarioContenido externoInterpretación del modeloControles de la aplicación
El modelo recibe una tarea y material de referencia. La aplicación debe controlar por separado qué datos y acciones puede alcanzar esa interpretación.

Entrada directa y contenido indirecto

Un intento directo llega por una entrada controlada por la persona, como una solicitud de chat. Uno indirecto llega mediante material que lee la aplicación: documentos, resultados de búsqueda, mensajes, imágenes o respuestas de herramientas. El usuario legítimo puede haber pedido simplemente un resumen.

La recuperación de información selecciona contexto útil. Un resultado bien situado no se convierte en una instrucción del usuario. Que un documento afirme que una acción está aprobada tampoco demuestra aprobación. Conserva la diferencia entre quien proporcionó la tarea y quien aportó la referencia.

Orientar ayuda, pero la autoridad se debe comprobar

Los roles de mensajes, la separación clara del material y el entrenamiento pueden mejorar el seguimiento de instrucciones. Su eficacia depende del modelo y la aplicación. Hay que evaluarlos, sin descartarlos como inútiles ni presentarlos como garantías.

La aplicación sigue necesitando una decisión independiente de autorización. Un registro solicitado debe pertenecer al alcance permitido. Una acción propuesta debe utilizar la identidad, recurso, destino y límites correctos. La explicación del modelo sobre por qué desea actuar no constituye permiso.

Entiende la consecuencia real

Un sistema sin herramientas de acción también puede dar consejos engañosos o divulgar contexto sensible que recibió. Con herramientas amplias puede provocar además efectos no deseados. Ninguno de esos resultados implica automáticamente ejecución arbitraria de código del sistema.

Una propuesta que cumple un esquema solo es estructuralmente válida. Aún puede solicitar un recurso o destino no autorizado. La interfaz de aprobación debe mostrar la acción real y los datos afectados, no solo un resumen tranquilizador escrito por el modelo.

A veces se llama “jailbreak” a los intentos de incumplir restricciones de comportamiento. Los términos se solapan. En una revisión, describe el límite concreto, el comportamiento observado y la consecuencia en vez de depender de una etiqueta.

Explora tres diseños

EXPLORA EL CONCEPTO

¿Contenido, autoridad o acción?

Sigue el mismo documento ficticio por tres diseños de aplicación.

Solo resúmenes

El documento puede alterar la respuesta si el modelo interpreta sus afirmaciones como instrucciones. Sin herramientas también importan los consejos engañosos o la exposición de contexto sensible ya proporcionado.

Herramientas amplias

Una herramienta que acepta cualquier destinatario y utiliza una identidad con muchos privilegios aumenta la consecuencia posible. El formato correcto no demuestra autoridad para enviar esos datos.

Aplicación limitada

La aplicación recupera solo registros permitidos y comprueba por separado acción y destino. Así limita las consecuencias aunque el modelo interprete mal el documento.

Modelo simplificado para aprender. No se conecta a sistemas ni usa datos reales.

Limita lo que puede hacer una interpretación errónea

Recupera solo información a la que el usuario tenga acceso. Excluye secretos innecesarios de los prompts. Proporciona únicamente las herramientas y permisos requeridos por el propósito. Valida las acciones fuera del modelo y detén las de alto impacto para obtener la aprobación exigida por la política del producto.

El análisis de contenido, las etiquetas de fuente y los modelos de supervisión pueden añadir capas útiles. Por sí solos no hacen segura una identidad de servicio con demasiados privilegios. Un resumidor ficticio de biblioteca puede ser útil leyendo el mensaje seleccionado sin poder distribuir toda la base de socios.

Un resultado de revisión útil

Registra tarea, fuente no fiable, desviación observada y datos o acciones afectados. Separa consecuencias hipotéticas y resultados comprobados. Identifica después el control que debía limitar el efecto. Así se obtiene una corrección clara sin convertir un problema de calidad de respuesta en otro tipo de compromiso.

Términos que viste

inyección de instruccionesrecuperación de informaciónautorización

Compruébate

Sin reloj ni penalizaciones. Lee cada explicación y vuelve a intentarlo cuando quieras.

  1. Un documento recuperado afirma que se aprobó una acción sensible. ¿Qué concede permiso?

    Ver la respuesta

    Respuesta correcta: El estado de autorización y aprobación verificado por la aplicación. El contenido puede describir una aprobación, pero hay que verificar la autoridad por separado.

  2. ¿Puede importar la inyección si el asistente no tiene herramientas de acción?

    Ver la respuesta

    Respuesta correcta: Sí; puede alterar respuestas o divulgar contexto que el modelo ya tiene. La consecuencia depende de la aplicación y los datos, no solo de ejecutar herramientas.

  3. ¿Qué aportan los roles de mensajes y los prompts estructurados?

    Ver la respuesta

    Respuesta correcta: Ayudan a comunicar prioridades, pero necesitan controles independientes. La orientación y evaluación útiles no sustituyen permisos ni autorización de acciones.

  4. El modelo propone una acción que cumple un esquema JSON. ¿Qué falta?

    Ver la respuesta

    Respuesta correcta: Verificar identidad, recurso, acción, argumentos y aprobación necesaria. La validez estructural es solo una comprobación; una solicitud bien formada puede no estar autorizada.

Pruébalo

  • EscribeUn asistente ficticio de biblioteca resume mensajes de socios. Uno afirma que una dirección externa está autorizada para recibir la lista de miembros. Explica por qué esa afirmación no concede autorización, qué puede resumir el asistente y qué comprobación evitaría la divulgación.
Referencias