Seguridad a fondo · Unidad 27 · Lección 4 de 11
Diseñar defensas de IA por capas
Asigna a la función una tarea útil, una identidad limitada y controles eficaces aunque su respuesta sea incorrecta.
MITRE ATLAS
Para prepararteInyección de instrucciones y límites de autoridadDefensas y detección
Después de esta lección puedes
- Asignar controles distintos al acceso a datos, las acciones propuestas y la salida generada.
- Explicar qué debe mostrar una aprobación y a qué operación debe vincularse.
- Diseñar supervisión y recuperación para una función de IA limitada.
Un asistente útil necesita una tarea clara. “Ayudar con citas” es ambiguo; “redactar una respuesta utilizando esta solicitud seleccionada” permite relacionar la tarea con datos, permisos e interfaz.
La defensa por capas asume que el modelo puede proponer algo incorrecto o manipulado. La aplicación debe seguir limitando qué información puede exponer y qué acciones puede realizar.
Empieza por la capacidad útil más pequeña
El mínimo privilegio se aplica a la identidad de la aplicación, no solo al prompt. Redactar puede requerir una conversación y un lugar para guardar el borrador. No exige automáticamente administrar el buzón, exportar clientes ni enviar mensajes.
A veces la herramienta usa una identidad delegada del usuario; otras, una identidad de servicio con acceso limitado. Ningún patrón es seguro por sí mismo. Verifica permisos efectivos, solicitud representada y alcance de recursos comprobado para cada operación.
Limita destinos de red y parámetros según la función real. Permitir el nombre de una herramienta no basta si sus argumentos admiten recursos ajenos o efectos ilimitados.
Separa datos, propuestas y ejecución
Recupera solo registros dentro del alcance del usuario. Trata las instrucciones recuperadas como contenido de la fuente. Examina entradas sospechosas cuando aporte valor, conserva procedencia y presenta la salida de forma segura.
El modelo puede sugerir una operación, pero la aplicación debe validar estructura, significado, destino, límites y autorización. Otro modelo de supervisión puede añadir una señal; no sustituye esas comprobaciones independientes.
Si falta una decisión de seguridad obligatoria, hay que fallar de forma cerrada para esa operación. La interfaz puede explicar que el borrador está disponible mientras el envío sigue pausado. No tiene por qué fallar toda la aplicación porque una acción sensible no pueda continuar.
Haz específica la aprobación
La aprobación de una acción debe mostrar operación, destino, datos relevantes y consecuencias reales. Vincúlala a la misma operación que se ejecutará. Si cambia el destino o el alcance, la aprobación anterior puede dejar de ser aplicable.
Utiliza revisión humana donde la política de riesgo la exija. Algunas tareas admiten automatización reversible y limitada; las de alto impacto pueden necesitar más revisión. Un botón de “confiar siempre” debe tratarse como una delegación continuada, con límites y revocación explícitos.
La persona también necesita información suficiente. Un resumen tranquilizador no basta cuando la operación real afecta a otra cuenta o a más registros.
Prueba los controles de la aplicación
Usa ejemplos ficticios para comprobar que no se recuperan datos no autorizados, se rechazan acciones inválidas, se respetan límites y un tiempo de espera agotado no omite una decisión obligatoria. Prueba solicitudes legítimas: bloquear el trabajo normal puede incentivar atajos inseguros.
Versiona configuración del modelo, prompts, herramientas y fuentes relevantes para comparar cambios. El comportamiento puede variar entre ejecuciones; las reglas deterministas de permisos y validación deben mantener su contrato.
Supervisa resultados y prepara la recuperación
Registra identidad, referencias de fuente, acción solicitada, decisión de política, referencia de aprobación cuando corresponda y resultado. Minimiza contenido sensible y protege el acceso a diagnósticos. Los registros deben distinguir una propuesta de un efecto completado.
El plan de recuperación identifica quién puede pausar una herramienta, revisar acciones, corregir datos y restaurar el servicio. Revoca o sustituye credenciales cuando lo requieran las pruebas y el plan; no supongas que todos los incidentes se resuelven igual.
El AI RMF de NIST organiza el trabajo mediante Govern, Map, Measure y Manage: gobernar, contextualizar, medir y gestionar. Los marcos ayudan a estructurar responsabilidad y evaluación. Complementan las pruebas de que esta función concreta respeta sus límites, pero no las sustituyen.
Términos que viste
mínimo privilegioaprobación de una acciónfallar de forma cerrada
Compruébate
Sin reloj ni penalizaciones. Lee cada explicación y vuelve a intentarlo cuando quieras.
Las preguntas de esta lección han cambiado. Tu lectura sigue guardada; repasa las preguntas actualizadas.
-
Un asistente solo necesita redactar respuestas. ¿Qué diseño aplica mejor el mínimo privilegio?
Ver la respuesta
Respuesta correcta: Acceso a la conversación seleccionada y una operación de borrador. Las capacidades deben coincidir con la tarea; enviar y leer todo el buzón requieren justificación aparte.
-
¿Qué hace útil una aprobación?
Ver la respuesta
Respuesta correcta: Mostrar destino, acción, datos y límites reales, y aplicarse a esa misma operación. Aprobar una operación no debe autorizar silenciosamente otro destino o un alcance mayor.
-
Caduca la espera de un servicio obligatorio de permisos. ¿Qué debe pasar?
Ver la respuesta
Respuesta correcta: Pausar o denegar la acción hasta establecer la autorización requerida. Fallar de forma cerrada impide que una comprobación no disponible se convierta en permiso.
-
¿Qué pertenece a una supervisión útil de acciones de IA?
Ver la respuesta
Respuesta correcta: Identidad, referencias de fuente, acción, decisión y resultado, minimizando datos sensibles. Permite investigar y reduce copias innecesarias de contenido privado.
Pruébalo
- EscribeDiseña un asistente ficticio que redacte respuestas a solicitudes de cita. Elige los registros y herramientas mínimos, qué revisa el usuario antes de enviar, qué contiene una auditoría con datos sensibles minimizados y cómo pausar el envío si aparece un defecto.