Seguridad a fondo · Unidad 27
Ofensiva de IA
Comprende riesgos de aplicaciones de IA en modelos, datos, salida generada, permisos de herramientas y operación.
MITRE ATLAS
Para prepararteAprende con cuidado: permisos, personas e IAHistoria de los modelos de lenguaje
Después de esta lección puedes
- Relacionar identidad solicitante, salida del modelo, autoridad y efectos en registros aportados.
- Distinguir cita sin respaldo, acción rechazada y estimación de privacidad sin mezclar su evidencia.
- Definir autorización independiente y límites medibles de recursos.
Lecciones de esta unidad
Explorar 11 lecciones de este tema
- Inyección de instrucciones y límites de autoridadComprende por qué un documento no es una instrucción del usuario y dónde debe imponer esa distinción una aplicación de IA.9 min
- Datos, recuperación y salida segura en IASigue la información que entra y sale de una función de IA, con controles distintos para integridad, permisos y presentación.7 min
- Fiabilidad y riesgos de privacidad en IADistingue alterar una predicción de aprender sobre sus datos y entiende qué pruebas respaldan cada afirmación.6 min
- Diseñar defensas de IA por capasAsigna a la función una tarea útil, una identidad limitada y controles eficaces aunque su respuesta sea incorrecta.7 min
- Sistemas de IA: separa sugerencias y autoridadComprende contenido no fiable, permisos de herramientas y revisión.10 min
- Texto recuperado no es autoridadDistingue un documento pertinente de una fuente autorizada para cambiar un flujo de trabajo.3 min
- Las herramientas necesitan permisos propiosCompara una acción de herramienta propuesta con los permisos reales de quien solicita.4 min
- La salida generada necesita validaciónRevisa por separado la estructura, el respaldo factual y la divulgación de contenido generado.4 min
- Evaluar también los fallosDesglosa un promedio llamativo para encontrar un requisito crítico incumplido.3 min
- Solo el contexto necesarioElige el contexto necesario para una tarea aunque quien solicita pueda leer mucho más.4 min
- Aprobar necesita una acción revisableCompara el borrador aprobado con la acción exacta que está a punto de realizarse.3 min
La IA ayuda a resumir notas, clasificar eventos, buscar documentación o redactar explicaciones. También puede formar parte del sistema protegido. Ambos usos necesitan evidencia clara, acceso limitado y una forma de corregir errores.
Este módulo considera la aplicación completa: modelo, fuentes, identidad, interfaz, herramientas opcionales y operación. Algunos riesgos recuerdan fallos habituales; otros afectan aprendizaje, datos o evaluación. Comprender una categoría no elimina las demás.
Utiliza el asistente con evidencia
Un Modelo de lenguaje genera explicaciones útiles sin garantizar exactitud. Las familias emplean objetivos diferentes; un generador conversacional no define toda IA.
Al estudiar, compara con la referencia real, pide incertidumbres y comprueba ejemplos. En el trabajo, considera confidencialidad, conservación, acceso del proveedor y datos realmente necesarios. Una cita convincente no demuestra que exista ni que apoye la afirmación.
La revisión humana ayuda cuando hay tiempo, evidencia y autoridad para intervenir. No es una protección universal por sí sola. Los sistemas con consecuencias necesitan límites aplicables y respuestas definidas ante fallos.
Dibuja el producto alrededor del modelo
| Componente | Pregunta defensiva |
|---|---|
| Entradas e instrucciones | ¿Qué contenido es fiable y para qué propósito? |
| Recuperación | ¿Qué documentos puede ver este usuario y de dónde vienen? |
| Identidad | ¿Qué cuenta o carga actúa en cada etapa? |
| Salida | ¿Se muestra, guarda o interpreta el texto? |
| Herramientas | ¿Quién autoriza operación y recurso exactos? |
| Supervisión | ¿Qué se registra, protege, revisa y conserva? |
La credencial para contactar al proveedor del modelo no es necesariamente la identidad de las herramientas posteriores. El Ejecutor de herramientas tiene contexto de proceso y puede usar otras credenciales o autorización delegada. Cada límite exige comprobaciones propias.
Inyección de instrucciones y fallos de aplicación
La Inyección de instrucciones intenta que material no fiable redirija conducta. Un documento aporta información sin permiso para modificar políticas ni autorizar acciones. Jerarquía y entrenamiento ayudan, pero controles independientes deben gobernar operaciones sensibles.
La Recuperación también necesita permisos ordinarios. Un índice no debe divulgar documentos de otra organización porque el modelo pueda buscarlos. La salida enviada a bases de datos, navegadores u otros intérpretes necesita protección según contexto. Parametrizar consultas y codificar salida web cumplen funciones distintas.
Un rechazo en el chat no demuestra que toda herramienta esté bloqueada. Una respuesta inusual tampoco demuestra una acción no autorizada. Separa salida, operación propuesta, decisión de autorización y efecto observado.
Datos, evasión y privacidad
Envenenar entrenamiento intenta influir en comportamiento aprendido mediante datos manipulados. Cambiar documentos recuperados altera evidencia sin modificar necesariamente parámetros del modelo. Ambos afectan integridad, con mecanismos y validaciones distintos.
La evasión adversaria utiliza entradas diseñadas para provocar resultados no deseados. Las restricciones y la necesidad de conservar significado o función dependen de la tarea; «cambiar unos píxeles» no es una definición universal.
Inferir pertenencia estima si un registro apareció en entrenamiento. Extraer datos busca información protegida. Extraer un modelo busca reproducir o recuperar aspectos del modelo. Son afirmaciones diferentes; demostrar una no prueba las demás.
Profundiza en inyección de instrucciones, datos y salida y evasión y privacidad.
Acciones, texto y límites de recursos
Los asistentes con herramientas necesitan autorización ligada a persona o carga, acción, recurso y contexto. Capacidades limitadas, aislamiento, restricciones de destino y aprobación apropiada para acciones importantes reducen daño. La redacción del modelo no concede permisos.
El texto solo también divulga información o influye en decisiones perjudiciales. Evalúa comunicación y acción. Solicitudes, recuperación, generación o bucles sin límites pueden degradar disponibilidad o generar costes; define y verifica límites de uso y duración.
El asistente propone una acción legítima para otra cuenta. ¿Es segura?
No. Una operación válida necesita actor, recurso y propósito correctos. Los permisos deben rechazar la reserva o modificación no autorizada aunque la explicación sea convincente.
Convierte observaciones en mejoras
Utiliza situaciones ficticias o entornos de evaluación expresamente autorizados. Un hallazgo útil identifica fuente no fiable, decisión afectada, consecuencia demostrada y corrección, indicando incertidumbre. ATLAS y la terminología NIST ayudan a describir estas relaciones.
Defensa de IA explica controles por capas. Evalúa comportamiento del modelo y aplicación de políticas conjuntamente, con evidencia de la mejora y sus límites.
Revisión resuelta: un asistente, resultados distintos
Un asistente ficticio de biblioteca permite reservar solo para la membresía propia. Registra por separado selección de fuentes, texto generado y acciones opcionales. Los registros aportados corresponden a una evaluación simulada, sin personas ni efectos externos reales.
- A1: El solicitante M14 está autenticado. La credencial del proveedor pertenece a la aplicación. Un proceso independiente usa LibraryWorker; las reservas usan una credencial de servicio limitada por una comprobación independiente del miembro.
- A2: El modelo propone reservar para M27. La política compara con M14 y rechaza. El registro de efectos confirma que no se creó reserva.
- A3: El borrador cita R9, pero la recuperación completa contiene solo R1 y R2. No se aporta verificación externa de R9.
- A4: El intermediario permite como máximo tres operaciones enviadas por evaluación. Envía tres y rechaza una cuarta propuesta antes del envío. No se evaluaron coste por operación ni demanda concurrente.
- A5: Otro informe de privacidad califica un registro sintético como “probablemente presente en entrenamiento”. No aporta pertenencia real comprobada ni texto protegido recuperado.
Predice¿Debe calificarse el asistente como “seguro” o “comprometido” solo por la reserva rechazada de A2?
Ninguna etiqueta describe bien la evidencia. Proponer otro miembro es un comportamiento que mejorar; la comprobación independiente impidió la acción observada. A3 conserva una cita sin respaldo y A4 solo demuestra un límite concreto de recursos. Vincula cada conclusión con su registro.
Mejorar el límite que produjo cada resultado
Para A2, conserva comprobaciones independientes con identidad fiable y recurso propuesto real. Revisa reservas útiles permitidas además de las rechazadas: bloquear todo protegería un resultado haciendo inútil el servicio.
Para A3, no publiques el borrador como documentado por la apariencia convincente de la cita. Exige una fuente recuperable que apoye la afirmación o declara falta de respaldo y deriva a revisión. La ausencia en recuperación no demuestra que R9 no exista en ningún lugar, pero no respalda la atribución de esta respuesta.
A4 requiere presupuestos adicionales de coste, duración y concurrencia. A5 necesita un objetivo claro de evaluación y evidencia adecuada a ese objetivo. Ni estimar pertenencia ni omitir texto recuperado resuelve toda la cuestión de privacidad.
Entregable modelo: cuatro columnas de afirmación, evidencia, límite y corrección. Conserva la diferencia entre sugerencia del modelo, permiso de aplicación y efecto demostrado.
Términos que viste
Modelo de lenguajeInyección de instruccionesEjecutor de herramientasRecuperaciónATLAS
Compruébate
Sin reloj ni penalizaciones. Lee cada explicación y vuelve a intentarlo cuando quieras.
Las preguntas de esta lección han cambiado. Tu lectura sigue guardada; repasa las preguntas actualizadas.
-
¿Qué conclusión describe mejor la reserva A2?
Ver la respuesta
Respuesta correcta: La propuesta usó otro miembro; la política la rechazó y el registro confirma que no se creó reserva. El error del modelo y el límite de acción correcto son resultados distintos. No acredita propuesta correcta ni reserva no autorizada completada.
-
¿Qué acredita A4 sobre recursos?
Ver la respuesta
Respuesta correcta: El intermediario aplicó el límite de tres operaciones enviadas en esta evaluación; faltan otros límites de uso y disponibilidad. La cuarta propuesta se rechazó antes del envío. Verifica este límite de recuento, no todos los costes ni demanda concurrente.
-
¿Cómo debe describirse A5?
Ver la respuesta
Respuesta correcta: Se produjo una estimación de pertenencia; no se acredita exactitud ni recuperación de datos protegidos. Estimar pertenencia y recuperar contenido privado son afirmaciones diferentes. Aquí faltan evidencia real de pertenencia y de extracción.
-
¿Qué descripción de autoridad encaja con A1?
Ver la respuesta
Respuesta correcta: Hay que separar solicitante, credencial del proveedor, proceso ejecutor e identidad del servicio posterior. A1 les asigna contextos distintos. Las políticas reales del ejecutor y servicio gobiernan efectos, no solo el nombre mostrado del usuario.
Pruébalo
- EscribeRedacta una ficha de A1-A5 separando afirmaciones, operaciones propuestas, decisiones de autorización y efectos. Añade mejora de control de acciones, requisito de calidad de citas y verificación de recursos. Presenta la pertenencia como estimación, no como datos privados recuperados.