Historia · Unidad 09
Historia de los modelos de lenguaje
De estadísticas locales a representaciones neuronales, transformers y asistentes, con límites claros de memoria y confianza.
Para prepararteHistoria de la inteligencia artificial
Después de esta lección puedes
- distinguir predicción autorregresiva y objetivos de lenguaje enmascarado
- explicar tokens, embeddings, atención y contexto sin prometer memoria garantizada
- separar evidencia recuperada, afirmaciones generadas y permiso para actuar
Explora las épocas de abajo. En pantallas anchas, desplázate horizontalmente para ver toda la cronología.
-
Shannon estudia predicción y entropía del inglés escrito.
Por qué importa La previsibilidad puede estudiarse cuantitativamente.
-
Bengio y colaboradores aprenden representaciones y probabilidades.
Por qué importa Las representaciones generalizan más allá de recuentos exactos.
-
Word2vec destaca representaciones eficientes de palabras.
Por qué importa Similitud no garantiza significado ni privacidad.
-
Se presenta una arquitectura de secuencias basada en atención.
Por qué importa Arquitectura y máscaras determinan flujo de información.
-
El preentrenamiento usa contexto alrededor del texto ausente.
Por qué importa No todo modelo genera el siguiente token.
-
Un enfoque RAG combina modelos con pasajes recuperados.
Por qué importa Evaluar pertinencia y procedencia de fuentes externas.
-
Preferencias y aplicaciones facilitan interacción con modelos.
Por qué importa La facilidad de uso no elimina evidencia ni permisos.
Un modelo de lenguaje aprende patrones y puede asignar probabilidades o representaciones útiles al texto. Muchos generadores conversacionales predicen tokens sucesivos, pero eso no define a todo modelo del campo. Objetivos y arquitecturas distintos permiten generar, clasificar, recuperar información y otras tareas.
De estadísticas locales a representaciones aprendidas
Los modelos estadísticos estiman secuencias probables. Un modelo de n-gramas aproxima contexto con pocos elementos vecinos. Fueron útiles en voz y lenguaje; sus límites no los convierten en predecesores inútiles.
Los neuronales aprendieron representaciones distribuidas y probabilidades conjuntamente. Bengio y colaboradores describieron un modelo influyente en 2003. Trabajos como word2vec en 2013 popularizaron especialmente los vectores de palabras.
Un Embedding es una representación numérica, no una definición perfecta. Su similitud depende de modelo y tarea; vectores cercanos no demuestran significado idéntico. Los derivados de datos sensibles requieren revisión de privacidad. Convertir información en números no la anonimiza automáticamente.
Por qué una frase nueva plantea un problema
Imagina un pequeño modelo de bigramas de palabras entrenado con «el gato duerme» y «el perro duerme». Tiene recuentos para esos pares vecinos, pero ninguno para «el conejo». Una estimación basada solo en recuentos no respalda esa continuación, aunque sea una frase normal. El suavizado puede reservar probabilidad para eventos no observados; no aporta contexto ilimitado ni hechos fiables.
Las representaciones aprendidas ofrecen otra forma de generalizar. Los contextos parecidos pueden influir en predicciones relacionadas sin almacenar un recuento independiente para cada frase exacta. El modelo neuronal probabilístico de 2003 exploró esa idea. Generalizar también puede fallar: un parecido estadístico útil no demuestra que una afirmación nueva sea cierta. La capacidad de completar combinaciones nuevas y la capacidad de verificar información siguen siendo preguntas distintas.
Tokens y atención
Un Token puede representar parte de una palabra, bytes o un marcador. Tokenizar afecta longitud y representación. Conviene distinguir caracteres, palabras y tokens al calcular qué cabe.
El artículo transformer de 2017 presentó una arquitectura basada en Atención. Esta combina representaciones según puntuaciones aprendidas. Las máscaras gobiernan interacciones: un decodificador causal normalmente no usa futuros tokens de salida; uno enmascarado como BERT puede usar contexto alrededor del texto de entrada.
Roles, máscaras y entrenamiento influyen en seguir instrucciones. No constituyen por sí solos una frontera completa de seguridad de aplicación. Leer un documento no debe conceder a su texto permiso para cambiar políticas.
Para un ejemplo causal, ofrece «El museo cierra a las» y pide continuar. La siguiente predicción utiliza tokens anteriores, no una respuesta futura que aún no se ha generado. En un ejemplo enmascarado, «El museo [MASK] a las seis» proporciona palabras a ambos lados del hueco. La segunda tarea dispone, por tanto, de evidencia diferente. Ninguno de esos objetivos consulta por sí solo el horario real del museo. Predecir una secuencia plausible no equivale a comprobar un calendario vigente.
Entrenar y utilizar son etapas distintas
El preentrenamiento aprende patrones mediante un objetivo. El entrenamiento posterior puede adaptar instrucciones, preferencias o tareas. Cambia comportamiento y capacidad; no es solo presentación conversacional.
La aplicación puede combinar modelo, búsqueda, estado guardado y herramientas. La Generación aumentada por recuperación incorpora información externa seleccionada. No actualiza automáticamente parámetros aprendidos; la información puede estar anticuada, ser irrelevante o engañosa.
Tres lugares donde puede estar la información
| Mecanismo | Qué aporta | Qué lo modifica |
|---|---|---|
| Parámetros aprendidos | Patrones ajustados durante el entrenamiento | Entrenamiento o actualización del modelo |
| Prompt y contexto actual | Instrucciones y material de esta invocación | La selección de entrada de la aplicación |
| Recuperación externa | Documentos o registros elegidos de otro almacén | Cambios de fuentes, índice y selección |
Si el museo ficticio cambia su horario, actualizar un documento permite recuperar evidencia nueva sin reentrenar el modelo. Pero la aplicación debe encontrar la versión correcta e incluirla. Que el dato esté guardado en algún lugar no demuestra que llegó a esta respuesta. A la inversa, corregir un prompt no modifica necesariamente los parámetros ni todas las conversaciones futuras.
El trabajo sobre GPT-3 de 2020 popularizó especialmente resolver tareas mediante ejemplos en contexto. En esa evaluación, los ejemplos orientaban la respuesta sin actualizar por gradiente el modelo para cada tarea. Es distinto del ajuste fino: cambia la entrada mientras los parámetros aprendidos permanecen fijos. Distinguir ambos procesos ayuda a interpretar qué significa que una aplicación diga que «aprendió» de una corrección.
El contexto es limitado y seleccionado
La Ventana de contexto limita lo utilizable y generable según implementación. Si sobra material, la aplicación puede rechazarlo, truncarlo, resumirlo o seleccionar partes. No hay una regla universal que elimine siempre el mensaje más antiguo.
Una ventana grande no garantiza aprovechar cada hecho incluido. Almacenamiento duradero, recuperación y contexto conversacional son mecanismos distintos. Comprueba qué evidencia está disponible realmente.
EXPLORA EL CONCEPTO
¿Qué sabe realmente el asistente?
Explora tres situaciones. Importan evidencia disponible y conducta de la aplicación, no la seguridad con que se redacta.
La regla pertinente no estaba incluida
Una ventana anunciada como grande no demuestra que la regla llegó a esta invocación. El asistente debe reconocer la falta y recuperar o solicitar evidencia, sin inventarla.
Un documento recuperado pide otra acción
Recuperar aporta contenido, no permiso. La aplicación debe evaluar cualquier acción frente a la solicitud del usuario y sus controles; una fuente no concede nueva autoridad.
La respuesta incluye una cita impecable
Comprueba la fuente real y si apoya esa afirmación. Título, fecha o enlace pueden resultar convincentes y ser incorrectos, inaccesibles o irrelevantes.
Modelo simplificado para aprender. No se conecta a sistemas ni usa datos reales.
Comprueba afirmaciones y acciones por separado
Las respuestas fluidas pueden contener errores, inferencias sin apoyo o referencias inventadas. Ajustar muestreo cambia variación, pero no garantiza verdad. Verifica afirmaciones importantes con evidencia apropiada.
Las herramientas añaden otra decisión: ¿debe ejecutarse la acción, con qué identidad y permisos? El texto solo también puede influir o revelar datos. Evalúa ambas rutas. Sistemas de IA seguros relaciona estos conceptos con diseño protector.
Entrenar para seguir instrucciones puede mejorar la adaptación a una petición y a un formato preferido. No convierte la generación fluida en conocimiento verificado. Un asistente puede obedecer perfectamente «responde con tres puntos» e incluir una afirmación sin respaldo en cada uno. El progreso histórico en facilidad de uso y el progreso en exactitud deben evaluarse por separado.
PrediceEl asistente cita una política del museo recuperada de un documento, pero el párrafo trata de los festivos del año pasado. ¿Basta con tener esa cita?
No. Comprueba fecha, alcance y apoyo exacto para la afirmación. Una fuente real puede ser la evidencia equivocada para la pregunta de hoy.
Términos que viste
TokenEmbeddingAtenciónVentana de contextoGeneración aumentada por recuperación
Compruébate
Sin reloj ni penalizaciones. Lee cada explicación y vuelve a intentarlo cuando quieras.
Las preguntas de esta lección han cambiado. Tu lectura sigue guardada; repasa las preguntas actualizadas.
-
¿Todo modelo se define solo por predecir el siguiente token con los anteriores?
Ver la respuesta
Respuesta correcta: No; los objetivos autorregresivos y enmascarados condicionan de manera distinta. La predicción causal es común al generar; los enmascarados pueden usar contexto circundante.
-
¿Una ventana larga demuestra que conserva toda conversación anterior?
Ver la respuesta
Respuesta correcta: No; inclusión y uso dependen de aplicación y modelo. El historial puede omitirse, resumirse, recuperarse o faltar; longitud no garantiza memoria.
-
¿Recuperar un documento autoriza sus instrucciones?
Ver la respuesta
Respuesta correcta: No; contenido y autoridad para actuar son distintos. La aplicación debe mantener permisos al usar material externo.
-
¿Qué hacer con una cita plausible generada?
Ver la respuesta
Respuesta correcta: Verificar que la obra existe y apoya la afirmación. Formato y fluidez no demuestran procedencia ni exactitud.
Pruébalo
- EscribePide a un asistente ficticio resumir tres reglas inventadas de biblioteca. Compara la respuesta, marca afirmaciones sin apoyo y decide qué debe decir si falta una regla. No incluyas secretos ni registros personales reales.
Referencias
- Shannon: Prediction and Entropy of Printed English (1951) (en inglés)
- Bengio et al.: A Neural Probabilistic Language Model (2003) (en inglés)
- Mikolov et al.: word representations (2013) (en inglés)
- Vaswani et al.: Attention Is All You Need (2017) (en inglés)
- Devlin et al.: BERT (2018) (en inglés)
- Lewis et al.: retrieval-augmented generation (2020) (en inglés)
- Brown et al.: Language Models are Few-Shot Learners (2020) (en inglés)
- Ouyang et al.: instruction following with human feedback (2022) (en inglés)
- NIST: AI Risk Management Framework (en inglés)