Todas las lecciones Read in English

Historia · Unidad 09

Historia de los modelos de lenguaje

De estadísticas locales a representaciones neuronales, transformers y asistentes, con límites claros de memoria y confianza.

12 minlista

Para prepararteHistoria de la inteligencia artificial

Después de esta lección puedes

  • distinguir predicción autorregresiva y objetivos de lenguaje enmascarado
  • explicar tokens, embeddings, atención y contexto sin prometer memoria garantizada
  • separar evidencia recuperada, afirmaciones generadas y permiso para actuar

Explora las épocas de abajo. En pantallas anchas, desplázate horizontalmente para ver toda la cronología.

Un modelo de lenguaje aprende patrones y puede asignar probabilidades o representaciones útiles al texto. Muchos generadores conversacionales predicen tokens sucesivos, pero eso no define a todo modelo del campo. Objetivos y arquitecturas distintos permiten generar, clasificar, recuperar información y otras tareas.

Modelado causal y enmascaradoEl modelado causal predice el siguiente token con contexto anterior. El enmascarado puede predecir uno ausente con contexto de ambos lados. Son objetivos distintos, no etapas consecutivas.Predicción causalContexto anterior → siguienteel cielo es …El texto anterior da contextoPredicción enmascaradaContexto circundante → huecoel … es azulAmbos lados pueden dar contexto
Dos familias: el modelo causal usa contexto anterior para el siguiente token; el enmascarado puede usar contexto circundante para uno ausente. Son formas de aprendizaje con usos diferentes.

De estadísticas locales a representaciones aprendidas

Los modelos estadísticos estiman secuencias probables. Un modelo de n-gramas aproxima contexto con pocos elementos vecinos. Fueron útiles en voz y lenguaje; sus límites no los convierten en predecesores inútiles.

Los neuronales aprendieron representaciones distribuidas y probabilidades conjuntamente. Bengio y colaboradores describieron un modelo influyente en 2003. Trabajos como word2vec en 2013 popularizaron especialmente los vectores de palabras.

Un Embedding es una representación numérica, no una definición perfecta. Su similitud depende de modelo y tarea; vectores cercanos no demuestran significado idéntico. Los derivados de datos sensibles requieren revisión de privacidad. Convertir información en números no la anonimiza automáticamente.

Por qué una frase nueva plantea un problema

Imagina un pequeño modelo de bigramas de palabras entrenado con «el gato duerme» y «el perro duerme». Tiene recuentos para esos pares vecinos, pero ninguno para «el conejo». Una estimación basada solo en recuentos no respalda esa continuación, aunque sea una frase normal. El suavizado puede reservar probabilidad para eventos no observados; no aporta contexto ilimitado ni hechos fiables.

Las representaciones aprendidas ofrecen otra forma de generalizar. Los contextos parecidos pueden influir en predicciones relacionadas sin almacenar un recuento independiente para cada frase exacta. El modelo neuronal probabilístico de 2003 exploró esa idea. Generalizar también puede fallar: un parecido estadístico útil no demuestra que una afirmación nueva sea cierta. La capacidad de completar combinaciones nuevas y la capacidad de verificar información siguen siendo preguntas distintas.

Tokens y atención

Un Token puede representar parte de una palabra, bytes o un marcador. Tokenizar afecta longitud y representación. Conviene distinguir caracteres, palabras y tokens al calcular qué cabe.

El artículo transformer de 2017 presentó una arquitectura basada en Atención. Esta combina representaciones según puntuaciones aprendidas. Las máscaras gobiernan interacciones: un decodificador causal normalmente no usa futuros tokens de salida; uno enmascarado como BERT puede usar contexto alrededor del texto de entrada.

Roles, máscaras y entrenamiento influyen en seguir instrucciones. No constituyen por sí solos una frontera completa de seguridad de aplicación. Leer un documento no debe conceder a su texto permiso para cambiar políticas.

Para un ejemplo causal, ofrece «El museo cierra a las» y pide continuar. La siguiente predicción utiliza tokens anteriores, no una respuesta futura que aún no se ha generado. En un ejemplo enmascarado, «El museo [MASK] a las seis» proporciona palabras a ambos lados del hueco. La segunda tarea dispone, por tanto, de evidencia diferente. Ninguno de esos objetivos consulta por sí solo el horario real del museo. Predecir una secuencia plausible no equivale a comprobar un calendario vigente.

Entrenar y utilizar son etapas distintas

El preentrenamiento aprende patrones mediante un objetivo. El entrenamiento posterior puede adaptar instrucciones, preferencias o tareas. Cambia comportamiento y capacidad; no es solo presentación conversacional.

La aplicación puede combinar modelo, búsqueda, estado guardado y herramientas. La Generación aumentada por recuperación incorpora información externa seleccionada. No actualiza automáticamente parámetros aprendidos; la información puede estar anticuada, ser irrelevante o engañosa.

Tres lugares donde puede estar la información

Mecanismo Qué aporta Qué lo modifica
Parámetros aprendidos Patrones ajustados durante el entrenamiento Entrenamiento o actualización del modelo
Prompt y contexto actual Instrucciones y material de esta invocación La selección de entrada de la aplicación
Recuperación externa Documentos o registros elegidos de otro almacén Cambios de fuentes, índice y selección

Si el museo ficticio cambia su horario, actualizar un documento permite recuperar evidencia nueva sin reentrenar el modelo. Pero la aplicación debe encontrar la versión correcta e incluirla. Que el dato esté guardado en algún lugar no demuestra que llegó a esta respuesta. A la inversa, corregir un prompt no modifica necesariamente los parámetros ni todas las conversaciones futuras.

El trabajo sobre GPT-3 de 2020 popularizó especialmente resolver tareas mediante ejemplos en contexto. En esa evaluación, los ejemplos orientaban la respuesta sin actualizar por gradiente el modelo para cada tarea. Es distinto del ajuste fino: cambia la entrada mientras los parámetros aprendidos permanecen fijos. Distinguir ambos procesos ayuda a interpretar qué significa que una aplicación diga que «aprendió» de una corrección.

El contexto es limitado y seleccionado

La Ventana de contexto limita lo utilizable y generable según implementación. Si sobra material, la aplicación puede rechazarlo, truncarlo, resumirlo o seleccionar partes. No hay una regla universal que elimine siempre el mensaje más antiguo.

Una ventana grande no garantiza aprovechar cada hecho incluido. Almacenamiento duradero, recuperación y contexto conversacional son mecanismos distintos. Comprueba qué evidencia está disponible realmente.

EXPLORA EL CONCEPTO

¿Qué sabe realmente el asistente?

Explora tres situaciones. Importan evidencia disponible y conducta de la aplicación, no la seguridad con que se redacta.

La regla pertinente no estaba incluida

Una ventana anunciada como grande no demuestra que la regla llegó a esta invocación. El asistente debe reconocer la falta y recuperar o solicitar evidencia, sin inventarla.

Un documento recuperado pide otra acción

Recuperar aporta contenido, no permiso. La aplicación debe evaluar cualquier acción frente a la solicitud del usuario y sus controles; una fuente no concede nueva autoridad.

La respuesta incluye una cita impecable

Comprueba la fuente real y si apoya esa afirmación. Título, fecha o enlace pueden resultar convincentes y ser incorrectos, inaccesibles o irrelevantes.

Modelo simplificado para aprender. No se conecta a sistemas ni usa datos reales.

Comprueba afirmaciones y acciones por separado

Las respuestas fluidas pueden contener errores, inferencias sin apoyo o referencias inventadas. Ajustar muestreo cambia variación, pero no garantiza verdad. Verifica afirmaciones importantes con evidencia apropiada.

Las herramientas añaden otra decisión: ¿debe ejecutarse la acción, con qué identidad y permisos? El texto solo también puede influir o revelar datos. Evalúa ambas rutas. Sistemas de IA seguros relaciona estos conceptos con diseño protector.

Entrenar para seguir instrucciones puede mejorar la adaptación a una petición y a un formato preferido. No convierte la generación fluida en conocimiento verificado. Un asistente puede obedecer perfectamente «responde con tres puntos» e incluir una afirmación sin respaldo en cada uno. El progreso histórico en facilidad de uso y el progreso en exactitud deben evaluarse por separado.

PrediceEl asistente cita una política del museo recuperada de un documento, pero el párrafo trata de los festivos del año pasado. ¿Basta con tener esa cita?

No. Comprueba fecha, alcance y apoyo exacto para la afirmación. Una fuente real puede ser la evidencia equivocada para la pregunta de hoy.

Términos que viste

TokenEmbeddingAtenciónVentana de contextoGeneración aumentada por recuperación

Compruébate

Sin reloj ni penalizaciones. Lee cada explicación y vuelve a intentarlo cuando quieras.

  1. ¿Todo modelo se define solo por predecir el siguiente token con los anteriores?

    Ver la respuesta

    Respuesta correcta: No; los objetivos autorregresivos y enmascarados condicionan de manera distinta. La predicción causal es común al generar; los enmascarados pueden usar contexto circundante.

  2. ¿Una ventana larga demuestra que conserva toda conversación anterior?

    Ver la respuesta

    Respuesta correcta: No; inclusión y uso dependen de aplicación y modelo. El historial puede omitirse, resumirse, recuperarse o faltar; longitud no garantiza memoria.

  3. ¿Recuperar un documento autoriza sus instrucciones?

    Ver la respuesta

    Respuesta correcta: No; contenido y autoridad para actuar son distintos. La aplicación debe mantener permisos al usar material externo.

  4. ¿Qué hacer con una cita plausible generada?

    Ver la respuesta

    Respuesta correcta: Verificar que la obra existe y apoya la afirmación. Formato y fluidez no demuestran procedencia ni exactitud.

Pruébalo

  • EscribePide a un asistente ficticio resumir tres reglas inventadas de biblioteca. Compara la respuesta, marca afirmaciones sin apoyo y decide qué debe decir si falta una regla. No incluyas secretos ni registros personales reales.
Referencias