Ruta Estratégica en Inteligencia Artificial
Arquitectura de Modelos
La arquitectura Transformer
Cuando interactúas con un modelo como ChatGPT o Claude, no estás hablando con un simple programa de preguntas y respuestas. Debajo de la superficie se encuentra una compleja arquitectura neuronal llamada Transformer, presentada por primera vez en el revolucionario artículo de 2017, "Attention Is All You Need".
Antes de los Transformers, los modelos procesaban el texto de forma secuencial, palabra por palabra, como si leyeran una frase de izquierda a derecha. Este método, utilizado por las Redes Neuronales Recurrentes (RNNs), era lento y tenía dificultades para mantener el contexto en textos largos. El Transformer cambió las reglas del juego al procesar todas las palabras de una frase simultáneamente. Esta capacidad de procesamiento en paralelo no solo aceleró masivamente el entrenamiento, sino que también permitió una comprensión mucho más profunda del contexto.
La arquitectura Transformer, introducida en el artículo de 2017 “Attention Is All You Need,” es la base de casi todos los modelos de lenguaje grandes modernos, incluyendo GPT, Claude, LLaMA, Gemini y Mistral.
Para que un modelo matemático pueda procesar el lenguaje, primero debemos convertir las palabras en números. Este proceso comienza con la tokenización, donde el texto de entrada se divide en fragmentos más pequeños llamados tokens. Un token puede ser una palabra completa, como "gato", o una parte de una palabra, como "-mente".
A continuación, cada token se convierte en un vector numérico de alta dimensión. Este vector se conoce como embedding y su propósito es capturar el significado semántico del token y su relación con otros tokens. En este espacio vectorial, palabras con significados similares, como "rey" y "reina", estarán ubicadas cerca una de la otra.
El mecanismo de atención
La verdadera magia del Transformer reside en su mecanismo de auto-atención (self-attention). Este mecanismo permite al modelo sopesar la importancia de las diferentes palabras dentro de la misma secuencia de entrada al procesar cada palabra individualmente. No todas las palabras son igual de importantes para entender el significado de otra.
Por ejemplo, en la frase "El robot no pudo levantar la maleta porque era demasiado pesado", la palabra "pesado" se refiere a "robot" o a "maleta"? Un humano entiende por el contexto que se refiere a la maleta. La auto-atención le da al modelo una habilidad similar. Al procesar la palabra "pesado", el mecanismo asignaría una puntuación de atención más alta a "maleta" que a "robot", permitiendo al modelo capturar la dependencia correcta.
Esto se logra creando tres vectores para cada token de entrada: una Consulta (Query), una Clave (Key) y un Valor (Value). Piensa en ello como una búsqueda en una base de datos. La Consulta es la pregunta sobre el token actual. Las Claves de todos los demás tokens se comparan con esta Consulta para determinar su relevancia (la puntuación de atención). Los Valores de cada token se ponderan según estas puntuaciones y se suman para producir el resultado final: una nueva representación del token actual que está enriquecida con el contexto de toda la secuencia.
Tipos de modelos y memoria
Los modelos Transformer que encontramos no son todos iguales. Se pueden clasificar en dos grandes categorías según su entrenamiento.
Modelos Base: Son el producto del entrenamiento inicial masivo sobre enormes cantidades de texto de internet. Su único objetivo es predecir la siguiente palabra en una secuencia. Aunque no están diseñados para conversar o seguir órdenes, son la base sobre la que se construyen modelos más útiles. Poseen un vasto conocimiento del mundo, pero carecen de la capacidad de aplicarlo de forma dirigida.
Modelos Afinados por Instrucciones (Instruction-tuned): Estos son modelos base que han pasado por una segunda fase de entrenamiento llamada "fine-tuning". En esta etapa, se les entrena con un conjunto de datos más pequeño y de alta calidad que consiste en pares de "instrucción-respuesta". Este proceso les enseña a seguir órdenes, responder preguntas y mantener una conversación coherente. ChatGPT y Claude son ejemplos de modelos afinados por instrucciones.
| Característica | Modelo Base | Modelo Afinado por Instrucciones |
|---|---|---|
| Objetivo Principal | Predecir la siguiente palabra | Seguir instrucciones y conversar |
| Datos de Entrenamiento | Texto masivo no estructurado | Pares de instrucción-respuesta curados |
| Capacidad | Conocimiento general del mundo | Habilidad para aplicar conocimiento |
| Ejemplo | GPT-3 (versión inicial) | ChatGPT, Claude, Llama 3-Instruct |
Una limitación fundamental de la arquitectura Transformer es su ventana de contexto (context window). Esta es la cantidad máxima de tokens que el modelo puede tener en cuenta en un momento dado, tanto de la entrada del usuario como de su propia respuesta generada. Es, en esencia, la memoria a corto plazo del modelo.
Si una conversación excede la ventana de contexto, el modelo comenzará a "olvidar" las partes más antiguas de la conversación. Esta es la razón por la que un LLM puede perder el hilo en un diálogo muy largo. Los modelos más recientes tienen ventanas de contexto cada vez más grandes, lo que les permite manejar tareas más complejas que requieren recordar información de textos extensos, pero el límite siempre existe.
Ahora que entiendes los pilares de la arquitectura Transformer, es hora de poner a prueba tus conocimientos.
¿Cuál fue la principal innovación de la arquitectura Transformer en comparación con modelos anteriores como las Redes Neuronales Recurrentes (RNNs)?
En la frase "El perro persiguió al gato hasta que se cansó", el mecanismo de auto-atención ayudaría al modelo a entender que "cansó" se refiere más probablemente a...
Entender estos conceptos es clave para ir más allá del uso básico de los LLMs y empezar a comprender cómo y por qué funcionan de la manera en que lo hacen.