Cómo funciona Nivel: Avanzados

Cómo se entrena un LLM: una mirada en profundidad

Descubre cómo se entrena un LLM: desde la tokenización y el modelado autorregresivo hasta el paralelismo computacional y el postentrenamiento supervisado.

Comprender cómo se entrena un LLM exige examinar una canalización multifásica que transforma texto masivo no estructurado en una red neuronal capaz de inferir probabilidades contextuales. Este proceso no es un aprendizaje memorístico directo, sino una optimización estocástica iterativa sobre representaciones vectoriales en espacios de alta dimensionalidad.

1. Tokenización y proyección en espacios latentes

El texto plano no entra directamente a la red. El primer paso consiste en segmentar las cadenas de caracteres mediante algoritmos de subpalabras (como Byte-Pair Encoding o WordPiece). La tokenización convierte el texto en enteros discretos o tokens, los cuales reducen el tamaño del vocabulario sin perder granularidad semántica.

Posteriormente, una capa de embedding (incorporación) transforma cada token numérico en un vector continuo denso. Dado que la arquitectura Transformer carece de recurrencia secuencial intrínseca, se suman codificaciones posicionales (positional encodings) a estos vectores. Esta suma vectorial permite que las matrices de atención calculen dependencias relativas o absolutas entre elementos distantes de la secuencia.

2. Preentrenamiento autorregresivo y funciones de coste

Al analizar cómo se entrena un LLM a nivel de arquitectura, la tarea central suele ser el modelado causal del lenguaje (Causal Language Modeling). La red procesa una secuencia parcial y predice la distribución de probabilidad del siguiente token mediante el mecanismo de autoatención (self-attention).

Para ajustar los pesos del modelo se aplican los siguientes fundamentos matemáticos y computacionales:

  • Entropía cruzada (Cross-Entropy Loss): Cuantifica la divergencia entre la distribución de salida generada tras aplicar la función softmax a los logits (valores brutos no normalizados) y la distribución real del token objetivo.
  • Retropropagación y gradiente descendente: Los optimizadores (generalmente variantes de AdamW) calculan los gradientes de la pérdida respecto a miles de millones de parámetros.
  • Estabilización numérica: Durante el ciclo de optimización surgen problemas como gradientes explosivos o desvanecientes (exploding/vanishing gradients). Para contrarrestarlos, se aplica recorte de gradientes (gradient clipping) y planificadores de tasa de aprendizaje con fases de calentamiento (warmup) seguidas de decaimientos suaves.

3. Paralelismo distribuido y restricciones de hardware

La escala de memoria que demanda un modelo de lenguaje masivo excede la capacidad de cómputo de cualquier acelerador gráfico aislado. La memoria no solo almacena los pesos del modelo, sino también los estados del optimizador, los gradientes y las activaciones intermedias calculadas en la pasada hacia adelante (forward pass).

Resolver esta limitación técnica evidencia una de las mayores complejidades en cómo se entrena un LLM: el equilibrio entre latencia de comunicación y paralelismo efectivo. La industria implementa tres estrategias complementarias:

  1. Paralelismo de datos (Data Parallelism): Se replica el modelo en varios dispositivos y se distribuyen lotes (batches) de datos distintos, promediando los gradientes mediante operaciones colectivas como All-Reduce.
  2. Paralelismo de tensores (Tensor Parallelism): Se fragmentan las operaciones de multiplicación matricial internas de las capas lineales a lo largo de varios chips.
  3. Paralelismo de etapas (Pipeline Parallelism): Las capas consecutivas del Transformer se distribuyen a lo largo de una secuencia de procesadores, gestionando burbujas de inactividad temporal mediante micro-lotes.

Un fallo crítico recurrente en esta fase es la inestabilidad por precisión mixta. El cálculo en formatos de coma flotante de 16 bits (como FP16 o BF16) reduce drásticamente el tráfico de memoria, pero requiere copias maestras en 32 bits (FP32) para evitar el subdesbordamiento aritmético (underflow) de los gradientes.

4. Postentrenamiento: alineación y ajuste fino supervisado

Un modelo puramente preentrenado actúa como un completador de texto estadístico, pero carece de la habilidad para seguir directrices estructuradas de forma consistente. La etapa final de cómo se entrena un LLM se enfoca en el postentrenamiento (post-training), dividido comúnmente en dos fases:

  • Ajuste fino supervisado (Supervised Fine-Tuning o SFT): Se entrena al modelo con pares seleccionados de instrucción y respuesta canónica. En esta fase, la tasa de aprendizaje es mucho más baja para prevenir el olvido catastrófico (catastrophic forgetting), un fallo donde la red sobrescribe capacidades analíticas previas al sobreajustarse al formato conversacional.
  • Alineación con retroalimentación humana o dirigida: A través de técnicas como el aprendizaje por refuerzo a partir de preferencias, se entrena un modelo de recompensa (reward model) que puntúa las salidas generadas, o se optimizan directamente las probabilidades relativas entre respuestas deseadas e indeseadas. El reto técnico aquí radica en evitar el reward hacking, un comportamiento en el que el modelo explota sesgos métricos de la recompensa para obtener puntuaciones altas sin resolver la tarea adecuadamente.

Fuentes para ampliar

Preguntas frecuentes

¿Por qué un modelo preentrenado requiere una fase de postentrenamiento?

El preentrenamiento optimiza únicamente la predicción estadística del siguiente token sobre texto no estructurado. El postentrenamiento adapta esos pesos para que la red interprete intenciones del usuario y responda a instrucciones concretas sin desviarse del objetivo.

¿Qué función cumplen las codificaciones posicionales en el entrenamiento?

La arquitectura Transformer procesa todos los tokens de una secuencia de forma paralela en lugar de secuencial. Las codificaciones posicionales inyectan información sobre el orden de las palabras para que la autoatención distinga la sintaxis y la estructura de la frase.

¿Qué es el olvido catastrófico durante el ajuste fino?

Es un fallo de optimización donde la red ajusta sus pesos de forma excesiva a un nuevo conjunto de datos instructivos, borrando representaciones semánticas y razonamientos aprendidos durante el preentrenamiento masivo.