Fundamentos de IA Nivel: Novatos

Qué son los tokens en IA: explicado desde cero

Un token es una pieza de texto que utiliza un modelo de lenguaje. Este ejemplo muestra por qué una frase puede dividirse en varias piezas.

Ejemplo de la frase La IA explica ideas dividida en cinco piezas de texto ilustrativas, con los espacios señalados
Ejemplo simplificado: una frase puede separarse en varias piezas llamadas tokens. Cada modelo puede dividirla de otra forma.

En un modelo de lenguaje, un token es una unidad de texto definida por su tokenizador. Puede representar una palabra, parte de ella o incluso un carácter. El sistema convierte esas unidades en identificadores numéricos para procesarlas; el corte exacto depende del modelo.

Para comprender qué son los tokens en IA, sirve una analogía: son como piezas de construcción de diferentes tamaños. A veces un token coincide con una palabra corta; otras, con un fragmento, un signo de puntuación o una letra.

La unidad básica del lenguaje para las máquinas

El texto que escribimos en una pantalla está lleno de matices, espacios y signos. Antes de que un modelo pueda generar una respuesta o resumir un párrafo, debe aplicar un proceso previo llamado tokenización.

La tokenización consiste en tomar una cadena de caracteres y cortarla en bloques estandarizados según un catálogo predefinido llamado vocabulario. Si el sistema encuentra una palabra común, es probable que la asigne como una unidad completa. Si encuentra una palabra rara, técnica o compuesta, la dividirá en fragmentos más pequeños para poder trabajar con ella sin saturar su lista interna de elementos reconocidos.

Por eso no basta con contar palabras: una misma frase puede requerir más o menos tokens según el tokenizador empleado.

Cómo se divide una frase en la práctica

Observemos cómo se comporta un divisor de texto con ejemplos cotidianos. Tomemos una expresión breve:

  • “El gato juega en el jardín.”

Un tokenizador podría conservar algunas palabras completas y separar otras en fragmentos. El punto final puede ser un token independiente o combinarse con otro fragmento. No hay una única división válida para todos los modelos.

Ahora pensemos en una palabra más larga:

  • “Desafortunadamente no pudimos contactarlo.”

Un tokenizador puede dividir “Desafortunadamente” en varios fragmentos, pero no podemos afirmar cuáles serán sin consultar el tokenizador concreto. Así puede representar palabras nuevas o poco frecuentes mediante piezas ya disponibles.

Los espacios en blanco, las tildes, los emojis y las mayúsculas también pueden influir en el corte final. Un espacio no siempre se cuenta como token independiente: a veces queda unido al fragmento que viene después.

Por qué los modelos no leen palabras completas

Podría parecer más intuitivo que las máquinas trabajaran directamente con palabras enteras, pero ese enfoque presenta dos grandes inconvenientes prácticos:

  1. Tamaño inmanejable del vocabulario: Un idioma vivo contiene cientos de miles de palabras, a las que se suman conjugaciones verbales, diminutivos, erratas comunes y tecnicismos. Intentar almacenar cada variante entera exigiría catálogos gigantescos e ineficientes.
  2. Menor flexibilidad ante lo desconocido: Un catálogo formado solo por palabras completas necesitaría una estrategia adicional para representar erratas o neologismos. Los fragmentos de subpalabras ayudan a procesar términos nuevos con piezas conocidas.

Trabajar a nivel de subpalabras equilibra el tamaño del catálogo con la flexibilidad para procesar múltiples idiomas, código informático y errores comunes de escritura.

La relación entre tokens y límites de procesamiento

Los modelos de lenguaje tienen una capacidad limitada de información que pueden procesar a la vez, denominada habitualmente ventana de contexto. Este límite determina cuánto contenido puede tener en cuenta el modelo al formular una respuesta; no equivale a una memoria permanente.

La ventana de contexto se mide directamente en tokens, no en páginas ni en palabras. Todo cuenta dentro de ese presupuesto:

  • La instrucción o pregunta que formula el usuario.
  • Los documentos o fragmentos de texto adjuntos.
  • El historial previo de la conversación.
  • La respuesta que el propio sistema va a generar.

Si una petición supera ese límite, el servicio puede rechazarla, recortarla o resumir parte del historial, según su implementación. Conocer qué son los tokens en IA permite entender por qué una conversación muy larga puede provocar respuestas incompletas o la pérdida de detalles anteriores.

Fuentes y revisión

Preguntas frecuentes

¿Un token equivale siempre a una palabra exacta?

No. Según el tokenizador, puede corresponder a una palabra, parte de ella, un carácter o un signo de puntuación.

¿Los signos de puntuación y los espacios consumen tokens?

Influyen en el recuento, pero no tienen por qué ser tokens separados: un espacio o un signo puede formar parte del mismo token que otro fragmento. El resultado exacto depende del tokenizador.

¿Por qué importa el número de tokens al usar una herramienta?

Porque tanto la entrada como la salida ocupan parte de la capacidad de contexto del modelo y, en algunos servicios, afectan al coste de uso.