ModelosGuía

Qué es un LLM y cómo funciona por dentro, explicado sin fórmulas

Qué es un LLM y cómo funciona: tokens con un ejemplo real en español, predicción del siguiente token, atención, entrenamiento, contexto y por qué alucina.

10 min

Un LLM (large language model, modelo de lenguaje grande) es un programa entrenado con enormes cantidades de texto para hacer una sola cosa: predecir cuál es el siguiente trozo de texto. ChatGPT, Claude y Gemini son LLM con una interfaz de chat encima. Todo lo que parecen saber hacer, desde responder preguntas hasta programar, sale de repetir esa predicción una y otra vez, una pieza cada vez.

Esta guía explica cómo funciona eso por dentro sin una sola fórmula: qué son los tokens (con un ejemplo real en español), qué hace la atención, cómo se entrena un modelo, qué es la ventana de contexto, para qué sirve la temperatura y por qué a veces se inventa cosas. Si buscas el panorama general de la IA que crea texto, imágenes o vídeo, eso está en qué es la IA generativa.

Qué significa cada letra

  • Large (grande) se refiere al número de parámetros, los valores numéricos que el modelo ajusta durante el entrenamiento. GPT-3, en 2020, tenía 175.000 millones y pareció enorme. En 2026, el mayor modelo descargable, Kimi K3, tiene 2,8 billones. OpenAI, Anthropic y Google no publican el tamaño de los suyos.
  • Language (lenguaje) porque se entrena con texto: webs, libros, código, artículos científicos. Los modelos actuales también aceptan imágenes, audio o vídeo, pero el núcleo sigue siendo el mismo.
  • Model (modelo) porque es una representación estadística aprendida de los datos, no una base de datos que se consulta.

Los tokens: el texto convertido en números

Un LLM no lee letras ni palabras. Lee tokens, trozos de texto que pueden ser una palabra entera, una parte de una palabra o un signo. Antes de llegar al modelo, un programa llamado tokenizador corta el texto y sustituye cada trozo por un número de su vocabulario.

Este es un ejemplo real. Lo hemos calculado con o200k_base, el tokenizador público de OpenAI que la librería tiktoken asigna a GPT-4o, GPT-4.1, o3 y GPT-5. Su vocabulario tiene unos 200.000 tokens.

Frase:   El pingüino comió 12345 sardinas.
Tokens:  El | ping | ü | ino | com | ió | ␣ | 123 | 45 | sard | inas | .
Total:   12 tokens para 5 palabras

Se ve la lógica: las palabras y los trozos frecuentes son un token, y lo raro se parte. «Pingüino» se queda en tres piezas por la diéresis; los números se cortan de tres en tres cifras. En cambio, palabras comunes como « lenguaje», « palabras» o « inteligencia» (con el espacio delante, que forma parte del token) son un solo token.

El español gasta más tokens que el inglés porque los tokenizadores se han construido con más texto en inglés. Para medirlo usamos el artículo 1 de la Declaración Universal de Derechos Humanos, que tiene versión oficial en ambos idiomas: «All human beings are born free and equal…» en inglés y «Todos los seres humanos nacen libres e iguales…» en español.

InglésEspañol
Palabras3028
Tokens con o200k_base (de GPT-4o a GPT-5)3338
Tokens con cl100k_base (GPT-4)3344

Con el tokenizador antiguo, el español necesitaba un 33 % más de tokens que el inglés para decir lo mismo; con el nuevo, un 15 % más. Importa porque las APIs cobran por token y porque la ventana de contexto se mide en tokens. Como referencia, Google indica que un token son unos 4 caracteres en sus modelos, y Anthropic que un millón de tokens son unas 555.000 palabras con el tokenizador actual de Claude. Cada empresa usa el suyo, así que la misma frase da cifras distintas en cada modelo.

Lo único que hace: predecir el siguiente token

Con el texto convertido en números, el modelo hace un cálculo que termina en una lista de probabilidades: una para cada token de su vocabulario. Si el texto es «La capital de Francia es», el token « París» se lleva casi toda la probabilidad. El programa elige un token, lo añade al texto y vuelve a empezar con el texto un poco más largo. Así, token a token, se escribe una respuesta entera. Esta forma de generar se llama autorregresiva.

Por eso los asistentes escriben la respuesta poco a poco en pantalla: es literalmente así como se genera. Un modelo rápido produce del orden de cien tokens por segundo: Claude Sonnet 5.5, por ejemplo, entre 100 y 130 según las mediciones de Artificial Analysis.

Parece demasiado simple para explicar lo que hacen estos modelos. La clave es que, para predecir bien el siguiente token en millones de textos distintos, el modelo tiene que haber aprendido gramática, hechos, estilos, razonamientos y hasta a programar. Predecir bien obliga a modelar bien.

Dentro del modelo: el transformer y la atención

Casi todos los LLM actuales usan la arquitectura transformer, presentada por investigadores de Google en 2017 en el artículo Attention Is All You Need. Lo que pasa dentro, simplificado:

  1. Cada token se convierte en un vector, una lista de miles de números que representa su significado. Tokens parecidos acaban con vectores parecidos.
  2. Esos vectores pasan por decenas de capas. DeepSeek V4.1 Flash tiene 40; Hy4 de Tencent, 78. En cada capa, el vector de cada token se va enriqueciendo con información del resto del texto.
  3. La atención es el mecanismo que hace ese enriquecimiento. En cada capa, cada token «mira» a los demás y decide cuánto le importa cada uno para entender su propio significado.

Un ejemplo con el mismo tokenizador. En «Me senté en el banco del parque» y en «Pedí un préstamo al banco», la palabra « banco» es exactamente el mismo token, el número 46197. El modelo recibe lo mismo en las dos frases. Es la atención la que, al relacionar « banco» con « parque» o con « préstamo», convierte ese número idéntico en dos significados distintos.

Los modelos más grandes de 2026 añaden un truco para no hacer todo el cálculo con todos los parámetros: la mezcla de expertos (MoE). El modelo está dividido en muchos bloques especializados y cada token solo activa unos pocos. Kimi K3 tiene 2,8 billones de parámetros, pero cada token usa 104.000 millones. Por eso su velocidad se parece más a la de un modelo de ese tamaño.

Cómo se entrena: tres fases

1. Preentrenamiento: leer casi todo

El modelo empieza con parámetros aleatorios y lee una cantidad gigantesca de texto intentando predecir cada siguiente token. Cada vez que falla, sus parámetros se ajustan un poco. DeepSeek V4.1 Flash se entrenó con 45 billones de tokens; ALIA-40b, el modelo del Barcelona Supercomputing Center, con 9,8 billones en 35 lenguas europeas. Mistral Large 3 se entrenó desde cero con 3.000 gráficas H200.

Durante años se pensó que bastaba con hacer modelos más grandes. El estudio Chinchilla de DeepMind (2022) mostró que el tamaño y la cantidad de datos deben crecer a la vez: su modelo de 70.000 millones de parámetros, entrenado con cuatro veces más datos, superó a uno de 280.000 millones con el mismo cálculo.

El resultado de esta fase es un modelo base: sabe continuar textos, pero no sabe conversar. Si le escribes una pregunta, igual la continúa con otras tres preguntas, como si fuera un examen.

2. Ajuste fino con instrucciones

Después se le enseñan miles de ejemplos de conversaciones bien resueltas, escritas o revisadas por personas: una petición y una buena respuesta. Así aprende el formato de asistente: contestar a lo que se pregunta, seguir instrucciones, decir que no a ciertas peticiones.

3. Aprendizaje por refuerzo

La última fase afina el comportamiento con recompensas. La técnica que lo popularizó es el RLHF (aprendizaje por refuerzo a partir de preferencias humanas): personas comparan varias respuestas, se entrena un modelo que aprende sus preferencias y el LLM se ajusta para producir las preferidas. El artículo de OpenAI sobre InstructGPT (2022) mostró su efecto: los evaluadores preferían las respuestas de un modelo de 1.300 millones de parámetros ajustado así a las de GPT-3, con 175.000 millones.

Hay variantes. Anthropic usa desde 2022 la IA constitucional, donde parte de las valoraciones las hace un modelo guiado por una lista de principios. DPO (2023) consigue un efecto parecido sin entrenar un modelo de recompensa aparte. Y desde finales de 2024 se usa cada vez más el refuerzo con recompensas comprobables (si el código pasa los tests, si la cuenta da el resultado correcto), que es lo que ha dado lugar a los modelos de razonamiento.

La ventana de contexto: la memoria de trabajo

El modelo no recuerda nada entre una petición y otra. En cada petición recibe un texto completo (tus instrucciones, los documentos, toda la conversación hasta ese momento) y genera la respuesta a partir de él. La cantidad máxima de texto que puede recibir es la ventana de contexto.

En octubre de 2026, los modelos punteros de OpenAI, Anthropic y Google admiten alrededor de un millón de tokens: varios libros de una vez. Cuando una app dice que «recuerda» algo de otra conversación, lo que hace es guardar ese dato y volver a meterlo como texto en el contexto.

Dos matices. Más contexto cuesta más, porque se paga cada token que entra en cada petición. Y que quepa no significa que se use igual de bien: el estudio Lost in the Middle (2023) mostró que los modelos encuentran peor la información situada en mitad de un contexto largo que al principio o al final.

Además del contexto, cada modelo tiene una fecha de corte: lo que pasó después de sus datos de entrenamiento no lo sabe, salvo que lo busque en internet. Los Claude 5.5 tienen corte en junio de 2026; GPT-6 Astra, en abril de 2026.

La temperatura: por qué no responde siempre igual

Al elegir el siguiente token, el programa no siempre coge el más probable. Sortea entre los candidatos según sus probabilidades. La temperatura controla ese sorteo:

  • Baja (cerca de 0): casi siempre gana el más probable. Respuestas más previsibles y repetibles, útiles para extraer datos o clasificar.
  • Alta: los tokens menos probables tienen más opciones. Más variedad, útil para generar ideas, y más riesgo de que el texto se desvíe.

En la API de OpenAI la temperatura va de 0 a 2. En la práctica, cada vez se toca menos: los modelos que razonan gestionan la variabilidad de otra forma, y en los Claude actuales cambiarla devuelve un error. Por eso la misma pregunta puede dar dos respuestas distintas, y por eso conviene probar un prompt varias veces antes de fiarte de él.

Por qué se inventa cosas

Un LLM no consulta una base de datos: genera el texto más plausible según lo que aprendió. Casi siempre lo plausible coincide con lo cierto, pero no siempre. Si le preguntas por la biografía de alguien poco conocido, puede producir fechas y datos con el tono exacto de una biografía real, porque eso es lo que sabe hacer.

Dos investigaciones recientes ayudan a entenderlo. OpenAI publicó en septiembre de 2025 Why Language Models Hallucinate, que concluye que los modelos alucinan porque el entrenamiento y las evaluaciones premian adivinar frente a reconocer que no saben: en un examen tipo test, contestar al azar puntúa más que dejarlo en blanco. Y Anthropic, al rastrear qué pasa dentro de Claude (marzo de 2025), encontró que por defecto el modelo tiende a decir que no sabe, y que ese freno se desactiva cuando reconoce algo como conocido. Cuando ese reconocimiento falla (le suena un nombre pero no sabe nada de él), se inventa la respuesta.

Cómo reducir el problema en la práctica, con ejemplos, está en por qué la IA se inventa cosas.

¿Entiende lo que dice?

Es una pregunta abierta, pero hay datos. La misma investigación de Anthropic encontró que, al escribir un poema que rima, Claude elige la palabra de la rima antes de escribir el verso, es decir, planifica. Y que para sumar usa a la vez dos caminos: uno calcula una cifra aproximada y otro la última cifra exacta. No es como lo hacemos nosotros, pero tampoco es repetir frases memorizadas. Lo prudente es tratarlo como una herramienta muy capaz que se equivoca de formas distintas a las nuestras.

Por dónde seguir

Preguntas frecuentes

¿Qué diferencia hay entre un LLM y ChatGPT?

El LLM es el modelo: el archivo de parámetros que predice texto. ChatGPT es un producto que usa varios LLM de OpenAI (en octubre de 2026, GPT-6 Sol o GPT-6 Luna según el plan) y les añade una interfaz, memoria, búsqueda web, generación de imágenes y otras herramientas. Con Claude y Gemini pasa lo mismo: el nombre se usa a la vez para el modelo y para la app.

¿Un LLM aprende de lo que le escribo?

No mientras hablas: sus parámetros no cambian durante la conversación, y lo que parece memoria es texto que la app vuelve a meter en el contexto. Lo que sí puede pasar es que la empresa use tus conversaciones para entrenar versiones futuras, si no lo has desactivado en los ajustes de privacidad.

¿Cuántos parámetros tienen GPT-6, Claude o Gemini?

No se sabe: OpenAI, Anthropic y Google no publican el tamaño de sus modelos. Los abiertos sí lo hacen. El más grande descargable a octubre de 2026, Kimi K3 de Moonshot, tiene 2,8 billones de parámetros, de los que usa 104.000 millones en cada token.

Escrito por

Equipo editorial

No te pierdas nada.

Lo importante de la semana en IA, en un email que se lee en cinco minutos.