ModelosGuía

Modelos de razonamiento: qué son, cuándo compensan y cuánto cuesta que la IA piense

Qué son los modelos de razonamiento de IA, cómo se activa el razonamiento extendido en ChatGPT, Claude y Gemini, cuánto cuesta pensar y cuándo compensa.

9 min

Un modelo de razonamiento es un modelo de lenguaje entrenado para «pensar» antes de contestar: genera primero una cadena de pasos intermedios (plantear el problema, probar caminos, comprobar resultados) y solo después escribe la respuesta. Compensa en problemas de varios pasos con una solución comprobable, como matemáticas, programación, planificación o análisis de documentos complejos. No compensa en tareas sencillas, porque ese pensamiento se cobra y se espera: puede multiplicar el coste y el tiempo de respuesta por diez o más.

En octubre de 2026, los modelos punteros de OpenAI, Anthropic y Google razonan todos, y lo que eliges ya no es si razonan sino cuánto. Esta guía explica cómo funciona, cómo se controla en cada uno, cuánto cuesta y en qué tareas merece la pena.

Qué es exactamente un modelo de razonamiento

La idea viene de una técnica de 2022. El artículo Chain-of-Thought Prompting, de investigadores de Google, mostró que si en el prompt se incluyen ejemplos resueltos paso a paso, los modelos grandes resuelven mucho mejor problemas de aritmética, sentido común y lógica. Escribir los pasos les deja «espacio» para calcular.

El salto llegó cuando dejó de ser un truco del prompt y pasó a ser parte del entrenamiento. OpenAI presentó o1 el 12 de septiembre de 2024 en Learning to reason with LLMs: un modelo entrenado con aprendizaje por refuerzo para usar bien su cadena de pensamiento. Su hallazgo central fue que el rendimiento mejora de forma constante con más entrenamiento y también con más tiempo pensando al responder. En el examen de matemáticas AIME de 2024, GPT-4o resolvía el 12 % de los problemas; o1, el 74 % con un intento por problema, el 83 % votando entre 64 intentos y el 93 % eligiendo la mejor de 1.000 respuestas.

En enero de 2025, DeepSeek-R1 demostró, con pesos abiertos y publicado después en Nature, que esa capacidad se puede conseguir mediante aprendizaje por refuerzo puro, sin necesitar ejemplos de razonamiento escritos por personas. Desde entonces, casi todos los modelos nuevos lo incorporan.

Tres conceptos que aparecen en todas partes:

  • Tokens de razonamiento: el texto que el modelo genera para pensar. No forma parte de la respuesta, pero ocupa contexto y se cobra.
  • Cómputo en inferencia (test-time compute): gastar más cálculo en el momento de responder, en lugar de solo durante el entrenamiento. Es lo que haces al subir el nivel de esfuerzo.
  • Razonamiento extendido o pensamiento extendido: el nombre que le dio Anthropic al modo de Claude que piensa antes de responder. Hoy ha evolucionado a pensamiento adaptativo, en el que el modelo decide cuánto piensa según la pregunta.

Si quieres entender qué es un token y cómo genera texto un modelo, empieza por qué es un LLM.

Cómo se activa en ChatGPT, Claude y Gemini

En las apps se elige con un selector; por API, el control es más fino y cada proveedor lo llama de una forma. Así está a 8 de octubre de 2026.

OpenAI: ChatGPT y su API

En ChatGPT, el selector ofrece Instant, Medium y High, y los planes Pro añaden Extra High, Pro Standard y Pro Extended. Desde septiembre ya no cambia sola de Instant a razonamiento en Plus y Pro, y Gratis y Go tienen desde agosto un botón Think para preguntas difíciles.

En la API, el parámetro es reasoning.effort, con valores entre none, minimal, low, medium, high, xhigh y max según el modelo. GPT-6 Astra no admite none, y GPT-6.1 Sol empieza en low y usa medium por defecto. Con reasoning.mode: pro, el modelo hace todavía más trabajo.

Anthropic: Claude y su API

En la app de Claude, el menú del modelo tiene un nivel de esfuerzo (bajo, medio, alto, extra alto y máximo) y un interruptor de pensamiento. Con los modelos 5.5 el pensamiento no se puede apagar; el esfuerzo sí se ajusta.

En la API se controla con output_config.effort (low, medium, high, xhigh y max) y con el parámetro thinking. En Opus 5.5 y Fable 5.1 el pensamiento adaptativo está siempre activo; Haiku 5.5 permite apagarlo hasta el nivel high. Un ejemplo, según su documentación, para pedir a Opus 5.5 que piense más de lo habitual y devuelva un resumen de su razonamiento:

{
  "model": "claude-opus-5-5",
  "max_tokens": 16000,
  "thinking": { "type": "adaptive", "display": "summarized" },
  "output_config": { "effort": "high" },
  "messages": [{ "role": "user", "content": "Revisa este contrato y lista las cláusulas que permiten rescindirlo..." }]
}

Google: Gemini y su API

En la app de Gemini se elige el modelo (Flash o Pro) y, solo en el plan Ultra, el modo Deep Think desde la barra de escritura. En la API, el parámetro es thinking_level, con minimal, low, medium o high según el modelo. Los modelos actuales piensan por defecto, y Gemini 3.8 Flash admite de low a high.

Modelos abiertos

Cada uno lo hace a su manera: gpt-oss va de low a high, y DeepSeek V4 y GLM-5.3 usan reasoning_effort con low, high y max.

Los nombres coinciden a medias: el medium de un proveedor no equivale al de otro, ni siquiera entre dos modelos del mismo fabricante. Anthropic advierte en su guía que los niveles de Sonnet 5.5 están recalibrados respecto a Sonnet 5 y pide repetir las pruebas al cambiar de modelo.

Cuánto cuesta pensar

Los tres grandes cobran el razonamiento como tokens de salida, los más caros, aunque no veas ese texto. Lo dicen sus documentaciones: OpenAI («se facturan como tokens de salida»), Anthropic (se cobra el pensamiento completo, no el resumen que te devuelve) y Google (el precio de la respuesta es la suma de los tokens de salida y los de pensamiento).

Cuánto razona un modelo depende de la pregunta. OpenAI indica que puede generar desde unos cientos hasta decenas de miles de tokens de razonamiento. Hagamos la cuenta con Claude Sonnet 5.5 (2 dólares por millón de tokens de entrada y 10 por millón de salida) para una pregunta de 300 tokens con una respuesta visible de 400:

RazonamientoCoste de la preguntaVeces más caro
Ninguno0,0046 $1
5.000 tokens0,0546 $12
30.000 tokens0,3046 $66

La diferencia está en la salida cobrada, que pasa de 400 tokens a 5.400 y a 30.400.

Las mediciones de Artificial Analysis del 8 de octubre de 2026 muestran el mismo efecto con su batería de pruebas: cuánto sube la inteligencia, el coste por tarea y la espera al subir el esfuerzo de un mismo modelo.

Modelo y esfuerzo (índice)Coste por tareaPrimer fragmento de respuesta
Claude Opus 5.5, bajo (42)0,55 $8,7 s
Claude Opus 5.5, medio (51)1,34 $22,5 s
Claude Opus 5.5, alto (54)1,82 $37,6 s
Claude Opus 5.5, máximo (58)5,98 $731 s
GPT-6 Astra, bajo (46)0,82 $3,0 s
GPT-6 Astra, medio (50)1,54 $5,6 s
GPT-6 Astra, máximo (53)3,26 $414 s
GPT-6 Luna, sin razonamiento (18)0,01 $0,8 s
GPT-6 Luna, máximo (38)0,07 $111 s

Entre paréntesis, el índice de inteligencia de cada configuración.

Pasar de esfuerzo alto a máximo en Opus 5.5 añade 4 puntos de índice, multiplica el coste por más de tres y la espera por casi veinte. A veces merece la pena. Casi nunca por defecto.

Cuándo compensa y cuándo no

Los tres fabricantes coinciden bastante en sus guías. Google recomienda pensamiento mínimo o bajo para recuperar datos o clasificar, el nivel por defecto para comparar conceptos y el máximo para programación avanzada, matemáticas o planificación de varios pasos. OpenAI reserva none para voz, recuperación rápida de información y clasificación, y xhigh para investigación profunda, revisión de código y seguridad, «solo cuando tus pruebas muestren un beneficio claro». Anthropic avisa de que el nivel máximo, en la mayoría de tareas, «añade un coste significativo a cambio de mejoras relativamente pequeñas» y puede llevar a pensar de más.

Compensa razonar en:

  • Problemas con varias restricciones a la vez. Organizar un calendario, un reparto de turnos o un presupuesto con condiciones que se cruzan.
  • Programación difícil. Encontrar la causa de un fallo, cambios que tocan muchos archivos, revisar código en busca de errores.
  • Matemáticas, cálculos y lógica, donde cada paso depende del anterior.
  • Análisis de documentos largos con preguntas que exigen cruzar datos. «¿Qué cláusulas de estos tres contratos se contradicen?»
  • Agentes que tienen que planificar qué herramientas usar y en qué orden.

No compensa en:

  • Traducir, resumir un texto corto o corregir la ortografía.
  • Extraer campos de un documento con formato conocido.
  • Clasificar mensajes en categorías fijas.
  • Preguntas de dato concreto («¿cuándo se fundó tal empresa?»): pensar no le da el dato si no lo sabe; buscar en internet, sí.
  • Chats o asistentes de voz donde importa responder en un segundo.

Un ejemplo de tarea donde el razonamiento marca diferencia, para que lo pruebes tú en modo rápido y en modo con razonamiento:

Tengo que repartir 6 turnos de guardia (lunes a sábado) entre Ana, Luis y Marta.
Cada persona hace exactamente 2 turnos. Ana no puede ni lunes ni martes.
Luis no puede hacer dos días seguidos. Marta tiene que hacer el sábado.
Dame un reparto válido y comprueba cada condición al final.

Tiene varias soluciones válidas, pero para encontrarlas hay que probar combinaciones y descartar: justo el tipo de planificación con restricciones para el que los fabricantes recomiendan subir el razonamiento. Compara las dos respuestas y comprueba tú cada condición. Para la mayoría de preguntas del día a día, en cambio, el modo rápido suele bastar.

Lo que el razonamiento visible no te cuenta

Las apps muestran una sección desplegable con «lo que ha pensado» el modelo. No es el razonamiento real:

  • Es un resumen. OpenAI no expone los tokens de razonamiento, solo un resumen opcional. Anthropic dice expresamente que ningún ajuste devuelve el razonamiento en bruto y que el resumen lo hace otro modelo. Google devuelve también resúmenes de pensamiento.
  • Puede no reflejar lo que de verdad decidió la respuesta. Anthropic publicó en abril de 2025 un estudio, Reasoning models don’t always say what they think, en el que daba pistas a los modelos dentro del prompt. Claude 3.7 Sonnet mencionó en su razonamiento la pista que había usado solo el 25 % de las veces, y DeepSeek R1, el 39 %.
  • Un razonamiento largo no garantiza una respuesta correcta. Da sensación de rigor, pero el modelo puede razonar con soltura sobre un dato equivocado. Por qué ocurre está en por qué la IA se inventa cosas.

Por dónde seguir

Preguntas frecuentes

¿Los modelos de razonamiento se equivocan menos?

En problemas con una respuesta comprobable (matemáticas, lógica, código), sí, y mucho. En datos concretos no necesariamente: pueden inventar una cifra o una cita con la misma seguridad que un modelo normal, y además envuelta en un razonamiento largo que la hace parecer más fiable. Comprueba igual los datos importantes.

¿Sirve de algo pedirle a la IA que piense paso a paso?

Con un modelo sin razonamiento, sí: es la técnica de cadena de pensamiento, que mejora los resultados en problemas de varios pasos. Con los modelos de razonamiento actuales no hace falta, porque ya lo hacen por su cuenta en tokens aparte. Algunos, como los Claude más recientes, pueden incluso negarse si les pides que vuelquen su razonamiento interno en la respuesta.

¿Qué son Deep Think o el modo Pro?

Son modos que gastan todavía más cálculo en cada respuesta. Gemini Deep Think, en el plan Ultra, explora varias hipótesis en paralelo y suele tardar unos minutos. El modo Pro de OpenAI hace más trabajo de modelo para la respuesta final y se factura con las tarifas normales del modelo, pero con muchos más tokens.

Escrito por

Equipo editorial

No te pierdas nada.

Lo importante de la semana en IA, en un email que se lee en cinco minutos.