SoftwareComparativa

Precio de la API de OpenAI, Claude y Gemini: cuánto cuesta de verdad usar la IA

Precios oficiales por millón de tokens de OpenAI, Claude y Gemini a octubre de 2026, qué es un token en español y cuánto cuestan un chatbot o 1.000 resúmenes.

11 min

Usar la IA por API se paga por tokens, los trozos de texto que el modelo lee y escribe. A 8 de octubre de 2026, los modelos más baratos de OpenAI (GPT-6 Luna) y de Anthropic (Claude Haiku 5.5) cuestan 0,10 dólares por millón de tokens de entrada y 0,50 por millón de salida, y los más potentes (GPT-6 Astra y Claude Fable 5.1), 10 y 50 dólares. Con esos precios, resumir 1.000 correos cuesta entre 14 céntimos y 14 dólares según el modelo que elijas.

Abajo tienes la tabla oficial, cuántos tokens gasta el español (lo hemos medido) y tres cálculos con la cuenta a la vista.

Precios por millón de tokens (octubre de 2026)

Precios estándar en dólares por millón de tokens, copiados el 8 de octubre de 2026 de las páginas oficiales de OpenAI, Anthropic y Google. Son tarifas sin impuestos. Los tres primeros modelos son de OpenAI, los cuatro siguientes de Anthropic y los últimos de Google.

Modelo (ID en la API)EntradaSalida
GPT-6 Astra (gpt-6-astra)10,0050,00
GPT-6.1 Sol (gpt-6.1-sol)2,0010,00
GPT-6 Luna (gpt-6-luna)0,100,50
Claude Fable 5.1 (claude-fable-5-1)10,0050,00
Claude Opus 5.5 (claude-opus-5-5)4,0020,00
Claude Sonnet 5.5 (claude-sonnet-5-5)2,0010,00
Claude Haiku 5.5 (claude-haiku-5-5)0,100,50
Gemini 3.1 Pro, preview (gemini-3.1-pro-preview)2,0012,00
Gemini 3.8 Flash (gemini-3.8-flash)0,753,75
Gemini 3.5 Flash-Lite (gemini-3.5-flash-lite)0,302,50
Gemini 2.5 Flash-Lite (gemini-2.5-flash-lite)0,100,40

La caché y los lotes rebajan estos precios; lo vemos más abajo.

Las letras pequeñas que cambian la cuenta:

  • Contexto largo. En OpenAI, si la entrada pasa de 272.000 tokens, el precio sube (GPT-6 Astra pasa a 20 dólares de entrada y 75 de salida). En Gemini 3.1 Pro, a partir de 200.000 tokens la entrada cuesta 4 dólares y la salida 18. Claude Haiku 5.5 cuesta 0,50 y 2,50 si el prompt supera los 100.000 tokens. El resto de modelos de Claude cobra lo mismo en toda su ventana de un millón de tokens.
  • Gemini 3.8 Flash sube en enero. Los precios de la tabla valen hasta el 31 de diciembre de 2026. Desde el 1 de enero de 2027, Google cobrará 1,50 dólares de entrada y 7,50 de salida.
  • Gemini 3.1 Pro sigue en preview y no tiene nivel gratuito. Gemini 3.8 Flash y los Flash-Lite sí lo tienen.
  • Los modelos anteriores siguen disponibles, a menudo más caros que los nuevos. GPT-5.5 cuesta 5 dólares de entrada y 30 de salida, y Claude Opus 5, 5 y 25.

Qué es un token y cuántos gasta el español

Un token es el trozo en que el modelo divide el texto: una palabra, parte de una palabra o un signo. Se cobran por separado los de entrada (lo que envías) y los de salida (lo que el modelo genera).

Las reglas que publican los proveedores están pensadas para el inglés:

  • OpenAI: un token son unos 4 caracteres o 0,75 palabras de texto en inglés.
  • Google: unos 4 caracteres; 100 tokens son entre 60 y 80 palabras en inglés.
  • Anthropic: con su tokenizador actual, un millón de tokens son unas 555.000 palabras o 2,5 millones de caracteres, sin decir en qué idioma. Ese tokenizador, estrenado con Claude Opus 4.7, genera alrededor de un 30 % más de tokens que el anterior.

Como no hay una cifra oficial para el español, la hemos medido. Pasamos un corpus de 4.226 palabras de artículos divulgativos en español por tiktoken, la librería pública de OpenAI, con la codificación o200k_base, que tiktoken 0.14.0 asigna a GPT-4o y a GPT-5.5 (todavía no reconoce los GPT-6). Salieron 5.615 tokens: 1,33 tokens por palabra y 4,35 caracteres por token.

En la práctica, con o200k_base una página de 500 palabras son unos 665 tokens, y un millón de tokens da para unas 750.000 palabras. Con la estimación de Anthropic para Claude salen 1,8 tokens por palabra: unos 900 tokens por página y unas 555.000 palabras por millón.

Para que ninguna cuenta de este artículo se quede corta, en los cálculos usamos 1,8 tokens por palabra para todos los modelos, la cifra más alta. Con OpenAI, según nuestra medición, saldrían alrededor de un 25 % menos de tokens.

Lo que encarece la factura sin que lo veas

La salida es la cara. En casi todos los modelos de la tabla, un token de salida cuesta 5 veces lo que uno de entrada; en Gemini 3.1 Pro, 6 veces; en Gemini 3.5 Flash-Lite, más de 8, y en Gemini 2.5 Flash-Lite, 4. Una respuesta larga pesa más que un documento largo.

El razonamiento se cobra como salida. Los tokens que el modelo usa para «pensar» antes de responder se facturan como salida aunque no los veas, según OpenAI, Anthropic y Google. Se controla con el parámetro de esfuerzo (reasoning.effort en OpenAI, effort en Claude): para tareas sencillas, bájalo. Más en modelos de razonamiento.

El historial se reenvía en cada turno. Las API no recuerdan la conversación: en cada mensaje vuelves a mandar las instrucciones y todo lo anterior, así que en un chat la entrada crece con cada turno.

Las herramientas también son tokens. Las definiciones de las funciones que le das al modelo se cobran como entrada, y Anthropic añade un prompt de sistema propio: 286 tokens en Claude Opus 5.5.

La región cuesta un 10 % más. OpenAI cobra un 10 % más en sus endpoints de residencia de datos (modelos publicados desde el 5 de marzo de 2026); Anthropic multiplica por 1,1 si exiges inferencia solo en Estados Unidos, y los endpoints regionales de Claude en Bedrock y Google Cloud llevan el mismo recargo.

La búsqueda web va aparte. OpenAI y Anthropic cobran 10 dólares por cada 1.000 búsquedas, más los tokens del contenido que el modelo lee. Google da 5.000 búsquedas gratis al mes en los Gemini 3 y luego cobra 14 dólares por cada 1.000.

Cómo pagar menos: lotes, caché y el modelo justo

Procesamiento por lotes

Si no necesitas la respuesta al momento, los tres proveedores cobran la mitad por las peticiones enviadas en lote (batch). Es lo indicado para grandes volúmenes que pueden esperar.

Caché de prompts

Si muchas peticiones empiezan igual (las mismas instrucciones, el mismo documento), la parte repetida se lee de la caché a una fracción del precio. Cada proveedor lo hace a su manera.

En OpenAI, desde GPT-5.6, la caché es automática a partir de 1.024 tokens. Escribir en ella cuesta 1,25 veces el precio de entrada y leer, 0,1 veces (0,05 en GPT-6.1 Sol), y lo guardado sigue disponible 30 minutos desde el último uso. Por millón de tokens leídos: 1,00 dólares en GPT-6 Astra, 0,10 en GPT-6.1 Sol y 0,01 en GPT-6 Luna.

En Anthropic se activa con un campo cache_control en la petición. Escribir cuesta 1,25 veces el precio de entrada si la caché dura 5 minutos, o 2 veces si dura 1 hora, y cada lectura la renueva. Leer cuesta 0,1 veces la entrada, salvo en Opus 5.5 y Sonnet 5.5 (0,05) y en Fable 5.1 (0,025). Por millón de tokens leídos: 0,25 dólares en Fable 5.1, 0,20 en Opus 5.5, 0,10 en Sonnet 5.5 y 0,01 en Haiku 5.5.

En Google se llama caché de contexto, tiene precio propio en cada modelo y cobra además el almacenamiento por horas. Por millón de tokens leídos: 0,20 dólares en Gemini 3.1 Pro, 0,075 en 3.8 Flash (0,1 veces su entrada), 0,03 en 3.5 Flash-Lite y 0,01 en 2.5 Flash-Lite. Guardarlos en 3.8 Flash cuesta 0,50 dólares por millón de tokens y hora.

Datos de las guías de caché de OpenAI y Anthropic y de la tabla de Google, a 8 de octubre de 2026. La caché solo funciona si el principio del prompt es idéntico byte a byte: pon lo fijo delante y lo que cambia al final.

El modelo justo

En la generación actual de OpenAI y de Anthropic, el modelo de gama alta cuesta 100 veces más que el pequeño. Empieza por el pequeño y sube solo si no llega; en cómo elegir modelo de IA explicamos cómo probarlo con tus propios casos.

Tres cálculos con la cuenta a la vista

Todas las cuentas usan los precios de la tabla y 1,8 tokens por palabra: tokens de entrada por su precio más tokens de salida por el suyo, entre un millón.

Resumir 1.000 correos

Supuestos: cada correo tiene 400 palabras y le añadimos 100 de instrucciones. Son 500 palabras, unos 900 tokens de entrada. Cada resumen tiene 60 palabras, unos 108 tokens de salida. En total, 900.000 tokens de entrada y 108.000 de salida.

ModeloCuenta (entrada + salida)Total
GPT-6 Luna o Claude Haiku 5.50,9 × 0,10 + 0,108 × 0,500,14 $
Gemini 3.8 Flash0,9 × 0,75 + 0,108 × 3,751,08 $
Claude Sonnet 5.5 o GPT-6.1 Sol0,9 × 2 + 0,108 × 102,88 $
GPT-6 Astra o Claude Fable 5.10,9 × 10 + 0,108 × 5014,40 $

Si el modelo razona 300 tokens por correo, la salida pasa de 108.000 a 408.000 tokens. Con Haiku 5.5 el total sube a 0,29 dólares; con Sonnet 5.5, a 5,88. Con la API de lotes, cualquier fila de la tabla cuesta la mitad.

Un chatbot con 10.000 conversaciones al mes

Supuestos: unas instrucciones de sistema de 2.000 tokens (tono, normas y datos del negocio), conversaciones de 4 turnos, mensajes del usuario de 40 palabras (72 tokens) y respuestas de 120 palabras (216 tokens).

Como cada turno reenvía las instrucciones y todo lo anterior, la entrada crece en cada turno: 2.072, 2.360, 2.648 y 2.936 tokens. Son 10.016 tokens de entrada y 864 de salida por conversación; al mes, 100,16 millones de tokens de entrada y 8,64 millones de salida.

ModeloEntrada + salidaTotal al mes
GPT-6 Luna o Claude Haiku 5.510,02 $ + 4,32 $14,34 $
Gemini 3.8 Flash75,12 $ + 32,40 $107,52 $
Claude Sonnet 5.5 o GPT-6.1 Sol200,32 $ + 86,40 $286,72 $
Claude Opus 5.5400,64 $ + 172,80 $573,44 $
GPT-6 Astra o Claude Fable 5.11.001,60 $ + 432,00 $1.433,60 $

Ahora con caché. Las instrucciones de sistema se repiten en los 4 turnos: 8.000 tokens por conversación, 80 millones al mes. Con Claude Sonnet 5.5 (o GPT-6.1 Sol, que tiene los mismos precios de caché):

  • Mejor caso, la caché siempre caliente: 80 millones leídos a 0,10 son 8 dólares; los otros 20,16 millones de entrada, a 2 dólares, son 40,32; la salida sigue en 86,40. Total: 134,72 dólares.
  • Peor caso, una escritura por conversación y tres lecturas: 20 millones escritos a 2,50 son 50 dólares; 60 millones leídos a 0,10 son 6; más 40,32 y 86,40. Total: 182,72 dólares.

La caché recorta entre un 36 % y un 53 % la factura de este chatbot. Estas cuentas no incluyen razonamiento: si cada respuesta razona 200 tokens de media, la salida pasa de 8,64 a 16,64 millones de tokens, y con Sonnet 5.5 eso son 80 dólares más al mes. Para un chatbot de atención al cliente, un esfuerzo bajo suele bastar.

Clasificar 100.000 tickets en lote

Supuestos: cada ticket tiene 150 palabras y las instrucciones otras 150 (540 tokens de entrada); la respuesta es una etiqueta de unos 10 tokens. En total, 54 millones de tokens de entrada y 1 millón de salida, enviados con la API de lotes a mitad de precio.

Con GPT-6 Luna o Claude Haiku 5.5, en lote: 54 × 0,05 + 1 × 0,25 = 2,95 dólares (5,90 sin lote). Con Gemini 3.8 Flash: 54 × 0,375 + 1 × 1,875 = 22,13 dólares (44,25 sin lote). Con Claude Sonnet 5.5: 54 × 1 + 1 × 5 = 59 dólares (118 sin lote).

Para clasificar no hace falta razonar: en GPT-6 Luna puedes poner reasoning.effort a none, y en Claude, el esfuerzo en low.

Límites de gasto: lo que conviene configurar el primer día

Los tres proveedores tienen niveles con un gasto mensual máximo que sube con tu historial de pagos, y te dejan poner tu propio tope por debajo.

OpenAI

Funciona con crédito prepago: la compra mínima es de 5 dólares y la recarga automática viene activada al configurar el pago. El nivel sube con lo que has comprado en total, y cada uno tiene un límite de uso mensual: Free, 100 dólares; Build (5 dólares comprados), 500; Launch (100 dólares), 5.000, y Grow (500 dólares), 200.000. Por debajo puedes fijar un límite duro para la organización o para cada proyecto.

Anthropic

También es de prepago: compras el crédito en la Console. El tope mensual es de 500 dólares en el nivel Start, 1.000 en Build y 200.000 en Scale, y puedes poner tu propio límite de gasto para la organización o para cada espacio de trabajo.

Google (Gemini)

Google está pasando la API de Gemini a prepago, con una compra mínima de 5 dólares al cambiar de modalidad. El tope es de 250 dólares en Tier 1, 2.000 en Tier 2 y de 20.000 a más de 100.000 en Tier 3. En AI Studio puedes poner un tope por proyecto, todavía experimental y con unos 10 minutos de retraso en los datos, así que puedes pasarte un poco.

Fuentes: niveles de OpenAI y sus límites de gasto; límites de Anthropic; facturación de Gemini. Datos a 8 de octubre de 2026.

En OpenAI y en Anthropic, el crédito caduca al año y no se devuelve. Y la recarga automática de OpenAI, activada por defecto, es por donde crece la factura si se filtra una clave (qué hacer, en se ha filtrado tu API key).

Por dónde seguir

Preguntas frecuentes

¿Pago si la respuesta se corta o la petición falla?

Anthropic no cobra las peticiones que fallan, pero sí las que iban a salir bien aunque tu programa se desconecte o agote el tiempo de espera. En OpenAI, si la respuesta se queda sin espacio por el límite max_output_tokens, pagas la entrada y el razonamiento aunque no recibas texto visible.

¿Se puede probar la API sin pagar?

Gemini tiene un nivel gratuito, a cambio de que Google pueda usar lo que envías para mejorar sus productos. Anthropic da una pequeña cantidad de crédito a las cuentas nuevas. En OpenAI lo habitual es cargar el mínimo, 5 dólares, que da para miles de pruebas con un modelo barato.

¿Los precios de la API incluyen el IVA?

No. Los tres proveedores publican sus tarifas en dólares y sin impuestos. El IVA que corresponda se aplica en la factura según el país y según si compras como particular o como empresa.

Escrito por

Equipo editorial

No te pierdas nada.

Lo importante de la semana en IA, en un email que se lee en cinco minutos.