Cómo elegir un modelo de IA para un proyecto: criterios, costes y una prueba propia
Cómo elegir modelo de IA para un proyecto: calidad en tu tarea, contexto, coste por token, latencia, datos en la UE y una evaluación propia de 20 a 50 casos.
Para elegir un modelo de IA para un proyecto, empieza por tu tarea y no por un ranking: define qué es una respuesta correcta, prueba tres o cuatro candidatos con entre 20 y 50 casos reales y quédate con el más barato que supere el listón. Después ajusta lo que las tablas no miden: cuánto tarda en responder, cuánto texto le cabe, dónde se procesan los datos y cuánto te costará con tu volumen real.
Esta guía repasa esos criterios por orden y termina con cómo montar la evaluación. Es para quien va a integrar un modelo en un producto por API. Si lo que quieres es saber qué asistente usar tú (ChatGPT, Claude o Gemini), la respuesta está en cuál es la mejor IA para cada cosa.
1. Calidad en tu tarea, no en un benchmark
Los benchmarks públicos sirven para saber en qué liga juega un modelo, pero casi nunca miden lo que te importa: tus documentos, tu idioma, tu formato de salida. Sus trampas (datos de entrenamiento parecidos a las pruebas, márgenes de error enormes en español) las repasamos en la comparativa de ChatGPT, Claude y Gemini.
Hay dos formas razonables de empezar, y las dos aparecen en la guía de Anthropic para elegir modelo:
- Empezar por el pequeño y subir solo si no llega. Es lo sensato para tareas acotadas y de mucho volumen: clasificar, extraer datos, enrutar peticiones.
- Empezar por el grande para saber si la tarea es posible, y luego bajar de modelo o de nivel de esfuerzo mientras la calidad aguante. Es lo sensato para tareas difíciles: razonar sobre contratos, programar, agentes.
Un detalle de 2026 que cambia la ecuación: casi todos los modelos actuales tienen un parámetro de esfuerzo de razonamiento (reasoning.effort en OpenAI, effort en Anthropic, thinking_level en Gemini). Anthropic lo resume así en su documentación: ajustar el esfuerzo suele ser mejor palanca que cambiar de modelo. Un modelo intermedio con esfuerzo alto puede ganar a uno grande con esfuerzo bajo, y al revés. Lo explicamos en modelos de razonamiento.
2. Ventana de contexto y salida máxima
La ventana de contexto es cuánto texto puede tener en cuenta el modelo a la vez: tus instrucciones, los documentos y la conversación. La salida máxima es cuánto puede escribir en una respuesta, razonamiento incluido. Se miden en tokens; en español, una palabra son de media algo más de 1,3 tokens con el tokenizador público de OpenAI (cómo se calcula está en qué es un LLM).
A 8 de octubre de 2026, los tres modelos GPT-6 de OpenAI (Astra, 6.1 Sol y Luna) admiten 1.050.000 tokens de contexto, de los que 922.000 pueden ser de entrada, y escriben hasta 128.000; por encima de 272.000 tokens de entrada, la tarifa sube. Los cuatro Claude actuales (Fable 5.1, Opus 5.5, Sonnet 5.5 y Haiku 5.5) llegan a 1.000.000 de contexto y 128.000 de salida, aunque Haiku 5.5 cobra más por encima de 100.000 tokens de entrada. En Google, Gemini 3.8 Flash y Gemini 3.1 Pro (preview) aceptan 1.048.576 tokens y escriben hasta 65.536. El primero tiene el precio rebajado hasta el 31 de diciembre de 2026; el segundo sube la tarifa por encima de 200.000 tokens de entrada.
Con un millón de tokens en casi todos los modelos punteros, casi todo cabe. Otra cosa es que convenga meterlo entero:
- Pagas cada token que envías, en cada petición. Un manual de 200.000 tokens enviado con cada pregunta a un modelo de 2 dólares por millón son 40 céntimos por pregunta antes de que el modelo escriba nada.
- Que quepa no significa que lo use bien. El estudio Lost in the Middle (2023) mostró que los modelos rinden peor cuando la información relevante está en mitad de un contexto largo. Incluye en tu evaluación casos con la respuesta enterrada en medio.
Si tus documentos son muchos o cambian a menudo, lo habitual es recuperar solo los fragmentos relevantes antes de preguntar. Esa técnica es RAG.
3. Coste: haz la cuenta con tu volumen
Los proveedores cobran por millón de tokens, por separado los de entrada y los de salida, y en la mayoría de modelos los de salida cuestan unas cinco veces más. La tabla completa y actualizada de precios está en cuánto cuesta usar la IA por API; aquí va el método con un caso.
Imagina un servicio que clasifica y resume correos de clientes: 50.000 peticiones al mes, con 1.500 tokens de entrada (instrucciones y correo) y 200 de salida visibles por petición. Son 75 millones de tokens de entrada y 10 millones de salida al mes.
| Modelo | Precio por millón (entrada / salida) | Coste al mes |
|---|---|---|
| GPT-6 Luna o Claude Haiku 5.5 | 0,10 $ / 0,50 $ | 7,50 + 5,00 = 12,50 $ |
| Gemini 3.8 Flash | 0,75 $ / 3,75 $ | 56,25 + 37,50 = 93,75 $ |
| Claude Sonnet 5.5 o GPT-6.1 Sol | 2 $ / 10 $ | 150 + 100 = 250 $ |
| Claude Opus 5.5 | 4 $ / 20 $ | 300 + 200 = 500 $ |
| GPT-6 Astra o Claude Fable 5.1 | 10 $ / 50 $ | 750 + 500 = 1.250 $ |
Precios oficiales del 8 de octubre de 2026, sin impuestos. Gemini 3.8 Flash pasa a 1,50 $ y 7,50 $ el 1 de enero de 2027, lo que dobla su coste.
Entre el primero y el último hay un factor de cien, para la misma tarea. Y falta un factor que muchos olvidan: el razonamiento se cobra como salida. Si el modelo «piensa» 800 tokens antes de cada respuesta, la salida pasa de 10 a 50 millones de tokens al mes. Con Sonnet 5.5 la factura sube de 250 a 650 dólares; con GPT-6 Luna, de 12,50 a 32,50. Mide cuántos tokens de razonamiento gasta tu tarea (aparecen en el campo de uso de cada respuesta) antes de hacer el presupuesto.
Dos descuentos que cambian la cuenta en proyectos con volumen:
- Procesamiento por lotes. OpenAI, Anthropic y Google rebajan un 50 % las peticiones que no necesitan respuesta inmediata y aceptan esperar horas.
- Caché de prompts. Si todas tus peticiones empiezan igual (las mismas instrucciones largas), la parte repetida se cobra a una fracción del precio.
4. Latencia: cuánto tarda en empezar y a qué ritmo escribe
La latencia tiene dos partes. El tiempo hasta el primer token decide si un chat se siente ágil. La velocidad de salida, en tokens por segundo, decide cuánto tarda una respuesta larga. En los modelos que razonan, el primer token visible llega después de pensar, y eso puede ser mucho tiempo.
| Modelo y configuración (índice) | Primer fragmento | Tokens por segundo |
|---|---|---|
| GPT-6 Luna sin razonamiento (18) | 0,76 s | 119 |
| DeepSeek V4.1 Flash sin razonamiento (25) | 1,06 s | 219 |
| Claude Sonnet 5.5, esfuerzo bajo (36) | 1,05 s | 101 |
| GPT-6 Astra, esfuerzo medio (50) | 5,61 s | 46 |
| Claude Haiku 5.5, esfuerzo bajo (29) | 9,93 s | 178 |
| Gemini 3.8 Flash, pensamiento alto (41) | 24,33 s | 125 |
| Claude Opus 5.5, esfuerzo alto (54) | 37,62 s | 76 |
Entre paréntesis, el índice de inteligencia de esa configuración. Fuente: Artificial Analysis, mediciones con su carga de prueba estándar, consultadas el 8 de octubre de 2026. Tus tiempos dependerán de la longitud de tus prompts y de la región.
Para un chat de atención al cliente o un asistente de voz, busca configuraciones con el primer fragmento por debajo de dos o tres segundos. Para procesos en segundo plano, la latencia da igual y puedes usar lotes a mitad de precio. Si necesitas velocidad con un modelo grande, OpenAI y Anthropic venden modos rápidos con recargo (el de Anthropic, en vista previa para Opus, promete hasta 2,5 veces más velocidad de salida).
5. Datos y privacidad: qué se guarda y dónde se procesa
Por API, los tres grandes no entrenan con tus datos por defecto en sus servicios de pago. Para un proyecto en España, lo que más cambia de uno a otro es dónde se procesan los datos y cuánto tiempo se guardan.
OpenAI
Según su documentación sobre datos, no entrena con lo que envías a la API desde marzo de 2023, salvo que lo autorices. Guarda registros de abuso hasta 30 días, y la retención cero solo se concede con aprobación previa. Para procesar en Europa ofrece el endpoint eu.api.openai.com (EEE y Suiza), con un 10 % de recargo en los modelos lanzados desde marzo de 2026.
Anthropic
Su política de retención dice que no usa tus datos para entrenar sin tu permiso expreso y que no guarda las conversaciones por defecto, salvo con Fable y Mythos, que exigen 30 días. Su API directa procesa de forma global o solo en Estados Unidos, sin opción europea. Para procesar en la UE hay que usar Claude a través de Google Cloud, con su endpoint multirregión de la UE.
Google (API de Gemini)
Según las condiciones de la API, en el nivel de pago Google no usa tus datos para mejorar sus productos; en el gratuito sí, y con revisión humana. Qué guarda depende del servicio. Para procesar en Europa, Vertex AI ofrece regiones europeas (Madrid incluida) y la multirregión eu.
Un modelo abierto en tus servidores
No entrena con tus datos, guarda lo que tú decidas y procesa donde lo alojes.
Tres matices importantes:
- El nivel gratuito de Gemini no vale para un producto en Europa. Las condiciones de la API de Gemini dicen que solo puedes usar los servicios de pago para ofrecer aplicaciones a usuarios del Espacio Económico Europeo.
- El endpoint global no garantiza nada. La documentación de Vertex AI recomienda no usar el endpoint global si tienes requisitos de procesamiento en una región concreta.
- Necesitas un acuerdo de encargo del tratamiento con el proveedor si mandas datos personales. Y si tu aplicación entra en alguna categoría regulada, mira las obligaciones del reglamento europeo de IA.
6. ¿Modelo abierto o cerrado?
Modelo cerrado por API
Te da la calidad punta y se pone en marcha en minutos. A cambio, los datos salen a un tercero, pagas por uso y las condiciones las pone el proveedor, que puede cambiar o retirar el modelo.
Modelo abierto en tu infraestructura
Los mejores abiertos están unos 12 puntos por debajo de los cerrados en el índice de Artificial Analysis (46 frente a 58, octubre de 2026). Ponerlo en marcha lleva días o semanas y alguien que lo mantenga, y pagas el hardware o el alquiler de GPU lo uses o no. A cambio, los datos no salen de tu casa y siempre tienes la misma versión. La licencia varía mucho: de Apache 2.0 a licencias con límites comerciales.
Si tus datos no pueden salir de tu infraestructura, la decisión está tomada. Si no, lo práctico es empezar con una API y plantearse un modelo abierto cuando el volumen lo justifique. Qué modelos abiertos hay y qué permite cada licencia está en los mejores modelos de IA de código abierto, y qué hardware necesitas en IA en local.
7. Lo que no sale en las tablas
- Salidas estructuradas. OpenAI, Anthropic y Google pueden obligar al modelo a responder con un JSON que cumpla tu esquema. Si tu aplicación lee la respuesta con código, es imprescindible.
- Herramientas. Si el modelo tiene que llamar a tus funciones o actuar como agente, prueba exactamente eso: Claude Opus 5.5 y Sonnet 5.5, por ejemplo, no admiten forzar el uso de una herramienta concreta.
- Versiones y retirada. Usa identificadores de versión fija y apunta la fecha de retirada. Anthropic publica en la ficha de cada modelo una fecha mínima (Opus 5.5 no se retirará antes del 22 de septiembre de 2027). Los modelos en vista previa pueden cambiar sin aviso, y los parámetros también: en los Claude actuales, cambiar
temperaturedevuelve un error.
Cómo montar tu evaluación con 20 a 50 casos
Es la parte que más rinde y la que más gente se salta. No hace falta ninguna plataforma: una hoja de cálculo y un script bastan.
1. Reúne casos reales. Entre 20 y 50 ejemplos de tu uso real, no inventados, con unos cuantos difíciles: ambiguos, largos, mal escritos.
2. Escribe la respuesta esperada o una rúbrica. Para clasificar o extraer, la respuesta exacta. Para resúmenes o redacción, criterios comprobables («menciona el importe», «no inventa fechas», «menos de 100 palabras»).
{"id": 17, "entrada": "Hola, el pedido 4471 llegó roto y quiero el dinero, no otro.", "esperado": {"categoria": "devolucion", "pide_reembolso": true, "pedido": "4471"}}
3. Automatiza la corrección. Comparación exacta o por código siempre que puedas. Para lo demás, un modelo como juez con una rúbrica clara. La guía de evaluación de Anthropic recomienda priorizar volumen: más casos con corrección automática valen más que pocos corregidos a mano.
Eres un evaluador. Compara la RESPUESTA con los CRITERIOS.
Para cada criterio, responde "cumple" o "no cumple" y cita la frase que lo justifica.
Al final, da una nota de 0 a 4 (número de criterios cumplidos). No valores el estilo.
4. Desconfía del juez. El estudio que popularizó esta técnica, Judging LLM-as-a-Judge (2023), documentó tres sesgos: favorece la respuesta que va primero, la más larga y la de su propia familia de modelos. Usa como juez un modelo de otro proveedor, alterna el orden y revisa a mano una muestra.
5. Pasa cada caso tres veces. El mismo modelo da respuestas distintas a la misma entrada; así sabes si un fallo es sistemático o mala suerte.
6. Apunta tres números por modelo: aciertos, coste por caso (con los tokens reales que devuelve la API) y tiempo de respuesta. Elige el más barato que supere tu listón, no el que más aciertos tenga.
Si prefieres no programar el bucle, hay herramientas abiertas como promptfoo o Inspect, del instituto de seguridad de IA británico. Guarda los casos en tu propio repositorio: la plataforma de evaluaciones de OpenAI, por ejemplo, cierra el 30 de noviembre de 2026.
Errores habituales
- Elegir por el anuncio. El modelo que acaba de salir puede ser peor que el anterior en tu tarea, o costar el triple.
- Presupuestar sin el razonamiento. Los tokens que el modelo piensa no se ven, pero se cobran.
- Probar con cinco ejemplos fáciles. Con tan pocos casos, todos los modelos parecen iguales.
- Olvidar dónde viven los datos hasta que lo pregunta el cliente.
Por dónde seguir
- Cuánto cuesta usar la IA por API: la tabla de precios completa y cómo pagar menos.
- Primeros pasos con la API de Claude y de OpenAI: tu primera llamada, con código.
- Cómo meter IA en tu aplicación: la arquitectura, de principio a fin.
- Qué es un LLM: tokens, contexto y temperatura explicados desde dentro.
Preguntas frecuentes
¿Puedo cambiar de modelo más adelante sin rehacer la aplicación?
Sí, si lo preparas desde el principio: mete las llamadas al modelo detrás de una función propia, guarda los prompts fuera del código y conserva tu batería de casos de prueba. Con eso, cambiar de proveedor es cambiar un adaptador y volver a pasar la evaluación. Lo que más cuesta mover son las funciones exclusivas de cada API, como herramientas integradas o agentes alojados.
¿Qué modelo de IA es mejor para un chatbot de atención al cliente?
Suele bastar un modelo pequeño y rápido (GPT-6 Luna, Claude Haiku 5.5 o un Gemini Flash) con tus documentos como contexto, porque la latencia y el coste pesan más que la inteligencia máxima. Sube a uno intermedio solo si tu evaluación muestra errores en las preguntas difíciles, y deriva a una persona lo que el bot no resuelva.
¿Necesito un contrato especial para usar una API de IA con datos personales?
Necesitas un acuerdo de encargo del tratamiento con el proveedor (los grandes lo ofrecen para su API, pero comprueba que está firmado o incorporado a tus condiciones) y revisar dónde se procesan los datos si salen del Espacio Económico Europeo. Para datos sensibles, consulta a tu delegado de protección de datos antes de enviar nada.