IAGuía

Qué es la IA generativa: cómo funciona, ejemplos y límites

La IA generativa crea texto, imágenes, audio, vídeo y código a partir de una instrucción. Cómo funciona, ejemplos con herramientas actuales, costes y límites.

13 min

La IA generativa es la inteligencia artificial que crea contenido nuevo (texto, imágenes, audio, vídeo o código) a partir de una instrucción escrita en lenguaje normal. Lo consigue porque ha aprendido los patrones de enormes cantidades de ejemplos y genera algo que encaja con ellos, no porque consulte una base de datos. ChatGPT, Claude, Gemini, Midjourney o Suno son IA generativa.

Qué es la IA generativa y en qué se diferencia de la IA de siempre

Durante décadas, la IA que usábamos sin saberlo servía para clasificar o predecir: decidir si un correo es spam, si una transacción parece fraude, qué serie te va a gustar. Su salida es una etiqueta o un número.

La IA generativa hace otra cosa: produce un contenido que antes no existía. Le pides «un correo para reclamar una factura duplicada, tono firme pero educado» y escribe el correo. Le pides «una ilustración de un faro en estilo acuarela» y dibuja el faro.

Cambia también cómo la usas y cómo se equivoca. La IA predictiva devuelve una etiqueta, una cifra o una recomendación («este correo es spam, 97 %»), suele ir integrada en un sistema sin que la veas y su error típico es clasificar mal. La generativa devuelve un texto, una imagen, un audio, un vídeo o un programa («aquí tienes la respuesta al cliente»), la usas conversando con ella o desde una herramienta, y su error típico es inventarse algo que suena convincente.

Las dos son aprendizaje automático y conviven: el buscador de tu móvil usa IA predictiva para ordenar resultados y, desde hace poco, IA generativa para redactarte un resumen encima.

Cómo funciona, en cuatro ideas

No hace falta saber matemáticas para entender lo esencial. Si quieres el detalle técnico de los modelos de texto (tokens, atención, entrenamiento), está en qué es un LLM y cómo funciona por dentro.

1. Aprende de una cantidad enorme de ejemplos. Un modelo de texto se entrena con billones de tokens (trozos de palabra) sacados de libros, webs y código: Meta, por ejemplo, preentrenó Llama 3 con más de 15 billones. Uno de imágenes aprende de miles de millones de imágenes con su descripción, como LAION-5B, un conjunto abierto de 5.850 millones de pares de imagen y texto del que salieron los datos de las primeras versiones de Stable Diffusion. En ese entrenamiento ajusta miles de millones de números internos (los parámetros) hasta capturar los patrones: cómo se construye una frase, qué aspecto tiene un faro, cómo suena una voz.

2. Genera prediciendo. Un modelo de texto escribe un trozo de palabra (un token) cada vez: calcula cuál es el siguiente más probable dado todo lo anterior, lo añade y repite. Los modelos de imagen y vídeo suelen funcionar por difusión: parten de ruido aleatorio y lo van limpiando, paso a paso, hasta que aparece una imagen que encaja con tu descripción.

3. Se ajusta para obedecer. Un modelo recién entrenado solo sabe continuar textos. Para que siga instrucciones, responda con educación y rechace peticiones peligrosas, se le hace un segundo entrenamiento con ejemplos de buenas respuestas y con valoraciones de personas (la técnica se llama RLHF). Eso es lo que convierte un predictor de texto en un asistente.

4. No consulta: reconstruye. El modelo no tiene dentro una enciclopedia que mire antes de responder. Genera lo que es plausible según sus patrones. Casi siempre lo plausible coincide con lo cierto; cuando no, el resultado es una alucinación: una cita, una cifra o una sentencia inventadas con total aplomo. Por qué pasa y cómo evitarlo, en por qué la IA se inventa cosas.

Dos piezas más completan el cuadro. Los modelos multimodales entienden y generan varios tipos de contenido a la vez (le das una foto y te la describe; le das un texto y te devuelve audio). Y los asistentes actuales ya no dependen solo de lo que aprendieron: muchos buscan en internet o leen tus documentos antes de responder, lo que reduce los errores en datos recientes.

De dónde viene: los hitos que la trajeron hasta aquí

La base técnica es reciente. En 2014, Ian Goodfellow presentó las GAN, dos redes que compiten para generar imágenes realistas. En 2017, investigadores de Google publicaron «Attention Is All You Need», la arquitectura Transformer en la que se basan casi todos los modelos de texto actuales. En 2020, OpenAI presentó GPT-3, con 175.000 millones de parámetros, capaz de hacer tareas nuevas a partir de unos pocos ejemplos sin reentrenarlo.

El salto al gran público llegó en 2022. En abril apareció DALL·E 2 y en agosto Stable Diffusion, con los pesos del modelo publicados para que cualquiera lo ejecutara. El 30 de noviembre, OpenAI lanzó ChatGPT y la IA generativa pasó de los laboratorios a la conversación diaria. En 2023, GPT-4 empezó a aceptar imágenes además de texto, mientras Claude, Gemini y Llama completaban el panorama. En 2024 y 2025 llegaron los modelos que razonan antes de responder, el vídeo con sonido generado y los primeros agentes que encadenan tareas por su cuenta.

El ritmo no ha bajado. Solo entre septiembre y octubre de 2026, Anthropic publicó su familia de modelos Claude 5.5, Google anunció Gemini 4 y OpenAI llevó GPT-6 a todos los planes de ChatGPT, mientras cerraba su generador de vídeo Sora. Por eso en esta guía las herramientas van con fecha.

Qué puede generar: ejemplos por tipo de contenido

Lo que hay a octubre de 2026 para cada tipo de contenido, con un ejemplo de instrucción y su límite principal (los precios están más abajo).

Texto

Es lo que hacen ChatGPT y compañía. Un asistente de texto redacta un correo, resume un informe de 80 páginas, reescribe un texto para otro público, traduce, extrae datos de un documento, responde preguntas o te explica un contrato. Los grandes cambian cada pocas semanas: a octubre de 2026, OpenAI acaba de llevar su familia GPT-6 a ChatGPT, Anthropic ofrece Claude Opus 5.5 y Fable 5.1, y Google usa Gemini 3.1 Pro en su app mientras prepara Gemini 4. También están Microsoft Copilot, Le Chat (de la francesa Mistral) y DeepSeek. Cuál elegir para cada cosa, en ChatGPT, Claude o Gemini. Su límite principal es que se inventan datos con aplomo.

Un ejemplo de instrucción que funciona, porque da contexto, tono, límites y formato:

Eres responsable de atención al cliente de una tienda online de
bicicletas. Responde a este correo de un cliente que se queja de un
retraso de 10 días en su pedido. Tono cercano, sin excusas genéricas.
Ofrécele un cupón del 10 % y una fecha de entrega concreta: el jueves.
Máximo 120 palabras.

[correo del cliente]

Imágenes

Los generadores de imagen crean una ilustración o una foto realista a partir de una descripción y, cada vez más, editan fotos existentes con una instrucción («quita a la persona del fondo», «pon esta taza sobre una mesa de mármol»). Los más conocidos son los de Google (la familia Nano Banana, integrada en Gemini), el de OpenAI dentro de ChatGPT (GPT Image), Midjourney (en su versión 8.2), FLUX, de Black Forest Labs, y Adobe Firefly, que se presenta como «comercialmente seguro» porque se entrena con contenido de Adobe Stock con licencia y de dominio público. Sirven para ilustraciones, fotos de producto y bocetos. Sus límites son los derechos de autor y las marcas (logotipos o personajes ajenos) y la coherencia entre varias imágenes, como mantener el mismo personaje en una serie.

Fotografía de producto de una taza de cerámica azul sobre una mesa de
madera clara. Luz natural lateral de ventana, fondo desenfocado,
formato cuadrado, sin texto ni logotipos.

Vídeo

Generar vídeo ya es práctico para clips cortos: un plano de recurso, un anuncio para redes, una animación de producto. La referencia es Veo 3.1, de Google, que genera vídeo con sonido en 1080p o 4K, junto con Runway y Kling. Google añadió en 2026 Gemini Omni, que convierte cualquier entrada (texto, imagen, vídeo) en vídeo y, en su versión 1.1, alarga los clips hasta 40 segundos. Sora, el generador de OpenAI que popularizó el formato, ya no está disponible: su API cerró el 24 de septiembre de 2026.

Plano lento de 8 segundos: una cafetera italiana empieza a borbotear
sobre un fogón de gas. Vapor visible, luz de primera hora de la mañana,
sonido del café subiendo.

El límite es el coste y la duración. Por la API de Google, Veo 3.1 en 1080p cuesta 0,40 dólares por segundo: un minuto, 24 dólares, sin contar las tomas que descartes.

Voz y música

En voz, ElevenLabs genera locuciones naturales en más de 90 idiomas, incluido el español, dobla vídeos y clona voces; también transcribe audio. En música, Suno y Udio componen canciones completas con letra y voz a partir de una descripción, y Google tiene Lyria 3.5, que crea canciones de hasta tres minutos, útiles como música para vídeos. Los límites aquí son el consentimiento (clonar una voz exige el permiso de su dueño) y los derechos musicales.

La música es uno de los terrenos con más pleitos. Warner Music llegó a un acuerdo con Suno en noviembre de 2025 y con Udio ese mismo mes; Universal también firmó con Udio. En Alemania, la sociedad de autores GEMA anunció en julio de 2026 que había ganado a Suno ante un tribunal de Múnich. Antes de usar una canción generada en algo comercial, revisa la licencia de tu plan: la versión gratuita de Suno, por ejemplo, no da derechos comerciales.

Código

Los asistentes de programación escriben funciones, explican código ajeno, buscan errores y, en su versión de agente, hacen cambios en un proyecto entero y ejecutan las pruebas. Los más conocidos son GitHub Copilot, Cursor, Claude Code y Codex, de OpenAI. Sus límites: pueden introducir errores de seguridad y recomendar librerías que no existen, así que su código se revisa como el de cualquier compañero. Cómo empezar sin perder el control, en programar con IA.

Escribe una función en Python que lea un CSV de facturas con las
columnas cliente, fecha e importe, y devuelva el total facturado por
cliente. Añade pruebas para un archivo vacío y para importes con coma
decimal.

Para qué se usa en el trabajo

En España se usa más que la media europea. Según Eurostat, el 32,7 % de los europeos de 16 a 74 años usó herramientas de IA generativa en los tres meses anteriores a la encuesta de 2025; en España fue el 37,9 %, según el INE. Para trabajar la usó el 17,9 % de los españoles, frente al 15,4 % de media en la UE.

En las empresas, la adopción está todavía empezando. En 2025, el 20,3 % de las empresas españolas de 10 o más empleados usaba alguna IA (20,0 % en la UE); el 8,9 % la usaba para generar texto, voz o código (8,8 % en la UE) y el 11,4 % para generar imágenes, vídeo o audio (9,6 % en la UE). Los datos son de Eurostat (conjuntos isoc_ai_iaiu e isoc_eb_ai) y del INE; la próxima actualización de las empresas está prevista para diciembre de 2026.

Los usos más habituales en una oficina, de más sencillo a más avanzado:

  • Redactar y reescribir: correos, propuestas, descripciones de producto, actas a partir de unas notas.
  • Resumir y extraer: informes, contratos, transcripciones de reuniones, facturas en PDF convertidas en una tabla. Para documentos largos, mira la mejor IA para resumir PDF.
  • Atención al cliente: borradores de respuesta o chatbots que responden con la documentación de la empresa (con la técnica RAG). Klarna, por ejemplo, anunció en 2024 que su asistente atendió 2,3 millones de conversaciones en su primer mes, dos tercios de su servicio de chat (cifras de la propia empresa).
  • Marketing y diseño: imágenes para redes, variaciones de un anuncio, guiones de vídeo.
  • Análisis: subir una hoja de cálculo y pedir tendencias, gráficos o anomalías.
  • Automatizar procesos encadenando pasos con un agente: lo que funciona y lo que no, en agentes de IA en empresas.

Cuánto cuesta usar la IA generativa

Hay dos formas de pagar: una suscripción para usarla tú desde la web o la app, o la API, que se paga por uso y sirve para meterla en tus propios programas.

Suscripciones (octubre de 2026)

Todos tienen versión gratuita (la de Copilot, con límites). Esto cuestan los planes de pago:

ServicioPlan básico de pagoPlanes superiores
ChatGPTGo, 8 $/mes; Plus, 20 $/mesPro, de 100 a 500 $/mes
ClaudePro, 20 $/mesMax, desde 100 $/mes
GeminiAI Plus, 4,99 €/mes; AI Pro, 21,99 €/mesAI Ultra, desde 99,99 €/mes
Microsoft 365 CopilotPersonal, 10 €/mesPremium, 22 €/mes
Le Chat (Mistral)Pro, 14,99 $/mesTeam, 24,99 $ por usuario

Claude Pro baja a 17 $ al mes si pagas el año entero. Los precios en dólares son los que publican las empresas; en España se cobran en euros con impuestos y pueden variar. Para la mayoría de usos personales, la versión gratuita basta para empezar; el plan de unos 20 dólares o euros al mes compensa cuando la usas a diario o necesitas los modelos más capaces y límites más altos. Si buscas opciones sin coste, en las mejores herramientas de IA están las gratuitas que merecen la pena.

Por API: un cálculo real

Por API se paga por tokens, los trozos de texto que el modelo lee y escribe, con precios por millón. Un ejemplo con los precios oficiales a 8 de octubre de 2026: clasificar y resumir 1.000 correos de clientes, con unos 1.000 tokens de entrada y 200 de salida cada uno (1 millón de tokens leídos y 200.000 escritos).

ModeloPrecio por millón (entrada / salida)Coste de los 1.000 correos
Claude Haiku 5.50,10 $ / 0,50 $0,20 $
GPT-6 Luna0,10 $ / 0,50 $0,20 $
Gemini 3.1 Flash-Lite0,25 $ / 1,50 $0,55 $
Claude Sonnet 5.52 $ / 10 $4 $
GPT-6.1 Sol2 $ / 10 $4 $
Gemini 3.1 Pro (preview)2 $ / 12 $4,40 $

Para una tarea así, un modelo pequeño suele bastar y cuesta veinte veces menos. Los precios completos y cómo calcular los tuyos, en cuánto cuesta usar la IA por API.

Límites y riesgos que conviene conocer

Se inventa cosas

Es el límite más importante. Un modelo de texto puede darte una cita, una sentencia o una cifra falsas con el mismo tono que las verdaderas. Las causas y cómo reducirlo, en por qué la IA se inventa cosas.

Sesgos

Aprende de lo que hay en internet, con sus estereotipos incluidos. Si pides «un directivo» o «una enfermera», un generador puede devolverte el cliché de sus datos. Conviene revisar los resultados que van a ver otras personas, sobre todo si afectan a decisiones sobre ellas.

Derechos de autor

Hay dos frentes. El primero, con qué se entrenan los modelos: Anthropic pactó pagar 1.500 millones de dólares a autores de libros en el caso Bartz, con aprobación definitiva en julio de 2026; un tribunal de Múnich dio la razón a GEMA frente a OpenAI en noviembre de 2025 porque ChatGPT reproducía letras de canciones, y en el Reino Unido Getty Images perdió casi todo su pleito contra Stability AI.

El segundo, de quién es lo que generas. En España, la Ley de Propiedad Intelectual considera autor a «la persona natural» que crea la obra, y en Estados Unidos la Oficina de Derechos de Autor concluyó en enero de 2025 que escribir un prompt no basta para ser autor: hace falta una aportación humana creativa (seleccionar, ordenar, modificar). En la práctica, lo generado sin más puede no estar protegido, y las condiciones de cada herramienta marcan qué puedes hacer con ello.

Privacidad

Lo que escribes en un chatbot sale de tu ordenador y se procesa en los servidores del proveedor. No pegues datos personales de clientes, contraseñas ni información confidencial en una cuenta personal; revisa en la configuración si tus conversaciones se usan para entrenar y, para uso profesional, usa los planes de empresa, que ofrecen garantías contractuales. Si necesitas que nada salga de tu equipo, hay modelos que funcionan en local.

Energía

Una consulta de texto gasta poco: Google midió que la mediana de una petición a Gemini consumía 0,24 vatios hora en mayo de 2025, lo que gasta un televisor en menos de nueve segundos. El problema es la escala. La Agencia Internacional de la Energía calcula que los centros de datos usaron el 1,5 % de la electricidad mundial en 2024 (415 teravatios hora) y que su consumo rondará los 945 en 2030, algo más de lo que gasta hoy todo Japón, con la demanda de los centros dedicados a IA multiplicada por más de cuatro.

Ley y transparencia

En la Unión Europea, el reglamento de IA ya obliga a avisar cuando hablas con un chatbot y a marcar el contenido generado, y prohíbe algunos usos. Qué te afecta, en el reglamento europeo de IA. Y si te preguntas si algo que ves está hecho con IA, en cómo saber si un texto, imagen o vídeo está hecho con IA.

Cómo empezar a usarla bien

  1. Empieza con un asistente gratuito (ChatGPT, Claude o Gemini) y una tarea real que hagas cada semana: un informe, un correo difícil, un resumen.
  2. Dale contexto. Quién eres, para quién es, qué tono, qué extensión y qué formato. La diferencia entre «escribe un correo» y una instrucción completa es enorme.
  3. Pásale tu material. Un documento, una tabla, ejemplos de lo que te gusta. Cuanto menos tenga que suponer, menos se inventa.
  4. Itera. La primera respuesta es un borrador: pide cambios concretos («más corto», «quita la segunda idea», «en tono más directo»).
  5. Verifica antes de usar. Datos, cifras, nombres y citas, siempre en la fuente.

Por dónde seguir

Preguntas frecuentes

¿Qué diferencia hay entre la IA generativa y un LLM?

Un LLM (modelo de lenguaje grande) es un tipo de modelo de IA generativa: el que trabaja con texto. La IA generativa incluye también los modelos que crean imágenes, vídeo, voz o música, que suelen funcionar con otras técnicas, como la difusión.

¿Puedo usar en mi negocio lo que genero con IA?

En general sí, pero depende de las condiciones de cada herramienta (algunos planes gratuitos no dan derechos comerciales) y de que el resultado no copie obras, marcas o personas reales. Además, lo generado sin aportación creativa humana puede no estar protegido por derechos de autor, así que otros podrían reutilizarlo.

¿La IA generativa aprende de lo que le escribo?

Depende del servicio y del plan. Algunos proveedores usan las conversaciones de las cuentas personales para mejorar sus modelos salvo que lo desactives en la configuración; los planes de empresa suelen excluirlo por contrato. Revisa la política de privacidad de la herramienta antes de compartir información sensible.

Escrito por

Equipo editorial

No te pierdas nada.

Lo importante de la semana en IA, en un email que se lee en cinco minutos.