Ollama: cómo usar IA en tu ordenador gratis y sin internet
Tutorial de Ollama paso a paso: instalarlo en Windows, Mac o Linux, elegir modelo, los comandos básicos, su API local y cómo conectarlo a Open WebUI.
Ollama es un programa gratuito y de código abierto que descarga y ejecuta modelos de lenguaje en tu propio ordenador, con Windows, macOS o Linux. Lo instalas, eliges un modelo (Gemma 4 de Google, Qwen 3.6 de Alibaba, gpt-oss de OpenAI…) y conversas con él en una ventana, en la terminal o desde tus programas a través de una API local. Sin cuotas y sin que lo que escribes salga del equipo.
Los comandos y ejemplos de esta guía salen de la documentación oficial de Ollama a octubre de 2026 (versión estable 0.40.1, del 7 de octubre). Si no sabes si tu ordenador da para esto, empieza por qué necesitas para ejecutar IA en local.
Qué es Ollama exactamente
Ollama hace tres cosas a la vez:
- Gestiona modelos: los descarga de su biblioteca, los guarda en tu disco y los borra cuando ya no los quieres.
- Los ejecuta: usa la tarjeta gráfica si la hay (NVIDIA, AMD o la GPU de un Mac con chip M) y, si no, el procesador.
- Los sirve: abre un servidor en tu ordenador, en
http://localhost:11434, al que pueden conectarse otras aplicaciones.
Ollama no es un modelo: los modelos son de Google, Alibaba, Meta, OpenAI o Mistral, cada uno con su licencia. Su código está en GitHub con licencia MIT.
Desde el 30 de julio de 2025, en Windows y macOS trae además una aplicación con chat propio: descargas modelos, conversas y arrastras un PDF o un archivo de texto sin abrir la terminal.
Cómo instalar Ollama en Windows, macOS y Linux
Los requisitos de cada sistema son los de la documentación oficial a octubre de 2026: Windows, macOS, Linux y GPU.
Windows
Necesitas Windows 10 22H2 o posterior, en edición Home o Pro, y, si tienes una gráfica NVIDIA, el controlador 551.61 o posterior. Descarga el instalador OllamaSetup.exe desde ollama.com/download y ejecútalo. No pide permisos de administrador y necesita al menos 4 GB libres solo para el programa. También vale este comando de PowerShell:
irm https://ollama.com/install.ps1 | iex
Ollama queda funcionando en segundo plano y el comando ollama responde en cualquier terminal.
macOS
Pide macOS Sonoma (14) o posterior. En un Mac con chip M, Ollama usa el procesador y la gráfica; en uno con Intel, solo el procesador. Descarga Ollama.dmg y arrastra la aplicación a Aplicaciones, o usa el mismo script de terminal que en Linux. Al abrir la aplicación, si no encuentra el comando ollama en la terminal, te pide permiso para instalarlo.
Linux
Un solo comando, el que indica la página oficial de Linux:
curl -fsSL https://ollama.com/install.sh | sh
El script lo instala como servicio de systemd, que arranca con el sistema. Para actualizar, se repite el mismo comando. Si prefieres no ejecutar un script descargado, la documentación explica la instalación manual con el paquete. Para usar una gráfica NVIDIA hace falta el controlador 550 o posterior; para una AMD, ROCm 7.
Con Docker
La imagen oficial es ollama/ollama. Solo con CPU:
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Con NVIDIA, instala antes el NVIDIA Container Toolkit y añade --gpus=all. En Docker Desktop para Mac no hay aceleración por GPU (guía de Docker).
Para comprobar que todo está en marcha, en cualquier sistema:
ollama -v
Tu primer modelo en dos minutos
La forma más directa es escribir ollama a secas: abre un menú que te guía para elegir un modelo local o iniciar sesión para usar los de la nube. Si ya sabes qué quieres, el ejemplo de la guía de inicio oficial es este:
ollama run gemma4:e2b
Si no está en tu disco, lo descarga y abre una conversación. Gemma 4 E2B es la versión más pequeña de Gemma 4 (4,6 GB en 4 bits, con texto e imagen), y Ollama recomienda para ella 8 GB de memoria de vídeo libres o de memoria unificada en un Mac.
Dentro de la conversación:
- Escribe
/byepara salir. - Envuelve el texto entre
"""para escribir en varias líneas. - Con modelos que aceptan imágenes, pon la ruta del archivo en la pregunta:
ollama run gemma4 "¿Qué hay en esta imagen? /ruta/foto.png". /set parameter num_ctx 8192amplía la memoria de la conversación (lo explicamos en los problemas habituales).
Los comandos de Ollama que vas a usar
Los de la referencia oficial de la CLI, con lo que hace cada uno:
| Comando | Para qué sirve |
|---|---|
ollama run modelo | Abre un chat; descarga el modelo si falta |
ollama pull modelo | Solo descarga (o actualiza) el modelo |
ollama ls (o ollama list) | Lista los modelos que tienes en el disco |
ollama ps | Modelos cargados y si usan GPU o CPU |
ollama stop modelo | Saca el modelo de la memoria sin borrarlo |
ollama rm modelo | Borra el modelo del disco |
ollama show --modelfile modelo | Enseña la configuración del modelo |
ollama create nombre -f Modelfile | Crea un modelo personalizado (ver más abajo) |
ollama serve | Arranca el servidor a mano |
ollama launch | Abre Claude Code, Codex u OpenCode con Ollama |
ollama signin / signout | Entra o sale de tu cuenta |
ollama serve solo hace falta en Linux sin el servicio instalado o para depurar. ollama launch configura y abre esas herramientas para que trabajen con modelos de Ollama. La cuenta de signin solo es necesaria para la nube. Y ollama serve --help lista todas las variables de entorno con las que se configura el servidor.
Cómo elegir modelo en la biblioteca de Ollama
La biblioteca de Ollama tenía 245 modelos a 8 de octubre de 2026. Se puede filtrar por dónde corren (local o nube), por capacidades (herramientas, razonamiento, visión, embeddings) y por tamaño de descarga (hasta 8, 16, 32 o 64 GB). Ese último filtro es el más útil: si tu gráfica tiene 8 GB, empieza por los de hasta 8 GB.
Cómo leer las etiquetas
Cada modelo tiene variantes, y el nombre te dice cuál es. Con Gemma 4 E4B, según su página de etiquetas, gemma4:e4b-it-bf16 son los pesos a 16 bits, sin comprimir, y ocupa 16 GB. gemma4:e4b-it-q8_0 está cuantizado a 8 bits y baja a 12 GB. gemma4:e4b-it-q4_K_M, cuantizado a 4 bits, es el equilibrio habitual y se queda en 6,6 GB. Y gemma4:e4b-it-qat, de 6,1 GB, se entrenó para aguantar mejor la cuantización.
La cuantización guarda los números del modelo con menos precisión para que ocupe menos, a cambio de algo de calidad. La etiqueta sin apellido (gemma4:e4b o gemma4:latest) apunta a una variante cuantizada por defecto, que es la que conviene para empezar.
Por dónde empezar
Algunos modelos de la biblioteca a 8 de octubre de 2026. El tamaño es lo que ocupa en disco; en memoria necesitas eso y algo más para el contexto.
| Modelo | Tamaño (4 bits) | Según su ficha |
|---|---|---|
llama3.2:3b (Meta) | 2,0 GB | Muy ligero, solo texto |
gemma4:e2b (Google) | 4,6 GB | Texto e imagen, contexto de 128.000 tokens |
gemma4:e4b (Google) | 6,6 GB | Pensado para portátiles |
gemma4:12b (Google) | 8 GB | Contexto máximo de 256.000 tokens |
gpt-oss:20b (OpenAI) | 14 GB | Razonamiento y agentes |
qwen3.6:27b (Alibaba) | 17 GB | Programación con agentes; texto e imagen |
gemma4:31b (Google) | 20 GB | El Gemma 4 más grande |
Llama 3.2 tiene dos años, pero corre en casi cualquier equipo. Gemma 4 E2B es el más pequeño de su familia y E4B, un escalón más. gpt-oss es el modelo abierto de OpenAI.
Para comparar modelos abiertos por calidad y licencia, tienes los mejores modelos de IA de código abierto.
Personalizar un modelo con un Modelfile
Un Modelfile es un archivo de texto con la receta de un modelo: de cuál partes y con qué instrucciones y parámetros corre. Sirve para tener, por ejemplo, un asistente que siempre responde en español y con poca creatividad, sin repetirle las instrucciones cada vez.
Este ejemplo sigue la estructura de la referencia oficial del Modelfile:
FROM gemma4:e4b
PARAMETER temperature 0.3
PARAMETER num_ctx 8192
SYSTEM """Respondes siempre en español de España, con frases cortas.
Si no sabes algo, lo dices en vez de inventarlo."""
Lo guardas como Modelfile y lo creas y lanzas así:
ollama create asistente-es -f ./Modelfile
ollama run asistente-es
FROM (obligatoria) es el modelo base: uno de la biblioteca o un archivo GGUF de Hugging Face (FROM ./modelo.gguf). PARAMETER ajusta cosas como temperature (0,8 por defecto; más baja, respuestas más previsibles) o num_ctx. SYSTEM fija las instrucciones. Existen también MESSAGE (ejemplos de conversación) y TEMPLATE (la plantilla de formato), que casi nunca hace falta tocar. Para ver la receta de un modelo existente: ollama show --modelfile gemma4:e4b.
La API local de Ollama: el puerto 11434
Mientras Ollama está abierto, cualquier programa de tu ordenador puede pedirle respuestas en http://localhost:11434, sin clave. Estos ejemplos se basan en la referencia de la API.
Generar una respuesta a partir de un texto (stream: false hace que llegue de una vez, en lugar de palabra a palabra):
curl http://localhost:11434/api/generate -d '{
"model": "gemma4:e2b",
"prompt": "Explica en dos frases qué es la cuantización.",
"stream": false
}'
Conversación con historial, que es lo que usan las aplicaciones de chat:
curl http://localhost:11434/api/chat -d '{
"model": "gemma4:e2b",
"messages": [
{ "role": "system", "content": "Responde en español." },
{ "role": "user", "content": "Dame tres ideas para una cena rápida." }
],
"stream": false
}'
En la PowerShell de Windows, las comillas de curl dan guerra; la documentación propone esta alternativa:
(Invoke-WebRequest -method POST -Body '{"model":"gemma4:e2b", "prompt":"Escribe un haiku sobre el mar", "stream": false}' -uri http://localhost:11434/api/generate ).Content | ConvertFrom-json
Compatible con el código que ya tienes para OpenAI o Claude
Ollama imita parte de la API de OpenAI en http://localhost:11434/v1 y parte de la de Anthropic en /v1/messages. Con la librería oficial de OpenAI para Python, solo cambias la dirección; la clave es obligatoria para la librería, pero Ollama la ignora (compatibilidad con OpenAI):
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1/", api_key="ollama")
respuesta = client.chat.completions.create(
model="gemma4:e2b",
messages=[{"role": "user", "content": "Resume en una frase qué es Ollama."}],
)
print(respuesta.choices[0].message.content)
Ollama tiene también librerías propias (pip install ollama y npm i ollama). Cómo llevar esto a un producto lo cuenta la guía de cómo integrar IA en una aplicación.
Conectar Ollama a una interfaz de chat o a tu editor
La aplicación oficial basta para conversar. Si quieres algo más completo, Open WebUI es una interfaz web tipo ChatGPT, con historial, usuarios con permisos y consulta de documentos, que detecta Ollama sola. Con Docker y Ollama en el mismo ordenador, este es el comando de su README oficial, y se abre en http://localhost:3000:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
Sin Docker: pip install open-webui y open-webui serve (con Python 3.11 o 3.12, según su documentación), y se abre en http://localhost:8080. Más opciones:
- VS Code: la extensión oficial de Ollama añade tus modelos al selector del chat de VS Code (pide VS Code 1.127 o posterior).
- Agentes de programación:
ollama launch claude,ollama launch codexuollama launch opencodeabren Claude Code, Codex u OpenCode con modelos de Ollama. La documentación recomienda para esto al menos 64.000 tokens de contexto, que en local exigen mucha memoria. Qué agente elegir lo comparamos en la mejor IA para programar. - Otras: la lista de integraciones incluye Cline, Roo Code, Zed, JetBrains, Xcode y n8n, entre otras.
Ollama Cloud: cuando el modelo ya no corre en tu ordenador
Ollama ofrece modelos abiertos muy grandes en sus servidores, que se usan con los mismos comandos añadiendo cloud a la etiqueta (por ejemplo gemma4:cloud) tras iniciar sesión con ollama signin. Los planes, a 8 de octubre de 2026 según su página de precios, son cuatro. El gratuito (Free, 0 $) incluye el uso local ilimitado, unos créditos iniciales para la nube con modelos básicos y una petición a la vez. Pro cuesta 20 $/mes o 200 $/año y da 60 $ de créditos al mes, modelos más grandes y 3 peticiones a la vez. Max, por 100 $/mes, sube a 300 $ de créditos al mes y 10 peticiones a la vez. Y Team, por 500 $/mes, admite usuarios ilimitados con 1.000 $ de créditos compartidos.
Ollama afirma que no registra ni usa para entrenar las conversaciones de la nube, y que aloja los modelos sobre todo en Estados Unidos, con capacidad adicional en Europa y Singapur. Aun así, en la nube tus datos salen de tu ordenador.
Para trabajar solo en local, la FAQ oficial indica dos formas: la variable de entorno OLLAMA_NO_CLOUD=1, o añadir "disable_ollama_cloud": true en el archivo ~/.ollama/server.json. Después hay que reiniciar Ollama.
Problemas habituales con Ollama y cómo resolverlos
Va muy lento
Casi siempre es porque el modelo no cabe entero en la memoria de la gráfica. Compruébalo con ollama ps: la columna PROCESSOR dice 100% GPU si todo va en la gráfica, 100% CPU si va en la memoria del sistema, o un reparto como 48%/52% CPU/GPU. Si ves CPU, prueba una variante más pequeña o más cuantizada.
Se olvida de lo que le dijiste al principio
Es el contexto. Según su documentación, Ollama asigna por defecto 4K (4.096 tokens) si la gráfica tiene menos de 24 GiB, 32K entre 24 y 48 GiB, y 256K a partir de 48 GiB. Para un documento largo, 4K se queda corto. Se amplía desde los ajustes de la aplicación, con /set parameter num_ctx 16384 en el chat, con num_ctx en la API o arrancando el servidor con OLLAMA_CONTEXT_LENGTH=16384. Más contexto pide más memoria; si tu gráfica admite Flash Attention, OLLAMA_KV_CACHE_TYPE=q8_0 reduce a la mitad la que ocupa, con una pérdida de precisión que la documentación califica de muy pequeña.
Tarda en responder la primera vez
Ollama libera el modelo de la memoria tras 5 minutos sin uso y tiene que volver a cargarlo. Puedes cambiar ese tiempo con la variable OLLAMA_KEEP_ALIVE (por ejemplo, 30m) o con el parámetro keep_alive en cada llamada a la API.
«Address already in use» al lanzar ollama serve
En Windows y macOS la aplicación ya arranca el servidor, y en Linux lo hace el servicio de systemd. Si lanzas ollama serve a mano, choca con él porque el puerto 11434 ya está ocupado. No hace falta: usa ollama run directamente. Si de verdad necesitas otro servidor, cámbiale el puerto con OLLAMA_HOST=127.0.0.1:11435.
Me estoy quedando sin disco
Los modelos se guardan en ~/.ollama/models en macOS, en /usr/share/ollama/.ollama/models en Linux y en C:\Users\tu-usuario\.ollama\models en Windows. Para llevarlos a otro disco, define la variable OLLAMA_MODELS con la nueva ruta y reinicia Ollama. En Linux, el usuario ollama necesita permisos de lectura y escritura en esa carpeta.
No detecta la tarjeta gráfica
Actualiza los controladores: Ollama pide NVIDIA con capacidad de cómputo 5.0 o superior y controlador 550 o posterior (570 para las tarjetas más antiguas y 551.61 en Windows), y para AMD, ROCm 7 o Vulkan. En Linux, tras suspender el equipo a veces deja de ver la NVIDIA; se resuelve con sudo rmmod nvidia_uvm && sudo modprobe nvidia_uvm. Los registros están en ~/.ollama/logs/server.log (macOS), en %LOCALAPPDATA%\Ollama (Windows) o con journalctl -u ollama (Linux).
Quiero usarlo desde otro ordenador de casa
Por defecto Ollama solo escucha en 127.0.0.1, es decir, en tu propio equipo. Con OLLAMA_HOST=0.0.0.0:11434 acepta conexiones de otros dispositivos de la red. Pero la API local no tiene contraseña: cualquiera que llegue a ese puerto puede usar tus modelos, descargar otros o borrarlos. En septiembre de 2025, Cisco encontró 1.139 servidores de Ollama expuestos a internet, 214 de ellos respondiendo a cualquiera. Ábrelo solo dentro de tu red o de una VPN privada, y nunca abras el puerto 11434 en el router.
Por dónde seguir
- Para comparar Ollama con LM Studio y otras opciones, y saber qué modelo cabe en tu equipo: IA en local, qué necesitas.
- Para elegir el modelo por calidad y licencia: los mejores modelos de IA de código abierto.
- Para ver dónde encaja Ollama entre el resto de programas de IA: las mejores herramientas de IA para cada tarea.
Preguntas frecuentes
¿Ollama funciona sin tarjeta gráfica?
Sí. Sin una GPU compatible, Ollama ejecuta el modelo en el procesador y la memoria RAM del sistema. Funciona, pero responde bastante más despacio, así que conviene elegir modelos pequeños. En un Mac con chip de la serie M usa la GPU integrada; en un Mac con procesador Intel, solo la CPU.
¿Cómo se actualiza Ollama?
En Windows y macOS la aplicación descarga las actualizaciones sola: pulsa en su icono de la barra de tareas o de menús y elige «Restart to update». En Linux basta con volver a ejecutar el script de instalación, que sustituye la versión anterior sin tocar tus modelos.
¿Cómo desinstalo Ollama y borro los modelos?
En Windows, desde «Agregar o quitar programas» (si cambiaste la carpeta de modelos con OLLAMA_MODELS, esa carpeta hay que borrarla a mano). En macOS, borra la aplicación y la carpeta ~/.ollama, que es donde están los modelos. En Linux, para y deshabilita el servicio, borra el binario y la carpeta /usr/share/ollama. Los pasos exactos están en la documentación oficial de cada sistema.