Ollama: qué es y cómo funciona (guía principiante)
¿Qué es Ollama? Es la herramienta más sencilla para ejecutar un LLM en local en tu propia máquina: sin nube, sin suscripción, sin enviar ni una línea a OpenAI. Esta guía explica desde cero qué es Ollama, cómo descarga y ejecuta los modelos, los tres o cuatro comandos que usarás el 90 % del tiempo y lo imprescindible para empezar.
#¿Qué es Ollama?
Ollama es una herramienta open source que descarga, almacena y ejecuta modelos de lenguaje (LLM) directamente en tu ordenador. Escribes un comando, el modelo se carga en memoria y hablas con él, ya sea en la línea de comandos o a través de una interfaz gráfica que conectas a Ollama. Todo sucede localmente: no se envía ningún dato a Internet una vez descargado el modelo.
En concreto, Ollama cumple dos funciones a la vez: es un demonio (un programa que se ejecuta en segundo plano) y una CLI (una interfaz de línea de comandos) que se comunica con ese demonio. El demonio escucha en el puerto 11434 de tu máquina y expone una pequeña API HTTP —la misma que la de OpenAI, o casi—. Por tanto, todas las interfaces compatibles (Open WebUI, LM Studio en modo cliente, Continue.dev, etc.) pueden conectarse a ella sin modificaciones.
¿Por qué tanta gente se pasa a Ollama? Porque elimina toda la fricción técnica de los LLM locales: no hay que compilar, configurar manualmente la GPU ni gestionar versiones de Python. Lo instalas, escribes ollama run qwen3.5:9b y funciona. Es el equivalente de Docker para los LLM: se empaquetan el modelo y su entorno de ejecución en un formato único.
#¿Cómo funciona internamente?
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Cuando lanzas Ollama, tres capas colaboran. Entender estas capas cambia radicalmente tu capacidad para diagnosticar un problema.
- El demonio (ollama serve)
- Un servicio que se ejecuta en segundo plano, escucha en http://localhost:11434 y gestiona la carga y descarga de los modelos en memoria. En Windows y macOS, se inicia automáticamente tras la instalación. En Linux, normalmente es un servicio systemd.
- El motor de inferencia (llama.cpp)
- Es el encargado de ejecutar los modelos. Ollama incluye una versión precompilada con soporte para CUDA (NVIDIA), Metal (Apple Silicon) y CPU. No necesitas compilar nada.
- CLI (ollama)
- El programa de línea de comandos que invocas. Por sí mismo no hace mucho: envía solicitudes HTTP al demonio y muestra las respuestas.
Cuando escribes ollama run qwen3.5:9b, esto es lo que sucede realmente: la CLI pide al demonio que cargue este modelo; si el modelo no está en el disco, el demonio lo descarga desde el registro de Ollama (un poco como Docker Hub); lo carga en VRAM si tienes una GPU compatible, de lo contrario en RAM; y abre una sesión de chat interactiva. Todo el trabajo pesado lo realiza el demonio: la CLI es solo un cliente.
#Los comandos: run, pull, list
Tres comandos cubren el 90 % del uso. Apréndelos y el resto te resultará evidente.
#ollama run
El comando que hay que conocer primero. Descarga el modelo si no está presente, lo carga en memoria y luego abre una conversación interactiva en el terminal.
Una vez en la sesión, escribes tu pregunta y pulsas Enter. Para salir, usa /bye o pulsa Ctrl+D. Para pasar al modo multilínea, empieza con tres comillas ("""). Todo lo que empiece por / es un comando interno (/show, /set, /clear, /save, /load).
También puedes pasar directamente un prompt como argumento, lo que resulta útil para automatizar tareas mediante scripts:
#ollama pull
Descarga un modelo sin ejecutarlo. Es útil cuando quieres preparar varios modelos de antemano o descargar una variante concreta (tamaño, cuantización).
El nombre sigue el formato modele:tag. Sin tag, obtienes la versión predeterminada (generalmente un 8B/9B en cuantización Q4_K_M). Con un tag explícito, eliges el tamaño (2b, 4b, 9b, 27b, 30b) y la cuantización (q4_K_M, q5_K_M, q8_0, fp16).
#ollama list
Muestra los modelos instalados en tu máquina, su tamaño en disco y su fecha de instalación.
#Otros comandos útiles
- ollama ps
- Muestra los modelos actualmente cargados en memoria (y cuánta VRAM/RAM consumen). Indispensable para diagnosticar un "va lento".
- ollama rm <modele>
- Elimina un modelo del disco. Útil cuando el directorio de modelos empieza a pesar 50 GB.
- ollama show <modele>
- Muestra los metadatos de un modelo: tamaño del contexto, cuantización, plantilla de prompt, capacidades (herramientas, visión, etc.).
- ollama serve
- Inicia manualmente el demonio en primer plano. Útil en Linux o para diagnosticar problemas (ves los logs en directo).
- ollama create
- Crea un modelo personalizado a partir de un Modelfile — es equivalente a un Dockerfile para LLM. Tema más avanzado.
#Dónde se almacenan los modelos
Los modelos pueden ocupar varios gigabytes. Saber dónde están almacenados es esencial para hacer limpieza, mover la biblioteca a otro disco o hacer copias de seguridad.
- Windows
- %USERPROFILE%\.ollama\models — típicamente C:\Users\votrenom\.ollama\models
- macOS
- ~/.ollama/models
- Linux (instalación mediante el script oficial)
- /usr/share/ollama/.ollama/models — le démon tourne sous l'utilisateur ollama
- Linux (instalación manual a nivel de usuario)
- ~/.ollama/models
Dentro de este archivo, dos subcarpetas: blobs (los archivos binarios de los modelos, identificados por un hash) y manifests (las metadatos que describen qué blob corresponde a qué etiqueta). No edite estos archivos a mano — utilice ollama rm et ollama pull pour para gestionarlos.
#Configuración mínima para comenzar
La pregunta «¿Qué es Ollama y puede mi máquina ejecutarlo?» se repite todo el tiempo. Estos son los umbrales reales, no los mínimos de marketing.
- RAM 8 GB, sin GPU
- Limitado a modelos de 2-3B en Q4 (Qwen 3.5 2B, Granite 4.2 3B). 5–10 tokens/segundo en CPU moderna. Útil para probar y aprender.
- RAM 16 GB, sin GPU
- Los modelos 8B caben en Q4 (Granite 4.2 8B, Qwen 3.5 9B). Calcula entre 4 y 8 tokens por segundo. Es lento para un uso interactivo sostenido, pero funciona.
- GPU con 8 GB de VRAM
- Funciona con holgura con modelos 8B en Q4 (Qwen 3.5 9B, Granite 4.2 8B — 30–50 tokens/s). Alcanza su límite con los modelos 12-14B.
- GPU de 12 GB de VRAM (RTX 3060, 4070)
- El punto óptimo de entrada en 2026. Todos los modelos de 8B funcionan con fluidez, Gemma 4 12B en Q4 funciona con holgura, o Qwen 3.5 9B en Q8 ofrece la máxima calidad dentro de esta gama.
- GPU de 16 GB (RTX 4080, 5080) o Mac M-Pro de 32 GB unificados
- Subimos a modelos de 24B en Q4 (Mistral Small 24B, Devstral 24B, gpt-oss 20B) o a Qwen 3.5 9B en Q8 para mejorar la calidad.
- GPU de 24 GB (RTX 3090, 4090) o Mac M-Max de 48 GB+
- Se pueden ejecutar cómodamente modelos de 27-35B (Qwen 3.8 27B, Qwen 3.6 35B-A3B), y grandes modelos MoE en Q4 con un poco de paciencia.
En disco, prevé 10 GB por modelo 7B en Q4, 30 GB por modelo 32B. Tener entre 50 y 100 GB libres desde el principio evita tener que limpiar demasiado pronto.
#Primer modelo recomendado
Cuando descubres Ollama, el primer impulso es probar el modelo más grande posible "a ver qué pasa". Es un error: saturas la VRAM, parte del modelo pasa a la RAM, todo va lento y acabas abandonando. Empieza con un modelo pequeño.
- 01Qwen 3.5 9B — la opción razonable por defectoollama run qwen3.5:9b télécharge la version Q4_K_M de Qwen 3.5 9B (6,6 Go). Bonne qualité générale, français solide, entrée vision, fenêtre de contexte 256k. C'est le choix 8 Go de 2026 et un excellent baromètre pour évaluer ce que votre machine peut faire.
- 02Granite 4.2 8B — la alternativa austeraollama run granite4.2:8b pour le modèle d'IBM (5,3 Go, Apache 2.0). Un peu plus léger, très économe en tokens, contexte 128k. Bon compromis si votre carte est juste sur la VRAM. Pour un français très naturel avec plus de VRAM, Mistral Small 24B (ollama run mistral-small) reste une valeur sûre.
- 03Qwen 3.5 4B — el pequeño modelo polivalente que gana popularidadollama run qwen3.5:4b pour le nouveau petit modèle par défaut (3,4 Go, Apache 2.0). Étonnamment capable pour sa taille, correct en code léger et en extraction. Beaucoup l'adoptent comme défaut quand la VRAM est comptée.
- 04Granite 4.2 3B — si tu máquina es modestaollama run granite4.2:3b pour un modèle qui tient sur 4 Go de RAM (2,2 Go, Apache 2.0). Moins capable mais utilisable pour des tâches simples et pour apprendre la mécanique d'Ollama sans souffrir des temps de chargement.
#Consejos y posibles problemas
- El modelo se libera de la memoria después de 5 minutos de inactividad
- Es el valor predeterminado de OLLAMA_KEEP_ALIVE. Si quieres mantenerlo en VRAM durante más tiempo, establece OLLAMA_KEEP_ALIVE=2h (o -1 para no retirarlo nunca de la memoria). Por el contrario, pon 0 si quieres liberar la VRAM en cuanto termine una solicitud.
- Respuestas truncadas tras unas pocas frases
- El valor por defecto del parámetro num_ctx (ventana de contexto) es de 4096 tokens, independientemente de lo que soporte el modelo. Para un uso de RAG o documentos largos, crea un Modelfile con PARAMETER num_ctx 32768 y ejecuta ollama create. Ten cuidado: el consumo de VRAM aumenta rápidamente.
- Sin autocompletación de shell
- Escribe ollama help para ver todos los comandos, ollama help <comando> para los detalles de cada uno. La documentación está en la CLI.
- Conexión rechazada desde otra máquina de la red
- Por defecto, Ollama solo escucha en 127.0.0.1. Para exponerlo en la red local, define OLLAMA_HOST=0.0.0.0:11434 antes de arrancar el demonio. Ten en cuenta el firewall.
- El mismo nombre de modelo, varias versiones
- ollama pull qwen3.5:9b et ollama pull qwen3.5:9b-q8_0 téléchargent deux variantes séparées. Surveillez votre disque avec ollama list.
#Para ir más allá
Ya has entendido qué es Ollama y cómo funciona a nivel básico. Estos son los siguientes pasos naturales:
- Instalarlo de verdad en tu sistema operativo
- La guía de instalación de Ollama en Windows (o macOS, o Linux) detalla paso a paso la instalación, la verificación del GPU y el primer modelo en un entorno limpio.
- Elegir la cuantización adecuada
- La guía Elegir la cuantización (Q4, Q5, Q8, FP16) compara visualmente las pérdidas reales de calidad y te ayuda a decidir entre calidad y VRAM.
- Conectar una verdadera interfaz gráfica
- La guía de Open WebUI con Ollama te permite instalar en 10 minutos una interfaz similar a ChatGPT, multiusuario y con RAG integrado, sobre el demonio que ya tienes en ejecución.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.