Principiante 7 minOllama

Ollama: qué es y cómo funciona (guía principiante)

¿Qué es Ollama? Es la herramienta más sencilla para ejecutar un LLM en local en tu propia máquina: sin nube, sin suscripción, sin enviar ni una línea a OpenAI. Esta guía explica desde cero qué es Ollama, cómo descarga y ejecuta los modelos, los tres o cuatro comandos que usarás el 90 % del tiempo y lo imprescindible para empezar.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Qué es Ollama?

Ollama es una herramienta open source que descarga, almacena y ejecuta modelos de lenguaje (LLM) directamente en tu ordenador. Escribes un comando, el modelo se carga en memoria y hablas con él, ya sea en la línea de comandos o a través de una interfaz gráfica que conectas a Ollama. Todo sucede localmente: no se envía ningún dato a Internet una vez descargado el modelo.

En concreto, Ollama cumple dos funciones a la vez: es un demonio (un programa que se ejecuta en segundo plano) y una CLI (una interfaz de línea de comandos) que se comunica con ese demonio. El demonio escucha en el puerto 11434 de tu máquina y expone una pequeña API HTTP —la misma que la de OpenAI, o casi—. Por tanto, todas las interfaces compatibles (Open WebUI, LM Studio en modo cliente, Continue.dev, etc.) pueden conectarse a ella sin modificaciones.

i
En una frase
Ollama = un demonio local que sabe descargar y ejecutar LLM de pesos abiertos, y una CLI para hablar con él. Por debajo, es llama.cpp empaquetado adecuadamente. No tendrás que compilar ni manipular archivos GGUF manualmente.

¿Por qué tanta gente se pasa a Ollama? Porque elimina toda la fricción técnica de los LLM locales: no hay que compilar, configurar manualmente la GPU ni gestionar versiones de Python. Lo instalas, escribes ollama run qwen3.5:9b y funciona. Es el equivalente de Docker para los LLM: se empaquetan el modelo y su entorno de ejecución en un formato único.

#¿Cómo funciona internamente?

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Cuando lanzas Ollama, tres capas colaboran. Entender estas capas cambia radicalmente tu capacidad para diagnosticar un problema.

El demonio (ollama serve)
Un servicio que se ejecuta en segundo plano, escucha en http://localhost:11434 y gestiona la carga y descarga de los modelos en memoria. En Windows y macOS, se inicia automáticamente tras la instalación. En Linux, normalmente es un servicio systemd.
El motor de inferencia (llama.cpp)
Es el encargado de ejecutar los modelos. Ollama incluye una versión precompilada con soporte para CUDA (NVIDIA), Metal (Apple Silicon) y CPU. No necesitas compilar nada.
CLI (ollama)
El programa de línea de comandos que invocas. Por sí mismo no hace mucho: envía solicitudes HTTP al demonio y muestra las respuestas.

Cuando escribes ollama run qwen3.5:9b, esto es lo que sucede realmente: la CLI pide al demonio que cargue este modelo; si el modelo no está en el disco, el demonio lo descarga desde el registro de Ollama (un poco como Docker Hub); lo carga en VRAM si tienes una GPU compatible, de lo contrario en RAM; y abre una sesión de chat interactiva. Todo el trabajo pesado lo realiza el demonio: la CLI es solo un cliente.

→
El puerto 11434
Es el puerto HTTP que todo el mundo utiliza. Si una aplicación afirma «conectarse a tu Ollama», se comunica con http://localhost:11434. Si Ollama está en ejecución y abres esta URL en un navegador, verás el mensaje Ollama is running. Es la comprobación de funcionamiento más sencilla.

#Los comandos: run, pull, list

Tres comandos cubren el 90 % del uso. Apréndelos y el resto te resultará evidente.

#ollama run

El comando que hay que conocer primero. Descarga el modelo si no está presente, lo carga en memoria y luego abre una conversación interactiva en el terminal.

Terminal
ollama run qwen3.5:9b
# Première fois : télécharge ~6.6 Go puis lance le chat
# Fois suivantes : charge le modèle déjà présent et démarre

Una vez en la sesión, escribes tu pregunta y pulsas Enter. Para salir, usa /bye o pulsa Ctrl+D. Para pasar al modo multilínea, empieza con tres comillas ("""). Todo lo que empiece por / es un comando interno (/show, /set, /clear, /save, /load).

También puedes pasar directamente un prompt como argumento, lo que resulta útil para automatizar tareas mediante scripts:

Prompt one-shot
ollama run qwen3.5:9b "Résume ce texte en 3 points : [...]"

#ollama pull

Descarga un modelo sin ejecutarlo. Es útil cuando quieres preparar varios modelos de antemano o descargar una variante concreta (tamaño, cuantización).

Terminal
ollama pull granite4.2:3b
ollama pull qwen3.5:9b
ollama pull qwen3.5:9b-q8_0

El nombre sigue el formato modele:tag. Sin tag, obtienes la versión predeterminada (generalmente un 8B/9B en cuantización Q4_K_M). Con un tag explícito, eliges el tamaño (2b, 4b, 9b, 27b, 30b) y la cuantización (q4_K_M, q5_K_M, q8_0, fp16).

i
Cuantización, en dos palabras
Un modelo 'bruto' pesa 14 GB para 7 mil millones de parámetros en FP16. La cuantización comprime estos números en menos bits: Q4_K_M (4 bits) reduce el tamaño por ~4 con una pérdida de calidad mínima. Es el punto ideal recomendado para comenzar. Q5_K_M es un poco mejor en calidad, Q8_0 casi perfecto pero 2 veces más pesado, FP16 reservado para GPUs de gran tamaño.

#ollama list

Muestra los modelos instalados en tu máquina, su tamaño en disco y su fecha de instalación.

Terminal
ollama list
# NAME               ID            SIZE    MODIFIED
# qwen3.5:9b         42182419e950  6.6 GB  2 days ago
# granite4.2:8b      f974a74358d6  5.3 GB  1 week ago

#Otros comandos útiles

ollama ps
Muestra los modelos actualmente cargados en memoria (y cuánta VRAM/RAM consumen). Indispensable para diagnosticar un "va lento".
ollama rm <modele>
Elimina un modelo del disco. Útil cuando el directorio de modelos empieza a pesar 50 GB.
ollama show <modele>
Muestra los metadatos de un modelo: tamaño del contexto, cuantización, plantilla de prompt, capacidades (herramientas, visión, etc.).
ollama serve
Inicia manualmente el demonio en primer plano. Útil en Linux o para diagnosticar problemas (ves los logs en directo).
ollama create
Crea un modelo personalizado a partir de un Modelfile — es equivalente a un Dockerfile para LLM. Tema más avanzado.

#Dónde se almacenan los modelos

Los modelos pueden ocupar varios gigabytes. Saber dónde están almacenados es esencial para hacer limpieza, mover la biblioteca a otro disco o hacer copias de seguridad.

Windows
%USERPROFILE%\.ollama\models — típicamente C:\Users\votrenom\.ollama\models
macOS
~/.ollama/models
Linux (instalación mediante el script oficial)
/usr/share/ollama/.ollama/models — le démon tourne sous l'utilisateur ollama
Linux (instalación manual a nivel de usuario)
~/.ollama/models

Dentro de este archivo, dos subcarpetas: blobs (los archivos binarios de los modelos, identificados por un hash) y manifests (las metadatos que describen qué blob corresponde a qué etiqueta). No edite estos archivos a mano — utilice ollama rm et ollama pull pour para gestionarlos.

→
Mover los modelos a otro disco
Si tu SSD de sistema es pequeño y tienes un disco secundario más grande, define la variable de entorno OLLAMA_MODELS para apuntar a otro lugar. Ejemplo: OLLAMA_MODELS=D:\ollama-models en Windows, o export OLLAMA_MODELS=/mnt/data/ollama-models en Linux. Reinicia el demonio para que la variable se tome en cuenta.

#Configuración mínima para comenzar

La pregunta «¿Qué es Ollama y puede mi máquina ejecutarlo?» se repite todo el tiempo. Estos son los umbrales reales, no los mínimos de marketing.

RAM 8 GB, sin GPU
Limitado a modelos de 2-3B en Q4 (Qwen 3.5 2B, Granite 4.2 3B). 5–10 tokens/segundo en CPU moderna. Útil para probar y aprender.
RAM 16 GB, sin GPU
Los modelos 8B caben en Q4 (Granite 4.2 8B, Qwen 3.5 9B). Calcula entre 4 y 8 tokens por segundo. Es lento para un uso interactivo sostenido, pero funciona.
GPU con 8 GB de VRAM
Funciona con holgura con modelos 8B en Q4 (Qwen 3.5 9B, Granite 4.2 8B — 30–50 tokens/s). Alcanza su límite con los modelos 12-14B.
GPU de 12 GB de VRAM (RTX 3060, 4070)
El punto óptimo de entrada en 2026. Todos los modelos de 8B funcionan con fluidez, Gemma 4 12B en Q4 funciona con holgura, o Qwen 3.5 9B en Q8 ofrece la máxima calidad dentro de esta gama.
GPU de 16 GB (RTX 4080, 5080) o Mac M-Pro de 32 GB unificados
Subimos a modelos de 24B en Q4 (Mistral Small 24B, Devstral 24B, gpt-oss 20B) o a Qwen 3.5 9B en Q8 para mejorar la calidad.
GPU de 24 GB (RTX 3090, 4090) o Mac M-Max de 48 GB+
Se pueden ejecutar cómodamente modelos de 27-35B (Qwen 3.8 27B, Qwen 3.6 35B-A3B), y grandes modelos MoE en Q4 con un poco de paciencia.

En disco, prevé 10 GB por modelo 7B en Q4, 30 GB por modelo 32B. Tener entre 50 y 100 GB libres desde el principio evita tener que limpiar demasiado pronto.

!
La trampa de la «GPU detectada» pero sin utilizar
En Windows y Linux, Ollama detecta la GPU automáticamente, salvo si tus controladores NVIDIA son demasiado antiguos o si tienes una GPU AMD sin ROCm correctamente instalado. Compruébalo con ollama ps: si la columna PROCESSOR indica 100% CPU aunque tienes una GPU, la aceleración por hardware no está activa. En macOS con Apple Silicon, la aceleración Metal es automática y está siempre activa.

#Primer modelo recomendado

Cuando descubres Ollama, el primer impulso es probar el modelo más grande posible "a ver qué pasa". Es un error: saturas la VRAM, parte del modelo pasa a la RAM, todo va lento y acabas abandonando. Empieza con un modelo pequeño.

  1. 01
    Qwen 3.5 9B — la opción razonable por defecto
    ollama run qwen3.5:9b télécharge la version Q4_K_M de Qwen 3.5 9B (6,6 Go). Bonne qualité générale, français solide, entrée vision, fenêtre de contexte 256k. C'est le choix 8 Go de 2026 et un excellent baromètre pour évaluer ce que votre machine peut faire.
  2. 02
    Granite 4.2 8B — la alternativa austera
    ollama run granite4.2:8b pour le modèle d'IBM (5,3 Go, Apache 2.0). Un peu plus léger, très économe en tokens, contexte 128k. Bon compromis si votre carte est juste sur la VRAM. Pour un français très naturel avec plus de VRAM, Mistral Small 24B (ollama run mistral-small) reste une valeur sûre.
  3. 03
    Qwen 3.5 4B — el pequeño modelo polivalente que gana popularidad
    ollama run qwen3.5:4b pour le nouveau petit modèle par défaut (3,4 Go, Apache 2.0). Étonnamment capable pour sa taille, correct en code léger et en extraction. Beaucoup l'adoptent comme défaut quand la VRAM est comptée.
  4. 04
    Granite 4.2 3B — si tu máquina es modesta
    ollama run granite4.2:3b pour un modèle qui tient sur 4 Go de RAM (2,2 Go, Apache 2.0). Moins capable mais utilisable pour des tâches simples et pour apprendre la mécanique d'Ollama sans souffrir des temps de chargement.
→
Ejecuta ollama ps durante una conversación
En otro terminal mientras hablas, ejecuta ollama ps. Verás el modelo cargado, la memoria utilizada y la distribución entre GPU/CPU. Es la mejor forma de entender concretamente lo que sucede.

#Consejos y posibles problemas

El modelo se libera de la memoria después de 5 minutos de inactividad
Es el valor predeterminado de OLLAMA_KEEP_ALIVE. Si quieres mantenerlo en VRAM durante más tiempo, establece OLLAMA_KEEP_ALIVE=2h (o -1 para no retirarlo nunca de la memoria). Por el contrario, pon 0 si quieres liberar la VRAM en cuanto termine una solicitud.
Respuestas truncadas tras unas pocas frases
El valor por defecto del parámetro num_ctx (ventana de contexto) es de 4096 tokens, independientemente de lo que soporte el modelo. Para un uso de RAG o documentos largos, crea un Modelfile con PARAMETER num_ctx 32768 y ejecuta ollama create. Ten cuidado: el consumo de VRAM aumenta rápidamente.
Sin autocompletación de shell
Escribe ollama help para ver todos los comandos, ollama help <comando> para los detalles de cada uno. La documentación está en la CLI.
Conexión rechazada desde otra máquina de la red
Por defecto, Ollama solo escucha en 127.0.0.1. Para exponerlo en la red local, define OLLAMA_HOST=0.0.0.0:11434 antes de arrancar el demonio. Ten en cuenta el firewall.
El mismo nombre de modelo, varias versiones
ollama pull qwen3.5:9b et ollama pull qwen3.5:9b-q8_0 téléchargent deux variantes séparées. Surveillez votre disque avec ollama list.
i
Una interfaz gráfica en 5 minutos
La CLI basta para entender cómo funciona, pero para el uso diario, conecta Open WebUI (interfaz web tipo ChatGPT) o LM Studio en modo cliente al demonio de Ollama. Estas herramientas detectan automáticamente el servidor en localhost:11434 y muestran todos tus modelos en una interfaz clara.

#Para ir más allá

Ya has entendido qué es Ollama y cómo funciona a nivel básico. Estos son los siguientes pasos naturales:

Instalarlo de verdad en tu sistema operativo
La guía de instalación de Ollama en Windows (o macOS, o Linux) detalla paso a paso la instalación, la verificación del GPU y el primer modelo en un entorno limpio.
Elegir la cuantización adecuada
La guía Elegir la cuantización (Q4, Q5, Q8, FP16) compara visualmente las pérdidas reales de calidad y te ayuda a decidir entre calidad y VRAM.
Conectar una verdadera interfaz gráfica
La guía de Open WebUI con Ollama te permite instalar en 10 minutos una interfaz similar a ChatGPT, multiusuario y con RAG integrado, sobre el demonio que ya tienes en ejecución.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.