Principiante 3 minOllama

Instalar Ollama en Windows 11: guía completa (2026)

Respuesta directa

En Windows 11, Ollama se instala mediante un instalador convencional descargado del sitio oficial, con detección automática de la GPU (soporte nativo para CUDA de NVIDIA). Un solo comando de terminal (ollama run qwen3.5:4b) descarga y ejecuta un primer modelo en aproximadamente 5 minutos, sin configuración manual ni comandos complejos.

Tienes un PC con Windows y quieres ejecutar un LLM en local sin pasar por ChatGPT. Ollama es probablemente la herramienta más sencilla para lograrlo: un instalador estándar, un comando, un modelo. En solo 3 minutos, tienes Qwen 3.5 funcionando en tu máquina.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows 11

#¿Por qué Ollama?

Ollama gestiona por ti todo lo complicado: la descarga de los modelos, la cuantización, la carga en VRAM, la detección de la GPU y la API HTTP local. Por debajo funciona llama.cpp. Pero no tendrás que compilarlo.

La herramienta es gratuita, de código abierto y funciona completamente offline una vez descargado el modelo. Ningún dato se envía a un servidor remoto.

i
En dos palabras
Ollama = un daemon local que corre en segundo plano + una CLI para hablar con él. Los modelos viven en un directorio en tu disco. Es todo.

#Prerrequisitos

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida
Windows 10 o 11
64 bits. Ollama no tiene versión de 32 bits.
8 GB de RAM como mínimo
16 GB permiten usar con comodidad modelos de 8 a 9B con cuantización Q4.
10 GB de espacio en disco
Un modelo de 4 a 9B pesa aproximadamente 3 a 7 GB. Reserva mucho espacio si planeas probar varios.
GPU NVIDIA (opcional)
Controladores actualizados, RTX 20/30/40/50 o GTX 16. Ollama detecta la GPU automáticamente.
→
Sin GPU, también funciona
Una CPU moderna ejecuta un modelo pequeño (de 2 a 4B, como Qwen 3.5 2B o Granite 4.2 3B) a 5–10 tokens por segundo. Es lento, pero utilizable para hacer pruebas. Para un uso diario, busca una GPU con al menos 6 GB de VRAM.

#1. Descarga

Visita el sitio oficial y descarga el instalador de Windows.

Enlace oficial
https://ollama.com/download/windows

El instalador ocupa aproximadamente 700 MB. Es normal: incluye los binarios precompilados llama.cpp con soporte CUDA.

!
Verifica el dominio
Descarga Ollama únicamente desde ollama.com. Las versiones redistribuidas en GitHub por terceros pueden estar infectadas con malware. La herramienta es de código abierto: si eres paranoico, compílala desde el repositorio oficial.

#2. Instalación

  1. 01
    Inicia OllamaSetup.exe
    Haz doble clic en el instalador descargado. Windows Defender puede mostrar una advertencia de SmartScreen: haz clic en "Más información" y luego en "Ejecutar de todas formas".
  2. 02
    Instalación silenciosa
    Sin ventanas de configuración: el instalador se instala en %LOCALAPPDATA%\Programs\Ollama y arranca automáticamente el servicio en segundo plano.
  3. 03
    Comprueba el icono del sistema
    Un pequeño icono de Ollama aparece cerca del reloj, en la esquina inferior derecha. Indica que el daemon está en ejecución.
  4. 04
    Abre un terminal
    PowerShell, Windows Terminal o cmd.exe: da igual. Escribe el comando de verificación que aparece a continuación.
PowerShell
ollama --version

Deberías ver algo como ollama version is 0.5.x. Si no se reconoce el comando, cierra y vuelve a abrir el terminal: el PATH acaba de modificarse.

#3. Tu primer modelo

Qwen 3.5 4B es una buena opción inicial: multilingüe (con un nivel muy bueno de francés), ligero, muy rápido y de excelente calidad para su tamaño. Bajo licencia Apache 2.0.

Descargar e iniciar
ollama run qwen3.5:4b

La primera vez, Ollama descarga el modelo (aproximadamente 3,4 GB en Q4). Las veces siguientes, el lanzamiento es instantáneo. Cuando aparezca el prompt >>>, puedes conversar.

Prueba de conversación
>>> Bonjour, présente-toi en 2 phrases.

Je suis Qwen 3.5, un modèle de langage open-source développé par l'équipe Qwen (Alibaba).
Je fonctionne entièrement en local sur votre machine, sans connexion internet.
→
Salir de la conversación
Escribe /bye o pulsa Ctrl+D para salir. El modelo permanece cargado en memoria unos minutos, lo que permite volver a iniciarlo al instante.

#4. Verificar que se esté usando la GPU

Por defecto, Ollama detecta tu GPU NVIDIA y carga el modelo en ella. Para confirmarlo, ejecuta este comando mientras hay una conversación en curso:

Estado del modelo cargado
ollama ps

En la columna PROCESSOR, deberías ver 100% GPU. Si ves CPU o un porcentaje parcial, es que parte del modelo se carga en la RAM del sistema.

i
¿VRAM insuficiente?
Qwen 3.5 4B Q4 necesita aproximadamente 3,4 GB de VRAM. Si tu GPU va muy justa, pasa a un modelo aún más ligero: Granite 4.2 3B (ollama run granite4.2:3b, 2,2 GB) o Qwen 3.5 2B (ollama run qwen3.5:2b, 1,9 GB).

Para supervisar el uso del GPU en tiempo real, abre otra ventana de PowerShell:

Monitoring
nvidia-smi -l 1

#5. Una interfaz limpia con Open WebUI

El terminal es bueno para probar. Para uso diario, Open WebUI se parece a ChatGPT — historial, markdown, archivos adjuntos, todo está allí. El método más sencillo pasa por Docker Desktop.

Lanzar Open WebUI
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Abre después http://localhost:3000 en tu navegador. Crea una cuenta (es local, nada sale de tu máquina) y tus modelos Ollama aparecen en la lista.

#Solución de problemas

"ollama: comando no encontrado"
El PATH no se recargó. Cierra y vuelve a abrir todos tus terminales. Como último recurso, reinicia la sesión de Windows.
Descarga bloqueada en 0%
Un firewall corporativo a veces bloquea Ollama. Prueba desde otra red o configura un proxy mediante la variable HTTPS_PROXY.
El modelo está funcionando pero es lento
Comprueba ollama ps. Si indica 100% CPU, tu GPU es demasiado pequeña o no se ha detectado correctamente. Actualiza tus controladores NVIDIA.
Respuestas cortadas después de unas líneas
La ventana de contexto predeterminada es de 2048 tokens. Amplíala con /set parameter num_ctx 8192 en la conversación.

#Para ir más allá

Tienes Ollama funcionando. Las siguientes etapas lógicas:

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.