Instalar Ollama en Windows 11: guía completa (2026)
En Windows 11, Ollama se instala mediante un instalador convencional descargado del sitio oficial, con detección automática de la GPU (soporte nativo para CUDA de NVIDIA). Un solo comando de terminal (ollama run qwen3.5:4b) descarga y ejecuta un primer modelo en aproximadamente 5 minutos, sin configuración manual ni comandos complejos.
Tienes un PC con Windows y quieres ejecutar un LLM en local sin pasar por ChatGPT. Ollama es probablemente la herramienta más sencilla para lograrlo: un instalador estándar, un comando, un modelo. En solo 3 minutos, tienes Qwen 3.5 funcionando en tu máquina.
#¿Por qué Ollama?
Ollama gestiona por ti todo lo complicado: la descarga de los modelos, la cuantización, la carga en VRAM, la detección de la GPU y la API HTTP local. Por debajo funciona llama.cpp. Pero no tendrás que compilarlo.
La herramienta es gratuita, de código abierto y funciona completamente offline una vez descargado el modelo. Ningún dato se envía a un servidor remoto.
#Prerrequisitos
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
- Windows 10 o 11
- 64 bits. Ollama no tiene versión de 32 bits.
- 8 GB de RAM como mínimo
- 16 GB permiten usar con comodidad modelos de 8 a 9B con cuantización Q4.
- 10 GB de espacio en disco
- Un modelo de 4 a 9B pesa aproximadamente 3 a 7 GB. Reserva mucho espacio si planeas probar varios.
- GPU NVIDIA (opcional)
- Controladores actualizados, RTX 20/30/40/50 o GTX 16. Ollama detecta la GPU automáticamente.
#1. Descarga
Visita el sitio oficial y descarga el instalador de Windows.
El instalador ocupa aproximadamente 700 MB. Es normal: incluye los binarios precompilados llama.cpp con soporte CUDA.
#2. Instalación
- 01Inicia OllamaSetup.exeHaz doble clic en el instalador descargado. Windows Defender puede mostrar una advertencia de SmartScreen: haz clic en "Más información" y luego en "Ejecutar de todas formas".
- 02Instalación silenciosaSin ventanas de configuración: el instalador se instala en %LOCALAPPDATA%\Programs\Ollama y arranca automáticamente el servicio en segundo plano.
- 03Comprueba el icono del sistemaUn pequeño icono de Ollama aparece cerca del reloj, en la esquina inferior derecha. Indica que el daemon está en ejecución.
- 04Abre un terminalPowerShell, Windows Terminal o cmd.exe: da igual. Escribe el comando de verificación que aparece a continuación.
Deberías ver algo como ollama version is 0.5.x. Si no se reconoce el comando, cierra y vuelve a abrir el terminal: el PATH acaba de modificarse.
#3. Tu primer modelo
Qwen 3.5 4B es una buena opción inicial: multilingüe (con un nivel muy bueno de francés), ligero, muy rápido y de excelente calidad para su tamaño. Bajo licencia Apache 2.0.
La primera vez, Ollama descarga el modelo (aproximadamente 3,4 GB en Q4). Las veces siguientes, el lanzamiento es instantáneo. Cuando aparezca el prompt >>>, puedes conversar.
#4. Verificar que se esté usando la GPU
Por defecto, Ollama detecta tu GPU NVIDIA y carga el modelo en ella. Para confirmarlo, ejecuta este comando mientras hay una conversación en curso:
En la columna PROCESSOR, deberías ver 100% GPU. Si ves CPU o un porcentaje parcial, es que parte del modelo se carga en la RAM del sistema.
Para supervisar el uso del GPU en tiempo real, abre otra ventana de PowerShell:
#5. Una interfaz limpia con Open WebUI
El terminal es bueno para probar. Para uso diario, Open WebUI se parece a ChatGPT — historial, markdown, archivos adjuntos, todo está allí. El método más sencillo pasa por Docker Desktop.
Abre después http://localhost:3000 en tu navegador. Crea una cuenta (es local, nada sale de tu máquina) y tus modelos Ollama aparecen en la lista.
#Solución de problemas
- "ollama: comando no encontrado"
- El PATH no se recargó. Cierra y vuelve a abrir todos tus terminales. Como último recurso, reinicia la sesión de Windows.
- Descarga bloqueada en 0%
- Un firewall corporativo a veces bloquea Ollama. Prueba desde otra red o configura un proxy mediante la variable HTTPS_PROXY.
- El modelo está funcionando pero es lento
- Comprueba ollama ps. Si indica 100% CPU, tu GPU es demasiado pequeña o no se ha detectado correctamente. Actualiza tus controladores NVIDIA.
- Respuestas cortadas después de unas líneas
- La ventana de contexto predeterminada es de 2048 tokens. Amplíala con /set parameter num_ctx 8192 en la conversación.
#Para ir más allá
Tienes Ollama funcionando. Las siguientes etapas lógicas:
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.