Ollama en WSL2 o en Windows nativo: ¿cuál elegir? ?
En Windows coexisten dos formas de ejecutar Ollama: el instalador nativo .exe y una instalación de Linux en WSL2. Elegir entre Ollama en WSL2 y Ollama nativo no es solo una cuestión de gustos: afecta al rendimiento de la GPU, al acceso a los archivos y a la compatibilidad con AMD. Esta guía ayuda a decidir a partir de cifras y casos de uso concretos, para que elijas la configuración adecuada a la primera.
#El reto: dos Ollama en la misma máquina
Desde que Ollama ofrece un instalador nativo para Windows, la pregunta «¿Ollama en WSL2 o nativo?» se repite constantemente. Ambos enfoques ejecutan exactamente el mismo daemon, escuchan por defecto en http://localhost:11434 y sirven los mismos modelos GGUF. La diferencia está en otros aspectos: en la forma en que se expone la GPU, en dónde se encuentran tus archivos y en el ecosistema de herramientas que utilizas junto con Ollama.
En resumen, la ejecución nativa en Windows gana en simplicidad de instalación e integración con el escritorio, mientras que WSL2 gana en coherencia con un flujo de trabajo de Linux/desarrollo y en compatibilidad con herramientas que solo existen en Unix. Ninguno de los dos es «mejor» en términos absolutos: la elección correcta depende de lo que hagas con tus LLM.
- Ollama nativo para Windows
- Un .exe, un icono en la bandeja del sistema y el daemon se inicia con Windows. Ninguna capa de Linux que gestionar.
- Ollama bajo WSL2
- Una distribución de Linux (normalmente Ubuntu) en la que instalas Ollama como en un servidor. Ideal si tu entorno tecnológico ya está basado en Linux.
- Punto en común
- Misma API en el puerto 11434, mismos modelos, mismos comandos. De hecho, un cliente Windows puede comunicarse con un servidor WSL2 y viceversa.
#Prerrequisitos
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Para comparar ambos de forma justa, es necesario que cada entorno admita correctamente la GPU. Es ahí donde surgen la mayoría de las decepciones.
- Windows 11 (o una versión reciente de Windows 10)
- WSL2 con aceleración GPU (WSLg) requiere Windows 11 o una compilación Windows 10 reciente y actualizada.
- Controlador de GPU actualizado en Windows
- En WSL2, es el controlador de Windows el que expone la GPU a Linux a través de /dev/dxg. Instala el controlador NVIDIA (Game Ready o Studio) o AMD Adrenalin más reciente, NO un controlador de Linux en la distribución.
- WSL2 activado
- El comando « wsl --install », ejecutado desde PowerShell con permisos de administrador, instala WSL2 y una distribución de Ubuntu por defecto.
- VRAM suficiente
- Las cifras de referencia para Q4_K_M siguen siendo las mismas en ambos mundos: 7B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19 GB, 70B ≈ 40 GB. WSL2 no cambia estos requisitos.
#Instalar correctamente Ollama en WSL2
La instalación en WSL2 es idéntica a la de un servidor Linux: el script oficial detecta la GPU expuesta por WSLg y configura la aceleración automáticamente.
- 01Activar WSL2En una sesión de PowerShell con permisos de administrador: «wsl --install». Reinicia si se te solicita. Después, comprueba con «wsl -l -v» que tu distribución esté en VERSION 2.
- 02Actualizar la distribuciónAbre Ubuntu, luego «sudo apt update && sudo apt upgrade -y». Una distribución actualizada evita sorpresas con los runtimes de GPU.
- 03Instalar OllamaEjecuta el script oficial: « curl -fsSL https://ollama.com/install.sh | sh ». Detecta NVIDIA (a través de CUDA expuesto por WSLg) o AMD (ROCm) y lo anuncia en los logs.
- 04Verificar la GPUCarga un pequeño modelo y mira « ollama ps »: la columna PROCESSOR debe indicar GPU, no CPU. Si es CPU, la aceleración no está activa.
- 05Probar un modelo« ollama run qwen3.5:9b » y luego haz una pregunta. Este modelo de 2026 (6,6 GB en Q4, 256k de contexto, visión) es la opción predeterminada en una tarjeta de 8 GB. Añade --verbose para ver los tokens/segundo reales.
#Rendimiento de la GPU: ejecución nativa frente a WSL2, con cifras que lo respaldan
Esta es LA pregunta que motiva esta guía. Buena noticia: para la inferencia de LLM en GPU NVIDIA, la diferencia entre Ollama nativo y WSL2 es pequeña. Una vez cargado el modelo en la VRAM, el cálculo se realiza en la GPU en ambos casos, y WSL2 apenas añade sobrecarga a la generación de tokens en sí.
En la práctica, con una misma tarjeta (por ejemplo, una RTX 4070 de 12 GB con un modelo de 8B en Q4_K_M), se observan velocidades de generación muy similares: la diferencia suele ser de unos pocos puntos porcentuales y a menudo queda diluida en la variabilidad de las mediciones. Donde WSL2 puede penalizar un poco el rendimiento es en la carga inicial del modelo desde el disco: el sistema de archivos de WSL2 es rápido en su disco virtual ext4, pero el acceso a los archivos almacenados en Windows (a través de /mnt/c) es considerablemente más lento.
- Generación de tokens (GPU)
- Prácticamente idéntico en ejecución nativa y bajo WSL2 con NVIDIA. La GPU hace el trabajo en ambos casos; la capa WSL2 es transparente para el cálculo.
- Carga del modelo
- Rápido si los modelos están en el sistema de archivos Linux nativo de WSL2. Lento si Ollama lee sus blobs desde /mnt/c/... (al pasar por el puente con Windows).
- Latencia del primer token
- Comparable, siempre que el modelo ya esté en caché en la VRAM. La primera carga en frío es la etapa delicada.
- Sobrecarga de CPU
- Despreciable para la inferencia. WSL2 es una verdadera VM ligera, no una emulación; el costo de virtualización no se ve en cargas GPU.
Conclusión sobre el rendimiento puro: si tienes una tarjeta NVIDIA, la elección entre ejecución nativa y WSL2 NO depende de la velocidad de generación. Elige según tu flujo de trabajo. El rendimiento solo vuelve a ser un argumento en dos casos: el almacenamiento de los modelos (que deben mantenerse en el lado Linux cuando se usa WSL2) y la compatibilidad con AMD, que abordamos ahora.
#El caso de AMD: ROCm bajo WSL2
Con las GPU de AMD, la situación es diferente y más matizada. Ollama utiliza ROCm para acelerar en las Radeon compatibles. Sin embargo, ROCm ha sido durante mucho tiempo un campo minado en Windows, y WSL2 ha cambiado el panorama, aunque no siempre para bien, según tu tarjeta.
- AMD de forma nativa en Windows
- Ollama incluye una biblioteca ROCm para Windows. En las tarjetas oficialmente compatibles (RX 7000 recientes, algunas RX 6000), la aceleración funciona sin WSL2. A menudo es la opción más sencilla para un ordenador de sobremesa AMD.
- AMD bajo WSL2
- ROCm existe para WSL2, pero la lista de GPU compatibles es más reducida y la configuración más delicada. Puede ser necesario si quieres herramientas de Linux, pero no es más rápido por sí mismo.
- Tarjetas no compatibles
- Muchas Radeon antiguas y muchas APU no figuran en la lista oficial de ROCm. En estas tarjetas, Ollama puede recurrir a la CPU en ambos entornos.
- Solución alternativa con HSA
- La variable HSA_OVERRIDE_GFX_VERSION permite a veces forzar el reconocimiento de una GPU similar a un modelo compatible. Reservado a usuarios avanzados, sin garantía.
#Acceso a archivos e integración con VS Code
Más allá del rendimiento, a menudo el acceso a los archivos determina la elección. Se puede acceder a cada uno de los dos sistemas de archivos (NTFS de Windows y ext4 de Linux en WSL2) desde el otro, pero cruzar ese puente tiene un coste de rendimiento y las convenciones de rutas son diferentes.
- Desde WSL2 hacia Windows
- Tus discos Windows están montados en /mnt/c, /mnt/d, etc. Es práctico para leer carpetas de documentos, pero lento para accesos intensivos (carga de modelos grandes, indexación RAG).
- Desde Windows hacia WSL2
- El sistema de archivos de Linux es accesible mediante la ruta de red \\wsl$\Ubuntu\ en el Explorador. Es útil para copiar un archivo allí, pero evita que las herramientas de Windows trabajen intensivamente en ese sistema de archivos.
- Regla de oro
- Mantén cada carga de trabajo en su sistema de archivos nativo. Proyecto de desarrollo en Linux → en WSL2. Documentos de oficina → en Windows. Así evitas el puente lento.
En VS Code, la integración con WSL es excelente y favorece claramente WSL2 para el trabajo de desarrollo. La extensión oficial «WSL» abre un proyecto directamente en la distribución: el servidor de VS Code se ejecuta en Linux, el terminal integrado es un shell de Linux y tu código de llamada a la API de Ollama se ejecuta en el mismo entorno que el demonio.
#¿Qué configuración se recomienda según tu uso?
Aquí tienes un resumen práctico. Elige según tu perfil de uso predominante, en lugar de basarte en pequeñas diferencias de tokens por segundo.
- Uso en escritorio / público general (NVIDIA)
- Ollama nativo para Windows. Instalación en un clic, inicio al abrir la sesión, sin ninguna capa de Linux que mantener. Perfecto con LM Studio u Open WebUI como interfaz.
- Desarrollador Linux / stack Unix
- Ollama bajo WSL2. Recuperas tus herramientas (scripts bash, Docker, Python venv) en el mismo entorno que el daemon, con una integración de VS Code excelente.
- GPU AMD de consumo
- Prueba primero la versión nativa para Windows: suele ser la más sencilla de hacer funcionar mediante ROCm integrado. Pasa a WSL2 solo si tu flujo de trabajo lo requiere y tu tarjeta es compatible.
- Servidor / uso compartido en red
- WSL2 se aproxima a un despliegue convencional en un servidor Linux y facilita la reproducibilidad (los mismos comandos que en producción). Ten en cuenta OLLAMA_HOST para hacerlo accesible.
#Solución de problemas
- « ollama ps » muestra CPU en lugar de GPU
- En WSL2, comprueba que «nvidia-smi» responda. Si no, actualiza el controlador en Windows y no instales ningún controlador de Linux en la distribución.
- Carga del modelo muy lenta
- Tus modelos probablemente están almacenados en /mnt/c. Muévelos al sistema de archivos de Linux (~/.ollama) para recuperar la velocidad.
- « address already in use » en 11434
- Un Ollama nativo y un Ollama WSL2 funcionan al mismo tiempo. Detén uno de ellos o cambia el puerto del otro con OLLAMA_HOST=127.0.0.1:11435.
- GPU AMD ignorado
- Tarjeta fuera de la lista de ROCm. Comprueba la compatibilidad, prueba HSA_OVERRIDE_GFX_VERSION si procede o recurre a la ejecución nativa en Windows.
- El cliente de Windows no se conecta al daemon de WSL2
- Usa http://localhost:11434 (la redirección de WSL2 se encarga del puente) y asegúrate de que un solo daemon escuche en este puerto.
#Para ir más allá
Una vez que hayas elegido tu entorno, estas guías te ayudarán a sacarle el máximo provecho:
- Instalar Ollama en Windows 11
- Guía paso a paso del instalador nativo, complemento de este comparativo si eliges la vía Windows.
- Solucionar problemas de Ollama: GPU no detectada, lentitud, errores de memoria
- Para profundizar en los problemas de GPU, tanto en entornos nativos como bajo WSL2.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para ajustar el uso de VRAM a tu tarjeta, independientemente del entorno.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.