Intermedio 10 minWindows

Ollama en WSL2 o en Windows nativo: ¿cuál elegir? ?

En Windows coexisten dos formas de ejecutar Ollama: el instalador nativo .exe y una instalación de Linux en WSL2. Elegir entre Ollama en WSL2 y Ollama nativo no es solo una cuestión de gustos: afecta al rendimiento de la GPU, al acceso a los archivos y a la compatibilidad con AMD. Esta guía ayuda a decidir a partir de cifras y casos de uso concretos, para que elijas la configuración adecuada a la primera.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows 11

#El reto: dos Ollama en la misma máquina

Desde que Ollama ofrece un instalador nativo para Windows, la pregunta «¿Ollama en WSL2 o nativo?» se repite constantemente. Ambos enfoques ejecutan exactamente el mismo daemon, escuchan por defecto en http://localhost:11434 y sirven los mismos modelos GGUF. La diferencia está en otros aspectos: en la forma en que se expone la GPU, en dónde se encuentran tus archivos y en el ecosistema de herramientas que utilizas junto con Ollama.

En resumen, la ejecución nativa en Windows gana en simplicidad de instalación e integración con el escritorio, mientras que WSL2 gana en coherencia con un flujo de trabajo de Linux/desarrollo y en compatibilidad con herramientas que solo existen en Unix. Ninguno de los dos es «mejor» en términos absolutos: la elección correcta depende de lo que hagas con tus LLM.

Ollama nativo para Windows
Un .exe, un icono en la bandeja del sistema y el daemon se inicia con Windows. Ninguna capa de Linux que gestionar.
Ollama bajo WSL2
Una distribución de Linux (normalmente Ubuntu) en la que instalas Ollama como en un servidor. Ideal si tu entorno tecnológico ya está basado en Linux.
Punto en común
Misma API en el puerto 11434, mismos modelos, mismos comandos. De hecho, un cliente Windows puede comunicarse con un servidor WSL2 y viceversa.
i
No ejecutes los dos al mismo tiempo
Un Ollama nativo y un Ollama WSL2 necesitan ambos el puerto 11434. Si ambos funcionan, tendrás conflictos confusos (« address already in use » o peticiones que van al daemon incorrecto). Elige uno o cambia el puerto del otro mediante OLLAMA_HOST.

#Prerrequisitos

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Para comparar ambos de forma justa, es necesario que cada entorno admita correctamente la GPU. Es ahí donde surgen la mayoría de las decepciones.

Windows 11 (o una versión reciente de Windows 10)
WSL2 con aceleración GPU (WSLg) requiere Windows 11 o una compilación Windows 10 reciente y actualizada.
Controlador de GPU actualizado en Windows
En WSL2, es el controlador de Windows el que expone la GPU a Linux a través de /dev/dxg. Instala el controlador NVIDIA (Game Ready o Studio) o AMD Adrenalin más reciente, NO un controlador de Linux en la distribución.
WSL2 activado
El comando « wsl --install », ejecutado desde PowerShell con permisos de administrador, instala WSL2 y una distribución de Ubuntu por defecto.
VRAM suficiente
Las cifras de referencia para Q4_K_M siguen siendo las mismas en ambos mundos: 7B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19 GB, 70B ≈ 40 GB. WSL2 no cambia estos requisitos.
!
Trampa habitual: el controlador de Linux que lo rompe todo
En WSL2, nunca instales un controlador GPU Linux (el .run NVIDIA, o los paquetes mesa/amdgpu). La GPU ya está expuesta por el controlador de Windows. Instalar un controlador Linux encima rompe la aceleración. Se instalan únicamente el toolkit CUDA o los runtimes ROCm en espacio de usuario, no el controlador del kernel.

#Instalar correctamente Ollama en WSL2

La instalación en WSL2 es idéntica a la de un servidor Linux: el script oficial detecta la GPU expuesta por WSLg y configura la aceleración automáticamente.

  1. 01
    Activar WSL2
    En una sesión de PowerShell con permisos de administrador: «wsl --install». Reinicia si se te solicita. Después, comprueba con «wsl -l -v» que tu distribución esté en VERSION 2.
  2. 02
    Actualizar la distribución
    Abre Ubuntu, luego «sudo apt update && sudo apt upgrade -y». Una distribución actualizada evita sorpresas con los runtimes de GPU.
  3. 03
    Instalar Ollama
    Ejecuta el script oficial: « curl -fsSL https://ollama.com/install.sh | sh ». Detecta NVIDIA (a través de CUDA expuesto por WSLg) o AMD (ROCm) y lo anuncia en los logs.
  4. 04
    Verificar la GPU
    Carga un pequeño modelo y mira « ollama ps »: la columna PROCESSOR debe indicar GPU, no CPU. Si es CPU, la aceleración no está activa.
  5. 05
    Probar un modelo
    « ollama run qwen3.5:9b » y luego haz una pregunta. Este modelo de 2026 (6,6 GB en Q4, 256k de contexto, visión) es la opción predeterminada en una tarjeta de 8 GB. Añade --verbose para ver los tokens/segundo reales.
WSL2 (Ubuntu) — instalación
# Dans le terminal Ubuntu de WSL2
sudo apt update && sudo apt upgrade -y

# Installation officielle d'Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Vérifier la prise en charge du GPU
ollama pull qwen3.5:9b
ollama run qwen3.5:9b --verbose

# Le processeur utilisé (GPU attendu)
ollama ps
→
Comprobar que WSL2 detecta correctamente la GPU
Para NVIDIA, «nvidia-smi» debe funcionar directamente en WSL2 sin haber instalado nada en Linux: es la señal de que WSLg expone correctamente la tarjeta. Si responde, Ollama sabrá usarla.

#Rendimiento de la GPU: ejecución nativa frente a WSL2, con cifras que lo respaldan

Esta es LA pregunta que motiva esta guía. Buena noticia: para la inferencia de LLM en GPU NVIDIA, la diferencia entre Ollama nativo y WSL2 es pequeña. Una vez cargado el modelo en la VRAM, el cálculo se realiza en la GPU en ambos casos, y WSL2 apenas añade sobrecarga a la generación de tokens en sí.

En la práctica, con una misma tarjeta (por ejemplo, una RTX 4070 de 12 GB con un modelo de 8B en Q4_K_M), se observan velocidades de generación muy similares: la diferencia suele ser de unos pocos puntos porcentuales y a menudo queda diluida en la variabilidad de las mediciones. Donde WSL2 puede penalizar un poco el rendimiento es en la carga inicial del modelo desde el disco: el sistema de archivos de WSL2 es rápido en su disco virtual ext4, pero el acceso a los archivos almacenados en Windows (a través de /mnt/c) es considerablemente más lento.

Generación de tokens (GPU)
Prácticamente idéntico en ejecución nativa y bajo WSL2 con NVIDIA. La GPU hace el trabajo en ambos casos; la capa WSL2 es transparente para el cálculo.
Carga del modelo
Rápido si los modelos están en el sistema de archivos Linux nativo de WSL2. Lento si Ollama lee sus blobs desde /mnt/c/... (al pasar por el puente con Windows).
Latencia del primer token
Comparable, siempre que el modelo ya esté en caché en la VRAM. La primera carga en frío es la etapa delicada.
Sobrecarga de CPU
Despreciable para la inferencia. WSL2 es una verdadera VM ligera, no una emulación; el costo de virtualización no se ve en cargas GPU.
→
Mantén tus modelos en Linux
En WSL2, deja que Ollama almacene sus modelos en su ubicación predeterminada (~/.ollama en el sistema de archivos ext4 de la distribución). No configures OLLAMA_MODELS con una ruta /mnt/c/...: la velocidad de carga se reduciría enormemente al tener que atravesar el puente entre sistemas de archivos.

Conclusión sobre el rendimiento puro: si tienes una tarjeta NVIDIA, la elección entre ejecución nativa y WSL2 NO depende de la velocidad de generación. Elige según tu flujo de trabajo. El rendimiento solo vuelve a ser un argumento en dos casos: el almacenamiento de los modelos (que deben mantenerse en el lado Linux cuando se usa WSL2) y la compatibilidad con AMD, que abordamos ahora.

#El caso de AMD: ROCm bajo WSL2

Con las GPU de AMD, la situación es diferente y más matizada. Ollama utiliza ROCm para acelerar en las Radeon compatibles. Sin embargo, ROCm ha sido durante mucho tiempo un campo minado en Windows, y WSL2 ha cambiado el panorama, aunque no siempre para bien, según tu tarjeta.

AMD de forma nativa en Windows
Ollama incluye una biblioteca ROCm para Windows. En las tarjetas oficialmente compatibles (RX 7000 recientes, algunas RX 6000), la aceleración funciona sin WSL2. A menudo es la opción más sencilla para un ordenador de sobremesa AMD.
AMD bajo WSL2
ROCm existe para WSL2, pero la lista de GPU compatibles es más reducida y la configuración más delicada. Puede ser necesario si quieres herramientas de Linux, pero no es más rápido por sí mismo.
Tarjetas no compatibles
Muchas Radeon antiguas y muchas APU no figuran en la lista oficial de ROCm. En estas tarjetas, Ollama puede recurrir a la CPU en ambos entornos.
Solución alternativa con HSA
La variable HSA_OVERRIDE_GFX_VERSION permite a veces forzar el reconocimiento de una GPU similar a un modelo compatible. Reservado a usuarios avanzados, sin garantía.
!
AMD: verifica la compatibilidad ANTES de elegir
No des por hecho que tu Radeon tendrá aceleración bajo WSL2. Consulta la lista de GPU compatibles con ROCm en la documentación oficial de AMD y Ollama. Para una tarjeta AMD de consumo reciente, el instalador nativo de Ollama para Windows suele ser la opción menos complicada.
WSL2 — diagnóstico AMD ROCm
# La carte AMD est-elle vue par ROCm dans WSL2 ?
rocminfo | grep -i 'Name\|gfx'

# Forcer une version gfx proche (avancé, sans garantie)
# Exemple pour cibler gfx1030 sur une carte non listée :
HSA_OVERRIDE_GFX_VERSION=10.3.0 ollama serve

#Acceso a archivos e integración con VS Code

Más allá del rendimiento, a menudo el acceso a los archivos determina la elección. Se puede acceder a cada uno de los dos sistemas de archivos (NTFS de Windows y ext4 de Linux en WSL2) desde el otro, pero cruzar ese puente tiene un coste de rendimiento y las convenciones de rutas son diferentes.

Desde WSL2 hacia Windows
Tus discos Windows están montados en /mnt/c, /mnt/d, etc. Es práctico para leer carpetas de documentos, pero lento para accesos intensivos (carga de modelos grandes, indexación RAG).
Desde Windows hacia WSL2
El sistema de archivos de Linux es accesible mediante la ruta de red \\wsl$\Ubuntu\ en el Explorador. Es útil para copiar un archivo allí, pero evita que las herramientas de Windows trabajen intensivamente en ese sistema de archivos.
Regla de oro
Mantén cada carga de trabajo en su sistema de archivos nativo. Proyecto de desarrollo en Linux → en WSL2. Documentos de oficina → en Windows. Así evitas el puente lento.

En VS Code, la integración con WSL es excelente y favorece claramente WSL2 para el trabajo de desarrollo. La extensión oficial «WSL» abre un proyecto directamente en la distribución: el servidor de VS Code se ejecuta en Linux, el terminal integrado es un shell de Linux y tu código de llamada a la API de Ollama se ejecuta en el mismo entorno que el demonio.

Llamada a la API de Ollama (idéntica en ejecución nativa y en WSL2)
import requests

# Même endpoint quel que soit l'environnement
resp = requests.post(
    "http://localhost:11434/api/generate",
    json={
        "model": "qwen3.5:9b",
        "prompt": "Explique WSL2 en une phrase.",
        "stream": False,
    },
    timeout=120,
)
print(resp.json()["response"])
→
Cliente Windows, servidor WSL2 (o al revés)
Gracias a la redirección de localhost de WSL2, un programa ejecutado en Windows puede llamar a una instancia de Ollama que se ejecuta en WSL2 en http://localhost:11434, y viceversa. Por tanto, no tienes que ejecutarlo todo en el mismo entorno: resulta útil para un IDE de Windows controlado por un daemon de Linux.

#¿Qué configuración se recomienda según tu uso?

Aquí tienes un resumen práctico. Elige según tu perfil de uso predominante, en lugar de basarte en pequeñas diferencias de tokens por segundo.

Uso en escritorio / público general (NVIDIA)
Ollama nativo para Windows. Instalación en un clic, inicio al abrir la sesión, sin ninguna capa de Linux que mantener. Perfecto con LM Studio u Open WebUI como interfaz.
Desarrollador Linux / stack Unix
Ollama bajo WSL2. Recuperas tus herramientas (scripts bash, Docker, Python venv) en el mismo entorno que el daemon, con una integración de VS Code excelente.
GPU AMD de consumo
Prueba primero la versión nativa para Windows: suele ser la más sencilla de hacer funcionar mediante ROCm integrado. Pasa a WSL2 solo si tu flujo de trabajo lo requiere y tu tarjeta es compatible.
Servidor / uso compartido en red
WSL2 se aproxima a un despliegue convencional en un servidor Linux y facilita la reproducibilidad (los mismos comandos que en producción). Ten en cuenta OLLAMA_HOST para hacerlo accesible.
i
En una palabra
GPU NVIDIA + uso de escritorio → nativo. Flujo de trabajo de desarrollo en Linux → WSL2. El rendimiento de generación es casi idéntico; el ecosistema que los rodea debe determinar la elección.

#Solución de problemas

« ollama ps » muestra CPU en lugar de GPU
En WSL2, comprueba que «nvidia-smi» responda. Si no, actualiza el controlador en Windows y no instales ningún controlador de Linux en la distribución.
Carga del modelo muy lenta
Tus modelos probablemente están almacenados en /mnt/c. Muévelos al sistema de archivos de Linux (~/.ollama) para recuperar la velocidad.
« address already in use » en 11434
Un Ollama nativo y un Ollama WSL2 funcionan al mismo tiempo. Detén uno de ellos o cambia el puerto del otro con OLLAMA_HOST=127.0.0.1:11435.
GPU AMD ignorado
Tarjeta fuera de la lista de ROCm. Comprueba la compatibilidad, prueba HSA_OVERRIDE_GFX_VERSION si procede o recurre a la ejecución nativa en Windows.
El cliente de Windows no se conecta al daemon de WSL2
Usa http://localhost:11434 (la redirección de WSL2 se encarga del puente) y asegúrate de que un solo daemon escuche en este puerto.
WSL2 — cambiar el puerto para evitar un conflicto
# Faire écouter l'Ollama WSL2 sur un autre port
OLLAMA_HOST=127.0.0.1:11435 ollama serve

# Puis interroger ce daemon précisément
curl http://localhost:11435/api/tags

#Para ir más allá

Una vez que hayas elegido tu entorno, estas guías te ayudarán a sacarle el máximo provecho:

Instalar Ollama en Windows 11
Guía paso a paso del instalador nativo, complemento de este comparativo si eliges la vía Windows.
Solucionar problemas de Ollama: GPU no detectada, lentitud, errores de memoria
Para profundizar en los problemas de GPU, tanto en entornos nativos como bajo WSL2.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para ajustar el uso de VRAM a tu tarjeta, independientemente del entorno.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.