Intermedio 10 minOpenAI

gpt-oss en local: los modelos de pesos abiertos de OpenAI con Ollama

OpenAI finalmente publicó pesos abiertos: gpt-oss-20b y gpt-oss-120b, dos modelos de mezcla de expertos bajo licencia Apache 2.0. Esta guía muestra cómo ejecutar gpt-oss con Ollama, cuánta VRAM requiere cada versión, cómo funciona la cuantización MXFP4 nativa y cómo ajustar el esfuerzo de razonamiento. Terminamos evaluando qué ofrecen realmente estos modelos de pesos abiertos frente a Qwen y DeepSeek.

Por Clara M.·Actualización 2026-07-24·Probado en Windows, macOS y Linux

#¿Por qué gpt-oss cambia el panorama?

Durante años, OpenAI mantuvo sus modelos cerrados. Con gpt-oss, la empresa vuelve por primera vez desde GPT-2 a ofrecer pesos que realmente se pueden descargar, y esta vez bajo licencia Apache 2.0: uso comercial permitido, sin cláusula que obligue a compartir, sin límite de usuarios. Descargas los pesos, se ejecutan en tu máquina y nada sale de tu red.

Técnicamente, gpt-oss se basa en una arquitectura MoE (Mixture of Experts): el modelo contiene muchos parámetros en total, pero solo activa una pequeña fracción con cada token. Resultado: una calidad cercana a la de un modelo denso grande, con el consumo de memoria y la velocidad de un modelo mucho más pequeño. Ambas versiones están orientadas al razonamiento, las llamadas a herramientas y el seguimiento de instrucciones, con un contexto de 128k tokens.

gpt-oss-20b
≈ 21 mil millones de parámetros en total, ≈ 3,6 mil millones activos por token. Diseñado para una sola tarjeta de consumo de 16 GB.
gpt-oss-120b
≈ 117 mil millones de parámetros en total, ≈ 5,1 mil millones activos por token. Destinado a una tarjeta de centro de datos de 80 GB o a una máquina con una gran cantidad de memoria unificada.
Licencia
Apache 2.0 — permite el uso comercial, la redistribución y el ajuste fino sin restricciones de uso.
Cuantización
MXFP4 nativo en los pesos de los expertos: el formato de 4 bits forma parte de la publicación, no de una conversión aproximada realizada por terceros.

#gpt-oss ollama: ¿20b o 120b?

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

La elección depende casi exclusivamente de tu hardware. Los dos modelos comparten la misma familia y el mismo formato de respuesta; la diferencia de calidad existe, pero sigue siendo secundaria frente a la pregunta «¿cabe en mi VRAM?». Aquí tienes una referencia sencilla.

20b — la opción predeterminada razonable
Alrededor de 14 a 16 GB una vez cargado en MXFP4. Se puede ejecutar en una RTX 4080 de 16 GB o una RTX 4090, y en un Mac Apple Silicon a partir de 24 GB de memoria unificada. Es la versión que se debe instalar primero.
120b — cuando tienes suficiente memoria
Aproximadamente 60-65 GB en MXFP4. Está pensado para una GPU de 80 GB (clase H100/A100), un equipo con varias GPU o un Mac con mucha memoria unificada (M3/M5 Ultra de 96 GB o más). No tiene sentido probarlo con menos de 64 GB de memoria disponible para el modelo.
Calidad relativa
El 120b amplía la ventaja en razonamiento de varios pasos, código largo y tareas ambiguas. En preguntas y respuestas habituales y en francés, el 20b ya se desenvuelve muy bien.
i
MoE: pocos parámetros activos, pero toda la memoria
La arquitectura MoE reduce el cálculo por token, no la huella de memoria: todos los expertos deben cargarse en VRAM aunque solo un grupo trabaje en cada paso. Es por eso que el 120b pide ~65 GB mientras que solo activa ~5 B de parámetros.

#Prerrequisitos

Nada exótico: una instalación de Ollama actualizada y suficiente memoria para la versión deseada. Ollama gestiona por sí solo la descarga, la cuantización MXFP4 y el reparto de la carga entre GPU y CPU.

Ollama reciente
Versión compatible con gpt-oss y MXFP4. Actualiza antes de empezar: las versiones demasiado antiguas no reconocen el formato.
VRAM / memoria unificada
≥ 16 GB para el 20b, ≥ 64 GB para el 120b. Por debajo de estos valores, Ollama descargará parte del modelo en la RAM del sistema y la velocidad caerá drásticamente.
Espacio en disco
≈ 12-14 GB para el 20b, ≈ 60-65 GB para el 120b. Los pesos se almacenan en la carpeta de modelos de Ollama.
Daemon en escucha
Ollama expone su API en http://localhost:11434 por defecto, lo que resulta práctico para conectar Open WebUI o código que utilice esa API.
→
¿Aún no tienes Ollama?
Sigue primero la guía de instalación de Ollama para tu sistema operativo (Windows, macOS o Linux) y luego vuelve aquí. Todo el resto de esta guía presupone que el comando ollama responde en tu terminal.

#Instalar gpt-oss-20b en un solo comando

La versión 20b se instala y se inicia en una sola línea. Ollama descarga los pesos MXFP4, los carga en el GPU y abre una sesión de chat.

Terminal
# Télécharge et lance gpt-oss-20b
ollama run gpt-oss:20b

En la primera ejecución, ten en cuenta el tiempo necesario para descargar unos 13 GB. Después, el modelo queda en caché. Para descargar únicamente los pesos sin abrir una sesión interactiva, usa pull.

Terminal
# Récupérer sans lancer le chat
ollama pull gpt-oss:20b

# Vérifier que le modèle est présent
ollama list

# Voir s'il tourne bien sur le GPU
ollama ps

En ollama ps, lo deseable es ver un porcentaje de GPU elevado. Si la columna muestra « 100% CPU », significa que el modelo no ha cabido en la VRAM y se ha trasladado a la RAM: la generación será lenta. En una RTX 4090, puedes esperar una velocidad de generación cómoda para el uso interactivo; en una 4080 de 16 GB, el 20b cabe, pero sin margen para un contexto grande.

Para controlar el modelo mediante una API en lugar de usar el chat, el endpoint ya está disponible. Aquí tienes una llamada mínima.

API — generación
curl http://localhost:11434/api/generate -d '{
  "model": "gpt-oss:20b",
  "prompt": "Explique la quantification MXFP4 en trois phrases.",
  "stream": false
}'

#El 120b, para qué máquinas

El comando es el mismo, solo cambia el tag. Pero ejecútalo únicamente si realmente dispones de la memoria necesaria: con menos de 64 GB, Ollama trasladará parte de los expertos a la CPU y obtendrás, en el mejor de los casos, unos pocos tokens por segundo.

Terminal
# ~60-65 Go de mémoire nécessaires
ollama pull gpt-oss:120b
ollama run gpt-oss:120b
  1. 01
    Verificar la memoria disponible
    En GPU NVIDIA, nvidia-smi debe mostrar una tarjeta de 80 GB (o varias tarjetas que acumulen suficiente VRAM). En Mac, una memoria unificada de 96 GB+ deja margen para el modelo y el sistema.
  2. 02
    Hacer el pull
    La descarga es considerable (~60 GB): ten en cuenta la velocidad de descarga y el espacio en disco. El formato MXFP4 evita tener que volver a cuantizar el modelo tú mismo.
  3. 03
    Comprobar dónde se ejecuta el modelo
    Después de ollama run, ejecutar ollama ps en otro terminal confirma qué porcentaje del modelo está en la GPU. Si una gran parte del modelo se deriva a la CPU, la memoria es insuficiente; vuelve al 20b.
  4. 04
    Ajustar el contexto
    El 120b acepta 128k tokens, pero un contexto completo consume mucha memoria adicional. Reduce num_ctx si vas justo de VRAM.
!
Configuraciones multi-GPU de consumo: cuidado con las expectativas
Combinar dos RTX 4090 (48 GB) no basta para el 120b, y el reparto entre GPU a través de PCIe añade latencia. Para este modelo, una sola tarjeta de 80 GB o una gran cantidad de memoria unificada sigue ofreciendo mucha más fluidez que un montaje improvisado con varias tarjetas.

#Ajustar el esfuerzo de razonamiento

Particularidad de gpt-oss: los modelos generan una cadena de razonamiento antes de responder, y puedes ajustar este esfuerzo. Tres niveles —low, medium, high— permiten elegir el equilibrio entre velocidad y profundidad. Con un esfuerzo bajo, el modelo responde rápidamente a tareas sencillas; con un esfuerzo alto, razona durante más tiempo para resolver problemas de matemáticas, código o lógica de varios pasos.

El ajuste se realiza en el mensaje de sistema. Indica el nivel deseado y el modelo ajusta la longitud de su reflexión interna.

API — esfuerzo alto
curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:20b",
  "messages": [
    { "role": "system", "content": "Reasoning: high" },
    { "role": "user", "content": "Résous : un train part à 14h à 120 km/h, un autre à 15h à 150 km/h. Quand se rejoignent-ils ?" }
  ],
  "stream": false
}'
Reasoning: low
Respuestas rápidas, poca reflexión visible. Ideal para reformulación, resúmenes cortos, preguntas factuales.
Reasoning: medium
Buen equilibrio por defecto: un poco de razonamiento sin disparar la latencia.
Reasoning: high
Reflexión profunda, mejor en problemas difíciles — a cambio de una generación más larga y de más tokens consumidos.
→
El razonamiento cuesta tokens
Un esfuerzo «high» multiplica los tokens de reflexión antes de la respuesta final. En tareas simples, mantener «low» o «medium» reduce netamente el tiempo de respuesta sin perder calidad percibida.

#Fortalezas y debilidades frente a Qwen y DeepSeek

gpt-oss llega a un terreno ya ocupado por modelos de pesos abiertos muy sólidos. Veamos en qué destaca y en qué sigue por detrás, sin indulgencia.

Puntos fuertes
Razonamiento y llamadas a herramientas bien trabajados, esfuerzo ajustable, una licencia Apache 2.0 clara y un consumo de memoria controlado gracias a MoE + MXFP4. El 20b ofrece una relación calidad/VRAM impresionante en una sola tarjeta de 16 GB.
Frente a Qwen3
Qwen suele seguir por delante en tareas multilingües y en francés, con una gama de tamaños más amplia (desde 4B hasta grandes MoE). gpt-oss compensa con la calidad de su cadena de razonamiento y la precisión con la que sigue las instrucciones.
Frente a DeepSeek
Los modelos de razonamiento de DeepSeek (R1 y V3.2) llegan más lejos en los problemas muy difíciles, pero sus versiones grandes requieren mucho más hardware. El 20b de gpt-oss está orientado a un uso local accesible, mientras que DeepSeek V3.2 apunta a la gama alta.
Debilidad que hay que conocer
El francés no es la prioridad de gpt-oss: la calidad en este idioma es buena, pero ligeramente inferior a la del inglés y, a veces, a la de Qwen. Haz pruebas con tus propios prompts antes de decidir.

#Solución de problemas

« unknown model » o formato no reconocido
Tu Ollama es demasiado antiguo para MXFP4. Actualiza a una versión reciente y vuelve a ejecutar el pull.
Generación muy lenta en el 20b
ollama ps montre du CPU au lieu du GPU : le modèle a débordé. Fermez les autres applis gourmandes en VRAM, réduisez num_ctx, ou vérifiez que le GPU est bien détecté.
El 120b falla o va terriblemente lento
Memoria insuficiente. Con menos de 64 GB realmente disponibles para el modelo, quédate con el 20b; el 120b no está hecho para tu máquina.
Respuestas demasiado lentas en el uso cotidiano
Reduce el esfuerzo de razonamiento a low o medium en el mensaje del sistema: high consume muchísimos tokens de reflexión.
Contexto que sobrecarga la VRAM
128k tokens consumen mucha memoria. Fija num_ctx en un valor razonable (por ejemplo, 8192) para tus usos cotidianos.

#Para ir más allá

Una vez que gpt-oss esté instalado, estas guías del sitio ayudan a perfeccionar tu stack local y a comparar los modelos:

Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para entender dónde se sitúa MXFP4 en comparación con los formatos GGUF clásicos y encontrar un equilibrio entre calidad y memoria en tus otros modelos.
Elegir tu GPU para IA local
Guía de compra 2026 para dimensionar la tarjeta según si buscas el 20b en 16 GB o modelos más exigentes.
Instalar DeepSeek R1 con Ollama
Comparativo directo en el terreno del razonamiento: instala R1 y evalúalo lado a lado con gpt-oss.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.