gpt-oss en local: los modelos de pesos abiertos de OpenAI con Ollama
OpenAI finalmente publicó pesos abiertos: gpt-oss-20b y gpt-oss-120b, dos modelos de mezcla de expertos bajo licencia Apache 2.0. Esta guía muestra cómo ejecutar gpt-oss con Ollama, cuánta VRAM requiere cada versión, cómo funciona la cuantización MXFP4 nativa y cómo ajustar el esfuerzo de razonamiento. Terminamos evaluando qué ofrecen realmente estos modelos de pesos abiertos frente a Qwen y DeepSeek.
#¿Por qué gpt-oss cambia el panorama?
Durante años, OpenAI mantuvo sus modelos cerrados. Con gpt-oss, la empresa vuelve por primera vez desde GPT-2 a ofrecer pesos que realmente se pueden descargar, y esta vez bajo licencia Apache 2.0: uso comercial permitido, sin cláusula que obligue a compartir, sin límite de usuarios. Descargas los pesos, se ejecutan en tu máquina y nada sale de tu red.
Técnicamente, gpt-oss se basa en una arquitectura MoE (Mixture of Experts): el modelo contiene muchos parámetros en total, pero solo activa una pequeña fracción con cada token. Resultado: una calidad cercana a la de un modelo denso grande, con el consumo de memoria y la velocidad de un modelo mucho más pequeño. Ambas versiones están orientadas al razonamiento, las llamadas a herramientas y el seguimiento de instrucciones, con un contexto de 128k tokens.
- gpt-oss-20b
- ≈ 21 mil millones de parámetros en total, ≈ 3,6 mil millones activos por token. Diseñado para una sola tarjeta de consumo de 16 GB.
- gpt-oss-120b
- ≈ 117 mil millones de parámetros en total, ≈ 5,1 mil millones activos por token. Destinado a una tarjeta de centro de datos de 80 GB o a una máquina con una gran cantidad de memoria unificada.
- Licencia
- Apache 2.0 — permite el uso comercial, la redistribución y el ajuste fino sin restricciones de uso.
- Cuantización
- MXFP4 nativo en los pesos de los expertos: el formato de 4 bits forma parte de la publicación, no de una conversión aproximada realizada por terceros.
#gpt-oss ollama: ¿20b o 120b?
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
La elección depende casi exclusivamente de tu hardware. Los dos modelos comparten la misma familia y el mismo formato de respuesta; la diferencia de calidad existe, pero sigue siendo secundaria frente a la pregunta «¿cabe en mi VRAM?». Aquí tienes una referencia sencilla.
- 20b — la opción predeterminada razonable
- Alrededor de 14 a 16 GB una vez cargado en MXFP4. Se puede ejecutar en una RTX 4080 de 16 GB o una RTX 4090, y en un Mac Apple Silicon a partir de 24 GB de memoria unificada. Es la versión que se debe instalar primero.
- 120b — cuando tienes suficiente memoria
- Aproximadamente 60-65 GB en MXFP4. Está pensado para una GPU de 80 GB (clase H100/A100), un equipo con varias GPU o un Mac con mucha memoria unificada (M3/M5 Ultra de 96 GB o más). No tiene sentido probarlo con menos de 64 GB de memoria disponible para el modelo.
- Calidad relativa
- El 120b amplía la ventaja en razonamiento de varios pasos, código largo y tareas ambiguas. En preguntas y respuestas habituales y en francés, el 20b ya se desenvuelve muy bien.
#Prerrequisitos
Nada exótico: una instalación de Ollama actualizada y suficiente memoria para la versión deseada. Ollama gestiona por sí solo la descarga, la cuantización MXFP4 y el reparto de la carga entre GPU y CPU.
- Ollama reciente
- Versión compatible con gpt-oss y MXFP4. Actualiza antes de empezar: las versiones demasiado antiguas no reconocen el formato.
- VRAM / memoria unificada
- ≥ 16 GB para el 20b, ≥ 64 GB para el 120b. Por debajo de estos valores, Ollama descargará parte del modelo en la RAM del sistema y la velocidad caerá drásticamente.
- Espacio en disco
- ≈ 12-14 GB para el 20b, ≈ 60-65 GB para el 120b. Los pesos se almacenan en la carpeta de modelos de Ollama.
- Daemon en escucha
- Ollama expone su API en http://localhost:11434 por defecto, lo que resulta práctico para conectar Open WebUI o código que utilice esa API.
#Instalar gpt-oss-20b en un solo comando
La versión 20b se instala y se inicia en una sola línea. Ollama descarga los pesos MXFP4, los carga en el GPU y abre una sesión de chat.
En la primera ejecución, ten en cuenta el tiempo necesario para descargar unos 13 GB. Después, el modelo queda en caché. Para descargar únicamente los pesos sin abrir una sesión interactiva, usa pull.
En ollama ps, lo deseable es ver un porcentaje de GPU elevado. Si la columna muestra « 100% CPU », significa que el modelo no ha cabido en la VRAM y se ha trasladado a la RAM: la generación será lenta. En una RTX 4090, puedes esperar una velocidad de generación cómoda para el uso interactivo; en una 4080 de 16 GB, el 20b cabe, pero sin margen para un contexto grande.
Para controlar el modelo mediante una API en lugar de usar el chat, el endpoint ya está disponible. Aquí tienes una llamada mínima.
#El 120b, para qué máquinas
El comando es el mismo, solo cambia el tag. Pero ejecútalo únicamente si realmente dispones de la memoria necesaria: con menos de 64 GB, Ollama trasladará parte de los expertos a la CPU y obtendrás, en el mejor de los casos, unos pocos tokens por segundo.
- 01Verificar la memoria disponibleEn GPU NVIDIA, nvidia-smi debe mostrar una tarjeta de 80 GB (o varias tarjetas que acumulen suficiente VRAM). En Mac, una memoria unificada de 96 GB+ deja margen para el modelo y el sistema.
- 02Hacer el pullLa descarga es considerable (~60 GB): ten en cuenta la velocidad de descarga y el espacio en disco. El formato MXFP4 evita tener que volver a cuantizar el modelo tú mismo.
- 03Comprobar dónde se ejecuta el modeloDespués de ollama run, ejecutar ollama ps en otro terminal confirma qué porcentaje del modelo está en la GPU. Si una gran parte del modelo se deriva a la CPU, la memoria es insuficiente; vuelve al 20b.
- 04Ajustar el contextoEl 120b acepta 128k tokens, pero un contexto completo consume mucha memoria adicional. Reduce num_ctx si vas justo de VRAM.
#Ajustar el esfuerzo de razonamiento
Particularidad de gpt-oss: los modelos generan una cadena de razonamiento antes de responder, y puedes ajustar este esfuerzo. Tres niveles —low, medium, high— permiten elegir el equilibrio entre velocidad y profundidad. Con un esfuerzo bajo, el modelo responde rápidamente a tareas sencillas; con un esfuerzo alto, razona durante más tiempo para resolver problemas de matemáticas, código o lógica de varios pasos.
El ajuste se realiza en el mensaje de sistema. Indica el nivel deseado y el modelo ajusta la longitud de su reflexión interna.
- Reasoning: low
- Respuestas rápidas, poca reflexión visible. Ideal para reformulación, resúmenes cortos, preguntas factuales.
- Reasoning: medium
- Buen equilibrio por defecto: un poco de razonamiento sin disparar la latencia.
- Reasoning: high
- Reflexión profunda, mejor en problemas difíciles — a cambio de una generación más larga y de más tokens consumidos.
#Fortalezas y debilidades frente a Qwen y DeepSeek
gpt-oss llega a un terreno ya ocupado por modelos de pesos abiertos muy sólidos. Veamos en qué destaca y en qué sigue por detrás, sin indulgencia.
- Puntos fuertes
- Razonamiento y llamadas a herramientas bien trabajados, esfuerzo ajustable, una licencia Apache 2.0 clara y un consumo de memoria controlado gracias a MoE + MXFP4. El 20b ofrece una relación calidad/VRAM impresionante en una sola tarjeta de 16 GB.
- Frente a Qwen3
- Qwen suele seguir por delante en tareas multilingües y en francés, con una gama de tamaños más amplia (desde 4B hasta grandes MoE). gpt-oss compensa con la calidad de su cadena de razonamiento y la precisión con la que sigue las instrucciones.
- Frente a DeepSeek
- Los modelos de razonamiento de DeepSeek (R1 y V3.2) llegan más lejos en los problemas muy difíciles, pero sus versiones grandes requieren mucho más hardware. El 20b de gpt-oss está orientado a un uso local accesible, mientras que DeepSeek V3.2 apunta a la gama alta.
- Debilidad que hay que conocer
- El francés no es la prioridad de gpt-oss: la calidad en este idioma es buena, pero ligeramente inferior a la del inglés y, a veces, a la de Qwen. Haz pruebas con tus propios prompts antes de decidir.
#Solución de problemas
- « unknown model » o formato no reconocido
- Tu Ollama es demasiado antiguo para MXFP4. Actualiza a una versión reciente y vuelve a ejecutar el pull.
- Generación muy lenta en el 20b
- ollama ps montre du CPU au lieu du GPU : le modèle a débordé. Fermez les autres applis gourmandes en VRAM, réduisez num_ctx, ou vérifiez que le GPU est bien détecté.
- El 120b falla o va terriblemente lento
- Memoria insuficiente. Con menos de 64 GB realmente disponibles para el modelo, quédate con el 20b; el 120b no está hecho para tu máquina.
- Respuestas demasiado lentas en el uso cotidiano
- Reduce el esfuerzo de razonamiento a low o medium en el mensaje del sistema: high consume muchísimos tokens de reflexión.
- Contexto que sobrecarga la VRAM
- 128k tokens consumen mucha memoria. Fija num_ctx en un valor razonable (por ejemplo, 8192) para tus usos cotidianos.
#Para ir más allá
Una vez que gpt-oss esté instalado, estas guías del sitio ayudan a perfeccionar tu stack local y a comparar los modelos:
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para entender dónde se sitúa MXFP4 en comparación con los formatos GGUF clásicos y encontrar un equilibrio entre calidad y memoria en tus otros modelos.
- Elegir tu GPU para IA local
- Guía de compra 2026 para dimensionar la tarjeta según si buscas el 20b en 16 GB o modelos más exigentes.
- Instalar DeepSeek R1 con Ollama
- Comparativo directo en el terreno del razonamiento: instala R1 y evalúalo lado a lado con gpt-oss.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.