GLM-5 en local con Ollama : el competidor open-weights
GLM-5 es la nueva familia de pesos abiertos de Zhipu AI (Universidad de Tsinghua). Versiones 9B y 32B, licencia permisiva, razonamiento sólido, francés correcto y resultados respetables en programación. Esta guía muestra cómo instalar GLM-5 localmente con Ollama, mide el rendimiento real en RTX 4070 y 4090, y lo compara con Qwen3-32B y DeepSeek V3.2 en las mismas tareas.
#¿Por qué GLM-5?
GLM-5 no tiene la notoriedad de Qwen3 o DeepSeek, pero es uno de los modelos chinos de pesos abiertos más logrados de los últimos meses. El 9B está dirigido a configuraciones modestas (12 GB de VRAM bastan), mientras que el 32B está pensado para las RTX 4090 y los Mac Studio. Sobre el papel, declara puntuaciones cercanas a las de GPT-4o-mini en MMLU y HumanEval, con el mismo tamaño que Qwen3-32B.
En la práctica, GLM-5 destaca en tres aspectos: el razonamiento estructurado (modo thinking similar al de Qwen3), el francés (notablemente mejor que Qwen3-9B en prompts complejos) y el código Python. Sus puntos débiles: la ventana de contexto se limita a 128k en local pese a la promesa de 1M, y la visión no está integrada (a diferencia de GLM-4V).
#Requisitos de hardware
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
- GLM-5 9B Q4_K_M
- ≈ 5,5 GB de VRAM. RTX 3060 12 GB, RTX 4060 8 GB (offload parcial), Mac M2 con 16 GB de memoria unificada, todas las RTX 4070+.
- GLM-5 32B Q4_K_M
- ≈ 19 GB de VRAM. Una RTX 4090 de 24 GB permite trabajar con comodidad, al igual que una RTX 3090 de 24 GB. Con 16 GB (4080), hay que bajar a Q3_K_M.
- GLM-5 32B Q5_K_M
- ≈ 22-23 GB de VRAM. Cabe en una RTX 4090, con poco margen. Prefiere Q4_K_M si activas un contexto largo.
- Ollama 0.6.0+
- La compatibilidad con GLM-5 se ha añadido progresivamente. Se necesita una versión reciente para el tokenizador y la plantilla de chat.
- Disco
- Calcula entre 6 GB (9B Q4) y 23 GB (32B Q5). Más si mantienes varias cuantizaciones en paralelo.
#1. Descargar el modelo desde Hugging Face
Zhipu AI publica los pesos oficiales en Hugging Face bajo la organización THUDM. Dos repositorios te interesan:
Estos repositorios contienen los pesos en formato safetensors (FP16/BF16). Para Ollama, necesitas GGUF. Dos opciones: descargar un GGUF ya convertido por la comunidad o realizar la conversión tú mismo.
#2. GGUF y conversión si es necesario
Si no hay un GGUF oficial ni comunitario que se adapte (variante exótica, cuantización específica), la conversión pasa por llama.cpp. El procedimiento estándar:
#3. Instalar GLM-5 en Ollama (local)
Una vez que tengas el GGUF, Ollama lo importa mediante un Modelfile. Crea un archivo llamado Modelfile junto al GGUF:
Luego crea el modelo en Ollama, comprueba que quede registrado y ejecútalo:
#4. Probar la calidad en francés
El francés de GLM-5 es uno de sus puntos fuertes para un modelo entrenado principalmente en chino y en inglés. Tres prompts útiles para evaluar rápidamente:
- 01Razonamiento estructurado« Una botella y su tapón cuestan 1,10 €. La botella cuesta 1 € más que el tapón. ¿Cuánto cuesta el tapón? Detalla tu razonamiento. » GLM-5 9B debería responder 0,05 € mostrando la ecuación.
- 02Síntesis largaPega un artículo de 2000 palabras y pide un resumen en 5 puntos clave en francés. El 32B mantiene un hilo claro; el 9B abrevia demasiado cuando el contexto es extenso.
- 03Código Python contextual« Escribe una función en Python que analice un CSV con delimitador ;, maneje comillas y devuelva un generador de diccionarios. Sin pandas. » GLM-5 produce código limpio e idiomático, mientras que Qwen3-9B tiende a importar csv sin manejar correctamente las comillas.
#5. Tokens/segundo medidos en RTX 4070 y 4090
Mediciones realizadas con Ollama 0.6.x, OLLAMA_FLASH_ATTENTION=1, contexto 8k, prompt de 500 tokens, generación de 300 tokens. Promedio sobre 5 ejecuciones.
- RTX 4070 12 GB — GLM-5 9B Q4_K_M
- ≈ 55-60 tokens/seg. Cómodo para chat, el modelo permanece el 100 % en VRAM.
- RTX 4070 12 GB — GLM-5 9B Q5_K_M
- ≈ 48-52 tokens/seg. Ligero aumento de calidad, pérdida de velocidad medida.
- RTX 4090 24 GB — GLM-5 9B Q4_K_M
- ≈ 110-120 tokens/sec. Muy sobredimensionada para el modelo de 9B.
- RTX 4090 24 GB — GLM-5 32B Q4_K_M
- ≈ 22-26 tokens/seg. El caso de uso objetivo: calidad de un modelo de 32B a una velocidad adecuada para un uso interactivo.
- RTX 4090 24 GB — GLM-5 32B Q5_K_M
- ≈ 18-22 tokens/seg. Poco margen de VRAM si el contexto > 16k.
- Mac M4 Pro 48 GB — GLM-5 32B Q4_K_M
- ≈ 12-15 tokens/segundo. Aceptable para tareas sin streaming (síntesis, análisis).
#GLM-5 vs Qwen3-32B vs DeepSeek V3.2
Con el mismo prompt y en la misma máquina, esto es lo que observamos en la práctica. Es una lectura cualitativa, no un benchmark normalizado: úsalo como una brújula, no como una verdad absoluta.
- Francés general
- Qwen3-32B ≥ GLM-5 32B > DeepSeek V3.2 (en modo rápido). Qwen3 sigue por delante en fluidez, GLM-5 está muy cerca y DeepSeek V3.2 genera más alucinaciones en francés.
- Razonamiento estructurado
- GLM-5 32B (modo thinking) ≈ Qwen3-32B (thinking). DeepSeek V3.2 obtiene mejores resultados si se le permite activar su razonamiento prolongado, pero con un coste en tokens de entre 3 y 5 veces el original.
- Código Python
- Qwen3-Coder > GLM-5 32B > DeepSeek V3.2 ≈ Qwen3-32B. Para tareas específicas de programación, sigue con Qwen3-Coder. GLM-5 32B ofrece resultados aceptables como modelo generalista.
- Velocidad con la misma cantidad de VRAM (24 GB)
- GLM-5 32B Q4 ≈ Qwen3-32B Q4 (~25 tok/s). DeepSeek V3.2 no cabe en 24 GB: es un MoE de 685B y queda fuera de las opciones para este nivel de capacidad.
- Espacio ocupado en disco
- GLM-5 32B Q4 ≈ 19 GB. Qwen3-32B Q4 ≈ 20 GB. DeepSeek V3.2 ≈ 380 GB Q4 — inviable sin un clúster.
#Solución de problemas
- Salida incoherente o íntegramente en chino
- Tokenizer mal convertido o plantilla incorrecta. Comprueba la versión de llama.cpp utilizada para la conversión y que el Modelfile incluya las etiquetas <|user|>, <|assistant|>, [gMASK]<sop>.
- Tokens de parada ignorados (respuesta infinita)
- Agrega PARAMETER stop "<|endoftext|>" y PARAMETER stop "<|user|>" en el Modelfile. De lo contrario, el modelo puede continuar con turnos de diálogo ficticios.
- OOM en contexto largo en RTX 4090
- La caché KV se dispara por encima de 32k. Activa OLLAMA_KV_CACHE_TYPE=q8_0 (ahorro de aproximadamente un 40 % de la VRAM ocupada por la caché) o reduce num_ctx.
- Velocidad < 10 tok/s con un modelo de 9B en una 4070
- Parte del modelo ha pasado a la RAM del sistema. Compruébalo con ollama ps: la columna PROCESSOR debe mostrar 100 % GPU. Si aparece CPU, reduce num_ctx o cambia a Q3_K_M.
- Modo thinking demasiado verboso
- GLM-5 puede generar largas cadenas de pensamiento. Para cortarlas, pide explícitamente «respuesta directa sin razonamiento intermedio» en el prompt de sistema.
#GLM-5.2 ha salido: ¿se debe migrar?
Desde el 13 de junio de 2026, Zhipu ofrece GLM-5.2: aproximadamente 753B de parámetros en MoE, licencia MIT, contexto de 1M, diseñado para agentes de programación de larga duración. Hasta la fecha, es el modelo «frontier» con mejor soporte para ejecutarlo localmente: existen versiones cuantizadas en GGUF (unsloth) tanto para Ollama como para LM Studio. Cuenta con un Mac de 256 GB o una máquina con RTX 4090 para la cuantización de 2 bits: si tu hardware ya podía ejecutar GLM-5, los pasos de instalación de esta guía siguen siendo los mismos; solo cambia la referencia del modelo.
#Para ir más allá
Vale la pena invertir un poco en GLM-5 para sacarle el máximo provecho. Tres vías útiles:
- Elegir la cuantización adecuada
- Q4_K_M es el punto óptimo por defecto, pero GLM-5 32B en Q5_K_M cabe en 24 GB con un contexto razonable y mejora notablemente el código.
- Personalizar mediante Modelfile
- Prompt de sistema, plantilla de respuesta, parámetros de muestreo: un Modelfile bien configurado evita repetir las instrucciones en cada sesión.
- Comparar con Qwen3 en condiciones reales
- La guía Qwen3-32B vs GLM-5 (próximamente) propone un protocolo de comparación con 30 prompts representativos (FR, código, razonamiento, síntesis).
Hardware recomendado: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) — alternativa de PC para los LLM locales cuantizados; no es el Mac del tutorial. Todo el hardware de IA →
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.