Intermedio 11 minOllama

GLM-5 en local con Ollama : el competidor open-weights

GLM-5 es la nueva familia de pesos abiertos de Zhipu AI (Universidad de Tsinghua). Versiones 9B y 32B, licencia permisiva, razonamiento sólido, francés correcto y resultados respetables en programación. Esta guía muestra cómo instalar GLM-5 localmente con Ollama, mide el rendimiento real en RTX 4070 y 4090, y lo compara con Qwen3-32B y DeepSeek V3.2 en las mismas tareas.

Por Mohamed Meguedmi·Actualización 2026-08-11·Probado en Windows, macOS y Linux

#¿Por qué GLM-5?

GLM-5 no tiene la notoriedad de Qwen3 o DeepSeek, pero es uno de los modelos chinos de pesos abiertos más logrados de los últimos meses. El 9B está dirigido a configuraciones modestas (12 GB de VRAM bastan), mientras que el 32B está pensado para las RTX 4090 y los Mac Studio. Sobre el papel, declara puntuaciones cercanas a las de GPT-4o-mini en MMLU y HumanEval, con el mismo tamaño que Qwen3-32B.

En la práctica, GLM-5 destaca en tres aspectos: el razonamiento estructurado (modo thinking similar al de Qwen3), el francés (notablemente mejor que Qwen3-9B en prompts complejos) y el código Python. Sus puntos débiles: la ventana de contexto se limita a 128k en local pese a la promesa de 1M, y la visión no está integrada (a diferencia de GLM-4V).

i
GLM-5 vs GLM 5.1
Esta guía cubre GLM-5 (versión inicial). GLM 5.1 (versión posterior) corrige varias regresiones en el código y mejora el seguimiento de instrucciones. Si empiezas desde cero hoy, lee también la guía de GLM 5.1 del sitio antes de decidir.

#Requisitos de hardware

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j
GLM-5 9B Q4_K_M
≈ 5,5 GB de VRAM. RTX 3060 12 GB, RTX 4060 8 GB (offload parcial), Mac M2 con 16 GB de memoria unificada, todas las RTX 4070+.
GLM-5 32B Q4_K_M
≈ 19 GB de VRAM. Una RTX 4090 de 24 GB permite trabajar con comodidad, al igual que una RTX 3090 de 24 GB. Con 16 GB (4080), hay que bajar a Q3_K_M.
GLM-5 32B Q5_K_M
≈ 22-23 GB de VRAM. Cabe en una RTX 4090, con poco margen. Prefiere Q4_K_M si activas un contexto largo.
Ollama 0.6.0+
La compatibilidad con GLM-5 se ha añadido progresivamente. Se necesita una versión reciente para el tokenizador y la plantilla de chat.
Disco
Calcula entre 6 GB (9B Q4) y 23 GB (32B Q5). Más si mantienes varias cuantizaciones en paralelo.

#1. Descargar el modelo desde Hugging Face

Zhipu AI publica los pesos oficiales en Hugging Face bajo la organización THUDM. Dos repositorios te interesan:

Repositorio oficial 9B
https://huggingface.co/THUDM/glm-5-9b-chat
Repositorio oficial 32B
https://huggingface.co/THUDM/glm-5-32b-chat

Estos repositorios contienen los pesos en formato safetensors (FP16/BF16). Para Ollama, necesitas GGUF. Dos opciones: descargar un GGUF ya convertido por la comunidad o realizar la conversión tú mismo.

→
Atajo: GGUF listo para usar
Busca en Hugging Face glm-5 GGUF — bartowski, mradermacher y lmstudio-community publican conversiones Q4_K_M, Q5_K_M y Q8_0 actualizadas. Es la opción práctica para el 95 % de los casos.

#2. GGUF y conversión si es necesario

Si no hay un GGUF oficial ni comunitario que se adapte (variante exótica, cuantización específica), la conversión pasa por llama.cpp. El procedimiento estándar:

Clonar llama.cpp y instalar las dependencias
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
pip install -r requirements.txt
Convertir HF → GGUF FP16
python convert_hf_to_gguf.py /chemin/vers/glm-5-9b-chat \
  --outfile glm-5-9b-chat-f16.gguf \
  --outtype f16
Cuantizar en Q4_K_M
./build/bin/llama-quantize \
  glm-5-9b-chat-f16.gguf \
  glm-5-9b-chat-Q4_K_M.gguf \
  Q4_K_M
!
Tokenizer GLM
GLM utiliza un tokenizer SentencePiece derivado. Si convert_hf_to_gguf.py muestra errores por falta de tokens especiales, actualiza llama.cpp (el soporte para GLM-5 se añadió en una PR reciente). Con una versión demasiado antigua, la conversión se completa correctamente, pero la inferencia produce texto incomprensible.

#3. Instalar GLM-5 en Ollama (local)

Una vez que tengas el GGUF, Ollama lo importa mediante un Modelfile. Crea un archivo llamado Modelfile junto al GGUF:

Modelfile para GLM-5 9B
FROM ./glm-5-9b-chat-Q4_K_M.gguf

PARAMETER temperature 0.7
PARAMETER top_p 0.9
PARAMETER num_ctx 32768
PARAMETER stop "<|user|>"
PARAMETER stop "<|endoftext|>"

TEMPLATE """[gMASK]<sop>{{ if .System }}<|system|>
{{ .System }}{{ end }}<|user|>
{{ .Prompt }}<|assistant|>
{{ .Response }}"""

SYSTEM """Tu es un assistant utile, précis et concis. Tu réponds en français sauf demande contraire."""

Luego crea el modelo en Ollama, comprueba que quede registrado y ejecútalo:

Creación y lanzamiento
ollama create glm5-9b -f Modelfile
ollama list
ollama run glm5-9b
→
Cuando llegue el soporte nativo
Si Ollama publica GLM-5 en su registro oficial (ollama run glm5 sin Modelfile), opta por esa versión: la plantilla de chat se mantendrá en el proyecto de origen y evitarás errores con los tokens de parada.

#4. Probar la calidad en francés

El francés de GLM-5 es uno de sus puntos fuertes para un modelo entrenado principalmente en chino y en inglés. Tres prompts útiles para evaluar rápidamente:

  1. 01
    Razonamiento estructurado
    « Una botella y su tapón cuestan 1,10 €. La botella cuesta 1 € más que el tapón. ¿Cuánto cuesta el tapón? Detalla tu razonamiento. » GLM-5 9B debería responder 0,05 € mostrando la ecuación.
  2. 02
    Síntesis larga
    Pega un artículo de 2000 palabras y pide un resumen en 5 puntos clave en francés. El 32B mantiene un hilo claro; el 9B abrevia demasiado cuando el contexto es extenso.
  3. 03
    Código Python contextual
    « Escribe una función en Python que analice un CSV con delimitador ;, maneje comillas y devuelva un generador de diccionarios. Sin pandas. » GLM-5 produce código limpio e idiomático, mientras que Qwen3-9B tiende a importar csv sin manejar correctamente las comillas.
i
Modo de pensamiento
GLM-5 tiene un modo de cadena de pensamiento que se puede activar mediante un prefijo de sistema (consulta la ficha del modelo en HF para conocer el formato exacto). Al activarlo, la calidad del razonamiento mejora un nivel, a costa de aproximadamente un 30-40 % más de tokens.

#5. Tokens/segundo medidos en RTX 4070 y 4090

Mediciones realizadas con Ollama 0.6.x, OLLAMA_FLASH_ATTENTION=1, contexto 8k, prompt de 500 tokens, generación de 300 tokens. Promedio sobre 5 ejecuciones.

RTX 4070 12 GB — GLM-5 9B Q4_K_M
≈ 55-60 tokens/seg. Cómodo para chat, el modelo permanece el 100 % en VRAM.
RTX 4070 12 GB — GLM-5 9B Q5_K_M
≈ 48-52 tokens/seg. Ligero aumento de calidad, pérdida de velocidad medida.
RTX 4090 24 GB — GLM-5 9B Q4_K_M
≈ 110-120 tokens/sec. Muy sobredimensionada para el modelo de 9B.
RTX 4090 24 GB — GLM-5 32B Q4_K_M
≈ 22-26 tokens/seg. El caso de uso objetivo: calidad de un modelo de 32B a una velocidad adecuada para un uso interactivo.
RTX 4090 24 GB — GLM-5 32B Q5_K_M
≈ 18-22 tokens/seg. Poco margen de VRAM si el contexto > 16k.
Mac M4 Pro 48 GB — GLM-5 32B Q4_K_M
≈ 12-15 tokens/segundo. Aceptable para tareas sin streaming (síntesis, análisis).
→
Activa Flash Attention
Configurar OLLAMA_FLASH_ATTENTION=1 en el entorno proporciona una mejora del 10-15 % en GLM-5 32B y estabiliza la VRAM con contextos largos. Al combinarlo con OLLAMA_KV_CACHE_TYPE=q8_0, liberas 2-3 GB adicionales sin degradación visible.

#GLM-5 vs Qwen3-32B vs DeepSeek V3.2

Con el mismo prompt y en la misma máquina, esto es lo que observamos en la práctica. Es una lectura cualitativa, no un benchmark normalizado: úsalo como una brújula, no como una verdad absoluta.

Francés general
Qwen3-32B ≥ GLM-5 32B > DeepSeek V3.2 (en modo rápido). Qwen3 sigue por delante en fluidez, GLM-5 está muy cerca y DeepSeek V3.2 genera más alucinaciones en francés.
Razonamiento estructurado
GLM-5 32B (modo thinking) ≈ Qwen3-32B (thinking). DeepSeek V3.2 obtiene mejores resultados si se le permite activar su razonamiento prolongado, pero con un coste en tokens de entre 3 y 5 veces el original.
Código Python
Qwen3-Coder > GLM-5 32B > DeepSeek V3.2 ≈ Qwen3-32B. Para tareas específicas de programación, sigue con Qwen3-Coder. GLM-5 32B ofrece resultados aceptables como modelo generalista.
Velocidad con la misma cantidad de VRAM (24 GB)
GLM-5 32B Q4 ≈ Qwen3-32B Q4 (~25 tok/s). DeepSeek V3.2 no cabe en 24 GB: es un MoE de 685B y queda fuera de las opciones para este nivel de capacidad.
Espacio ocupado en disco
GLM-5 32B Q4 ≈ 19 GB. Qwen3-32B Q4 ≈ 20 GB. DeepSeek V3.2 ≈ 380 GB Q4 — inviable sin un clúster.
i
Veredicto práctico
Si tienes 24 GB de VRAM y quieres un modelo 32B generalista, la elección está entre GLM-5 y Qwen3. GLM-5 es más interesante para el razonamiento estructurado y para salir un poco de lo habitual; Qwen3-32B sigue siendo una apuesta fiable. DeepSeek V3.2 sigue siendo un modelo para usar mediante API o en un servidor grande: con 24 GB no hay debate.

#Solución de problemas

Salida incoherente o íntegramente en chino
Tokenizer mal convertido o plantilla incorrecta. Comprueba la versión de llama.cpp utilizada para la conversión y que el Modelfile incluya las etiquetas <|user|>, <|assistant|>, [gMASK]<sop>.
Tokens de parada ignorados (respuesta infinita)
Agrega PARAMETER stop "<|endoftext|>" y PARAMETER stop "<|user|>" en el Modelfile. De lo contrario, el modelo puede continuar con turnos de diálogo ficticios.
OOM en contexto largo en RTX 4090
La caché KV se dispara por encima de 32k. Activa OLLAMA_KV_CACHE_TYPE=q8_0 (ahorro de aproximadamente un 40 % de la VRAM ocupada por la caché) o reduce num_ctx.
Velocidad < 10 tok/s con un modelo de 9B en una 4070
Parte del modelo ha pasado a la RAM del sistema. Compruébalo con ollama ps: la columna PROCESSOR debe mostrar 100 % GPU. Si aparece CPU, reduce num_ctx o cambia a Q3_K_M.
Modo thinking demasiado verboso
GLM-5 puede generar largas cadenas de pensamiento. Para cortarlas, pide explícitamente «respuesta directa sin razonamiento intermedio» en el prompt de sistema.

#GLM-5.2 ha salido: ¿se debe migrar?

Desde el 13 de junio de 2026, Zhipu ofrece GLM-5.2: aproximadamente 753B de parámetros en MoE, licencia MIT, contexto de 1M, diseñado para agentes de programación de larga duración. Hasta la fecha, es el modelo «frontier» con mejor soporte para ejecutarlo localmente: existen versiones cuantizadas en GGUF (unsloth) tanto para Ollama como para LM Studio. Cuenta con un Mac de 256 GB o una máquina con RTX 4090 para la cuantización de 2 bits: si tu hardware ya podía ejecutar GLM-5, los pasos de instalación de esta guía siguen siendo los mismos; solo cambia la referencia del modelo.

i
Próximamente: guía específica
Una guía completa sobre GLM-5.2 (instalación con Ollama + LM Studio, configuraciones realistas, expectativas honestas sobre las velocidades) está en preparación y se publicará esta semana en el sitio.

#Para ir más allá

Vale la pena invertir un poco en GLM-5 para sacarle el máximo provecho. Tres vías útiles:

Elegir la cuantización adecuada
Q4_K_M es el punto óptimo por defecto, pero GLM-5 32B en Q5_K_M cabe en 24 GB con un contexto razonable y mejora notablemente el código.
Personalizar mediante Modelfile
Prompt de sistema, plantilla de respuesta, parámetros de muestreo: un Modelfile bien configurado evita repetir las instrucciones en cada sesión.
Comparar con Qwen3 en condiciones reales
La guía Qwen3-32B vs GLM-5 (próximamente) propone un protocolo de comparación con 30 prompts representativos (FR, código, razonamiento, síntesis).

Hardware recomendado: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) — alternativa de PC para los LLM locales cuantizados; no es el Mac del tutorial. Todo el hardware de IA →

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.