Intermedio 10 minGLM

GLM 5.1 en local: la alternativa de pesos abiertos que conocer

GLM 5.1 es la última iteración de la familia de modelos de pesos abiertos de Zhipu AI, uno de los laboratorios chinos más activos en el autoalojamiento. El modelo suele quedar eclipsado por Qwen y Llama en los debates francófonos, injustamente: en ciertos usos —programación, razonamiento estructurado y llamadas a herramientas— está a su altura. Esta guía te muestra cómo instalar GLM 5.1 en local con Ollama o llama.cpp, cuánta VRAM consume según la cuantización, qué rendimiento ofrece en francés y en programación, y dónde se sitúa frente a Qwen 3.5 y Gemma 4.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué usar GLM 5.1 en local?

Tres razones concretas llevan a probar GLM 5.1 en lugar de un Qwen 3.5 o un Gemma 4 equivalente. Primero, su licencia permisiva: la versión open-weight (disponible en 9B y 32B) permite el uso comercial, algo que no puede darse por sentado en el ecosistema open-source. Segundo, las llamadas nativas a herramientas: GLM 5.1 fue entrenado desde el principio para llamar a herramientas, lo que lo hace especialmente adecuado para agentes locales sin tener que improvisar soluciones con prompts.

Por último, la relación calidad/tamaño: el 9B se sitúa al nivel de un Gemma 4 12B en varios benchmarks de código y razonamiento, lo que lo convierte en una opción interesante si estás limitado a 12 GB de VRAM. El 32B apunta más alto y compite con modelos de 24-35B como Qwen 3.8 27B o Mistral Small 24B.

i
En dos palabras
GLM 5.1 = un modelo chino de pesos abiertos sólido, infravalorado en el ámbito francófono, especialmente bueno en programación y en llamadas a herramientas. Ollama permite acceder a él con un solo comando; llama.cpp, si quieres más control.

#Lo que caracteriza a GLM 5.1

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

GLM 5.1 conserva la arquitectura transformer densa de las versiones anteriores: aquí no hay Mixture-of-Experts, a diferencia de Qwen 3.6 35B-A3B o DeepSeek V4. Esta elección simplifica la inferencia y garantiza que la tasa de generación no se desplome ante preguntas que requieran expertos inusuales.

Tamaños
9B y 32B con pesos abiertos. Existe una versión de 100B+, pero solo está disponible a través de la API de Zhipu y no se puede descargar.
Contexto
128k tokens en ambos tamaños, ampliados a 1M mediante escalado YaRN en el 32B (con degradación por encima de 200k).
Tokenizer
Tokenizer bilingüe chino/inglés optimizado, con una cobertura adecuada del francés. Prever aproximadamente un 5 % más de tokens que con un Mistral para un texto equivalente en francés.
Tool calling
Formato nativo compatible con el esquema de herramientas de OpenAI. No se necesita ingeniería de prompts para activarlo, el modelo sabe cuándo llamar a una función.
Licencia
Licencia GLM (variante de Apache 2.0 con cláusula de atribución). Uso comercial autorizado, redistribución bajo los mismos términos.
Multimodal
Solo texto en los modelos de 9B y 32B con pesos abiertos. La versión de visión (GLM-V) es un modelo independiente que hay que descargar por separado.
→
¿Por qué no usar un MoE aquí?
Un modelo denso de 32B es más fácil de desplegar que un MoE de 35B-A3B: no hay sorpresas de VRAM relacionadas con el enrutamiento ni grandes variaciones en la velocidad de generación según la pregunta. Si buscas una velocidad estable y previsible, GLM 5.1 32B resulta más cómodo que un MoE equivalente.

#Prerrequisitos

Ollama ≥ 0.5
Para la versión de Ollama. Las versiones más antiguas no reconocen la plantilla de chat de GLM 5.1.
llama.cpp reciente
Build de 2026 o posterior. El soporte de la arquitectura GLM se estabilizó al final de 2025.
Espacio en disco
6 GB para el 9B Q4, 19 GB para el 32B Q4. Duplica estas cifras para Q8 y multiplícalas por cuatro para FP16.
VRAM mínima
8 GB para el 9B Q4, 24 GB para el 32B Q4. Con menos VRAM, parte del modelo pasa a ejecutarse en la CPU y la velocidad de generación cae a 3-5 tok/s.
Controlador de GPU actualizado
CUDA 12.x para NVIDIA, ROCm 6.x para AMD, Metal nativo para Apple Silicon.

#1. Instalación con Ollama

Ollama es el camino más corto. El modelo está disponible bajo el nombre glm5.1 en la biblioteca oficial, con los tags habituales por tamaño y cuantización.

Pull y lanzamiento directo
ollama run glm5.1:9b

Para el 32B, misma mecánica pero cuenta con varios minutos de descarga y al menos 24 GB de VRAM o memoria unificada.

Etiquetas útiles
ollama pull glm5.1:9b           # alias de 9b-instruct-q4_K_M
ollama pull glm5.1:9b-q8_0      # qualité supérieure, +60% VRAM
ollama pull glm5.1:32b          # 32B Q4 par défaut
ollama pull glm5.1:32b-q5_K_M   # le sweet spot 32B sur 24 Go

Una vez descargado el modelo, el endpoint compatible con OpenAI de Ollama escucha por defecto en http://localhost:11434, y glm5.1 responde como cualquier modelo servido por Ollama.

i
Verificar que el modelo quepa en la VRAM
Después del primer prompt, ejecuta ollama ps en otro terminal. La columna PROCESSOR debe mostrar 100% GPU. Si ves 70% GPU / 30% CPU, es que has superado la capacidad de la VRAM: pasa a una cuantización más agresiva o elige un modelo más pequeño.

#2. Instalación con llama.cpp

Con llama.cpp, se descarga un GGUF de Hugging Face y se ejecuta desde la línea de comandos o a través del servidor HTTP. Es la opción que conviene priorizar si quieres ajustar con precisión la caché KV o el modelo borrador para la decodificación especulativa, o si utilizas varias GPU.

Descarga GGUF
# 9B en Q4_K_M (recommandé)
wget https://huggingface.co/zhipuai/glm-5.1-9b-chat-gguf/resolve/main/glm-5.1-9b-chat-Q4_K_M.gguf

# 32B en Q4_K_M
wget https://huggingface.co/zhipuai/glm-5.1-32b-chat-gguf/resolve/main/glm-5.1-32b-chat-Q4_K_M.gguf
Iniciar en modo servidor
./llama-server \
  -m glm-5.1-9b-chat-Q4_K_M.gguf \
  -c 16384 \
  -ngl 99 \
  -fa \
  --host 0.0.0.0 --port 8080
-c 16384
Ventana de contexto. 16k es un buen valor predeterminado para francés/código; aumenta a 32k o más si tienes suficiente VRAM.
-ngl 99
Todo en la GPU. Pon un valor más bajo para descargar capas a la CPU si superas la capacidad.
-fa
Flash Attention. Imprescindible por encima de 8k para evitar que se dispare el consumo de memoria KV.
--host 0.0.0.0
Expone el servidor en la red. Usa 127.0.0.1 si quieres restringirlo a la máquina local.
→
Cuantización del KV-cache
En GLM 5.1, --cache-type-k q8_0 --cache-type-v q8_0 divide por 2 la memoria KV con una pérdida de calidad casi nula. Imprescindible si apuntas a 64k+ de contexto en un 32B.

#3. VRAM por cuantización

Las cifras siguientes incluyen los pesos + una caché KV para 8k de contexto. Para aumentar a 32k o 128k, añade entre 2 y 8 GB según el tamaño.

GLM 5.1 9B — Q4_K_M
≈ 6 GB de VRAM. Cabe con muy poco margen en una GTX 1660 de 6 GB y con margen suficiente en una RTX 3050/3060/4060 de 8 GB.
GLM 5.1 9B — Q5_K_M
≈ 7 GB de VRAM. Pertinente a partir de 8 GB con un poco de margen.
GLM 5.1 9B — Q8_0
≈ 10 GB de VRAM. Pensado para una RTX 3060 de 12 GB, una 4070 de 12 GB o un Mac con 16 GB o más.
GLM 5.1 32B — Q4_K_M
≈ 19 GB de VRAM. Punto óptimo: RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio.
GLM 5.1 32B — Q5_K_M
≈ 23 GB de VRAM. Cerca del límite de los 24 GB; optar por un Mac de 48 GB o más o por una configuración multi-GPU para tener margen.
GLM 5.1 32B — Q8_0
≈ 34 GB VRAM. Reservado para la RTX 5090 32 GB, los Mac Studio Ultra o el multi-GPU (2× 3090, 2× 4090).
!
La trampa del contexto de 128k
Activar la ventana máxima añade entre 5 y 10 GB al KV-cache según el tamaño. Con el 32B Q5 y 24 GB de memoria, el modelo cabe con un contexto de 8k, pero supera la capacidad disponible con uno de 32k. Aumenta el contexto por etapas y supervisa ollama ps o nvidia-smi.

#4. Calidad en francés y en código

GLM 5.1 está entrenado principalmente con textos en chino y en inglés, pero se desenvuelve correctamente en francés: no al nivel de un Mistral nativo, pero sí por encima de un Gemma 4 12B de la misma categoría de tamaño. Los errores típicos afectan a los giros idiomáticos y a algunos casos poco frecuentes de concordancia; nada que dificulte su uso como asistente general o para RAG.

Francés — 9B
Fiable para resúmenes, traducción y RAG sobre documentos en francés. Algunos anglicismos puntuales. Preferir una temperatura baja (0.2-0.4) para minimizar las desviaciones.
Francés — 32B
Redacción muy cuidada. A la par con Mistral Small 24B en calidad de escritura, ligeramente por debajo de los grandes modelos propietarios.
Código — 9B
Excelente para su tamaño. Genera código de calidad en Python, JS, Go y Rust. Supera a un Granite 4.2 8B generalista y se mantiene a la altura de Qwen 3.5 9B en tareas de código.
Código — 32B
Muy buen rendimiento. En HumanEval, MBPP y MultiPL-E, está entre los modelos con pesos abiertos que mejores resultados obtienen. Bueno en refactorización de múltiples archivos gracias al contexto de 128k.
Razonamiento
Cadena de pensamiento explícita si se solicita, sin un token especial <think> como el de DeepSeek R1. El modelo de 32B obtiene resultados sólidos en AIME, GPQA y MATH.
Tool calling
Formato nativo compatible con las herramientas de OpenAI. El modelo decide por sí mismo si llamar a una función y formatea los argumentos JSON sin errores.
→
Para programar a diario
Si tu objetivo principal es la asistencia con el código, compara GLM 5.1 9B con Qwen 3.5 9B en tus propias tareas. Ambos son excelentes, pero uno puede adaptarse mejor a tu lenguaje y estilo. Ningún benchmark público sustituye 30 minutos de prueba en tu repositorio.

#5. GLM 5.1 vs Qwen 3.5 y Gemma 4

Tres familias de modelos de pesos abiertos pertenecen a la misma categoría de tamaño en 2026: GLM 5.1, Qwen (3.5 9B / 3.8 27B) y Gemma 4 (12B / 26B-A4B). Una comparación honesta:

Velocidad pura (tok/s)
Con igual tamaño y VRAM, GLM 5.1 está en el mismo rango que Qwen 3.5 denso y Gemma 4. No hay diferencias significativas — la velocidad depende principalmente del backend (Ollama vs llama.cpp vs vLLM) y del GPU.
Calidad en francés
Mistral Small 24B nativo > Qwen 3.5 ≈ GLM 5.1 > Gemma 4 a tamaño equivalente. Si el francés es crucial, Mistral sigue por delante; GLM 5.1 es una sólida segunda opción de pesos abiertos.
Código
Qwen3-Coder 30B / Devstral 24B > GLM 5.1 ≈ Qwen 3.8 generalista > Gemma 4 a igualdad de tamaño. GLM 5.1 32B es competitivo frente a Qwen 3.8 27B, ligeramente por detrás de los modelos especializados en código.
Tool calling
GLM 5.1 ≈ Qwen 3.5 > Gemma 4. Los dos primeros han sido entrenados explícitamente para herramientas, Gemma pide un poco más de ingeniería de prompts.
Contexto largo
Qwen 3.5 256k nativo (Qwen 3.8 27B: 262k) > GLM 5.1 128k (1M mediante YaRN) > Gemma 4 128k. Para análisis de base de código completa, Qwen mantiene una ventaja de longitud.
Licencia
GLM (similar a Apache) ≈ Qwen (Apache 2.0 en la mayoría de las variantes) ≈ Gemma 4 (Apache 2.0 desde abril de 2026). Tres licencias sencillas para uso empresarial, ya que Gemma ha abandonado su cláusula personalizada.
Ecosistema
Qwen > Gemma 4 > GLM 5.1. Qwen ahora tiene la mayor cantidad de fine-tunes comunitarios, Gemma 4 lo sigue de cerca y GLM 5.1 sigue siendo menos conocido: menos variantes, menos tutoriales en francés.
i
Nuestra recomendación honesta
Si tienes 12 GB de VRAM y quieres probar algo que salga de lo común: GLM 5.1 9B. Si buscas el mejor generalista abierto con 24 GB: Qwen 3.8 27B o GLM 5.1 32B según lo que funcione mejor con tus prompts. Si la comunidad y el fine-tuning importan: Qwen 3.5 sigue siendo imbatible en cantidad de opciones derivadas.

#Consejos y posibles problemas

Prompt de sistema corto
GLM 5.1 sigue bien los prompts de sistema, pero se satura un poco si le das uno de 800 palabras. Procura que tenga entre 200 y 400 palabras y sea claro y estructurado.
Temperatura baja para el francés
0.2-0.4 para minimizar los anglicismos y las anomalías de concordancia. Por encima de 0.7, la calidad de la escritura en francés empieza a fluctuar.
Tokens de parada
El modelo utiliza <|endoftext|> y <|user|> como delimitadores. Si escribes tu propio cliente, añade estas dos cadenas a los tokens de parada para evitar que siga hablando solo.
Streaming mediante Ollama
Los endpoints /api/chat y /v1/chat/completions admiten stream=true. GLM 5.1 no presenta ninguna particularidad al respecto, a diferencia de algunos modelos MoE.
Fine-tuning LoRA
GLM 5.1 9B es viable con LoRA en una RTX 4090 de 24 GB con Unsloth. El 32B requiere múltiples GPUs o un Mac con memoria unificada generosa.
Modelfile Ollama
Para fijar un prompt de sistema y unos parámetros, crea un Modelfile basado en glm5.1:9b y luego ejecuta ollama create monassistant -f Modelfile. El modelo derivado aparece en ollama list como cualquier otro.
!
Confusión con ChatGLM y GLM-4
No confundas GLM 5.1 (arquitectura transformer densa moderna, lanzada en 2026) con ChatGLM (la primera generación, 2023) o GLM-4 (2024). Las etiquetas de Ollama son distintas (chatglm, glm4, glm5.1); comprueba bien qué estás descargando.

#Para ir más allá

GLM 5.1 está funcionando, ya tienes tus primeros resultados. Algunas pistas para mejorar:

Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para decidir con precisión el equilibrio calidad/VRAM en tus casos de uso.
Qwen3.6 35B-A3B en local: prueba y necesidades de VRAM
El competidor directo de la familia Qwen, con arquitectura MoE. Una comparativa útil si tienes dudas.
Open WebUI con Ollama: guía completa
Una interfaz similar a ChatGPT sobre GLM 5.1: conversaciones, RAG, múltiples usuarios.
Crear un agente de IA local en Python con LangChain y Ollama
Para aprovechar el llamado nativo de herramientas de GLM 5.1 y hacer que llame a tus propias funciones.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.