GLM 5.1 en local: la alternativa de pesos abiertos que conocer
GLM 5.1 es la última iteración de la familia de modelos de pesos abiertos de Zhipu AI, uno de los laboratorios chinos más activos en el autoalojamiento. El modelo suele quedar eclipsado por Qwen y Llama en los debates francófonos, injustamente: en ciertos usos —programación, razonamiento estructurado y llamadas a herramientas— está a su altura. Esta guía te muestra cómo instalar GLM 5.1 en local con Ollama o llama.cpp, cuánta VRAM consume según la cuantización, qué rendimiento ofrece en francés y en programación, y dónde se sitúa frente a Qwen 3.5 y Gemma 4.
#¿Por qué usar GLM 5.1 en local?
Tres razones concretas llevan a probar GLM 5.1 en lugar de un Qwen 3.5 o un Gemma 4 equivalente. Primero, su licencia permisiva: la versión open-weight (disponible en 9B y 32B) permite el uso comercial, algo que no puede darse por sentado en el ecosistema open-source. Segundo, las llamadas nativas a herramientas: GLM 5.1 fue entrenado desde el principio para llamar a herramientas, lo que lo hace especialmente adecuado para agentes locales sin tener que improvisar soluciones con prompts.
Por último, la relación calidad/tamaño: el 9B se sitúa al nivel de un Gemma 4 12B en varios benchmarks de código y razonamiento, lo que lo convierte en una opción interesante si estás limitado a 12 GB de VRAM. El 32B apunta más alto y compite con modelos de 24-35B como Qwen 3.8 27B o Mistral Small 24B.
#Lo que caracteriza a GLM 5.1
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
GLM 5.1 conserva la arquitectura transformer densa de las versiones anteriores: aquí no hay Mixture-of-Experts, a diferencia de Qwen 3.6 35B-A3B o DeepSeek V4. Esta elección simplifica la inferencia y garantiza que la tasa de generación no se desplome ante preguntas que requieran expertos inusuales.
- Tamaños
- 9B y 32B con pesos abiertos. Existe una versión de 100B+, pero solo está disponible a través de la API de Zhipu y no se puede descargar.
- Contexto
- 128k tokens en ambos tamaños, ampliados a 1M mediante escalado YaRN en el 32B (con degradación por encima de 200k).
- Tokenizer
- Tokenizer bilingüe chino/inglés optimizado, con una cobertura adecuada del francés. Prever aproximadamente un 5 % más de tokens que con un Mistral para un texto equivalente en francés.
- Tool calling
- Formato nativo compatible con el esquema de herramientas de OpenAI. No se necesita ingeniería de prompts para activarlo, el modelo sabe cuándo llamar a una función.
- Licencia
- Licencia GLM (variante de Apache 2.0 con cláusula de atribución). Uso comercial autorizado, redistribución bajo los mismos términos.
- Multimodal
- Solo texto en los modelos de 9B y 32B con pesos abiertos. La versión de visión (GLM-V) es un modelo independiente que hay que descargar por separado.
#Prerrequisitos
- Ollama ≥ 0.5
- Para la versión de Ollama. Las versiones más antiguas no reconocen la plantilla de chat de GLM 5.1.
- llama.cpp reciente
- Build de 2026 o posterior. El soporte de la arquitectura GLM se estabilizó al final de 2025.
- Espacio en disco
- 6 GB para el 9B Q4, 19 GB para el 32B Q4. Duplica estas cifras para Q8 y multiplícalas por cuatro para FP16.
- VRAM mínima
- 8 GB para el 9B Q4, 24 GB para el 32B Q4. Con menos VRAM, parte del modelo pasa a ejecutarse en la CPU y la velocidad de generación cae a 3-5 tok/s.
- Controlador de GPU actualizado
- CUDA 12.x para NVIDIA, ROCm 6.x para AMD, Metal nativo para Apple Silicon.
#1. Instalación con Ollama
Ollama es el camino más corto. El modelo está disponible bajo el nombre glm5.1 en la biblioteca oficial, con los tags habituales por tamaño y cuantización.
Para el 32B, misma mecánica pero cuenta con varios minutos de descarga y al menos 24 GB de VRAM o memoria unificada.
Una vez descargado el modelo, el endpoint compatible con OpenAI de Ollama escucha por defecto en http://localhost:11434, y glm5.1 responde como cualquier modelo servido por Ollama.
#2. Instalación con llama.cpp
Con llama.cpp, se descarga un GGUF de Hugging Face y se ejecuta desde la línea de comandos o a través del servidor HTTP. Es la opción que conviene priorizar si quieres ajustar con precisión la caché KV o el modelo borrador para la decodificación especulativa, o si utilizas varias GPU.
- -c 16384
- Ventana de contexto. 16k es un buen valor predeterminado para francés/código; aumenta a 32k o más si tienes suficiente VRAM.
- -ngl 99
- Todo en la GPU. Pon un valor más bajo para descargar capas a la CPU si superas la capacidad.
- -fa
- Flash Attention. Imprescindible por encima de 8k para evitar que se dispare el consumo de memoria KV.
- --host 0.0.0.0
- Expone el servidor en la red. Usa 127.0.0.1 si quieres restringirlo a la máquina local.
#3. VRAM por cuantización
Las cifras siguientes incluyen los pesos + una caché KV para 8k de contexto. Para aumentar a 32k o 128k, añade entre 2 y 8 GB según el tamaño.
- GLM 5.1 9B — Q4_K_M
- ≈ 6 GB de VRAM. Cabe con muy poco margen en una GTX 1660 de 6 GB y con margen suficiente en una RTX 3050/3060/4060 de 8 GB.
- GLM 5.1 9B — Q5_K_M
- ≈ 7 GB de VRAM. Pertinente a partir de 8 GB con un poco de margen.
- GLM 5.1 9B — Q8_0
- ≈ 10 GB de VRAM. Pensado para una RTX 3060 de 12 GB, una 4070 de 12 GB o un Mac con 16 GB o más.
- GLM 5.1 32B — Q4_K_M
- ≈ 19 GB de VRAM. Punto óptimo: RTX 3090, 4090, 5090, RX 7900 XTX, Mac Studio.
- GLM 5.1 32B — Q5_K_M
- ≈ 23 GB de VRAM. Cerca del límite de los 24 GB; optar por un Mac de 48 GB o más o por una configuración multi-GPU para tener margen.
- GLM 5.1 32B — Q8_0
- ≈ 34 GB VRAM. Reservado para la RTX 5090 32 GB, los Mac Studio Ultra o el multi-GPU (2× 3090, 2× 4090).
#4. Calidad en francés y en código
GLM 5.1 está entrenado principalmente con textos en chino y en inglés, pero se desenvuelve correctamente en francés: no al nivel de un Mistral nativo, pero sí por encima de un Gemma 4 12B de la misma categoría de tamaño. Los errores típicos afectan a los giros idiomáticos y a algunos casos poco frecuentes de concordancia; nada que dificulte su uso como asistente general o para RAG.
- Francés — 9B
- Fiable para resúmenes, traducción y RAG sobre documentos en francés. Algunos anglicismos puntuales. Preferir una temperatura baja (0.2-0.4) para minimizar las desviaciones.
- Francés — 32B
- Redacción muy cuidada. A la par con Mistral Small 24B en calidad de escritura, ligeramente por debajo de los grandes modelos propietarios.
- Código — 9B
- Excelente para su tamaño. Genera código de calidad en Python, JS, Go y Rust. Supera a un Granite 4.2 8B generalista y se mantiene a la altura de Qwen 3.5 9B en tareas de código.
- Código — 32B
- Muy buen rendimiento. En HumanEval, MBPP y MultiPL-E, está entre los modelos con pesos abiertos que mejores resultados obtienen. Bueno en refactorización de múltiples archivos gracias al contexto de 128k.
- Razonamiento
- Cadena de pensamiento explícita si se solicita, sin un token especial <think> como el de DeepSeek R1. El modelo de 32B obtiene resultados sólidos en AIME, GPQA y MATH.
- Tool calling
- Formato nativo compatible con las herramientas de OpenAI. El modelo decide por sí mismo si llamar a una función y formatea los argumentos JSON sin errores.
#5. GLM 5.1 vs Qwen 3.5 y Gemma 4
Tres familias de modelos de pesos abiertos pertenecen a la misma categoría de tamaño en 2026: GLM 5.1, Qwen (3.5 9B / 3.8 27B) y Gemma 4 (12B / 26B-A4B). Una comparación honesta:
- Velocidad pura (tok/s)
- Con igual tamaño y VRAM, GLM 5.1 está en el mismo rango que Qwen 3.5 denso y Gemma 4. No hay diferencias significativas — la velocidad depende principalmente del backend (Ollama vs llama.cpp vs vLLM) y del GPU.
- Calidad en francés
- Mistral Small 24B nativo > Qwen 3.5 ≈ GLM 5.1 > Gemma 4 a tamaño equivalente. Si el francés es crucial, Mistral sigue por delante; GLM 5.1 es una sólida segunda opción de pesos abiertos.
- Código
- Qwen3-Coder 30B / Devstral 24B > GLM 5.1 ≈ Qwen 3.8 generalista > Gemma 4 a igualdad de tamaño. GLM 5.1 32B es competitivo frente a Qwen 3.8 27B, ligeramente por detrás de los modelos especializados en código.
- Tool calling
- GLM 5.1 ≈ Qwen 3.5 > Gemma 4. Los dos primeros han sido entrenados explícitamente para herramientas, Gemma pide un poco más de ingeniería de prompts.
- Contexto largo
- Qwen 3.5 256k nativo (Qwen 3.8 27B: 262k) > GLM 5.1 128k (1M mediante YaRN) > Gemma 4 128k. Para análisis de base de código completa, Qwen mantiene una ventaja de longitud.
- Licencia
- GLM (similar a Apache) ≈ Qwen (Apache 2.0 en la mayoría de las variantes) ≈ Gemma 4 (Apache 2.0 desde abril de 2026). Tres licencias sencillas para uso empresarial, ya que Gemma ha abandonado su cláusula personalizada.
- Ecosistema
- Qwen > Gemma 4 > GLM 5.1. Qwen ahora tiene la mayor cantidad de fine-tunes comunitarios, Gemma 4 lo sigue de cerca y GLM 5.1 sigue siendo menos conocido: menos variantes, menos tutoriales en francés.
#Consejos y posibles problemas
- Prompt de sistema corto
- GLM 5.1 sigue bien los prompts de sistema, pero se satura un poco si le das uno de 800 palabras. Procura que tenga entre 200 y 400 palabras y sea claro y estructurado.
- Temperatura baja para el francés
- 0.2-0.4 para minimizar los anglicismos y las anomalías de concordancia. Por encima de 0.7, la calidad de la escritura en francés empieza a fluctuar.
- Tokens de parada
- El modelo utiliza <|endoftext|> y <|user|> como delimitadores. Si escribes tu propio cliente, añade estas dos cadenas a los tokens de parada para evitar que siga hablando solo.
- Streaming mediante Ollama
- Los endpoints /api/chat y /v1/chat/completions admiten stream=true. GLM 5.1 no presenta ninguna particularidad al respecto, a diferencia de algunos modelos MoE.
- Fine-tuning LoRA
- GLM 5.1 9B es viable con LoRA en una RTX 4090 de 24 GB con Unsloth. El 32B requiere múltiples GPUs o un Mac con memoria unificada generosa.
- Modelfile Ollama
- Para fijar un prompt de sistema y unos parámetros, crea un Modelfile basado en glm5.1:9b y luego ejecuta ollama create monassistant -f Modelfile. El modelo derivado aparece en ollama list como cualquier otro.
#Para ir más allá
GLM 5.1 está funcionando, ya tienes tus primeros resultados. Algunas pistas para mejorar:
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para decidir con precisión el equilibrio calidad/VRAM en tus casos de uso.
- Qwen3.6 35B-A3B en local: prueba y necesidades de VRAM
- El competidor directo de la familia Qwen, con arquitectura MoE. Una comparativa útil si tienes dudas.
- Open WebUI con Ollama: guía completa
- Una interfaz similar a ChatGPT sobre GLM 5.1: conversaciones, RAG, múltiples usuarios.
- Crear un agente de IA local en Python con LangChain y Ollama
- Para aprovechar el llamado nativo de herramientas de GLM 5.1 y hacer que llame a tus propias funciones.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.