Principiante 12 minPanorama

LLM chinos en local: Qwen, DeepSeek, GLM, Kimi

En 2026, si descargas un LLM de pesos abiertos para ejecutarlo en tu equipo, es muy probable que provenga de China. Qwen, DeepSeek, GLM, Kimi: estas familias dominan los primeros puestos de las clasificaciones de modelos abiertos, a menudo bajo licencias más permisivas que las de los laboratorios occidentales. Este panorama distingue lo que ofrece cada familia, lo que dicen realmente sus licencias y por qué ejecutar un LLM chino localmente responde de antemano a la cuestión de la confidencialidad.

Por Mohamed Meguedmi·Actualización 2026-09-01·Probado en Windows, macOS y Linux

#¿Por qué los LLM chinos dominan los modelos de pesos abiertos?

El panorama de los modelos abiertos ha cambiado. Mientras que hace dos años Meta (Llama) lideraba la carrera, hoy son los laboratorios chinos quienes publican los pesos de los modelos más potentes y lo hacen con mayor frecuencia. Alibaba (Qwen), DeepSeek, Zhipu AI (GLM) y Moonshot (Kimi) lanzan modelos a un ritmo intenso, desde el pequeño 3B hasta los MoE de varios cientos de miles de millones de parámetros.

La razón es tanto estratégica como técnica: publicar los pesos en abierto les permite ganar visibilidad mundial, atraer a la comunidad e imponerse como estándares de hecho, incluso frente a los modelos cerrados estadounidenses. Para ti, como usuario que ejecuta modelos localmente, el resultado es sencillo: una inmensa selección de modelos gratuitos, actualizados regularmente y a menudo a la par con los modelos en la nube en programación, razonamiento y capacidades multilingües.

i
Pesos abiertos ≠ código abierto
«Open-weight» significa que los pesos del modelo se pueden descargar y ejecutar libremente. Esto no garantiza que los datos de entrenamiento o el código completo estén publicados. Es el caso de casi todos los modelos de esta guía: obtienes el modelo, no su receta.

#La ejecución local resuelve la cuestión de la confidencialidad

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Es la objeción automática: «un LLM chino, mis datos van a China». Es cierto para las API en la nube (chat.qwen.ai, la app DeepSeek, la plataforma Zhipu): allí, tus prompts sí pasan por servidores remotos sujetos a la legislación china. Pero esta guía trata del uso en local, y en local ese temor simplemente deja de tener fundamento.

Cuando lanzas el modelo con Ollama o LM Studio, descargas un archivo de pesos fijo (por ejemplo, un GGUF) y es tu GPU quien calcula las respuestas. El modelo no tiene capacidad de red: no es un software que «llame a casa», es una gran matriz de números. Nada sale de tu máquina, independientemente de la procedencia del modelo.

En la nube (API)
Tus prompts se envían al proveedor. El origen del modelo y la jurisdicción importan de verdad.
Ejecución local
Los pesos se ejecutan en tu hardware, fuera de línea si lo deseas. Ningún dato abandona el equipo.
El verdadero riesgo residual
Un sesgo o una censura en las respuestas del modelo (algunos temas sensibles), no una fuga de datos. Se trata de la calidad de la salida, no de privacidad.
→
Asegurarse de que nada salga
Para convencerte: ejecuta Ollama, desactiva el Wi-Fi y habla con el modelo. Todo sigue funcionando. Un LLM local solo necesita la red para la descarga inicial de los pesos.

#Licencias reales: Apache 2.0 y MIT

Otra idea errónea: «las licencias chinas son opacas o engañosas». La realidad de 2026 es la inversa: suelen ser las licencias más claras del mercado. La mayoría de los modelos de este panorama están publicados bajo Apache 2.0 o MIT, dos licencias permisivas internacionales, incluso para uso comercial.

Qwen
La mayoría de las variantes recientes (como Qwen3.8-27B) están bajo Apache 2.0 — uso comercial libre, redistribución autorizada.
DeepSeek
Los modelos V3/V4 y R1 están publicados bajo la licencia MIT, una de las más permisivas que existen.
GLM (Zhipu)
Las últimas generaciones, incluida GLM-5.2, han pasado a la licencia MIT.
Kimi (Moonshot)
Pesos abiertos bajo licencia permisiva de tipo MIT/Apache según las versiones.
!
Lee de todos modos la ficha del modelo
Algunas familias antiguas o variantes específicas pueden tener una licencia propia con cláusulas de uso. Antes de un despliegue comercial, revisa siempre el archivo LICENSE en la página de Hugging Face del modelo específico que descargues, no solo la reputación de la familia.

#Qwen (Alibaba): la navaja suiza

Qwen es la familia más completa y versátil del ecosistema. Alibaba ofrece el modelo en todos los tamaños, desde el 3B que cabe en una GPU de gama de entrada hasta los grandes MoE, y en todas las especialidades: uso general, código (Qwen3-Coder), visión (Qwen3-VL) y un modo «thinking» para el razonamiento.

Puntos fuertes
Multilingüe excelente (incluyendo un francés muy correcto), gama de tamaños sin igual, ecosistema de herramientas maduro, disponibilidad day-0 en Ollama.
Tamaños típicos
Desde modelos de 3B/7B para probar, pasando por el de 27B (Qwen3.8) como punto óptimo entre calidad y VRAM, hasta los MoE 35B-A3B para GPU grandes.
Para quién
La primera opción por defecto si empiezas y quieres un modelo que haga todo correctamente.

#DeepSeek: el campeón del razonamiento

DeepSeek se dio a conocer con R1, un modelo de razonamiento mediante cadena de pensamiento que sacudió el sector a principios de 2025. La familia sigue siendo la referencia en tareas lógicas, matemáticas y de código complejo. Las versiones destiladas de R1 (7B, 14B, 32B) hacen accesible este razonamiento en hardware de consumo.

Puntos fuertes
Razonamiento y matemáticas de muy alto nivel, licencia MIT, versiones destiladas que se pueden ejecutar en local.
La trampa
Los modelos insignia (V3/V4, 671B y más en MoE) son enormes: quedan fuera del alcance de una sola GPU. Para el uso local de consumo, opta por los modelos destilados de R1.
Para quién
Quienes realizan tareas difíciles de programación, matemáticas o lógica, o quieren ver al modelo «pensar» antes de responder.

#GLM (Zhipu): el aspirante versátil

GLM, desarrollado por Zhipu AI, es el competidor serio de Qwen. Bueno en francés, sólido en código y razonamiento, ofrece tamaños razonables (alrededor de 9B y 32B) que apuntan directamente al punto óptimo de GPUs de 12 a 24 GB, así como gigantes de arquitectura MoE como GLM-5.2 (753B) para configuraciones extremas.

Puntos fuertes
Excelente equilibrio calidad/tamaño en las variantes 9B-32B, buen francés, licencia MIT en las últimas generaciones
Tamaños típicos
9B para una GPU de 8 a 12 GB, 32B para 24 GB. Las versiones MoE de frontera siguen reservadas para los Mac con mucha RAM unificada.
Para quién
Una alternativa creíble a Qwen cuando quieres comparar, o un modelo que funciona bien en francés en hardware modesto.

#Kimi y MiniCPM: los dos extremos

Estas dos familias ilustran los extremos del espectro. Kimi (Moonshot) busca el muy grande: modelos MoE de 1 trillón de parámetros y más, conocidos por su contexto largo y su calidad agente. MiniCPM (equipo OpenBMB / ModelBest) busca lo contrario: modelos compactos y eficientes, diseñados para funcionar en dispositivos móviles o en GPUs pequeñas.

Kimi K2 / K3
MoE gigantes (de 1T a 2.8T de parámetros). Pesos abiertos, pero «abierto» no significa «ejecutable en tu equipo»: se necesitan decenas de aceleradores. Reservados para servidores, no para una estación de trabajo.
MiniCPM
Modelos ultracompactos, algunos multimodales, diseñados para sistemas embebidos y configuraciones pequeñas. Ideales cuando cada gigabyte de VRAM cuenta.
Puntos clave
Los modelos de pesos abiertos cubren todo el espectro de hardware. No confundas «el modelo es libre» con «mi máquina puede ejecutarlo».

#¿Cuál elegir según tu VRAM?

El verdadero factor limitante en local no es la marca del modelo, sino la VRAM de tu GPU. En cuantización Q4_K_M (el mejor equilibrio calidad/tamaño), aquí tienes referencias concretas para clasificar estas familias por nivel de hardware.

8 GB (RTX 3060 8G, 4060)
Qwen 7B, GLM 9B, DeepSeek-R1 destilado de 7B en Q4 (~5 GB). Cómodo para chat y código ligero.
12 GB (RTX 3060 12G, 4070)
El punto óptimo. Qwen 14B, GLM 9B en Q8, DeepSeek-R1 14B (~9 GB). Margen para un contexto más amplio.
16 GB (RTX 4080, 5070 Ti)
Qwen ~24-27B, DeepSeek-R1 32B con una cuantización agresiva. El nivel «serio» para el razonamiento.
24 GB (RTX 3090/4090)
Qwen 27-32B y GLM 32B íntegramente en VRAM (~19 GB), MoE 35B-A3B. Lo mejor de la IA local para el público general.
Mac con RAM unificada (48-128+ GB)
Único escenario realista para los grandes MoE (GLM-5.2, DeepSeek Flash) mediante offload a la memoria unificada, con una velocidad de generación moderada.
i
Indicador de VRAM en Q4
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Añade siempre entre 1 y 2 GB para el contexto y el sistema. Un modelo que supera la capacidad de la VRAM pasa a la RAM (offload a la CPU) y su tasa de generación cae en picado.

#Instalar un modelo chino en la práctica

La pila típica es idéntica independientemente de la procedencia del modelo: Ollama como daemon de inferencia (escucha en http://localhost:11434), con Open WebUI o LM Studio como interfaz. A continuación se explica cómo obtener un modelo de cada familia.

  1. 01
    Instalar Ollama
    Descarga el daemon desde ollama.com y ejecútalo. Expone una API local en el puerto 11434: no hay nada más que configurar para empezar.
  2. 02
    Elegir un modelo según tu VRAM
    Consulta la tabla anterior. En caso de duda, empieza por Qwen 14B o GLM 9B en Q4_K_M: caben en la mayoría de las GPU recientes y cubren el 90 % de los usos.
  3. 03
    Descargar e iniciar
    Un solo comando descarga los pesos y luego abre el chat. La primera ejecución descarga varios gigabytes; las siguientes son instantáneas.
  4. 04
    Verificar el modo offline
    Una vez que los pesos estén en caché, desconecta la conexión de red y continúa conversando: es la prueba de que el modelo se ejecuta al 100 % en local.
Terminal
# Qwen généraliste (Alibaba, Apache 2.0)
ollama run qwen3

# DeepSeek-R1 distillé, raisonnement (MIT)
ollama run deepseek-r1:14b

# GLM, l'alternative polyvalente (Zhipu)
ollama run glm4

# Vérifier les modèles installés et que le daemon répond
curl http://localhost:11434/api/tags
→
Los nombres de etiquetas varían
Los tags exactos (qwen3, deepseek-r1:14b, etc.) y las versiones disponibles evolucionan rápidamente en la biblioteca Ollama. Consulta ollama.com/library para conocer el nombre exacto y el tamaño en GB de cada variante antes de descargarla.

#Para ir más allá

Este panorama te ofrece un mapa general; estas guías profundizan en cada familia y en los ajustes para el uso local:

El punto óptimo de Qwen
«Qwen 3.8 27B en local: instalación de Ollama, VRAM y ajustes» detalla el comando exacto, la VRAM según la cuantización y el modo thinking.
El razonamiento DeepSeek
« Instalar DeepSeek R1 con Ollama » cubre las versiones destiladas 7B/14B/32B y la cadena de pensamiento local.
Elegir según tu tarjeta
Las guías «¿Qué LLM para 12 GB / 16 GB / 24 GB de VRAM?» traducen estos umbrales en recomendaciones concretas por GPU.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.