LLM chinos en local: Qwen, DeepSeek, GLM, Kimi
En 2026, si descargas un LLM de pesos abiertos para ejecutarlo en tu equipo, es muy probable que provenga de China. Qwen, DeepSeek, GLM, Kimi: estas familias dominan los primeros puestos de las clasificaciones de modelos abiertos, a menudo bajo licencias más permisivas que las de los laboratorios occidentales. Este panorama distingue lo que ofrece cada familia, lo que dicen realmente sus licencias y por qué ejecutar un LLM chino localmente responde de antemano a la cuestión de la confidencialidad.
#¿Por qué los LLM chinos dominan los modelos de pesos abiertos?
El panorama de los modelos abiertos ha cambiado. Mientras que hace dos años Meta (Llama) lideraba la carrera, hoy son los laboratorios chinos quienes publican los pesos de los modelos más potentes y lo hacen con mayor frecuencia. Alibaba (Qwen), DeepSeek, Zhipu AI (GLM) y Moonshot (Kimi) lanzan modelos a un ritmo intenso, desde el pequeño 3B hasta los MoE de varios cientos de miles de millones de parámetros.
La razón es tanto estratégica como técnica: publicar los pesos en abierto les permite ganar visibilidad mundial, atraer a la comunidad e imponerse como estándares de hecho, incluso frente a los modelos cerrados estadounidenses. Para ti, como usuario que ejecuta modelos localmente, el resultado es sencillo: una inmensa selección de modelos gratuitos, actualizados regularmente y a menudo a la par con los modelos en la nube en programación, razonamiento y capacidades multilingües.
#La ejecución local resuelve la cuestión de la confidencialidad
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Es la objeción automática: «un LLM chino, mis datos van a China». Es cierto para las API en la nube (chat.qwen.ai, la app DeepSeek, la plataforma Zhipu): allí, tus prompts sí pasan por servidores remotos sujetos a la legislación china. Pero esta guía trata del uso en local, y en local ese temor simplemente deja de tener fundamento.
Cuando lanzas el modelo con Ollama o LM Studio, descargas un archivo de pesos fijo (por ejemplo, un GGUF) y es tu GPU quien calcula las respuestas. El modelo no tiene capacidad de red: no es un software que «llame a casa», es una gran matriz de números. Nada sale de tu máquina, independientemente de la procedencia del modelo.
- En la nube (API)
- Tus prompts se envían al proveedor. El origen del modelo y la jurisdicción importan de verdad.
- Ejecución local
- Los pesos se ejecutan en tu hardware, fuera de línea si lo deseas. Ningún dato abandona el equipo.
- El verdadero riesgo residual
- Un sesgo o una censura en las respuestas del modelo (algunos temas sensibles), no una fuga de datos. Se trata de la calidad de la salida, no de privacidad.
#Licencias reales: Apache 2.0 y MIT
Otra idea errónea: «las licencias chinas son opacas o engañosas». La realidad de 2026 es la inversa: suelen ser las licencias más claras del mercado. La mayoría de los modelos de este panorama están publicados bajo Apache 2.0 o MIT, dos licencias permisivas internacionales, incluso para uso comercial.
- Qwen
- La mayoría de las variantes recientes (como Qwen3.8-27B) están bajo Apache 2.0 — uso comercial libre, redistribución autorizada.
- DeepSeek
- Los modelos V3/V4 y R1 están publicados bajo la licencia MIT, una de las más permisivas que existen.
- GLM (Zhipu)
- Las últimas generaciones, incluida GLM-5.2, han pasado a la licencia MIT.
- Kimi (Moonshot)
- Pesos abiertos bajo licencia permisiva de tipo MIT/Apache según las versiones.
#Qwen (Alibaba): la navaja suiza
Qwen es la familia más completa y versátil del ecosistema. Alibaba ofrece el modelo en todos los tamaños, desde el 3B que cabe en una GPU de gama de entrada hasta los grandes MoE, y en todas las especialidades: uso general, código (Qwen3-Coder), visión (Qwen3-VL) y un modo «thinking» para el razonamiento.
- Puntos fuertes
- Multilingüe excelente (incluyendo un francés muy correcto), gama de tamaños sin igual, ecosistema de herramientas maduro, disponibilidad day-0 en Ollama.
- Tamaños típicos
- Desde modelos de 3B/7B para probar, pasando por el de 27B (Qwen3.8) como punto óptimo entre calidad y VRAM, hasta los MoE 35B-A3B para GPU grandes.
- Para quién
- La primera opción por defecto si empiezas y quieres un modelo que haga todo correctamente.
#DeepSeek: el campeón del razonamiento
DeepSeek se dio a conocer con R1, un modelo de razonamiento mediante cadena de pensamiento que sacudió el sector a principios de 2025. La familia sigue siendo la referencia en tareas lógicas, matemáticas y de código complejo. Las versiones destiladas de R1 (7B, 14B, 32B) hacen accesible este razonamiento en hardware de consumo.
- Puntos fuertes
- Razonamiento y matemáticas de muy alto nivel, licencia MIT, versiones destiladas que se pueden ejecutar en local.
- La trampa
- Los modelos insignia (V3/V4, 671B y más en MoE) son enormes: quedan fuera del alcance de una sola GPU. Para el uso local de consumo, opta por los modelos destilados de R1.
- Para quién
- Quienes realizan tareas difíciles de programación, matemáticas o lógica, o quieren ver al modelo «pensar» antes de responder.
#GLM (Zhipu): el aspirante versátil
GLM, desarrollado por Zhipu AI, es el competidor serio de Qwen. Bueno en francés, sólido en código y razonamiento, ofrece tamaños razonables (alrededor de 9B y 32B) que apuntan directamente al punto óptimo de GPUs de 12 a 24 GB, así como gigantes de arquitectura MoE como GLM-5.2 (753B) para configuraciones extremas.
- Puntos fuertes
- Excelente equilibrio calidad/tamaño en las variantes 9B-32B, buen francés, licencia MIT en las últimas generaciones
- Tamaños típicos
- 9B para una GPU de 8 a 12 GB, 32B para 24 GB. Las versiones MoE de frontera siguen reservadas para los Mac con mucha RAM unificada.
- Para quién
- Una alternativa creíble a Qwen cuando quieres comparar, o un modelo que funciona bien en francés en hardware modesto.
#Kimi y MiniCPM: los dos extremos
Estas dos familias ilustran los extremos del espectro. Kimi (Moonshot) busca el muy grande: modelos MoE de 1 trillón de parámetros y más, conocidos por su contexto largo y su calidad agente. MiniCPM (equipo OpenBMB / ModelBest) busca lo contrario: modelos compactos y eficientes, diseñados para funcionar en dispositivos móviles o en GPUs pequeñas.
- Kimi K2 / K3
- MoE gigantes (de 1T a 2.8T de parámetros). Pesos abiertos, pero «abierto» no significa «ejecutable en tu equipo»: se necesitan decenas de aceleradores. Reservados para servidores, no para una estación de trabajo.
- MiniCPM
- Modelos ultracompactos, algunos multimodales, diseñados para sistemas embebidos y configuraciones pequeñas. Ideales cuando cada gigabyte de VRAM cuenta.
- Puntos clave
- Los modelos de pesos abiertos cubren todo el espectro de hardware. No confundas «el modelo es libre» con «mi máquina puede ejecutarlo».
#¿Cuál elegir según tu VRAM?
El verdadero factor limitante en local no es la marca del modelo, sino la VRAM de tu GPU. En cuantización Q4_K_M (el mejor equilibrio calidad/tamaño), aquí tienes referencias concretas para clasificar estas familias por nivel de hardware.
- 8 GB (RTX 3060 8G, 4060)
- Qwen 7B, GLM 9B, DeepSeek-R1 destilado de 7B en Q4 (~5 GB). Cómodo para chat y código ligero.
- 12 GB (RTX 3060 12G, 4070)
- El punto óptimo. Qwen 14B, GLM 9B en Q8, DeepSeek-R1 14B (~9 GB). Margen para un contexto más amplio.
- 16 GB (RTX 4080, 5070 Ti)
- Qwen ~24-27B, DeepSeek-R1 32B con una cuantización agresiva. El nivel «serio» para el razonamiento.
- 24 GB (RTX 3090/4090)
- Qwen 27-32B y GLM 32B íntegramente en VRAM (~19 GB), MoE 35B-A3B. Lo mejor de la IA local para el público general.
- Mac con RAM unificada (48-128+ GB)
- Único escenario realista para los grandes MoE (GLM-5.2, DeepSeek Flash) mediante offload a la memoria unificada, con una velocidad de generación moderada.
#Instalar un modelo chino en la práctica
La pila típica es idéntica independientemente de la procedencia del modelo: Ollama como daemon de inferencia (escucha en http://localhost:11434), con Open WebUI o LM Studio como interfaz. A continuación se explica cómo obtener un modelo de cada familia.
- 01Instalar OllamaDescarga el daemon desde ollama.com y ejecútalo. Expone una API local en el puerto 11434: no hay nada más que configurar para empezar.
- 02Elegir un modelo según tu VRAMConsulta la tabla anterior. En caso de duda, empieza por Qwen 14B o GLM 9B en Q4_K_M: caben en la mayoría de las GPU recientes y cubren el 90 % de los usos.
- 03Descargar e iniciarUn solo comando descarga los pesos y luego abre el chat. La primera ejecución descarga varios gigabytes; las siguientes son instantáneas.
- 04Verificar el modo offlineUna vez que los pesos estén en caché, desconecta la conexión de red y continúa conversando: es la prueba de que el modelo se ejecuta al 100 % en local.
#Para ir más allá
Este panorama te ofrece un mapa general; estas guías profundizan en cada familia y en los ajustes para el uso local:
- El punto óptimo de Qwen
- «Qwen 3.8 27B en local: instalación de Ollama, VRAM y ajustes» detalla el comando exacto, la VRAM según la cuantización y el modo thinking.
- El razonamiento DeepSeek
- « Instalar DeepSeek R1 con Ollama » cubre las versiones destiladas 7B/14B/32B y la cadena de pensamiento local.
- Elegir según tu tarjeta
- Las guías «¿Qué LLM para 12 GB / 16 GB / 24 GB de VRAM?» traducen estos umbrales en recomendaciones concretas por GPU.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.