Intermedio 11 minNoticias

Kimi K3 en casa: la verdad sobre el hardware necesario (2.8T parámetros)

Respuesta directa

Kimi K3 no se ejecuta en un ordenador de escritorio: sus pesos nativos ocupan 1,56 TB y la cuantización GGUF más pequeña publicada (Unsloth, 1 bit dinámico) todavía ocupa 594 GB, con 610 GB de memoria recomendados. Ni un Mac Studio de 512 GB ni una RTX 5090 por sí sola bastan. Para probarlo, utiliza la API de Moonshot o kimi-k3:cloud en Ollama; para ejecutarlo en local, elige un modelo más pequeño.

Los pesos de Kimi K3 son abiertos desde finales de julio de 2026, y las búsquedas «ollama kimi k3», «kimi k3 lmstudio» o «kimi k3 on 5090» muestran que muchos lectores se preguntan si pueden instalarlo en casa. Esta guía proporciona las cifras publicadas por Moonshot y por Unsloth, calcula lo que puede cargar tu máquina e indica qué hacer como alternativa.

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux

#Kimi K3 en local: lo que realmente publicó Moonshot

La ficha de Hugging Face de Moonshot describe Kimi K3 como un modelo multimodal de pesos abiertos de 2,8 billones de parámetros, con una ventana de contexto de un millón de tokens. Es un Mixture-of-Experts: 896 expertos, de los cuales se seleccionan 16 para cada token, lo que supone 104 mil millones de parámetros activados. Los pesos se distribuyen en MXFP4 (pesos) con activaciones MXFP8, y se aplicó un entrenamiento consciente de la cuantización desde la fase de fine-tuning supervisado. El código y los pesos se rigen por la «Kimi K3 License»: lee este texto antes de cualquier uso comercial, ya que no es una licencia MIT o Apache estándar. El modelo llegó a Hugging Face alrededor del 27 de julio de 2026 según la prensa especializada.

Parámetros totales / activos
2,8 T en total, 104 Md activos por token (ficha Moonshot).
Expertos
896 expertos, 16 seleccionados por token, más 2 expertos compartidos
Formato publicado
MXFP4 para los pesos, MXFP8 para las activaciones. No es un GGUF.
Contexto
1 048 576 tokens, con un caché KV que se suma a la memoria de los pesos.
Motores recomendados
vLLM, SGLang y TokenSpeed. llama.cpp utiliza los GGUF de la comunidad.
i
Activos no quiere decir residentes
Solo 104 mil millones de parámetros trabajan por cada token, pero el router puede elegir cualquier experto: todos los pesos deben permanecer accesibles. Es la memoria, no la potencia de cálculo, la que determina el hardware. El principio se detalla en nuestra guía sobre los MoE.

#Lo que realmente pesan los pesos

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Circulan dos cifras y hay que distinguirlas. Algunos artículos estiman «del orden de 1,4 TB» multiplicando 2,8 T de parámetros por medio byte. El tamaño medido de los archivos es mayor: Unsloth y Runpod indican 1,56 TB para la versión nativa, porque las capas ajenas a los expertos (atención, enrutadores, expertos compartidos) se mantienen en una precisión superior. El BF16 sin cuantizar alcanzaría aproximadamente 5,6 TB, según Runpod. Por tanto, la cifra de 1,4 TB que daba la versión de esta guía era aproximadamente un 10 % demasiado baja.

Tamaños publicados para Kimi K3 (fuentes: Unsloth, Runpod)
FormatoTamañoMemoria total recomendadaFidelidad medida
Nativo MXFP4 / UD-Q8_K_XL1,56 TB1,6 TBSin pérdida
Unsloth UD-Q2_K_XL (cuantización dinámica de 2 bits)861,3 GB880 GBAproximadamente un 90 % de coincidencia en el top-1
Unsloth UD-IQ2_XXS711,1 GB726 GB84,1 % de acuerdo top-1
Unsloth UD-IQ1_M648,9 GB665 GB81,2 % de acuerdo en top-1
Unsloth UD-IQ1_S (1 bit dinámico)594 GB610 GB78,9 % de acuerdo top-1
BF16 (teórico)aproximadamente 5,6 TBFuera de alcanceReferencia

La tabla refuta una idea errónea de la versión anterior: un Q2 no es «siempre del orden del terabyte». Unsloth sí ofrece archivos GGUF de menos de 900 GB. Pero 594 GB siguen siendo casi quince veces la memoria de una RTX 5090 de 32 GB, y la diferencia de calidad es real: la cuantización dinámica de 1 bit solo reproduce la elección del modelo original en el 78,9 % de los casos del conjunto de evaluación de Unsloth. Para entender cómo afectan los bits a la calidad, consulta nuestra guía de cuantización.

#El hardware: lo que se recomienda, lo que es posible

Moonshot no publica una configuración mínima en la página del modelo: redirige a las recetas vLLM, SGLang y TokenSpeed y a su API. La referencia documentada para el autohospedaje nativo proviene de Runpod: un nodo con ocho GPUs B300 de 288 GB cada uno, es decir, aproximadamente 2,3 TB, o dieciséis B200 distribuidos en dos nodos. El número de «64 aceleradores o más» que esta página citaba no aparece en ninguna fuente primaria consultada: se ha eliminado.

Con un GGUF de Unsloth, la regla que establece su documentación es sencilla: la suma de RAM y VRAM debe ser aproximadamente igual al tamaño de la cuantización; de lo contrario, el modelo funciona, pero pasa a utilizar el disco y lo hace mucho más lentamente. Unsloth también cita unos 20 tokens por segundo en generación cuando el modelo cabe en las B200. Es una tasa de generación indicada por un proveedor en hardware de centro de datos, no una medición aplicable a un equipo doméstico.

#¿Y en un Mac? El cálculo en lugar de los rumores

No se ha encontrado ninguna fuente verificable para la cifra de «16 segundos por token en un MacBook Pro M1 Max» que esta página recogía: no la presentamos como un hecho. Lo que las fuentes establecen es más claro. Kingy AI señala que el punto de partida (checkpoint de 1,56 TB) ya superaba la capacidad de memoria de un Mac Studio de 512 GB, y que incluso el archivo de 553,2 GiB de la versión de 1 bit supera la capacidad de esa máquina antes de contar el consumo adicional de memoria. Los 128 GB de un Mac representan aproximadamente una quinta parte de los 610 GB recomendados.

En cambio, puedes estimar por ti mismo el orden de magnitud. Si la memoria no es suficiente, cada token vuelve a leer desde el SSD los expertos que activa: 104 mil millones de parámetros a aproximadamente 4 bits, lo que equivale a unos 50 GB leídos por token. Con un SSD que proporciona 3 GB/s, se obtienen alrededor de 17 segundos por token; a 7 GB/s, alrededor de 7 segundos. Es un cálculo teórico de un límite superior, no una medición, pero explica por qué los testimonios sobre la ejecución «en disco» hablan de segundos por token y no de tokens por segundo.

!
Lo que significa que 'funciona'
A 10 segundos por token, una respuesta de 300 tokens tarda casi cincuenta minutos, y el modo de razonamiento de K3, siempre activo, añade aún más tokens de reflexión antes de la respuesta. Técnicamente cargado, prácticamente inutilizable.

#Ollama, LM Studio, llama.cpp: qué permite cada herramienta

Ollama
La biblioteca oficial lista una sola variante, kimi-k3:cloud: el modelo se ejecuta en los servidores de Ollama, no en tu máquina. El comando ollama run kimi-k3:cloud sirve para probar el modelo con la interfaz habitual, con las limitaciones de confidencialidad y facturación de un servicio remoto.
LM Studio
Carga GGUF locales. Para K3, esto supone descargar varios cientos de GB de archivos Unsloth y disponer de la memoria correspondiente. En un equipo de consumo, la respuesta es no.
llama.cpp
Es el motor al que están destinados los GGUF de Unsloth, que se apoyan en una rama derivada de llama.cpp con soporte de visión. Gestiona la ejecución de los expertos en la CPU y los archivos divididos en varias partes: es la vía realista para una estación de trabajo con varios cientos de GB de RAM.
vLLM y SGLang
Los dos motores recomendados por Moonshot para un servicio multi-GPU con formato nativo.
Tu máquina frente a Kimi K3
MáquinaMemoria disponibleVeredicto
RTX 5090 (32 GB) + 64 GB de RAMaproximadamente 96 GBImposible: 6 veces demasiado poco, incluso en 1 bit
Mac mini o MacBook, 16 a 64 GB16 a 64 GBImposible localmente; solo API o nube
Mac Studio de 128 a 256 GB128 a 256 GBInsuficiente para los 610 GB recomendados
Mac Studio 512 GB512 GBPor debajo del tamaño del archivo de 1 bit, sin contar el contexto
Estación de 768 GB a 1 TB de RAM + GPU600 a 900 GBFactible en GGUF de 1 a 2 bits, velocidad modesta
8 GPU B300 (aproximadamente 2,3 TB)2,3 TBConfiguración documentada para el formato nativo

#Las opciones realistas para probar Kimi K3

  1. 01
    1. La API oficial de Moonshot
    El modelo se llama kimi-k3 en platform.kimi.ai, con una API compatible con OpenAI y Anthropic. Es la forma más rápida de evaluar la calidad, con un parámetro reasoning_effort ajustable en low, high o max.
  2. 02
    2. Ollama cloud
    ollama run kimi-k3:cloud utilise vos habitudes Ollama avec l'inférence déportée. La page de la bibliothèque affiche les tarifs par million de tokens : vérifiez-les avant d'automatiser. Notre guide sur Ollama Cloud détaille les limites.
  3. 03
    3. Un alquiler de GPU
    Alquilar un nodo multi-GPU por horas durante una prueba, con vLLM. Haz primero el cálculo de rentabilidad (coste por hora dividido por la tasa sostenida de tokens por segundo), que Runpod formula en sus preguntas frecuentes.
  4. 04
    4. Una estación con mucha RAM
    Solo si ya tienes 700 GB de memoria: GGUF UD-IQ1_S y llama.cpp, aceptando una calidad reducida y una baja velocidad de generación.

#Que un modelo tenga pesos abiertos no significa que se pueda ejecutar en casa

Los pesos abiertos garantizan el derecho a descargar, auditar, ajustar y, según la licencia, redistribuir. No garantizan que alguien pueda ejecutarlos. Un modelo de 30 mil millones de parámetros en una tarjeta de 24 GB te pertenece realmente; uno de 2,8 T que solo puede cargar un clúster sigue siendo, en la práctica, un servicio. Kimi K3 es una buena noticia para la auditabilidad y para las organizaciones que ya tienen un clúster, sin cambiar lo que un particular puede hacer en casa.

#Alternativas que tu hardware puede realmente cargar

El catálogo QuelLLM estima las necesidades de memoria en Q4, sin incluir la memoria del contexto: DeepSeek V4 Flash 284B, aproximadamente 170 GB; GLM 5.2 753B-A40B, aproximadamente 437 GB; Kimi K3, aproximadamente 1 624 GB. Para uso diario, un modelo de 30 a 70 mil millones de parámetros en Q4 sigue ofreciendo la mejor relación entre calidad y viabilidad.

DeepSeek V4 Flash 284B
Aproximadamente 170 GB en Q4 según el catálogo: posible en un Mac Studio con mucha memoria o una estación de trabajo. Ver la guía específica.
GLM 5.2 753B-A40B
Aproximadamente 437 GB en Q4: es el tamaño más cercano a K3 accesible en una estación bien equipada.
Kimi K2.5 y K2.7
Aproximadamente 600 GB en Q4: más pequeños que K3, pero todavía requieren infraestructura de estación de trabajo.
Modelos de 30 a 70 mil millones
En una tarjeta de 24 a 32 GB o en un Mac de 64 GB: la opción razonable para un uso real. El calculador de VRAM proporciona el valor exacto.

#Veredicto: Kimi K3 en local, casi nunca

Pesos nativos de 1,56 TB, cuantizaciones de 594 a 861 GB, 610 GB de memoria para la más pequeña: Kimi K3 es un modelo de servidor. Para evaluarlo, usa la API o kimi-k3:cloud. Para un uso real en casa, elige un modelo que quepa en tu memoria con margen para el contexto.

FAQ
¿Se puede instalar Kimi K3 con Ollama?+
No en local. La biblioteca Ollama solo ofrece la variante kimi-k3:cloud, que se ejecuta en servidores remotos y no en tu máquina. Para un modelo realmente cargado en tu equipo, se necesitaría un GGUF de varios cientos de GB a través de llama.cpp, lo que excluye un ordenador común, incluso muy bien equipado.
¿Kimi K3 funciona en una RTX 5090?+
No. Una RTX 5090 ofrece 32 GB de VRAM, mientras que el GGUF de Unsloth más pequeño ocupa 594 GB y requiere 610 GB de memoria total. Incluso con 128 GB adicionales de RAM del sistema, la máquina seguiría muy lejos de la capacidad necesaria, y descargar parte del modelo al disco haría que la generación fuera inutilizable.
¿Un Mac mini o un Mac Studio puede ejecutar Kimi K3?+
No en la práctica. Un Mac Studio de 512 GB aún queda por debajo del tamaño del archivo de 1 bit (553,2 GiB), sin contar el contexto, y un Mac mini está aún más lejos. En estas máquinas, elige un modelo más pequeño o pasa por la API del modelo o por Ollama Cloud.
¿Puede LM Studio cargar Kimi K3?+
En teoría, sí: LM Studio puede leer archivos GGUF y Unsloth publica modelos en ese formato. En la práctica, se necesita suficiente memoria: al menos 610 GB para la versión de 1 bit. En un equipo de consumo, la aplicación no puede cargar el modelo; es mejor optar por uno más pequeño.
¿Qué cuantización elegir para Kimi K3?+
Unsloth recomienda UD-IQ1_S (594 GB) como equilibrio entre tamaño y calidad: un 78,9 % de coincidencia top-1 con el original según sus mediciones. La versión de 2 bits UD-Q2_K_XL, de 861 GB, alcanza aproximadamente el 90 %. En ambos casos, esto ya supone disponer de una estación de trabajo con más de 600 GB de memoria.
¿Por qué Kimi K3 es tan grande con solo 104 mil millones de parámetros activos?+
Porque el router puede activar cualquiera de los 896 expertos: solo 16 realizan cálculos en cada token, pero todos deben permanecer disponibles en memoria. El costo de cálculo por token es moderado; es la capacidad de memoria, no la potencia, la que exige hardware de servidor.

#Para ir más allá

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.