Inicio › Catálogo › Mejor LLM sin GPU (solo CPU) en 2026

Mejor LLM sin GPU (solo CPU) en 2026

◆ IA Local — Tu ChatGPT privado y gratuito, en tu máquina, en 1 h · 24 € · o todos los kits 49 € →

Ranking actualizado el 22/09/2026

¿Sin GPU? Los LLM modernos de 1-7B funcionan correctamente en CPU gracias a llama.cpp y a las cuantizaciones Q4. Se necesitan 8-16 GB de RAM y hay que aceptar velocidades de 5-15 tokens/seg. Estas son las mejores opciones.

Clasificación

1

🇺🇸 Gemma 4 E4B

Google · 4 mil millones de parámetros · Apache 2.0 · 128 000 tokens ctx

Multimodal con 4B de parámetros efectivos (texto+imagen+audio). 140 idiomas. Para portátiles y edge.

Por qué esta posición 4B parámetros — funciona correctamente en CPU moderna (5-10 tokens/seg en Q4).
ollama run gemma4:e4b
VRAM Q4
10 GB
12 GB en Q8
2

🇺🇸 Granite 4.1 3B Instruct

IBM · 3B parámetros · Apache 2.0 · 131 072 tokens ctx

Modelo denso de 3B, Apache 2.0, 12 idiomas, incluido el francés, 131k de contexto, GQA 40Q/8KV. Llamadas a herramientas y FIM para código. Lanzamiento el 29 de abril de 2026.

Por qué esta posición 3 mil millones de parámetros — funciona correctamente en una CPU moderna (30-50 tokens/segundo en Q4).
ollama run granite4.1:3b
VRAM Q4
2 GB
3 GB en Q8
3

🇺🇸 Gemma 4 E2B

Google · 2000 millones de parámetros · Apache 2.0 · 128 000 tokens ctx

Gemma 4 E2B: 2B parámetros efectivos (5,1B en total), ~3 GB de VRAM en Q4 (pesos de Ollama: 4,3 GB con QAT y 7,2 GB por defecto). Multimodal de texto e imagen, contexto de 128k, Apache 2.0.

Por qué esta posición 2B de parámetros — funciona correctamente en una CPU moderna (30-50 tokens/seg en Q4).
ollama run gemma4:e2b
VRAM Q4
3 GB
5 GB en Q8
4

🇺🇸 Granite 4.1

IBM · 3B parámetros · Apache 2.0 · 128 000 tokens ctx

Granite 4.1 (3B Apache 2.0): etiqueta Ollama genérica de la familia IBM Granite 4.1, 128k de contexto, llamadas a herramientas y código. Lanzamiento en mayo de 2026.

Por qué esta posición 3 mil millones de parámetros — funciona correctamente en una CPU moderna (30-50 tokens/segundo en Q4).
ollama run granite4.1
VRAM Q4
1.7 GB
3.2 GB en Q8
5

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B parámetros · Apache 2.0 · 16 000 tokens ctx

Ajuste fino SFT «thinking» de OLMo 3 7B: razonamiento paso a paso, contexto de 16k, ~4,2 GB de VRAM en Q4. 100 % abierto, licencia Apache 2.0.

Por qué esta posición 7B de parámetros — funciona correctamente en CPU moderna (5 a 10 tokens/segundo en Q4).
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
VRAM Q4
4.2 GB
8 GB en Q8
6

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B parámetros · MIT · 128 000 tokens ctx

GLM 5.3 (Zhipu): modelo denso de 7B especializado en código y razonamiento, contexto de 128k, ~4,1 GB de VRAM en Q4. Ligero, funciona en GPU de 6-8 GB, licencia MIT.

Por qué esta posición 7B de parámetros — funciona correctamente en CPU moderna (5 a 10 tokens/segundo en Q4).
ollama pull glm-5.3
VRAM Q4
4.1 GB
7 GB en Q8
7

🇺🇸 Granite 4.0 3B Vision

IBM · 3B parámetros · Apache 2.0 · 16 384 tokens ctx

VLM 3B especializado en la extracción de datos de documentos empresariales. OCR, tablas, formularios.

Por qué esta posición 3 mil millones de parámetros — funciona correctamente en una CPU moderna (30-50 tokens/segundo en Q4).
# HuggingFace : ibm-granite/granite-4.0-3b-vision
VRAM Q4
2.2 GB
3.8 GB en Q8

Tabla comparativa

Puesto Modelo Params VRAM Q4 Contexto Licencia Con GPU integrada / sin GPU
#1 Gemma 4 E4B 4B 10 GB 128 000 Apache 2.0 ✗
#2 Granite 4.1 3B Instruct 3B 2 GB 131 072 Apache 2.0 ✗
#3 Gemma 4 E2B 2B 3 GB 128 000 Apache 2.0 ✗
#4 Granite 4.1 3B 1.7 GB 128 000 Apache 2.0 ✗
#5 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 ✗
#6 GLM 5.3 7B 7B 4.1 GB 128 000 MIT ✗
#7 Granite 4.0 3B Vision 3B 2.2 GB 16 384 Apache 2.0 ✗
El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Metodología del ranking

Solo modelos ≤ 8B: por encima de ese tamaño, la tasa de generación en CPU es demasiado baja. Se da una clara preferencia a los modelos ≤ 3B (muy rápidos en una CPU moderna) y a las licencias permisivas.

Criterios considerados:

  • Tamaño ≤ 8B (idealmente ≤ 3B)
  • Velocidad en CPU ≥ 5 tokens/seg
  • RAM requerida ≤ 16 GB
  • Calidad aceptable en Q4

La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.

Preguntas frecuentes

¿Es realmente posible ejecutar un LLM sin GPU?

Sí — gracias a llama.cpp + cuantización Q4_K_M, un 7B funciona a 5-10 tokens/segundo en una CPU Ryzen 7 o Apple M1. Para un uso interactivo, busca un 1-3B (30-50 tokens/segundo).

¿Cuánta RAM se necesita?

Para un 7B en Q4: 8 GB de RAM mínimo, 16 GB recomendados (el modelo ocupa ~5 GB, el resto para el sistema operativo + contexto). Para un 3B: 6-8 GB son suficientes. Para un 1B: 4 GB.

¿Qué CPU para un LLM?

Cuantos más núcleos y más soporte para AVX2/AVX-512, mejor. Ryzen 7/9 recientes, Intel Core i7/i9 recientes, Apple M1/M2/M3: todos excelentes. Prioriza la memoria rápida (DDR5 > DDR4): el ancho de banda de la RAM suele limitar más que los núcleos.

¿Puede ayudar una iGPU (Intel / AMD)?

Solo un poco: Vulkan en una iGPU ofrece una mejora del 20-40 % frente a usar solo la CPU. No es espectacular, pero vale la pena aprovecharla. En los Mac con Apple Silicon, la GPU integrada se puede utilizar mediante Metal y marca una gran diferencia (es el modo 'unified memory').

Para ir más allá

Los kits de QuelLLM La guía de referencia según el uso
Todos los kits de por vida — 49 €