🇺🇸 Gemma 4 E4B
Multimodal con 4B de parámetros efectivos (texto+imagen+audio). 140 idiomas. Para portátiles y edge.
ollama run gemma4:e4b
Ranking actualizado el 22/09/2026
¿Sin GPU? Los LLM modernos de 1-7B funcionan correctamente en CPU gracias a llama.cpp y a las cuantizaciones Q4. Se necesitan 8-16 GB de RAM y hay que aceptar velocidades de 5-15 tokens/seg. Estas son las mejores opciones.
Multimodal con 4B de parámetros efectivos (texto+imagen+audio). 140 idiomas. Para portátiles y edge.
ollama run gemma4:e4b
Modelo denso de 3B, Apache 2.0, 12 idiomas, incluido el francés, 131k de contexto, GQA 40Q/8KV. Llamadas a herramientas y FIM para código. Lanzamiento el 29 de abril de 2026.
ollama run granite4.1:3b
Gemma 4 E2B: 2B parámetros efectivos (5,1B en total), ~3 GB de VRAM en Q4 (pesos de Ollama: 4,3 GB con QAT y 7,2 GB por defecto). Multimodal de texto e imagen, contexto de 128k, Apache 2.0.
ollama run gemma4:e2b
Granite 4.1 (3B Apache 2.0): etiqueta Ollama genérica de la familia IBM Granite 4.1, 128k de contexto, llamadas a herramientas y código. Lanzamiento en mayo de 2026.
ollama run granite4.1
Ajuste fino SFT «thinking» de OLMo 3 7B: razonamiento paso a paso, contexto de 16k, ~4,2 GB de VRAM en Q4. 100 % abierto, licencia Apache 2.0.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
GLM 5.3 (Zhipu): modelo denso de 7B especializado en código y razonamiento, contexto de 128k, ~4,1 GB de VRAM en Q4. Ligero, funciona en GPU de 6-8 GB, licencia MIT.
ollama pull glm-5.3
VLM 3B especializado en la extracción de datos de documentos empresariales. OCR, tablas, formularios.
# HuggingFace : ibm-granite/granite-4.0-3b-vision
| Puesto | Modelo | Params | VRAM Q4 | Contexto | Licencia | Con GPU integrada / sin GPU |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 E4B | 4B | 10 GB | 128 000 | Apache 2.0 | ✗ |
| #2 | Granite 4.1 3B Instruct | 3B | 2 GB | 131 072 | Apache 2.0 | ✗ |
| #3 | Gemma 4 E2B | 2B | 3 GB | 128 000 | Apache 2.0 | ✗ |
| #4 | Granite 4.1 | 3B | 1.7 GB | 128 000 | Apache 2.0 | ✗ |
| #5 | OLMo 3 7B Think (SFT) | 7B | 4.2 GB | 16 000 | Apache 2.0 | ✗ |
| #6 | GLM 5.3 7B | 7B | 4.1 GB | 128 000 | MIT | ✗ |
| #7 | Granite 4.0 3B Vision | 3B | 2.2 GB | 16 384 | Apache 2.0 | ✗ |
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
Solo modelos ≤ 8B: por encima de ese tamaño, la tasa de generación en CPU es demasiado baja. Se da una clara preferencia a los modelos ≤ 3B (muy rápidos en una CPU moderna) y a las licencias permisivas.
Criterios considerados:
La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.
¿Es realmente posible ejecutar un LLM sin GPU?
Sí — gracias a llama.cpp + cuantización Q4_K_M, un 7B funciona a 5-10 tokens/segundo en una CPU Ryzen 7 o Apple M1. Para un uso interactivo, busca un 1-3B (30-50 tokens/segundo).
¿Cuánta RAM se necesita?
Para un 7B en Q4: 8 GB de RAM mínimo, 16 GB recomendados (el modelo ocupa ~5 GB, el resto para el sistema operativo + contexto). Para un 3B: 6-8 GB son suficientes. Para un 1B: 4 GB.
¿Qué CPU para un LLM?
Cuantos más núcleos y más soporte para AVX2/AVX-512, mejor. Ryzen 7/9 recientes, Intel Core i7/i9 recientes, Apple M1/M2/M3: todos excelentes. Prioriza la memoria rápida (DDR5 > DDR4): el ancho de banda de la RAM suele limitar más que los núcleos.
¿Puede ayudar una iGPU (Intel / AMD)?
Solo un poco: Vulkan en una iGPU ofrece una mejora del 20-40 % frente a usar solo la CPU. No es espectacular, pero vale la pena aprovecharla. En los Mac con Apple Silicon, la GPU integrada se puede utilizar mediante Metal y marca una gran diferencia (es el modo 'unified memory').