◆ IA Local — Tu ChatGPT privado y gratuito, en tu máquina, en 1 h · 24 € · o todos los kits 49 € →

Guía de presupuesto · actualizada en 2026

Construir tu stack LLM local por presupuesto

La combinación de hardware + modelo más barata que realmente permite ejecutar Qwen 3, Gemma 3 y las versiones destiladas de DeepSeek R1 a una velocidad utilizable en 2026.

¿Qué máquina para mi presupuesto?

Introduce tu presupuesto y tu prioridad: la herramienta muestra las máquinas que encajan, lo que ejecutan y sus precios verificados esta semana.

Cómo leer esta guía

Establece dos variables: presupuesto et uso principal. Todo lo demás —cuantización, motor de ejecución, longitud del contexto— se deriva de ello. Parte de la VRAM, elige el modelo más grande que quepa en Q4_K_M con margen a 8K de contexto y luego elige el motor de ejecución.

Regla básica: un modelo en GGUF Q4_K_M ocupa aproximadamente (paramètres × 0,6) Go de VRAM, más ~1,5 GB de caché KV a 8K. Un modelo de 14B necesita, por tanto, ~10 GB, lo que explica por qué la RTX 3060 de 12 GB de segunda mano sigue siendo una referencia en relación calidad-precio.

Elige tu nivel

NivelPresupuestoConfiguración de referenciaVRAM / memoria unificadaModelo ideal (Q4_K_M)
Entrada400-550 €Mini-PC Ryzen 7 5700U de segunda mano, 16 GB DDR40 GB GPU / 16 GB RAMQwen3 4B
Calidad-precio850-1 000 €Ryzen 5 7600 + RTX 3060 12 GB de ocasión + 32 GB DDR512 GBQwen 3 14B o Qwen 2.5 Coder 14B
Rendimiento1 400-1 600 €Ryzen 7 7700 + RTX 3090 24 GB de ocasión + 64 GB DDR524 GBQwen3-Coder 30B-A3B o DeepSeek-R1-Distill-Qwen-32B
Silencioso≈ 2 000 €Apple Mac mini M5 Pro 24 GB (nuevo)≈ 16 GB utilizablesQwen 3 14B

Precios indicativos del mercado de segunda mano en Francia/UE a mediados de 2026: el mercado de segunda mano fluctúa, comprueba los precios actuales antes de comprar.

Nivel 2 — el campeón a 900 €

Es el nivel que recomendamos a la mayoría de los lectores. Una RTX 3060 de 12 GB de segunda mano se vende por unos 200-240 € en el mercado de ocasión, y 12 GB de VRAM coinciden exactamente con el punto ideal para modelos de la clase 14B.

Modelo (Q4_K_M)VRAM utilizadaTokens/s (estimación)Ideal para
Qwen 3 8B~6 GB~50Chat, RAG
Qwen 2.5 Coder 14B~10 GB~28Completado de código, refactorizaciones
Gemma 3 12B~8 GB~34Multilingüe, preguntas y respuestas sobre documentos
DeepSeek-R1-Distill-Qwen-14B~10 GB~28Razonamiento paso a paso

Estimación, no una medición de QuelLLM: aproximadamente el 70 % del límite teórico (el ancho de banda de la RTX 3060, 360 GB/s, dividido por el tamaño del modelo). El límite de un 8B en Q4 es de aproximadamente 72 tokens/s, y el de un 14B de aproximadamente 40.

Entorno de ejecución: ¿Ollama, llama.cpp o vLLM?

Desarrolladores que trabajan solos → Ollama por defecto. Equipos de 3+ → vLLM detrás de un pequeño proxy FastAPI.

Consumo, ruido y costo total

ConfigEn reposo (W)Carga (W)kWh/año (4 h/día bajo carga)Costo/año a 0,20 €/kWh
Mini-PC de gama de entrada8355110,20 €
3060 valor4522032164,20 €
Rendimiento en 309050360526105,10 €
Mac mini (procesador Pro)6659519,00 €

Cifras de potencia orientativas. Cálculo: potencia bajo carga × 4 h × 365 días, con la máquina apagada el resto del tiempo. Si se deja encendida en reposo, añade la potencia en reposo × 20 h × 365.

Incluso la configuración que más energía consume supone un gasto de aproximadamente 105 € en electricidad al año a este ritmo, lo que equivale a un poco más de cinco meses de una suscripción de 20 €/mes.

Veredicto

PerfilNivel recomendadoPor qué
Curioso, solo chatGama de entrada: 400 €Qwen3 4B en CPU va más rápido que la lectura
Desarrollador que trabaja solo, programación diariaValor de 900 €Un modelo de 14B para programación a ~28 tok/s es el punto de equilibrio precio/rendimiento
Razonamiento, agentes, multimodeloRendimiento a 1.500 €24 GB permiten usar modelos de la clase 32B
Silencio y cero mantenimientoSilencioso ≈ 2 000 €El Mac mini consume solo unos pocos vatios en reposo

Preguntas frecuentes

¿Son suficientes 8 GB de VRAM para un uso útil en 2026?

Por poco. Puedes ejecutar Qwen3 8B Q4_K_M con un contexto de 4K en una RTX 3050 de 8 GB o una RX 6600, pero pierdes el margen para los modelos de 14B que hacen que la inferencia local sea realmente interesante. Apuntar a 12 GB si es posible.

¿Conviene comprar una tarjeta AMD en lugar de una NVIDIA?

Para tareas exclusivamente de inferencia, las Radeon RDNA3 y RDNA4 (7800 XT, 7900 GRE, RX 9070 XT) funcionan bien con el backend Vulkan de llama.cpp y con ROCm. A menudo cuestan menos con la misma cantidad de memoria, pero pierdes parte del ecosistema CUDA: vLLM queda más limitado y pierdes flash-attn y la mayoría de las herramientas de fine-tuning.

¿Se puede hacer fine-tuning con estos presupuestos?

El fine-tuning LoRA de modelos 7B funciona en una tarjeta de 12 GB con Unsloth. Un 14B+ requiere, en la práctica, 24 GB. El fine-tuning completo por encima de 1B supera lo que permite el hardware de consumo en 2026.

¿Cómo se compara la memoria unificada de Mac con la VRAM dedicada?

Su ancho de banda sigue siendo considerablemente inferior al de una tarjeta de gama alta: 307 GB/s en un Mac mini M5 Pro frente a 936 GB/s en una RTX 3090. En un modelo que cabe en la tarjeta, el Mac genera entonces aproximadamente 2 a 3 veces menos de tokens por segundo. Gana en consumo, capacidad de memoria y carga de varios modelos; pierde en tokens por segundo por euro.

Más herramientas gratuitas