Guía de presupuesto · actualizada en 2026
Construir tu stack LLM local por presupuesto
La combinación de hardware + modelo más barata que realmente permite ejecutar Qwen 3, Gemma 3 y las versiones destiladas de DeepSeek R1 a una velocidad utilizable en 2026.
¿Qué máquina para mi presupuesto?
Introduce tu presupuesto y tu prioridad: la herramienta muestra las máquinas que encajan, lo que ejecutan y sus precios verificados esta semana.
Cómo leer esta guía
Establece dos variables: presupuesto et uso principal. Todo lo demás —cuantización, motor de ejecución, longitud del contexto— se deriva de ello. Parte de la VRAM, elige el modelo más grande que quepa en Q4_K_M con margen a 8K de contexto y luego elige el motor de ejecución.
Regla básica: un modelo en GGUF Q4_K_M ocupa aproximadamente (paramètres × 0,6) Go de VRAM, más ~1,5 GB de caché KV a 8K. Un modelo de 14B necesita, por tanto, ~10 GB, lo que explica por qué la RTX 3060 de 12 GB de segunda mano sigue siendo una referencia en relación calidad-precio.
Elige tu nivel
| Nivel | Presupuesto | Configuración de referencia | VRAM / memoria unificada | Modelo ideal (Q4_K_M) |
|---|---|---|---|---|
| Entrada | 400-550 € | Mini-PC Ryzen 7 5700U de segunda mano, 16 GB DDR4 | 0 GB GPU / 16 GB RAM | Qwen3 4B |
| Calidad-precio | 850-1 000 € | Ryzen 5 7600 + RTX 3060 12 GB de ocasión + 32 GB DDR5 | 12 GB | Qwen 3 14B o Qwen 2.5 Coder 14B |
| Rendimiento | 1 400-1 600 € | Ryzen 7 7700 + RTX 3090 24 GB de ocasión + 64 GB DDR5 | 24 GB | Qwen3-Coder 30B-A3B o DeepSeek-R1-Distill-Qwen-32B |
| Silencioso | ≈ 2 000 € | Apple Mac mini M5 Pro 24 GB (nuevo) | ≈ 16 GB utilizables | Qwen 3 14B |
Precios indicativos del mercado de segunda mano en Francia/UE a mediados de 2026: el mercado de segunda mano fluctúa, comprueba los precios actuales antes de comprar.
Nivel 2 — el campeón a 900 €
Es el nivel que recomendamos a la mayoría de los lectores. Una RTX 3060 de 12 GB de segunda mano se vende por unos 200-240 € en el mercado de ocasión, y 12 GB de VRAM coinciden exactamente con el punto ideal para modelos de la clase 14B.
| Modelo (Q4_K_M) | VRAM utilizada | Tokens/s (estimación) | Ideal para |
|---|---|---|---|
| Qwen 3 8B | ~6 GB | ~50 | Chat, RAG |
| Qwen 2.5 Coder 14B | ~10 GB | ~28 | Completado de código, refactorizaciones |
| Gemma 3 12B | ~8 GB | ~34 | Multilingüe, preguntas y respuestas sobre documentos |
| DeepSeek-R1-Distill-Qwen-14B | ~10 GB | ~28 | Razonamiento paso a paso |
Estimación, no una medición de QuelLLM: aproximadamente el 70 % del límite teórico (el ancho de banda de la RTX 3060, 360 GB/s, dividido por el tamaño del modelo). El límite de un 8B en Q4 es de aproximadamente 72 tokens/s, y el de un 14B de aproximadamente 40.
Entorno de ejecución: ¿Ollama, llama.cpp o vLLM?
- Ollama — el mejor para un solo usuario en un equipo de escritorio. Descarga automáticamente los GGUF, ofrece una API compatible con OpenAI y se integra con Open WebUI con un solo comando.
- llama.cpp — el mejor cuando hay que aprovechar hasta el último token/s de una CPU o de la memoria unificada. CLI más técnica, mejor portabilidad.
- vLLM — el mejor para atender a varios usuarios o agentes simultáneamente, gracias a PagedAttention y al batching continuo.
Desarrolladores que trabajan solos → Ollama por defecto. Equipos de 3+ → vLLM detrás de un pequeño proxy FastAPI.
Consumo, ruido y costo total
| Config | En reposo (W) | Carga (W) | kWh/año (4 h/día bajo carga) | Costo/año a 0,20 €/kWh |
|---|---|---|---|---|
| Mini-PC de gama de entrada | 8 | 35 | 51 | 10,20 € |
| 3060 valor | 45 | 220 | 321 | 64,20 € |
| Rendimiento en 3090 | 50 | 360 | 526 | 105,10 € |
| Mac mini (procesador Pro) | 6 | 65 | 95 | 19,00 € |
Cifras de potencia orientativas. Cálculo: potencia bajo carga × 4 h × 365 días, con la máquina apagada el resto del tiempo. Si se deja encendida en reposo, añade la potencia en reposo × 20 h × 365.
Incluso la configuración que más energía consume supone un gasto de aproximadamente 105 € en electricidad al año a este ritmo, lo que equivale a un poco más de cinco meses de una suscripción de 20 €/mes.
Veredicto
| Perfil | Nivel recomendado | Por qué |
|---|---|---|
| Curioso, solo chat | Gama de entrada: 400 € | Qwen3 4B en CPU va más rápido que la lectura |
| Desarrollador que trabaja solo, programación diaria | Valor de 900 € | Un modelo de 14B para programación a ~28 tok/s es el punto de equilibrio precio/rendimiento |
| Razonamiento, agentes, multimodelo | Rendimiento a 1.500 € | 24 GB permiten usar modelos de la clase 32B |
| Silencio y cero mantenimiento | Silencioso ≈ 2 000 € | El Mac mini consume solo unos pocos vatios en reposo |
Preguntas frecuentes
¿Son suficientes 8 GB de VRAM para un uso útil en 2026?
Por poco. Puedes ejecutar Qwen3 8B Q4_K_M con un contexto de 4K en una RTX 3050 de 8 GB o una RX 6600, pero pierdes el margen para los modelos de 14B que hacen que la inferencia local sea realmente interesante. Apuntar a 12 GB si es posible.
¿Conviene comprar una tarjeta AMD en lugar de una NVIDIA?
Para tareas exclusivamente de inferencia, las Radeon RDNA3 y RDNA4 (7800 XT, 7900 GRE, RX 9070 XT) funcionan bien con el backend Vulkan de llama.cpp y con ROCm. A menudo cuestan menos con la misma cantidad de memoria, pero pierdes parte del ecosistema CUDA: vLLM queda más limitado y pierdes flash-attn y la mayoría de las herramientas de fine-tuning.
¿Se puede hacer fine-tuning con estos presupuestos?
El fine-tuning LoRA de modelos 7B funciona en una tarjeta de 12 GB con Unsloth. Un 14B+ requiere, en la práctica, 24 GB. El fine-tuning completo por encima de 1B supera lo que permite el hardware de consumo en 2026.
¿Cómo se compara la memoria unificada de Mac con la VRAM dedicada?
Su ancho de banda sigue siendo considerablemente inferior al de una tarjeta de gama alta: 307 GB/s en un Mac mini M5 Pro frente a 936 GB/s en una RTX 3090. En un modelo que cabe en la tarjeta, el Mac genera entonces aproximadamente 2 a 3 veces menos de tokens por segundo. Gana en consumo, capacidad de memoria y carga de varios modelos; pierde en tokens por segundo por euro.