¿Qué LLM en RTX 5070 (12 GB)? ?
La RTX 5070 incluye 12 GB de GDDR7 a 672 GB/s: carga en VRAM todos los modelos de hasta aproximadamente 10 GB, entre ellos Qwen 3.5 9B (6,6 GB) y Gemma 4 12B (7,7 a 8 GB), con un margen real para el contexto. No carga Mistral Small 24B ni gpt-oss 20B, que pesan 14 GB. Su límite teórico alcanza aproximadamente 127 tokens/s en un modelo de 5,3 GB, y los 12 GB siguen siendo el límite que debes tener presente antes de comprar.
La RTX 5070 es la tarjeta de 12 GB más rápida de la generación Blackwell, con un ancho de banda de 672 GB/s. Su reto no es la velocidad, sino la capacidad: 12 GB bastan para modelos de 4B a 12B, pero no para modelos mayores. Esta guía cuantifica qué cabe y qué supera esa capacidad, explica cómo ajustar Ollama para el contexto y en qué momento la 5070 Ti de 16 GB pasa a ser la compra adecuada.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Para esta configuración: RTX 5070 12 GB.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RTX 5070 para un LLM local: lo que permiten 12 GB de GDDR7
Una RTX 5070 carga sin problemas modelos de 4B a 12B en Q4. Qwen 3.5 9B pesa 6,6 GB y Gemma 4 12B entre 7,7 y 8 GB según la biblioteca Ollama: ambos caben en los 12 GB con un margen de 4 a 5 GB para el contexto, lo que permite 16.000 tokens o más con la caché K/V cuantizada. En cambio, la tarjeta no carga ningún modelo de 14 GB: Mistral Small 24B y gpt-oss 20B superan los 12 GB. Su velocidad es excelente para un uso interactivo: 672 GB/s en un bus de 192 bits. La 5070 es adecuada para los usos habituales y alcanza un límite claro en cuanto se buscan modelos de mayor calidad.
- Arquitectura
- Blackwell, 6 144 núcleos CUDA y Tensor Cores de 5.ª generación según NVIDIA.
- Memoria
- 12 GB de GDDR7 en un bus de 192 bits, 672 GB/s de ancho de banda según Wikipedia.
- Potencia
- 250 W de potencia gráfica total; NVIDIA indica 650 W de alimentación mínima para el ordenador completo.
- Precio de lanzamiento
- 549 dólares, lanzado el 5 de marzo de 2025 según Wikipedia.
#¿Qué modelos caben en 12 GB?
| Modelo | Tamaño | Margen disponible con 12 GB | Veredicto |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 6,7 GB | Muy amplio, contexto largo |
| Qwen 3.5 9B | 6,6 GB | 5,4 GB | Cómodo |
| Gemma 4 12B | 7,7 a 8,0 GB | 4 a 4,3 GB | Cómodo, con posibilidad de un contexto de 16 000 tokens |
| Mistral Small 24B | 14 GB | Negativo | No cabe en la VRAM |
| Qwen 3.5 27B | 17 GB | Negativo | No cabe en la VRAM |
La referencia del sitio es de aproximadamente 0,6 GB por cada mil millones de parámetros en Q4, contando solo los pesos. Con 12 GB, esto sitúa el límite práctico en torno a los 14 a 16 mil millones de parámetros si el contexto sigue siendo corto, y en torno a los 12 mil millones si quieres trabajar con documentos largos. Para un modelo de 8B a 9B, el margen es muy superior al necesario para un contexto habitual.
#Instalar Ollama y verificar la tarjeta
- 01Controlador NVIDIAOllama requiere un controlador NVIDIA de la versión 550 o posterior. Para una RTX 50, instala el controlador más reciente que ofrezca NVIDIA y compruébalo con nvidia-smi.
- 02Instalar OllamaDescarga el instalador para tu sistema: CUDA está incluido.
- 03Ejecutar un modeloPrueba ollama run gemma4:12b para probar el límite de la tarjeta, u ollama run qwen3.5:9b para un modelo más ligero.
- 04VerificarEjecuta ollama ps: la columna PROCESSOR debe mostrar 100 % GPU.
#Qué velocidad esperar: un límite superior, no una medición
Aquí no se presenta ninguna velocidad de generación como una medición propia. El límite máximo de generación es el ancho de banda dividido por el tamaño de los pesos. Una medición pública de terceros (LLaMA 3 8B en Q4_K_M con llama.cpp, mayo de 2024) registra 106 tokens/s en una RTX 4080 cuyo límite máximo es de 156 tokens/s, es decir, aproximadamente un 68 %. Tomando el 70 % como orden de magnitud, se obtienen las siguientes estimaciones para un contexto corto.
| Modelo (Q4) | Tamaño del modelo | Límite máximo | Estimación al 70 % |
|---|---|---|---|
| Granite 4.2 8B | 5,3 GB | 127 tokens/s | aproximadamente 89 tokens/s |
| Qwen 3.5 9B | 6,6 GB | 102 tokens/s | aproximadamente 71 tokens/s |
| Gemma 4 12B | 7,7 GB | 87 tokens/s | aproximadamente 61 tokens/s |
Estos límites son muy superiores a la velocidad de lectura humana: la 5070 nunca será lenta con estos modelos. Está limitada por la capacidad, no por la velocidad. Las estimaciones disminuyen con el contexto, y la lectura del prompt exige más capacidad de cálculo que de memoria.
#Gestionar el contexto en 12 GB
El margen de 4 GB de Gemma 4 12B desaparece rápidamente con un contexto largo. Ollama cuantiza la caché K/V en q8_0 para usar aproximadamente la mitad de la memoria que con f16, el valor predeterminado, con una pérdida de precisión muy baja según su documentación; esto requiere Flash Attention. Es el ajuste que permite usar un modelo de 12B con documentos largos.
Un detalle que puede causar problemas si das servicio a varias personas: las solicitudes en paralelo multiplican el contexto reservado según su número, de acuerdo con las preguntas frecuentes de Ollama. Un modelo que cabe en la memoria para un usuario puede exceder la memoria disponible para tres.
#Lo que se hace concretamente con 12 GB
Doce gigabytes cambian la naturaleza de los usos en comparación con 8 GB. Un modelo de 9B deja suficiente espacio para un contexto de 16 000 tokens y un pequeño modelo de embeddings: es una configuración cómoda para un RAG personal. Un modelo de 12B ofrece respuestas de mayor calidad en redacción y síntesis, a costa de un contexto más limitado. A un asistente de código le basta con un modelo de 8B a 12B y fragmentos específicos, pero no con un repositorio entero cargado de una sola vez.
| Uso | ¿Realista? | Configuración recomendada |
|---|---|---|
| Charla diaria | Sí, muy cómodo | Qwen 3.5 9B o Gemma 4 12B |
| Resumen de documentos largos | Sí, con un contexto de 16 000 tokens | Gemma 4 12B, caché K/V en q8_0 |
| RAG sobre tus archivos | Sí | Qwen 3.5 9B y embeddings ligeros |
| Asistente de código | Sí, con un modelo de 8B a 12B | Extractos seleccionados, contexto de 8.192 tokens |
| Modelos de 14 GB o más | No | Prever 16 GB de VRAM |
La elección entre 9B y 12B depende de la tarea. El 9B deja más margen y se adapta a contextos largos; el 12B es más capaz, pero cada gigabyte de contexto cuenta. Comienza con el más pequeño que cumpla con tus necesidades y solo pasa al 12B si la calidad lo exige.
#Cuando la 5070 ya no es suficiente
Tres señales indican que se necesita más memoria. Quieres un modelo de 14 a 24B, como Mistral Small 24B o gpt-oss 20B. Necesitas un contexto superior a 16 000 tokens en un 12B. Cargas varios modelos juntos: generación, embeddings, reranker. En estos casos, la velocidad de la 5070 no es el problema, y las siguientes opciones son la 5070 Ti, la 5080 o una tarjeta de 24 GB.
#Lo que no se puede cargar con 12 GB
| Modelo | Tamaño | Consecuencia |
|---|---|---|
| Mistral Small 24B | 14 GB | Descarga 2 GB en la RAM |
| Qwen 3.5 27B | 17 GB | Rebasa claramente el límite |
| Qwen 3.5 35B | 24 GB | Fuera de alcance: como mínimo, 24 GB de VRAM |
| Modelos de 70B en Q4 | aproximadamente 40 GB | Fuera del alcance de una GPU de consumo de 12 GB |
Un modelo que no cabe en la VRAM no se bloquea: parte de los pesos se lee desde la RAM del sistema y la velocidad de generación cae considerablemente, ya que el enlace PCIe es mucho más lento que la GDDR7. Por tanto, un modelo de 14 GB en una tarjeta con 12 GB es utilizable para una prueba, pero no para el uso diario. Para estos modelos, busca 16 GB o más.
#Jugar y ejecutar un LLM en la misma tarjeta
La RTX 5070 se utiliza a menudo para ambos usos. El modelo cargado ocupa VRAM mientras permanece en memoria, y un juego reciente también necesita varios gigabytes: con 12 GB, los dos juntos superan rápidamente la capacidad disponible. La regla es sencilla: libera el modelo de la memoria antes de iniciar un juego y vuelve a cargarlo después. Ollama libera la memoria tras un periodo de inactividad, y ollama ps indica qué sigue cargado. Si quieres un asistente disponible durante tus partidas, opta por un modelo pequeño de 4B.
#¿Una 4070 Ti Super de segunda mano en su lugar?
La pregunta se plantea frecuentemente: una RTX 4070 Ti Super de segunda mano, con 16 GB, frente a una RTX 5070 nueva, con 12 GB. Para los LLM, la capacidad gana: con 16 GB se pueden cargar modelos de 14 GB que la 5070 no puede alojar. La 5070 mantiene la ventaja de la garantía, un consumo más bajo (250 W) y memoria GDDR7. Si tus modelos caben en 12 GB, la 5070 nueva es una opción razonable; de lo contrario, la capacidad es lo más importante. La guía específica explica en detalle la 4070 Ti Super.
#5070 o 5070 Ti: 12 GB o 16 GB
| Criterio | RTX 5070 | RTX 5070 Ti |
|---|---|---|
| Memoria | 12 GB GDDR7, 192 bits | 16 GB GDDR7, 256 bits |
| Ancho de banda | 672 GB/s | 896 GB/s |
| Núcleos CUDA | 6 144 | 8 960 |
| Potencia gráfica | 250 W | 300 W |
| Fuente de alimentación mínima | 650 W | 750 W |
| Modelos de 14 GB | No | Sí, con 2 GB de margen |
La 5070 Ti aporta dos cosas: 4 GB más de memoria, que permiten Mistral Small 24B y gpt-oss 20B, y un 33 % más de ancho de banda. Los precios recomendados al lanzamiento eran de 549 dólares para la 5070 y de 749 dólares para la 5070 Ti, es decir, una diferencia de 200 dólares. Si tus modelos caben en 12 GB, la 5070 es suficiente; si buscas modelos de 14 GB, la diferencia es una buena inversión. Consulta el seguimiento de precios para comparar al momento de la compra.
#Veredicto 2026
- Compra una 5070 si
- Tus modelos tienen entre 4B y 12B y quieres la velocidad de la generación Blackwell. Es muy capaz para este uso.
- Prefiere la 5070 Ti si
- Quieres explorar modelos de 14 a 24B: los 16 GB hacen la diferencia.
- Cuidado con el juego y el LLM juntos
- Un juego reciente y un modelo cargado comparten los 12 GB: cierra uno antes de lanzar el otro.
En resumen, la 5070 es una tarjeta rápida cuyo único defecto es estar limitada a 12 GB. Si este límite no te molesta hoy, tampoco te molestará en los próximos meses, siempre que sigas usando modelos de 4B a 12B; si te molesta, es mejor pagar por esa capacidad desde ahora.
- Fuente: especificaciones oficiales de NVIDIA (RTX 5070 y 5070 Ti)
- Fuente: preguntas frecuentes oficiales de Ollama (Flash Attention, caché K/V, paralelismo)
- Fuente: tamaños de Gemma 4 en la biblioteca Ollama
#Preguntas frecuentes
¿Puede la RTX 5070 de 12 GB ejecutar un modelo de 70B?+
¿Cuántos tokens por segundo en una RTX 5070?+
¿12 GB son suficientes para un uso profesional en 2026?+
¿La RTX 5070 soporta DLSS 4 y el LLM al mismo tiempo?+
¿Qué fuente de alimentación se necesita para una RTX 5070?+
¿Cómo verificar que el modelo cabe en la VRAM?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.