Intermedio 11 minRTX 50

¿Qué LLM en RTX 5070 (12 GB)? ?

Respuesta directa

La RTX 5070 incluye 12 GB de GDDR7 a 672 GB/s: carga en VRAM todos los modelos de hasta aproximadamente 10 GB, entre ellos Qwen 3.5 9B (6,6 GB) y Gemma 4 12B (7,7 a 8 GB), con un margen real para el contexto. No carga Mistral Small 24B ni gpt-oss 20B, que pesan 14 GB. Su límite teórico alcanza aproximadamente 127 tokens/s en un modelo de 5,3 GB, y los 12 GB siguen siendo el límite que debes tener presente antes de comprar.

La RTX 5070 es la tarjeta de 12 GB más rápida de la generación Blackwell, con un ancho de banda de 672 GB/s. Su reto no es la velocidad, sino la capacidad: 12 GB bastan para modelos de 4B a 12B, pero no para modelos mayores. Esta guía cuantifica qué cabe y qué supera esa capacidad, explica cómo ajustar Ollama para el contexto y en qué momento la 5070 Ti de 16 GB pasa a ser la compra adecuada.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Para esta configuración: RTX 5070 12 GB.

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RTX 5070 para un LLM local: lo que permiten 12 GB de GDDR7

Una RTX 5070 carga sin problemas modelos de 4B a 12B en Q4. Qwen 3.5 9B pesa 6,6 GB y Gemma 4 12B entre 7,7 y 8 GB según la biblioteca Ollama: ambos caben en los 12 GB con un margen de 4 a 5 GB para el contexto, lo que permite 16.000 tokens o más con la caché K/V cuantizada. En cambio, la tarjeta no carga ningún modelo de 14 GB: Mistral Small 24B y gpt-oss 20B superan los 12 GB. Su velocidad es excelente para un uso interactivo: 672 GB/s en un bus de 192 bits. La 5070 es adecuada para los usos habituales y alcanza un límite claro en cuanto se buscan modelos de mayor calidad.

Arquitectura
Blackwell, 6 144 núcleos CUDA y Tensor Cores de 5.ª generación según NVIDIA.
Memoria
12 GB de GDDR7 en un bus de 192 bits, 672 GB/s de ancho de banda según Wikipedia.
Potencia
250 W de potencia gráfica total; NVIDIA indica 650 W de alimentación mínima para el ordenador completo.
Precio de lanzamiento
549 dólares, lanzado el 5 de marzo de 2025 según Wikipedia.

#¿Qué modelos caben en 12 GB?

Modelos en RTX 5070 (tamaños de Ollama, solo los pesos)
ModeloTamañoMargen disponible con 12 GBVeredicto
Granite 4.2 8B5,3 GB6,7 GBMuy amplio, contexto largo
Qwen 3.5 9B6,6 GB5,4 GBCómodo
Gemma 4 12B7,7 a 8,0 GB4 a 4,3 GBCómodo, con posibilidad de un contexto de 16 000 tokens
Mistral Small 24B14 GBNegativoNo cabe en la VRAM
Qwen 3.5 27B17 GBNegativoNo cabe en la VRAM

La referencia del sitio es de aproximadamente 0,6 GB por cada mil millones de parámetros en Q4, contando solo los pesos. Con 12 GB, esto sitúa el límite práctico en torno a los 14 a 16 mil millones de parámetros si el contexto sigue siendo corto, y en torno a los 12 mil millones si quieres trabajar con documentos largos. Para un modelo de 8B a 9B, el margen es muy superior al necesario para un contexto habitual.

#Instalar Ollama y verificar la tarjeta

  1. 01
    Controlador NVIDIA
    Ollama requiere un controlador NVIDIA de la versión 550 o posterior. Para una RTX 50, instala el controlador más reciente que ofrezca NVIDIA y compruébalo con nvidia-smi.
  2. 02
    Instalar Ollama
    Descarga el instalador para tu sistema: CUDA está incluido.
  3. 03
    Ejecutar un modelo
    Prueba ollama run gemma4:12b para probar el límite de la tarjeta, u ollama run qwen3.5:9b para un modelo más ligero.
  4. 04
    Verificar
    Ejecuta ollama ps: la columna PROCESSOR debe mostrar 100 % GPU.

#Qué velocidad esperar: un límite superior, no una medición

Aquí no se presenta ninguna velocidad de generación como una medición propia. El límite máximo de generación es el ancho de banda dividido por el tamaño de los pesos. Una medición pública de terceros (LLaMA 3 8B en Q4_K_M con llama.cpp, mayo de 2024) registra 106 tokens/s en una RTX 4080 cuyo límite máximo es de 156 tokens/s, es decir, aproximadamente un 68 %. Tomando el 70 % como orden de magnitud, se obtienen las siguientes estimaciones para un contexto corto.

Límite teórico en RTX 5070 (672 GB/s)
Modelo (Q4)Tamaño del modeloLímite máximoEstimación al 70 %
Granite 4.2 8B5,3 GB127 tokens/saproximadamente 89 tokens/s
Qwen 3.5 9B6,6 GB102 tokens/saproximadamente 71 tokens/s
Gemma 4 12B7,7 GB87 tokens/saproximadamente 61 tokens/s

Estos límites son muy superiores a la velocidad de lectura humana: la 5070 nunca será lenta con estos modelos. Está limitada por la capacidad, no por la velocidad. Las estimaciones disminuyen con el contexto, y la lectura del prompt exige más capacidad de cálculo que de memoria.

#Gestionar el contexto en 12 GB

El margen de 4 GB de Gemma 4 12B desaparece rápidamente con un contexto largo. Ollama cuantiza la caché K/V en q8_0 para usar aproximadamente la mitad de la memoria que con f16, el valor predeterminado, con una pérdida de precisión muy baja según su documentación; esto requiere Flash Attention. Es el ajuste que permite usar un modelo de 12B con documentos largos.

Ajustes del servidor Ollama (Linux, macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

Un detalle que puede causar problemas si das servicio a varias personas: las solicitudes en paralelo multiplican el contexto reservado según su número, de acuerdo con las preguntas frecuentes de Ollama. Un modelo que cabe en la memoria para un usuario puede exceder la memoria disponible para tres.

#Lo que se hace concretamente con 12 GB

Doce gigabytes cambian la naturaleza de los usos en comparación con 8 GB. Un modelo de 9B deja suficiente espacio para un contexto de 16 000 tokens y un pequeño modelo de embeddings: es una configuración cómoda para un RAG personal. Un modelo de 12B ofrece respuestas de mayor calidad en redacción y síntesis, a costa de un contexto más limitado. A un asistente de código le basta con un modelo de 8B a 12B y fragmentos específicos, pero no con un repositorio entero cargado de una sola vez.

Usos en la RTX 5070 (12 GB)
Uso¿Realista?Configuración recomendada
Charla diariaSí, muy cómodoQwen 3.5 9B o Gemma 4 12B
Resumen de documentos largosSí, con un contexto de 16 000 tokensGemma 4 12B, caché K/V en q8_0
RAG sobre tus archivosSíQwen 3.5 9B y embeddings ligeros
Asistente de códigoSí, con un modelo de 8B a 12BExtractos seleccionados, contexto de 8.192 tokens
Modelos de 14 GB o másNoPrever 16 GB de VRAM

La elección entre 9B y 12B depende de la tarea. El 9B deja más margen y se adapta a contextos largos; el 12B es más capaz, pero cada gigabyte de contexto cuenta. Comienza con el más pequeño que cumpla con tus necesidades y solo pasa al 12B si la calidad lo exige.

#Cuando la 5070 ya no es suficiente

Tres señales indican que se necesita más memoria. Quieres un modelo de 14 a 24B, como Mistral Small 24B o gpt-oss 20B. Necesitas un contexto superior a 16 000 tokens en un 12B. Cargas varios modelos juntos: generación, embeddings, reranker. En estos casos, la velocidad de la 5070 no es el problema, y las siguientes opciones son la 5070 Ti, la 5080 o una tarjeta de 24 GB.

#Lo que no se puede cargar con 12 GB

Modelos por encima del umbral de 12 GB (tamaños Ollama)
ModeloTamañoConsecuencia
Mistral Small 24B14 GBDescarga 2 GB en la RAM
Qwen 3.5 27B17 GBRebasa claramente el límite
Qwen 3.5 35B24 GBFuera de alcance: como mínimo, 24 GB de VRAM
Modelos de 70B en Q4aproximadamente 40 GBFuera del alcance de una GPU de consumo de 12 GB

Un modelo que no cabe en la VRAM no se bloquea: parte de los pesos se lee desde la RAM del sistema y la velocidad de generación cae considerablemente, ya que el enlace PCIe es mucho más lento que la GDDR7. Por tanto, un modelo de 14 GB en una tarjeta con 12 GB es utilizable para una prueba, pero no para el uso diario. Para estos modelos, busca 16 GB o más.

#Jugar y ejecutar un LLM en la misma tarjeta

La RTX 5070 se utiliza a menudo para ambos usos. El modelo cargado ocupa VRAM mientras permanece en memoria, y un juego reciente también necesita varios gigabytes: con 12 GB, los dos juntos superan rápidamente la capacidad disponible. La regla es sencilla: libera el modelo de la memoria antes de iniciar un juego y vuelve a cargarlo después. Ollama libera la memoria tras un periodo de inactividad, y ollama ps indica qué sigue cargado. Si quieres un asistente disponible durante tus partidas, opta por un modelo pequeño de 4B.

#¿Una 4070 Ti Super de segunda mano en su lugar?

La pregunta se plantea frecuentemente: una RTX 4070 Ti Super de segunda mano, con 16 GB, frente a una RTX 5070 nueva, con 12 GB. Para los LLM, la capacidad gana: con 16 GB se pueden cargar modelos de 14 GB que la 5070 no puede alojar. La 5070 mantiene la ventaja de la garantía, un consumo más bajo (250 W) y memoria GDDR7. Si tus modelos caben en 12 GB, la 5070 nueva es una opción razonable; de lo contrario, la capacidad es lo más importante. La guía específica explica en detalle la 4070 Ti Super.

#5070 o 5070 Ti: 12 GB o 16 GB

RTX 5070 y RTX 5070 Ti: qué cambia para el LLM
CriterioRTX 5070RTX 5070 Ti
Memoria12 GB GDDR7, 192 bits16 GB GDDR7, 256 bits
Ancho de banda672 GB/s896 GB/s
Núcleos CUDA6 1448 960
Potencia gráfica250 W300 W
Fuente de alimentación mínima650 W750 W
Modelos de 14 GBNoSí, con 2 GB de margen

La 5070 Ti aporta dos cosas: 4 GB más de memoria, que permiten Mistral Small 24B y gpt-oss 20B, y un 33 % más de ancho de banda. Los precios recomendados al lanzamiento eran de 549 dólares para la 5070 y de 749 dólares para la 5070 Ti, es decir, una diferencia de 200 dólares. Si tus modelos caben en 12 GB, la 5070 es suficiente; si buscas modelos de 14 GB, la diferencia es una buena inversión. Consulta el seguimiento de precios para comparar al momento de la compra.

#Veredicto 2026

Compra una 5070 si
Tus modelos tienen entre 4B y 12B y quieres la velocidad de la generación Blackwell. Es muy capaz para este uso.
Prefiere la 5070 Ti si
Quieres explorar modelos de 14 a 24B: los 16 GB hacen la diferencia.
Cuidado con el juego y el LLM juntos
Un juego reciente y un modelo cargado comparten los 12 GB: cierra uno antes de lanzar el otro.

En resumen, la 5070 es una tarjeta rápida cuyo único defecto es estar limitada a 12 GB. Si este límite no te molesta hoy, tampoco te molestará en los próximos meses, siempre que sigas usando modelos de 4B a 12B; si te molesta, es mejor pagar por esa capacidad desde ahora.

#Preguntas frecuentes

FAQ
¿Puede la RTX 5070 de 12 GB ejecutar un modelo de 70B?+
No. Un 70B en Q4 pesa aproximadamente 40 GB solo en pesos, lo que supone más de tres veces los 12 GB de la tarjeta. Incluso descargando parte del modelo en la RAM del sistema, la generación sería extremadamente lenta. Con 12 GB, limítate a modelos de 4B a 12B; para un 70B, prevé al menos 48 GB de memoria.
¿Cuántos tokens por segundo en una RTX 5070?+
No se publican aquí mediciones fiables. El límite teórico, calculado dividiendo el ancho de banda de 672 GB/s por el tamaño del modelo, es de aproximadamente 127 tokens/s para Granite 4.2 8B (5,3 GB), es decir, cerca de 89 tokens/s al 70 % de ese límite. Es una estimación que disminuye cuando el contexto se alarga.
¿12 GB son suficientes para un uso profesional en 2026?+
Para un chat, resúmenes, RAG o extracción con un modelo de 4B a 12B, sí. Para redacción de alta calidad o un asistente de código en un repositorio grande, los modelos de 14 a 24B que ocupan 14 GB o más superan la capacidad de la tarjeta: prevé 16 GB.
¿La RTX 5070 soporta DLSS 4 y el LLM al mismo tiempo?+
Ambos funcionan en la tarjeta, pero comparten los 12 GB de VRAM. Un juego reciente ocupa una parte importante de la memoria: carga el modelo antes del juego o cierra el modelo mientras juegas. El LLM y el juego no deben ejecutarse al mismo tiempo con 12 GB.
¿Qué fuente de alimentación se necesita para una RTX 5070?+
NVIDIA indica 250 W de potencia gráfica total y una fuente de alimentación de al menos 650 W para el PC completo. Una fuente de alimentación de calidad de 650 W es adecuada; una potencia de 550 W está por debajo de la recomendación. Revisa también los conectores de tu modelo de tarjeta.
¿Cómo verificar que el modelo cabe en la VRAM?+
Después de cargarlo, ejecuta ollama ps: la columna PROCESSOR debe indicar 100 % GPU. Una distribución CPU/GPU significa que parte del modelo está en la RAM del sistema, lo que ralentiza notablemente la generación. Reduce entonces el contexto, activa la caché K/V en q8_0 o elige un modelo más pequeño.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.