¿Qué LLM usar con una Radeon RX 7700 XT (12 GB) ?
La Radeon RX 7700 XT (12 GB GDDR6, 432 GB/s) cuenta con soporte oficial de ROCm y Ollama, tanto en Linux como en Windows. Ejecuta sin compromisos los modelos de 8 a 14 mil millones de parámetros en Q4, pero no llega a los de 20 a 24 mil millones, que requieren de 13 a 14 GB. No se ha publicado ninguna cifra de velocidad para esta tarjeta en las tablas de resultados de llama.cpp: su rendimiento se sitúa entre el de una RX 6700 XT y el de una RX 7800 XT.
La RX 7700 XT destaca sobre todo por lo que permiten sus 12 GB y por su posición en la gama: más rápida y con mejor soporte que la generación anterior, pero por debajo del umbral de 16 GB que permite ejecutar modelos de 20 a 24B. Aquí tienes información para decidir si es suficiente, con mediciones citadas y estimaciones claramente identificadas.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.
¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#Lo que hace una RX 7700 XT en 2026
Una RX 7700 XT es adecuada para un LLM local de tamaño medio: en sus 12 GB caben Llama 3.1 8B, Gemma 4 12B o Phi-4 14B en Q4 con espacio para el contexto. Su ancho de banda de 432 GB/s, un 12,5 % superior al de una RX 6700 XT, fija el límite de velocidad de generación: aproximadamente 113 tokens por segundo con el modelo de referencia de 7B de las tablas de resultados, frente a 163 para una RX 7800 XT. Tiene una ventaja clara sobre la 6700 XT: ROCm y Ollama la incluyen oficialmente, incluso en Windows. Su punto débil es su capacidad, que la deja fuera de los modelos de 20 a 24 mil millones de parámetros, para los que los 16 GB de la 7800 XT resultan valiosos.
- Arquitectura
- RDNA 3, chip Navi 32 ensamblado en chiplets (1 GCD y 3 MCD), lanzado el 6 de septiembre de 2023.
- Cálculo
- 3 456 procesadores de flujo, 54 unidades de cálculo.
- Memoria
- 12 GB GDDR6, bus de 192 bits, 432 GB/s.
- Consumo
- 245 W de potencia de la tarjeta.
- Precio
- No se indica aquí: consulta /prix-gpu-ia para conocer el precio más bajo registrado cada semana.
#ROCm, Ollama y Windows: soporte oficial
Este es el punto que la distingue de la generación anterior. La tabla de compatibilidad de AMD incluye la RX 7700 XT como RDNA 3, con la arquitectura objetivo gfx1101, al igual que la RX 7800 XT. La documentación de Ollama la menciona entre las tarjetas compatibles con Linux y Windows. Un matiz influye en la elección del sistema: según AMD, las Radeon RX 7000 y 9000 solo cuentan con soporte en Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 y RHEL 9.7. Otra distribución puede funcionar, pero sin garantía. Vulkan sigue siendo la alternativa de respaldo: Ollama lo activa por defecto cuando el backend está instalado.
| Entorno | Estado | Fuente |
|---|---|---|
| ROCm bajo Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7) | Oficial, destinado a gfx1101 | Tabla de compatibilidad AMD |
| Ollama bajo Linux | Lista de tarjetas compatibles | Documentación de Ollama, se requiere ROCm v7 |
| Ollama bajo Windows | Lista de tarjetas compatibles | Documentación Ollama, pila ROCm v7 / HIP7 |
| Vulkan (Ollama, llama.cpp) | Alternativa generalista | Activado por defecto en Ollama |
#Lo que cabe en 12 GB de VRAM
En una tarjeta de 12 GB, calcula unos 11 GB para el modelo y su caché KV si la tarjeta no se usa para mostrar la imagen en pantalla. Los pesos indicados provienen del catálogo QuelLLM; la caché KV se suma y crece con la longitud de la conversación.
| Modelo | Peso en Q4 | Margen para el contexto | Veredicto |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 5 GB | Muy cómodo |
| Gemma 4 12B | ≈ 7 GB | ≈ 4 GB | Cómodo, contexto largo posible |
| Phi-4 14B | ≈ 9 GB | ≈ 2 GB | Cabe, pero hay que limitar el contexto |
| gpt-oss 20B | ≈ 13 GB | ninguna | No cabe en la VRAM; descarga parcial al procesador |
| Devstral Small 2 24B | ≈ 14 GB | ninguna | Se necesitan al menos 16 GB |
Para ir más allá de 14B sin cambiar de tarjeta, existen dos opciones: cuantizar la caché KV para recuperar uno o dos gigabytes, o elegir un modelo de mezcla de expertos (MoE) en el que solo algunos parámetros estén activos por token. La memoria ocupada sigue correspondiendo al tamaño completo del modelo, por lo que un MoE de 20B no cabe con más facilidad en 12 GB, pero genera más rápido si cabe.
- ¿Qué LLM para 12 GB de VRAM, independientemente de la tarjeta?
- Cuantizar la caché KV para recuperar VRAM
- Calculadora de VRAM para tu modelo y tu contexto
#Velocidad de generación: lo que sabemos y lo que estimamos
Seamos precisos sobre las pruebas disponibles: las dos discusiones públicas del repositorio llama.cpp, una bajo Vulkan y otra bajo ROCm, que recopilan datos de tarjetas AMD con el mismo modelo (Llama 2 7B en Q4_0), no contienen ninguna fila para la RX 7700 XT en el momento de la redacción. No hemos realizado ninguna medición por nuestra cuenta. Lo que podemos hacer es situarla entre dos tarjetas para las que sí hay mediciones: la RX 6700 XT a 83,88 tokens por segundo en generación (ancho de banda de 384 GB/s) y la RX 7800 XT a 118,27 (624 GB/s), ambas bajo Vulkan.
El cálculo a partir del ancho de banda da un límite superior: 432 GB/s divididos por 3,82 GB de pesos dan aproximadamente 113 tokens por segundo con el modelo de referencia de 7B. Las tarjetas AMD de la misma discusión alcanzan entre el 59 % y el 83 % de ese límite (83 % para la 6700 XT, 72 % para la 7800 XT). Sobre esta base, un valor entre 65 y 95 tokens por segundo parece plausible para la 7700 XT: es una hipótesis de trabajo, no un resultado, que debe confirmarse con llama-bench.
| Modelo (Q4) | Tamaño del modelo | Límite de 432 GB/s | Estimación al 60-80 % del límite |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 72 tokens/s | ≈ 43 a 58 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 62 tokens/s | ≈ 37 a 49 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 48 tokens/s | ≈ 29 a 38 tokens/s |
Para la conversación, todo lo que supere una decena de tokens por segundo se lee cómodamente; estas estimaciones quedan por tanto muy por encima del umbral de uso, incluso con un amplio margen de error.
#Frente a sus competidoras directas: 6700 XT, 7800 XT y RTX 4070
A menudo se elige entre tres tarjetas similares. Las mediciones publicadas con Vulkan ayudan a situar la RTX 4070, una de las tarjetas de 12 GB de la generación Ada mencionadas: 92,29 tokens por segundo en generación y 3.179 en lectura del prompt. Sus 12 GB, al igual que los de la 7700 XT, limitan ambas tarjetas a los mismos modelos; las diferencias están en el ecosistema de software, la lectura del prompt, la eficiencia energética y el precio. Las velocidades de la RX 7700 XT aún están por medir; las de las otras tres tarjetas ya están publicadas.
| Tarjeta | VRAM | Ancho de banda | Lectura pp512 | Generación tg128 |
|---|---|---|---|---|
| RX 6700 XT | 12 GB | 384 GB/s | 1 051,20 t/s | 83,88 t/s |
| RX 7700 XT | 12 GB | 432 GB/s | no publicado | no publicado |
| RTX 4070 | 12 GB | no citado | 3 179,37 t/s | 92,29 t/s |
| RX 7800 XT | 16 GB | 624 GB/s | 2 017,33 t/s | 118,27 t/s |
Leer este cuadro: pasar de la 7700 XT a la 7800 XT no cuesta solo más velocidad, añade 4 GB de VRAM, es decir, acceso a modelos de 20 a 24B. Este es el único criterio que realmente cambia lo que puedes ejecutar. Si tu uso es un 8B o un 12B, la 7700 XT no es limitante; si buscas modelos de código de 24B, sí lo es.
- Radeon RX 7800 XT, el mismo chip con 16 GB
- Radeon RX 6700 XT, la generación anterior con 12 GB
- RTX 4070: la alternativa de NVIDIA con 12 GB
#Puesta en marcha en Linux
- 01Verificar el sistemaComprueba que tu distribución sea Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 o RHEL 9.7, las únicas versiones que AMD enumera para esta tarjeta.
- 02Instalar el controlador ROCmOllama requiere el controlador ROCm v7 en Linux. Instálalo con la herramienta amdgpu-install descrita en la documentación de AMD.
- 03Instalar Ollama y luego un modeloDescarga Gemma 4 12B en Q4_K_M o un 8B y luego ejecútalo con ollama run.
- 04Verificar que la tarjeta gráfica esté trabajandoEjecuta ollama ps: la columna del procesador debe indicar una ejecución en la GPU. Si la tarjeta no se detecta, agrega al usuario ollama al grupo render.
- 05Medir y compararInicia llama-bench con el GGUF del hilo público para comparar tu tarjeta con las mediciones de otros y publicar la tuya.
En Windows, la documentación de Ollama contempla una pila ROCm v7 o HIP7 para las Radeon RX 7000; la instalación se limita a instalar el controlador Radeon actualizado y después Ollama. La guía sobre Ollama y las GPU AMD detalla las variables de entorno útiles para seleccionar una tarjeta cuando el sistema cuenta con varias.
#Cuando 12 GB ya no son suficientes
El umbral es claro: por encima de 11 GB de pesos, el modelo ya no cabe completamente en la VRAM. Ollama y llama.cpp trasladan entonces parte de las capas al procesador, y la velocidad cae en picado porque la memoria del sistema es mucho más lenta que la GDDR6. Tres situaciones se repiten: un modelo de código de 24B, un contexto largo en un 14B o un segundo modelo cargado al mismo tiempo para el RAG. Cada una se soluciona con más VRAM, no con más potencia de cálculo.
| Tu uso | ¿Son suficientes 12 GB? | Lo que cambia a continuación |
|---|---|---|
| Chat, resumen y traducción con un modelo de entre 8B y 12B | Sí | Nada |
| Asistente de código con un 14B, contexto corto | Sí | Monitorear el caché KV |
| Modelo de código 24B o gpt-oss 20B | No | Elegir un mínimo de 16 GB |
| RAG con generación, embeddings y reranker cargados juntos | Exacto | Elegir 16 GB para evitar las idas y vueltas |
| Contexto de 32 000 tokens o más en un 14B | No | Cuantizar el caché KV o elegir 16 GB |
Antes de comprarla de segunda mano, comprueba tres puntos concretos. La potencia de la tarjeta, de 245 W, exige una fuente de alimentación adecuada y dos conectores de alimentación PCIe correctamente conectados. El modelo exacto importa poco para el LLM, ya que la memoria de 12 GB es idéntica en todos los fabricantes; solo cambia la calidad de la refrigeración, lo que importa en sesiones largas de generación. Por último, prueba la tarjeta con un modelo real de entre 9 y 10 GB antes de dar el visto bueno a la compra: es la única prueba que utiliza la mayor parte de los 12 GB de memoria y exige la lectura repetida y continua de los pesos que realiza un LLM, algo que no tiene nada que ver con un videojuego.
#Veredicto 2026
- Si ya la tienes
- Consérvala: cubre todos los modelos de hasta 14B con soporte oficial, sin soluciones alternativas.
- Si compras de segunda mano
- Compara su precio con el de una RX 7800 XT en /prix-gpu-ia: si la diferencia es pequeña, merece la pena pagarla por los 4 GB adicionales de la 7800 XT.
- Si buscas modelos de 24B
- Pasa directamente a 16 GB o más: no es el rendimiento, sino la capacidad lo que limita.
- Precios de las tarjetas gráficas para IA local, registrados dos veces por semana
- Documentación de Ollama: GPU de AMD compatibles
- Tabla de compatibilidad ROCm de AMD
- Tabla de puntuaciones Vulkan del repositorio llama.cpp
#Preguntas frecuentes
¿La RX 7700 XT es adecuada para LLM locales?+
¿Qué modelos ejecutar con 12 GB y una RX 7700 XT?+
¿Cuántos tokens por segundo da una RX 7700 XT?+
¿Funciona la RX 7700 XT con Ollama bajo Windows?+
¿RX 7700 XT o RX 7800 XT para la IA local?+
¿Se necesita Ubuntu para usar la RX 7700 XT con ROCm?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.