Principiante 11 minRadeon RX 7000

¿Qué LLM usar con una Radeon RX 7700 XT (12 GB) ?

Respuesta directa

La Radeon RX 7700 XT (12 GB GDDR6, 432 GB/s) cuenta con soporte oficial de ROCm y Ollama, tanto en Linux como en Windows. Ejecuta sin compromisos los modelos de 8 a 14 mil millones de parámetros en Q4, pero no llega a los de 20 a 24 mil millones, que requieren de 13 a 14 GB. No se ha publicado ninguna cifra de velocidad para esta tarjeta en las tablas de resultados de llama.cpp: su rendimiento se sitúa entre el de una RX 6700 XT y el de una RX 7800 XT.

La RX 7700 XT destaca sobre todo por lo que permiten sus 12 GB y por su posición en la gama: más rápida y con mejor soporte que la generación anterior, pero por debajo del umbral de 16 GB que permite ejecutar modelos de 20 a 24B. Aquí tienes información para decidir si es suficiente, con mediciones citadas y estimaciones claramente identificadas.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.

¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#Lo que hace una RX 7700 XT en 2026

Una RX 7700 XT es adecuada para un LLM local de tamaño medio: en sus 12 GB caben Llama 3.1 8B, Gemma 4 12B o Phi-4 14B en Q4 con espacio para el contexto. Su ancho de banda de 432 GB/s, un 12,5 % superior al de una RX 6700 XT, fija el límite de velocidad de generación: aproximadamente 113 tokens por segundo con el modelo de referencia de 7B de las tablas de resultados, frente a 163 para una RX 7800 XT. Tiene una ventaja clara sobre la 6700 XT: ROCm y Ollama la incluyen oficialmente, incluso en Windows. Su punto débil es su capacidad, que la deja fuera de los modelos de 20 a 24 mil millones de parámetros, para los que los 16 GB de la 7800 XT resultan valiosos.

Arquitectura
RDNA 3, chip Navi 32 ensamblado en chiplets (1 GCD y 3 MCD), lanzado el 6 de septiembre de 2023.
Cálculo
3 456 procesadores de flujo, 54 unidades de cálculo.
Memoria
12 GB GDDR6, bus de 192 bits, 432 GB/s.
Consumo
245 W de potencia de la tarjeta.
Precio
No se indica aquí: consulta /prix-gpu-ia para conocer el precio más bajo registrado cada semana.

#ROCm, Ollama y Windows: soporte oficial

Este es el punto que la distingue de la generación anterior. La tabla de compatibilidad de AMD incluye la RX 7700 XT como RDNA 3, con la arquitectura objetivo gfx1101, al igual que la RX 7800 XT. La documentación de Ollama la menciona entre las tarjetas compatibles con Linux y Windows. Un matiz influye en la elección del sistema: según AMD, las Radeon RX 7000 y 9000 solo cuentan con soporte en Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 y RHEL 9.7. Otra distribución puede funcionar, pero sin garantía. Vulkan sigue siendo la alternativa de respaldo: Ollama lo activa por defecto cuando el backend está instalado.

Soporte para RX 7700 XT
EntornoEstadoFuente
ROCm bajo Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7)Oficial, destinado a gfx1101Tabla de compatibilidad AMD
Ollama bajo LinuxLista de tarjetas compatiblesDocumentación de Ollama, se requiere ROCm v7
Ollama bajo WindowsLista de tarjetas compatiblesDocumentación Ollama, pila ROCm v7 / HIP7
Vulkan (Ollama, llama.cpp)Alternativa generalistaActivado por defecto en Ollama

#Lo que cabe en 12 GB de VRAM

En una tarjeta de 12 GB, calcula unos 11 GB para el modelo y su caché KV si la tarjeta no se usa para mostrar la imagen en pantalla. Los pesos indicados provienen del catálogo QuelLLM; la caché KV se suma y crece con la longitud de la conversación.

Lo que admite una 7700 XT (Q4, solo los pesos)
ModeloPeso en Q4Margen para el contextoVeredicto
Llama 3.1 8B≈ 6 GB≈ 5 GBMuy cómodo
Gemma 4 12B≈ 7 GB≈ 4 GBCómodo, contexto largo posible
Phi-4 14B≈ 9 GB≈ 2 GBCabe, pero hay que limitar el contexto
gpt-oss 20B≈ 13 GBningunaNo cabe en la VRAM; descarga parcial al procesador
Devstral Small 2 24B≈ 14 GBningunaSe necesitan al menos 16 GB

Para ir más allá de 14B sin cambiar de tarjeta, existen dos opciones: cuantizar la caché KV para recuperar uno o dos gigabytes, o elegir un modelo de mezcla de expertos (MoE) en el que solo algunos parámetros estén activos por token. La memoria ocupada sigue correspondiendo al tamaño completo del modelo, por lo que un MoE de 20B no cabe con más facilidad en 12 GB, pero genera más rápido si cabe.

#Velocidad de generación: lo que sabemos y lo que estimamos

Seamos precisos sobre las pruebas disponibles: las dos discusiones públicas del repositorio llama.cpp, una bajo Vulkan y otra bajo ROCm, que recopilan datos de tarjetas AMD con el mismo modelo (Llama 2 7B en Q4_0), no contienen ninguna fila para la RX 7700 XT en el momento de la redacción. No hemos realizado ninguna medición por nuestra cuenta. Lo que podemos hacer es situarla entre dos tarjetas para las que sí hay mediciones: la RX 6700 XT a 83,88 tokens por segundo en generación (ancho de banda de 384 GB/s) y la RX 7800 XT a 118,27 (624 GB/s), ambas bajo Vulkan.

El cálculo a partir del ancho de banda da un límite superior: 432 GB/s divididos por 3,82 GB de pesos dan aproximadamente 113 tokens por segundo con el modelo de referencia de 7B. Las tarjetas AMD de la misma discusión alcanzan entre el 59 % y el 83 % de ese límite (83 % para la 6700 XT, 72 % para la 7800 XT). Sobre esta base, un valor entre 65 y 95 tokens por segundo parece plausible para la 7700 XT: es una hipótesis de trabajo, no un resultado, que debe confirmarse con llama-bench.

Límite teórico por modelo en una 7700 XT (cálculo)
Modelo (Q4)Tamaño del modeloLímite de 432 GB/sEstimación al 60-80 % del límite
Llama 3.1 8B≈ 6 GB≈ 72 tokens/s≈ 43 a 58 tokens/s
Gemma 4 12B≈ 7 GB≈ 62 tokens/s≈ 37 a 49 tokens/s
Phi-4 14B≈ 9 GB≈ 48 tokens/s≈ 29 a 38 tokens/s

Para la conversación, todo lo que supere una decena de tokens por segundo se lee cómodamente; estas estimaciones quedan por tanto muy por encima del umbral de uso, incluso con un amplio margen de error.

#Frente a sus competidoras directas: 6700 XT, 7800 XT y RTX 4070

A menudo se elige entre tres tarjetas similares. Las mediciones publicadas con Vulkan ayudan a situar la RTX 4070, una de las tarjetas de 12 GB de la generación Ada mencionadas: 92,29 tokens por segundo en generación y 3.179 en lectura del prompt. Sus 12 GB, al igual que los de la 7700 XT, limitan ambas tarjetas a los mismos modelos; las diferencias están en el ecosistema de software, la lectura del prompt, la eficiencia energética y el precio. Las velocidades de la RX 7700 XT aún están por medir; las de las otras tres tarjetas ya están publicadas.

7700 XT y tarjetas similares (Llama 2 7B Q4_0, Vulkan, sin Flash Attention)
TarjetaVRAMAncho de bandaLectura pp512Generación tg128
RX 6700 XT12 GB384 GB/s1 051,20 t/s83,88 t/s
RX 7700 XT12 GB432 GB/sno publicadono publicado
RTX 407012 GBno citado3 179,37 t/s92,29 t/s
RX 7800 XT16 GB624 GB/s2 017,33 t/s118,27 t/s

Leer este cuadro: pasar de la 7700 XT a la 7800 XT no cuesta solo más velocidad, añade 4 GB de VRAM, es decir, acceso a modelos de 20 a 24B. Este es el único criterio que realmente cambia lo que puedes ejecutar. Si tu uso es un 8B o un 12B, la 7700 XT no es limitante; si buscas modelos de código de 24B, sí lo es.

#Puesta en marcha en Linux

  1. 01
    Verificar el sistema
    Comprueba que tu distribución sea Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 o RHEL 9.7, las únicas versiones que AMD enumera para esta tarjeta.
  2. 02
    Instalar el controlador ROCm
    Ollama requiere el controlador ROCm v7 en Linux. Instálalo con la herramienta amdgpu-install descrita en la documentación de AMD.
  3. 03
    Instalar Ollama y luego un modelo
    Descarga Gemma 4 12B en Q4_K_M o un 8B y luego ejecútalo con ollama run.
  4. 04
    Verificar que la tarjeta gráfica esté trabajando
    Ejecuta ollama ps: la columna del procesador debe indicar una ejecución en la GPU. Si la tarjeta no se detecta, agrega al usuario ollama al grupo render.
  5. 05
    Medir y comparar
    Inicia llama-bench con el GGUF del hilo público para comparar tu tarjeta con las mediciones de otros y publicar la tuya.
Terminal
ollama ps
rocminfo | grep -i gfx
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

En Windows, la documentación de Ollama contempla una pila ROCm v7 o HIP7 para las Radeon RX 7000; la instalación se limita a instalar el controlador Radeon actualizado y después Ollama. La guía sobre Ollama y las GPU AMD detalla las variables de entorno útiles para seleccionar una tarjeta cuando el sistema cuenta con varias.

#Cuando 12 GB ya no son suficientes

El umbral es claro: por encima de 11 GB de pesos, el modelo ya no cabe completamente en la VRAM. Ollama y llama.cpp trasladan entonces parte de las capas al procesador, y la velocidad cae en picado porque la memoria del sistema es mucho más lenta que la GDDR6. Tres situaciones se repiten: un modelo de código de 24B, un contexto largo en un 14B o un segundo modelo cargado al mismo tiempo para el RAG. Cada una se soluciona con más VRAM, no con más potencia de cálculo.

¿Conviene quedarse en 12 GB?
Tu uso¿Son suficientes 12 GB?Lo que cambia a continuación
Chat, resumen y traducción con un modelo de entre 8B y 12BSíNada
Asistente de código con un 14B, contexto cortoSíMonitorear el caché KV
Modelo de código 24B o gpt-oss 20BNoElegir un mínimo de 16 GB
RAG con generación, embeddings y reranker cargados juntosExactoElegir 16 GB para evitar las idas y vueltas
Contexto de 32 000 tokens o más en un 14BNoCuantizar el caché KV o elegir 16 GB

Antes de comprarla de segunda mano, comprueba tres puntos concretos. La potencia de la tarjeta, de 245 W, exige una fuente de alimentación adecuada y dos conectores de alimentación PCIe correctamente conectados. El modelo exacto importa poco para el LLM, ya que la memoria de 12 GB es idéntica en todos los fabricantes; solo cambia la calidad de la refrigeración, lo que importa en sesiones largas de generación. Por último, prueba la tarjeta con un modelo real de entre 9 y 10 GB antes de dar el visto bueno a la compra: es la única prueba que utiliza la mayor parte de los 12 GB de memoria y exige la lectura repetida y continua de los pesos que realiza un LLM, algo que no tiene nada que ver con un videojuego.

#Veredicto 2026

Si ya la tienes
Consérvala: cubre todos los modelos de hasta 14B con soporte oficial, sin soluciones alternativas.
Si compras de segunda mano
Compara su precio con el de una RX 7800 XT en /prix-gpu-ia: si la diferencia es pequeña, merece la pena pagarla por los 4 GB adicionales de la 7800 XT.
Si buscas modelos de 24B
Pasa directamente a 16 GB o más: no es el rendimiento, sino la capacidad lo que limita.

#Preguntas frecuentes

FAQ
¿La RX 7700 XT es adecuada para LLM locales?+
Sí, para modelos de 8 a 14 mil millones de parámetros en Q4, con soporte oficial de ROCm y Ollama. Sus 12 GB la limitan a modelos por debajo del rango de 20 a 24 mil millones de parámetros, lo que constituye su principal desventaja frente a la RX 7800 XT y sus 16 GB.
¿Qué modelos ejecutar con 12 GB y una RX 7700 XT?+
Llama 3.1 8B, Gemma 4 12B y Phi-4 14B en Q4, con entre 6 y 9 GB de pesos y espacio para el contexto. Un modelo de 20 a 24B ocupa entre 13 y 14 GB en Q4: supera la capacidad de la VRAM y pasa a ejecutarse parcialmente en el procesador, con una reducción importante de la velocidad.
¿Cuántos tokens por segundo da una RX 7700 XT?+
No hay mediciones publicadas en las discusiones del repositorio llama.cpp. El cálculo da un límite máximo de aproximadamente 113 tokens por segundo en un modelo de 7B en Q4_0, y normalmente se observa entre un 59 % y un 83 % de ese límite en tarjetas AMD de gamas próximas. Mide su rendimiento tú mismo con llama-bench antes de dar cifras.
¿Funciona la RX 7700 XT con Ollama bajo Windows?+
Sí: la documentación de Ollama la menciona entre las Radeon RX compatibles con Windows y exige una pila ROCm v7 o HIP7. En Linux también figura en la lista, con el controlador ROCm v7. Vulkan, activado por defecto en Ollama, sirve como alternativa si falla la detección.
¿RX 7700 XT o RX 7800 XT para la IA local?+
La 7800 XT si buscas modelos de 20 a 24B, gracias a sus 16 GB y a su banda pasante de 624 GB/s frente a 432 GB/s. La 7700 XT basta si tu uso se mantiene entre 8 y 14 mil millones de parámetros. Compara los precios actuales antes de decidir.
¿Se necesita Ubuntu para usar la RX 7700 XT con ROCm?+
AMD solo ofrece soporte oficial para las Radeon RX 7000 en Ubuntu 24.04.4, Ubuntu 22.04.5, RHEL 10.1 y RHEL 9.7. Otra distribución puede funcionar, pero sin soporte garantizado. En Windows, Ollama se basa en una pila ROCm v7 o HIP7; Vulkan sigue siendo una opción en todos los sistemas.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.