Principiante 11 minRadeon RX 6000

¿Qué LLM en Radeon RX 6700 XT (12 GB)? ?

Respuesta directa

La RX 6700 XT (12 GB, 384 GB/s) ejecuta sin problemas modelos hasta de 14B en Q4 (aproximadamente 9 GB) y un 12B como Gemma 4 12B con margen para el contexto. Usa Vulkan en lugar de ROCm: no aparece ni en la lista oficial de ROCm ni en la de Ollama. En generación, iguala o supera a una RTX 3060 12 GB; en lectura de prompt, es casi dos veces más lenta.

Esta tarjeta de 2021 nunca se diseñó para la IA, y aun así el software no la ha olvidado. Esta guía explica qué ejecuta hoy, mediante qué software, a qué velocidad según mediciones publicadas y en qué momento sustituirla resulta más rentable que seguir empeñándose en usarla.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.

¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#Lo que hace una RX 6700 XT en 2026

Una Radeon RX 6700 XT sirve muy bien como tarjeta de entrada para un LLM local siempre que aceptes tres hechos: sus 12 GB de memoria permiten alojar un modelo de 14 mil millones de parámetros en Q4 (aproximadamente 9 GB de pesos), pero no uno de 24B; la opción de software fiable para esta tarjeta es Vulkan, a través de llama.cpp o Ollama, porque AMD no la incluye en ROCm; y su velocidad de generación, limitada por sus 384 GB/s de ancho de banda, basta para una conversación fluida con modelos de 8B a 12B. En un modelo de 7B en Q4_0, una medición publicada en el repositorio llama.cpp da 83,88 tokens por segundo en generación con Vulkan, un poco más que la RTX 3060 de 12 GB evaluada en la misma discusión. El verdadero punto débil es la lectura del prompt, que es dos veces más lenta.

Arquitectura
RDNA 2, chip Navi 22, lanzada el 18 de marzo de 2021 (ficha de Wikipedia de la serie RX 6000).
Cálculo
2.560 procesadores de flujo, 40 unidades de cálculo
Memoria
12 GB GDDR6, bus de 192 bits, 384 GB/s.
Consumo
230 W de potencia de la tarjeta.
Precio
No se indica aquí: los precios de segunda mano cambian cada semana; consulta /prix-gpu-ia.

#Ollama, ROCm o Vulkan: el camino que funciona

El error más común con esta tarjeta es buscar una guía de ROCm. La documentación de Ollama enumera, para Linux, las Radeon RX desde la 6800 hasta la 9070 XT: la 6700 XT no está incluida. En cuanto a ROCm, la tabla de compatibilidad de AMD solo menciona, dentro de RDNA 2, tarjetas profesionales como la PRO W6800 o la V620. Ollama amplía esta cobertura con Vulkan, activado por defecto cuando el backend está instalado, y esta es la vía que sigue disponible para una 6700 XT. Existe una alternativa para sortear esta limitación en ROCm: la variable HSA_OVERRIDE_GFX_VERSION, que fuerza un destino LLVM cercano, pero está reservada para la experimentación.

Tres opciones de software para una RX 6700 XT
RutaEstado de esta tarjeta¿Cuándo elegirlo?
Vulkan (Ollama, llama.cpp, LM Studio)Funciona, medido públicamente con llama.cppOpción predeterminada, tanto en Windows como en Linux
ROCm oficialTarjeta ausente de la lista ROCm y de la de OllamaEvitar: ninguna garantía de soporte
ROCm forzado (HSA_OVERRIDE_GFX_VERSION)Solución alternativa documentada por Ollama para otras tarjetasSólo para probar, sin esperar un beneficio comprobado
!
No confíes en ROCm para esta tarjeta
Ollama indica que ROCm no es compatible con todas las tarjetas AMD y propone la variable HSA_OVERRIDE_GFX_VERSION como recurso para solucionar problemas. Para la 6700 XT, ninguna fuente muestra una mejora respecto a Vulkan, cuyos resultados están publicados. Consulta el identificador de tu GPU con el comando rocminfo antes de cualquier intento.

#Lo que cabe en 12 GB de VRAM

La regla del sitio sigue siendo la misma: el tamaño del modelo en Q4 más la caché KV más un margen para el controlador y la salida de vídeo. Con 12 GB, un presupuesto realista deja aproximadamente 11 GB para el modelo y su contexto si la tarjeta no se encarga de la pantalla. Los tamaños que aparecen a continuación provienen del catálogo QuelLLM y de nuestras referencias habituales; corresponden únicamente a los pesos del modelo.

Lo que admite una tarjeta de 12 GB (Q4, solo los pesos)
ModeloPeso en Q4Memoria restante para el contextoVeredicto
Llama 3.1 8B≈ 6 GB≈ 5 a 6 GBFunciona con mucha holgura y permite un contexto largo
Gemma 4 12B≈ 7 GB≈ 4 a 5 GBCómodo, contexto medio a largo
Phi-4 14B≈ 9 GB≈ 2 a 3 GBCabe, pero hay que limitar el contexto
gpt-oss 20B≈ 13 GBnegativoNo cabe: pasa a ejecutarse parcialmente en el procesador
Devstral Small 2 24B≈ 14 GBnegativoDemasiado grande para 12 GB en Q4

La caché KV crece con la longitud de la conversación, lo que explica por qué un modelo de 14B «cabe» sobre el papel, pero se vuelve muy lento en cuanto el historial se alarga. La calculadora de VRAM del sitio da el total exacto para tu modelo y tu contexto, y la guía sobre la cuantización de la caché KV explica cómo recuperar uno o dos gigabytes. Para todas las tarjetas de 12 GB, la página dedicada compara los modelos sin limitarse a AMD.

#Velocidades medidas y límite de ancho de banda

Ninguna de las velocidades de procesamiento de esta página es una medición realizada por este sitio. Las cifras provienen de la discusión pública del repositorio llama.cpp que compara las tarjetas con Vulkan usando el mismo modelo, Llama 2 7B en Q4_0 (3,56 GiB), y el comando llama-bench. Hay dos valores relevantes: pp512, la velocidad de lectura de un prompt de 512 tokens, y tg128, la velocidad de escritura de 128 tokens. Para la RX 6700 XT, la discusión indica 1 051 tokens por segundo en lectura y 83,88 en generación; con Flash Attention activada, 1 011 y 81,86.

Este resultado se compara con un límite máximo sencillo: durante la generación, cada token obliga a la tarjeta a volver a leer todos los pesos, por lo que la velocidad máxima ronda el ancho de banda dividido por el tamaño del modelo. Aquí, 384 GB/s para 3,82 GB de pesos dan un límite máximo teórico de 100 tokens por segundo; la tarjeta alcanza el 83 % de ese límite, un buen rendimiento, mejor que el de varias tarjetas más recientes de la misma discusión.

Estimación para modelos comunes (cálculo, no medición)
Modelo (Q4)Tamaño del modeloLímite teórico a 384 GB/sOrden de magnitud realista (83 %)
Llama 3.1 8B≈ 6 GB≈ 64 tokens/s≈ 50 a 55 tokens/s
Gemma 4 12B≈ 7 GB≈ 55 tokens/s≈ 45 tokens/s
Phi-4 14B≈ 9 GB≈ 43 tokens/s≈ 35 tokens/s

Estos órdenes de magnitud suponen que el rendimiento medido en el 7B se mantiene en los modelos más grandes, lo cual no está garantizado: un controlador, una versión de llama.cpp o una cuantización diferente pueden modificar el resultado en varios puntos. En cuanto a la lectura de prompts, quédate solo con la relación entre tarjetas: esa lectura es la que tiene más peso en un uso RAG con documentos largos.

#Contra la RTX 3060 12 GB: la generación gana, el prompt pierde

La comparación habitual da por ganadora a la RTX 3060 de 12 GB gracias a CUDA. Las mediciones publicadas con Vulkan matizan esa idea. En generación, la RX 6700 XT supera a la RTX 3060 en ambos modos; en lectura del prompt, la RTX 3060 ofrece casi el doble de rendimiento. Ambas series proceden de la misma discusión, pero de versiones diferentes de llama.cpp: interpreta la diferencia como un orden de magnitud, no como una clasificación definitiva.

RX 6700 XT y RTX 3060 con Vulkan (Llama 2 7B Q4_0, discusión sobre llama.cpp)
MediciónRX 6700 XTRTX 3060 (12 GB)
Lectura del prompt (pp512), sin Flash Attention1 051,20 t/s1 815,70 t/s
Generación (tg128), sin Flash Attention83,88 t/s75,94 t/s
Lectura del prompt (pp512), con Flash Attention1 010,90 t/s2 012,88 t/s
Generación (tg128), con Flash Attention81,86 t/s80,59 t/s

La consecuencia práctica: para conversar con un modelo, las dos tarjetas ofrecen resultados equivalentes; para consultar un documento largo, la RTX 3060 tarda menos en generar la primera palabra. CUDA también conserva la ventaja de su ecosistema, con menos soluciones alternativas que aprender. A igualdad de precio en el mercado de segunda mano, la RTX 3060 de 12 GB sigue siendo la opción prudente, y la 6700 XT solo es una buena compra si ya está en tu PC o es considerablemente más barata.

#Puesta en marcha paso a paso

  1. 01
    Verificar el controlador Vulkan
    En Windows, el controlador Radeon incluye Vulkan y Ollama no requiere ninguna otra acción. En Linux, instala los componentes Vulkan de Mesa (RADV) o el controlador AMD, como indica la documentación de Ollama.
  2. 02
    Instalar Ollama o compilar llama.cpp
    Ollama activa por defecto Vulkan una vez instalado el backend. Con llama.cpp, compila con la opción -DGGML_VULKAN=on.
  3. 03
    Dar acceso a la tarjeta en Linux
    Agrega al usuario ollama al grupo render si la tarjeta no se detecta. Para que Ollama lea la VRAM libre, ejecútalo como root o concédele la capacidad indicada en el comando de abajo.
  4. 04
    Iniciar un primer modelo
    Descarga un 8B o Gemma 4 12B en Q4_K_M, ejecútalo con el comando ollama run y luego verifica con ollama ps que el modelo esté cargado en la GPU y no en el procesador.
  5. 05
    Medir en tu equipo
    Ejecuta llama-bench con el mismo GGUF utilizado en la discusión pública para comparar tu tarjeta con los resultados allí publicados antes de buscar una causa de lentitud.
Terminal
sudo setcap cap_perfmon+ep /usr/local/bin/ollama
# llama.cpp avec Vulkan
cmake .. -DGGML_VULKAN=on -DCMAKE_BUILD_TYPE=Release
./bin/llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

Si la velocidad de generación te parece baja con RADV, la discusión de llama.cpp recomienda ejecutar con la variable de entorno RADV_PERFTEST=nogttspill, que corrige varios problemas de rendimiento. Los demás ajustes de Vulkan se encuentran en la guía de compilación dedicada.

#Límites y momento de pasar a otra opción

Destacan tres limitaciones. Primero, la memoria: 12 GB excluyen los modelos de 20 a 32 mil millones de parámetros, un rango decisivo para la calidad de los asistentes de programación y razonamiento. Después, la lectura del prompt, que hace tediosas las sesiones con documentos largos. Por último, el soporte: una tarjeta fuera de la lista oficial depende de que las actualizaciones de Vulkan y llama.cpp sigan prestándole soporte, sin garantía a largo plazo.

¿Cuándo quedarse, cuándo cambiar?
Tu necesidad¿Seguir con la RX 6700 XT?Posible alternativa de reemplazo
Chat diario con un modelo de entre 8B y 12BSíNinguna
Asistente de código local con un modelo de 14BSí, contexto cortoUna tarjeta de 16 GB si el contexto crece
Modelos de 20 a 30B (gpt-oss 20B, Devstral 24B)No, memoria insuficienteTarjeta de 16 a 20 GB, página dedicada a continuación
RAG con documentos extensosPosible, pero tarda en generar la primera palabraTarjeta con mejor procesamiento del prompt
Soporte oficial garantizadoNoRadeon RX 7000 o 9000, RTX

#Veredicto 2026

Vale la pena
Si ya está en tu máquina: es una de las pocas tarjetas de 2021 que aún admite un 14B en Q4 con un rendimiento de generación superior al 80 % de su máximo teórico.
Compra mejor una RTX 3060 de 12 GB
Si empiezas desde cero y apuntas al mismo presupuesto: lectura del prompt dos veces más rápida y sin necesidad de soluciones alternativas de software.
Cambia de tarjeta
En cuanto quieras modelos de 20 a 30 mil millones de parámetros; los precios cambian cada semana y la página /prix-gpu-ia indica el coste por GB de VRAM.

#Preguntas frecuentes

FAQ
RX 6700 XT LLM: ¿qué modelos se pueden ejecutar?+
Los modelos de hasta 14 mil millones de parámetros en Q4, es decir, unos 9 GB de pesos, más el contexto: Llama 3.1 8B, Gemma 4 12B, Phi-4 14B. Un modelo de 20B como gpt-oss (unos 13 GB) o uno de 24B supera los 12 GB y pasa parcialmente al procesador, con una caída notable de velocidad.
¿Funciona una 6700 XT con Ollama?+
Sí, mediante Vulkan. Ollama no la menciona en su lista de ROCm, que comienza en la RX 6800 en Linux, pero activa Vulkan por defecto cuando el backend está instalado. Verifica con el comando ollama ps que el modelo esté correctamente cargado en la GPU.
¿Es viable ROCm en RX 6700 XT?+
No oficialmente: la tarjeta no aparece ni en la tabla de compatibilidad ROCm de AMD, que solo menciona tarjetas profesionales dentro de RDNA 2, ni en la lista de Ollama. Existe una solución alternativa mediante la variable HSA_OVERRIDE_GFX_VERSION, pero sigue siendo experimental y ninguna medición pública muestra una mejora frente a Vulkan, cuyos resultados están publicados.
¿Cuántos tokens por segundo en una RX 6700 XT?+
Con Llama 2 7B en Q4_0, el hilo público del repositorio llama.cpp indica 83,88 tokens por segundo en generación con Vulkan. Para Gemma 4 12B en Q4, la relación entre el ancho de banda y el tamaño de los pesos sugiere aproximadamente 45 tokens por segundo: una estimación calculada que debes verificar en tu equipo con llama-bench antes de citarla.
¿RX 6700 XT o RTX 3060 de 12 GB para un LLM?+
En generación, ambas tarjetas rinden por igual; la Radeon incluso lleva una ligera ventaja en las mediciones publicadas con Vulkan. Al procesar el prompt, la RTX 3060 es casi el doble de rápida, y CUDA evita tener que recurrir a soluciones alternativas. Al mismo precio de segunda mano, la RTX 3060 de 12 GB sigue siendo la opción más sencilla.
¿Cuándo hay que dejar de usar la RX 6700 XT para la IA local?+
Cuando quieres modelos de 20 a 32 mil millones de parámetros, que no caben en 12 GB, o cuando la lentitud al procesar prompts largos dificulta tu uso. Una tarjeta de 16 a 20 GB, como las Radeon RX 7800 XT o 7900 XT, es entonces el siguiente paso lógico.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.