¿Qué LLM en Radeon RX 6700 XT (12 GB)? ?
La RX 6700 XT (12 GB, 384 GB/s) ejecuta sin problemas modelos hasta de 14B en Q4 (aproximadamente 9 GB) y un 12B como Gemma 4 12B con margen para el contexto. Usa Vulkan en lugar de ROCm: no aparece ni en la lista oficial de ROCm ni en la de Ollama. En generación, iguala o supera a una RTX 3060 12 GB; en lectura de prompt, es casi dos veces más lenta.
Esta tarjeta de 2021 nunca se diseñó para la IA, y aun así el software no la ha olvidado. Esta guía explica qué ejecuta hoy, mediante qué software, a qué velocidad según mediciones publicadas y en qué momento sustituirla resulta más rentable que seguir empeñándose en usarla.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.
¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#Lo que hace una RX 6700 XT en 2026
Una Radeon RX 6700 XT sirve muy bien como tarjeta de entrada para un LLM local siempre que aceptes tres hechos: sus 12 GB de memoria permiten alojar un modelo de 14 mil millones de parámetros en Q4 (aproximadamente 9 GB de pesos), pero no uno de 24B; la opción de software fiable para esta tarjeta es Vulkan, a través de llama.cpp o Ollama, porque AMD no la incluye en ROCm; y su velocidad de generación, limitada por sus 384 GB/s de ancho de banda, basta para una conversación fluida con modelos de 8B a 12B. En un modelo de 7B en Q4_0, una medición publicada en el repositorio llama.cpp da 83,88 tokens por segundo en generación con Vulkan, un poco más que la RTX 3060 de 12 GB evaluada en la misma discusión. El verdadero punto débil es la lectura del prompt, que es dos veces más lenta.
- Arquitectura
- RDNA 2, chip Navi 22, lanzada el 18 de marzo de 2021 (ficha de Wikipedia de la serie RX 6000).
- Cálculo
- 2.560 procesadores de flujo, 40 unidades de cálculo
- Memoria
- 12 GB GDDR6, bus de 192 bits, 384 GB/s.
- Consumo
- 230 W de potencia de la tarjeta.
- Precio
- No se indica aquí: los precios de segunda mano cambian cada semana; consulta /prix-gpu-ia.
#Ollama, ROCm o Vulkan: el camino que funciona
El error más común con esta tarjeta es buscar una guía de ROCm. La documentación de Ollama enumera, para Linux, las Radeon RX desde la 6800 hasta la 9070 XT: la 6700 XT no está incluida. En cuanto a ROCm, la tabla de compatibilidad de AMD solo menciona, dentro de RDNA 2, tarjetas profesionales como la PRO W6800 o la V620. Ollama amplía esta cobertura con Vulkan, activado por defecto cuando el backend está instalado, y esta es la vía que sigue disponible para una 6700 XT. Existe una alternativa para sortear esta limitación en ROCm: la variable HSA_OVERRIDE_GFX_VERSION, que fuerza un destino LLVM cercano, pero está reservada para la experimentación.
| Ruta | Estado de esta tarjeta | ¿Cuándo elegirlo? |
|---|---|---|
| Vulkan (Ollama, llama.cpp, LM Studio) | Funciona, medido públicamente con llama.cpp | Opción predeterminada, tanto en Windows como en Linux |
| ROCm oficial | Tarjeta ausente de la lista ROCm y de la de Ollama | Evitar: ninguna garantía de soporte |
| ROCm forzado (HSA_OVERRIDE_GFX_VERSION) | Solución alternativa documentada por Ollama para otras tarjetas | Sólo para probar, sin esperar un beneficio comprobado |
#Lo que cabe en 12 GB de VRAM
La regla del sitio sigue siendo la misma: el tamaño del modelo en Q4 más la caché KV más un margen para el controlador y la salida de vídeo. Con 12 GB, un presupuesto realista deja aproximadamente 11 GB para el modelo y su contexto si la tarjeta no se encarga de la pantalla. Los tamaños que aparecen a continuación provienen del catálogo QuelLLM y de nuestras referencias habituales; corresponden únicamente a los pesos del modelo.
| Modelo | Peso en Q4 | Memoria restante para el contexto | Veredicto |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 5 a 6 GB | Funciona con mucha holgura y permite un contexto largo |
| Gemma 4 12B | ≈ 7 GB | ≈ 4 a 5 GB | Cómodo, contexto medio a largo |
| Phi-4 14B | ≈ 9 GB | ≈ 2 a 3 GB | Cabe, pero hay que limitar el contexto |
| gpt-oss 20B | ≈ 13 GB | negativo | No cabe: pasa a ejecutarse parcialmente en el procesador |
| Devstral Small 2 24B | ≈ 14 GB | negativo | Demasiado grande para 12 GB en Q4 |
La caché KV crece con la longitud de la conversación, lo que explica por qué un modelo de 14B «cabe» sobre el papel, pero se vuelve muy lento en cuanto el historial se alarga. La calculadora de VRAM del sitio da el total exacto para tu modelo y tu contexto, y la guía sobre la cuantización de la caché KV explica cómo recuperar uno o dos gigabytes. Para todas las tarjetas de 12 GB, la página dedicada compara los modelos sin limitarse a AMD.
- Calculadora de VRAM para un modelo y un contexto dados
- ¿Qué LLM para 12 GB de VRAM, independientemente de la tarjeta?
- Cuantizar la caché KV para ahorrar VRAM
#Velocidades medidas y límite de ancho de banda
Ninguna de las velocidades de procesamiento de esta página es una medición realizada por este sitio. Las cifras provienen de la discusión pública del repositorio llama.cpp que compara las tarjetas con Vulkan usando el mismo modelo, Llama 2 7B en Q4_0 (3,56 GiB), y el comando llama-bench. Hay dos valores relevantes: pp512, la velocidad de lectura de un prompt de 512 tokens, y tg128, la velocidad de escritura de 128 tokens. Para la RX 6700 XT, la discusión indica 1 051 tokens por segundo en lectura y 83,88 en generación; con Flash Attention activada, 1 011 y 81,86.
Este resultado se compara con un límite máximo sencillo: durante la generación, cada token obliga a la tarjeta a volver a leer todos los pesos, por lo que la velocidad máxima ronda el ancho de banda dividido por el tamaño del modelo. Aquí, 384 GB/s para 3,82 GB de pesos dan un límite máximo teórico de 100 tokens por segundo; la tarjeta alcanza el 83 % de ese límite, un buen rendimiento, mejor que el de varias tarjetas más recientes de la misma discusión.
| Modelo (Q4) | Tamaño del modelo | Límite teórico a 384 GB/s | Orden de magnitud realista (83 %) |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 64 tokens/s | ≈ 50 a 55 tokens/s |
| Gemma 4 12B | ≈ 7 GB | ≈ 55 tokens/s | ≈ 45 tokens/s |
| Phi-4 14B | ≈ 9 GB | ≈ 43 tokens/s | ≈ 35 tokens/s |
Estos órdenes de magnitud suponen que el rendimiento medido en el 7B se mantiene en los modelos más grandes, lo cual no está garantizado: un controlador, una versión de llama.cpp o una cuantización diferente pueden modificar el resultado en varios puntos. En cuanto a la lectura de prompts, quédate solo con la relación entre tarjetas: esa lectura es la que tiene más peso en un uso RAG con documentos largos.
#Contra la RTX 3060 12 GB: la generación gana, el prompt pierde
La comparación habitual da por ganadora a la RTX 3060 de 12 GB gracias a CUDA. Las mediciones publicadas con Vulkan matizan esa idea. En generación, la RX 6700 XT supera a la RTX 3060 en ambos modos; en lectura del prompt, la RTX 3060 ofrece casi el doble de rendimiento. Ambas series proceden de la misma discusión, pero de versiones diferentes de llama.cpp: interpreta la diferencia como un orden de magnitud, no como una clasificación definitiva.
| Medición | RX 6700 XT | RTX 3060 (12 GB) |
|---|---|---|
| Lectura del prompt (pp512), sin Flash Attention | 1 051,20 t/s | 1 815,70 t/s |
| Generación (tg128), sin Flash Attention | 83,88 t/s | 75,94 t/s |
| Lectura del prompt (pp512), con Flash Attention | 1 010,90 t/s | 2 012,88 t/s |
| Generación (tg128), con Flash Attention | 81,86 t/s | 80,59 t/s |
La consecuencia práctica: para conversar con un modelo, las dos tarjetas ofrecen resultados equivalentes; para consultar un documento largo, la RTX 3060 tarda menos en generar la primera palabra. CUDA también conserva la ventaja de su ecosistema, con menos soluciones alternativas que aprender. A igualdad de precio en el mercado de segunda mano, la RTX 3060 de 12 GB sigue siendo la opción prudente, y la 6700 XT solo es una buena compra si ya está en tu PC o es considerablemente más barata.
#Puesta en marcha paso a paso
- 01Verificar el controlador VulkanEn Windows, el controlador Radeon incluye Vulkan y Ollama no requiere ninguna otra acción. En Linux, instala los componentes Vulkan de Mesa (RADV) o el controlador AMD, como indica la documentación de Ollama.
- 02Instalar Ollama o compilar llama.cppOllama activa por defecto Vulkan una vez instalado el backend. Con llama.cpp, compila con la opción -DGGML_VULKAN=on.
- 03Dar acceso a la tarjeta en LinuxAgrega al usuario ollama al grupo render si la tarjeta no se detecta. Para que Ollama lea la VRAM libre, ejecútalo como root o concédele la capacidad indicada en el comando de abajo.
- 04Iniciar un primer modeloDescarga un 8B o Gemma 4 12B en Q4_K_M, ejecútalo con el comando ollama run y luego verifica con ollama ps que el modelo esté cargado en la GPU y no en el procesador.
- 05Medir en tu equipoEjecuta llama-bench con el mismo GGUF utilizado en la discusión pública para comparar tu tarjeta con los resultados allí publicados antes de buscar una causa de lentitud.
Si la velocidad de generación te parece baja con RADV, la discusión de llama.cpp recomienda ejecutar con la variable de entorno RADV_PERFTEST=nogttspill, que corrige varios problemas de rendimiento. Los demás ajustes de Vulkan se encuentran en la guía de compilación dedicada.
#Límites y momento de pasar a otra opción
Destacan tres limitaciones. Primero, la memoria: 12 GB excluyen los modelos de 20 a 32 mil millones de parámetros, un rango decisivo para la calidad de los asistentes de programación y razonamiento. Después, la lectura del prompt, que hace tediosas las sesiones con documentos largos. Por último, el soporte: una tarjeta fuera de la lista oficial depende de que las actualizaciones de Vulkan y llama.cpp sigan prestándole soporte, sin garantía a largo plazo.
| Tu necesidad | ¿Seguir con la RX 6700 XT? | Posible alternativa de reemplazo |
|---|---|---|
| Chat diario con un modelo de entre 8B y 12B | Sí | Ninguna |
| Asistente de código local con un modelo de 14B | Sí, contexto corto | Una tarjeta de 16 GB si el contexto crece |
| Modelos de 20 a 30B (gpt-oss 20B, Devstral 24B) | No, memoria insuficiente | Tarjeta de 16 a 20 GB, página dedicada a continuación |
| RAG con documentos extensos | Posible, pero tarda en generar la primera palabra | Tarjeta con mejor procesamiento del prompt |
| Soporte oficial garantizado | No | Radeon RX 7000 o 9000, RTX |
- Radeon RX 7700 XT, etapa RDNA 3 con 12 GB, soporte oficial
- Radeon RX 7800 XT, 16 GB para pasar a modelos de 20 a 24B
#Veredicto 2026
- Vale la pena
- Si ya está en tu máquina: es una de las pocas tarjetas de 2021 que aún admite un 14B en Q4 con un rendimiento de generación superior al 80 % de su máximo teórico.
- Compra mejor una RTX 3060 de 12 GB
- Si empiezas desde cero y apuntas al mismo presupuesto: lectura del prompt dos veces más rápida y sin necesidad de soluciones alternativas de software.
- Cambia de tarjeta
- En cuanto quieras modelos de 20 a 30 mil millones de parámetros; los precios cambian cada semana y la página /prix-gpu-ia indica el coste por GB de VRAM.
- Precios de tarjetas gráficas para la IA local, actualizados dos veces por semana
- Documentación Ollama: GPUs compatibles, ROCm y Vulkan
- Tabla de resultados de Vulkan del repositorio llama.cpp (Llama 2 7B Q4_0)
- Compatibilidad de GPU con ROCm, documentación de AMD
#Preguntas frecuentes
RX 6700 XT LLM: ¿qué modelos se pueden ejecutar?+
¿Funciona una 6700 XT con Ollama?+
¿Es viable ROCm en RX 6700 XT?+
¿Cuántos tokens por segundo en una RX 6700 XT?+
¿RX 6700 XT o RTX 3060 de 12 GB para un LLM?+
¿Cuándo hay que dejar de usar la RX 6700 XT para la IA local?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.