¿Qué LLM ejecutar en una tarjeta AMD Radeon 6700XT?

La búsqueda «6700xt llm» es frecuente entre quienes tienen una tarjeta de la generación RDNA 2 y quieren un modelo local sin comprar otra GPU. Buena noticia para el dúo 6700xt llm: los 12 GB de GDDR6 de esta tarjeta bastan para modelos de 7 a 14 mil millones de parámetros con cuantización de 4 bits, con una velocidad de generación cómoda para el chat, el código y el resumen de documentos. La limitación principal no es la potencia de cálculo, sino la memoria de vídeo, y el segundo obstáculo es de software: ROCm no ofrece soporte oficial para la RX 6700 XT, lo que obliga a realizar un ajuste o a utilizar el backend Vulkan. Este artículo detalla las especificaciones útiles, la VRAM por cuantización, las velocidades de generación realistas y las licencias; después responde a las preguntas frecuentes antes de orientarte hacia el configurador.

La RX 6700 XT frente a la inferencia local

En teoría, la Radeon RX 6700 XT es una tarjeta gráfica para videojuegos de 2021. Para un LLM, tres cifras son realmente importantes.

A modo de comparación, una tarjeta de 16 GB como la descrita en el guía LLM Radeon RX 6800 XT permite ejecutar modelos de 24B en Q4, y una tarjeta de 24 GB como la RX 7900 XTX alcanza los 32B. La 6700 XT se mantiene en la categoría de 12 GB, la misma que la RTX 3060 12 GB de NVIDIA. La guía dedicada a la RX 6700 XT y la selección mejor LLM para Radeon RX 6700 XT enumeran los modelos del catálogo que caben dentro de este límite de memoria.

VRAM consumida por cuantización: Q4, Q5, Q8, FP16

La regla de cálculo es sencilla: número de parámetros × bytes por parámetro, más la caché KV, que crece con la longitud del contexto. Las magnitudes aproximadas siguientes suponen un contexto de 8 192 tokens y una caché KV de 8 bits; se estiman a partir de los archivos GGUF habituales.

El punto de inflexión es claro: por encima de 12 GB, llama.cpp y Ollama trasladan las capas restantes al procesador, y la tasa de generación cae por un factor de 5 a 10. El guía «qué LLM para 12 GB de VRAM» detalla las combinaciones de tamaño × cuantización × contexto que permanecen el 100 % en GPU.

Lo que el top del catálogo no podrá ejecutar

Una parte del catálogo de quelllm.fr está fuera del alcance de una 6700 XT, y es mejor decirlo claramente que dar esperanzas de un milagro por software.

El caso límite interesante es el de los modelos MoE de aproximadamente 120B con pocos parámetros activos. Qwen 3.5 122B-A10B pesa ~73 GB en Q4 bajo licencia Apache 2.0, Qwen3.8 Flash Next 125B-A6B ~72 GB con solo 6B activos, y Mistral Small 4 ~72 GB bajo Apache 2.0. Con 64 GB de RAM del sistema y los 12 GB de la tarjeta, llama.cpp puede cargar estos modelos delegando la ejecución de los expertos en la CPU. La velocidad obtenida es de unos pocos tokens por segundo, estimada entre 3 y 8 según la RAM y la CPU, pendiente de confirmación en tu configuración. Es utilizable para procesamiento por lotes durante la noche, pero no para un chat interactivo. Los pesos están publicados en la página de Alibaba en Hugging Face et la página de Mistral en Hugging Face.

Tokens/sec reales y elección del software

En RDNA 2, la velocidad de generación depende tanto del backend como del modelo. Hay dos vías que funcionan.

Órdenes de magnitud medidos por la comunidad en la 6700 XT, por confirmar en tu máquina:

Para una interfaz de chat sobre Ollama, Open WebUI se despliega en un contenedor y gestiona el historial, los documentos y varios modelos.

Licencias y casos de uso concretos

La licencia determina qué puedes hacer con las salidas y si el modelo puede usarse en un producto. El catálogo muestra la licencia de cada ficha; las principales familias de licencias presentes en modelos de tamaños compatibles con 12 GB son Apache 2.0, MIT, Llama Community y algunas licencias propias. El filtro por licencia del catálogo permite excluir de forma inmediata las licencias con cláusulas de restricción comercial.

Lo que hace bien una 6700 XT en el día a día:

Para comparar puntuaciones entre modelos, el Open LLM Leaderboard sigue siendo la referencia pública, con la reserva habitual: un benchmark mide una tarea precisa, no tu uso.

¿Se necesita cambiar de tarjeta?

Si te encuentras con el límite de 12 GB, existen tres niveles en la gama de AMD.

Le comparador muestra dos fichas una junto a la otra para ver qué desbloquea realmente la VRAM adicional en un modelo dado.

FAQ

P: ¿Es compatible la RX 6700 XT con ROCm?

No oficialmente. AMD no lista el gfx1031 entre los destinos compatibles con ROCm. En la práctica, Ollama y llama.cpp compilados para ROCm funcionan forzando HSA_OVERRIDE_GFX_VERSION=10.3.0, que presenta la tarjeta como un gfx1030. Si este ajuste causa problemas, el backend Vulkan de llama.cpp ofrece una velocidad similar sin depender de ROCm.

P: ¿Cuál es el tamaño máximo de modelo que cabe en 12 GB?

Un 14B en Q4 o Q5 permanece completamente en VRAM con 8k de contexto. Un 24B o 27B requiere un Q3 agresivo o una transferencia parcial a la CPU, con una caída notable de la velocidad de generación. Los MoE de 30B con 3B activos son el mejor equilibrio por encima de 14B, siempre que se trasladen los expertos a la CPU.

P: ¿Se puede ejecutar DeepSeek R1 671B o Qwen 3 235B en una 6700 XT?

No. DeepSeek R1 671B requiere aproximadamente 400 GB en Q4, Qwen 3 235B-A22B alrededor de 142 GB. Ninguna combinación de RAM + 12 GB de VRAM en un PC de escritorio es suficiente. Los modelos MoE de alrededor de 120B con 6 a 10B activos son el límite absoluto, con 64 GB de RAM y una velocidad de unos pocos tokens por segundo.

P: ¿Windows o Linux para un LLM en una 6700 XT?

Ambos funcionan. En Windows, el backend Vulkan de llama.cpp y las versiones recientes de Ollama evitan tener que instalar ROCm. En Linux, ROCm con la variable de sobrescritura ofrece un procesamiento del prompt un poco más rápido. La diferencia de velocidad de generación se estima en torno al 10 % y no justifica por sí sola un cambio de sistema.

P: ¿Cuánta RAM del sistema se debe prever como complemento?

32 GB bastan para los modelos que caben en la VRAM y para un MoE 30B-A3B con expertos en la CPU. Pasar a 64 GB solo tiene sentido para probar modelos MoE de unos 120B con descarga completa a la RAM del sistema, como Qwen3.8 Flash Next 125B-A6B, a costa de una menor velocidad de generación.

P: ¿Es posible un contexto largo con 12 GB?

Sí, con algunas concesiones. La caché KV de un 8B ocupa aproximadamente 1 GB por bloque de 8k tokens en 16 bits; al cuantizarla a 8 bits, un 8B en Q4 alcanza 32k de contexto en los 12 GB. Un 14B se limita a 16k en las mismas condiciones. Las fichas del catálogo indican el contexto máximo admitido por cada modelo.

Conclusión

Para la consulta 6700xt llm, la respuesta se resume en una frase: un modelo de 7 a 14 mil millones de parámetros en Q4 o Q5, cargado mediante Ollama con el override de ROCm o mediante llama.cpp con Vulkan, se ejecuta íntegramente en VRAM a una velocidad cómoda. Los modelos MoE con expertos transferidos a la RAM amplían las posibilidades, pero la parte superior del catálogo sigue fuera de alcance. Para obtener la lista exacta de modelos compatibles con tus 12 GB, tu RAM y la licencia que buscas, utiliza el configurador quelllm.fr.

El hardware para ejecutar un LLM localmente

Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:

Amazon RTX 5070 Ti →

Enlaces de afiliación — QuéLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.

Artículo publicado y actualizado el por Mohamed Meguedmi · Fuente de datos: /api/models.json · Licencia del contenido: CC BY 4.0.

¿Tienes algún error o alguna actualización que comunicar? Colaborar.