¿Qué LLM ejecutar en una tarjeta AMD Radeon 6700XT?
La búsqueda «6700xt llm» es frecuente entre quienes tienen una tarjeta de la generación RDNA 2 y quieren un modelo local sin comprar otra GPU. Buena noticia para el dúo 6700xt llm: los 12 GB de GDDR6 de esta tarjeta bastan para modelos de 7 a 14 mil millones de parámetros con cuantización de 4 bits, con una velocidad de generación cómoda para el chat, el código y el resumen de documentos. La limitación principal no es la potencia de cálculo, sino la memoria de vídeo, y el segundo obstáculo es de software: ROCm no ofrece soporte oficial para la RX 6700 XT, lo que obliga a realizar un ajuste o a utilizar el backend Vulkan. Este artículo detalla las especificaciones útiles, la VRAM por cuantización, las velocidades de generación realistas y las licencias; después responde a las preguntas frecuentes antes de orientarte hacia el configurador.
La RX 6700 XT frente a la inferencia local
En teoría, la Radeon RX 6700 XT es una tarjeta gráfica para videojuegos de 2021. Para un LLM, tres cifras son realmente importantes.
- VRAM : 12 GB de GDDR6, bus de 192 bits.
- Ancho de banda de memoria : 384 GB/s. Esta cifra establece el límite de velocidad en tokens/segundo, ya que cada token generado vuelve a leer la totalidad de los pesos activos.
- Arquitectura : RDNA 2, identificador
gfx1031, 40 unidades de cálculo, sin núcleos matriciales dedicados.
A modo de comparación, una tarjeta de 16 GB como la descrita en el guía LLM Radeon RX 6800 XT permite ejecutar modelos de 24B en Q4, y una tarjeta de 24 GB como la RX 7900 XTX alcanza los 32B. La 6700 XT se mantiene en la categoría de 12 GB, la misma que la RTX 3060 12 GB de NVIDIA. La guía dedicada a la RX 6700 XT y la selección mejor LLM para Radeon RX 6700 XT enumeran los modelos del catálogo que caben dentro de este límite de memoria.
VRAM consumida por cuantización: Q4, Q5, Q8, FP16
La regla de cálculo es sencilla: número de parámetros × bytes por parámetro, más la caché KV, que crece con la longitud del contexto. Las magnitudes aproximadas siguientes suponen un contexto de 8 192 tokens y una caché KV de 8 bits; se estiman a partir de los archivos GGUF habituales.
- Modelo de 7 a 8B : Q4 ≈ 5 GB, Q5 ≈ 6 GB, Q8 ≈ 9 GB, FP16 ≈ 16 GB. Todo cabe en 12 GB hasta el Q8 incluido, FP16 excluido.
- Modelo de 12 a 14B : Q4 ≈ 8 a 9 GB, Q5 ≈ 10 GB, Q8 ≈ 15 GB. Q4 y Q5 caben en la VRAM; Q8 necesita alojar parte del modelo en la RAM del sistema.
- Modelo de 24 a 27B : Q4 ≈ 15 a 17 GB. No cabe completamente; un Q3 a 12 GB es posible pero degrada la calidad.
- Modelo MoE 30B con 3B activos : Q4 ≈ 18 GB de pesos, pero solo se leen los expertos activos en cada token. Con los expertos descargados a la CPU, la tasa de procesamiento sigue siendo utilizable.
El punto de inflexión es claro: por encima de 12 GB, llama.cpp y Ollama trasladan las capas restantes al procesador, y la tasa de generación cae por un factor de 5 a 10. El guía «qué LLM para 12 GB de VRAM» detalla las combinaciones de tamaño × cuantización × contexto que permanecen el 100 % en GPU.
Lo que el top del catálogo no podrá ejecutar
Una parte del catálogo de quelllm.fr está fuera del alcance de una 6700 XT, y es mejor decirlo claramente que dar esperanzas de un milagro por software.
- DeepSeek R1 671B : ~400 GB en Q4, licencia MIT. Imposible ejecutarlo en local en un PC de consumo, sea cual sea la tarjeta.
- Qwen 3 235B-A22B : ~142 GB en Q4, Apache 2.0. Fuera de alcance incluso con 128 GB de RAM.
- DeepSeek V4 Flash 284B : ~170 GB en Q4, MIT. Reservado para servidores multi-GPU o para Mac de gama alta con memoria unificada.
- GLM 5.3 Flash 320B-A18B : ~186 GB en Q4, MIT. Mismo veredicto.
El caso límite interesante es el de los modelos MoE de aproximadamente 120B con pocos parámetros activos. Qwen 3.5 122B-A10B pesa ~73 GB en Q4 bajo licencia Apache 2.0, Qwen3.8 Flash Next 125B-A6B ~72 GB con solo 6B activos, y Mistral Small 4 ~72 GB bajo Apache 2.0. Con 64 GB de RAM del sistema y los 12 GB de la tarjeta, llama.cpp puede cargar estos modelos delegando la ejecución de los expertos en la CPU. La velocidad obtenida es de unos pocos tokens por segundo, estimada entre 3 y 8 según la RAM y la CPU, pendiente de confirmación en tu configuración. Es utilizable para procesamiento por lotes durante la noche, pero no para un chat interactivo. Los pesos están publicados en la página de Alibaba en Hugging Face et la página de Mistral en Hugging Face.
Tokens/sec reales y elección del software
En RDNA 2, la velocidad de generación depende tanto del backend como del modelo. Hay dos vías que funcionan.
- Ollama con ROCm : la 6700 XT no está en la lista oficial, pero la variable
HSA_OVERRIDE_GFX_VERSION=10.3.0hace que se reconozca como una tarjeta de la misma familia. El procedimiento completo está en la guía Ollama GPU AMD ROCm ; el repositorio Ollama en GitHub documenta las variables de entorno. - llama.cpp con Vulkan : ningún controlador específico, funciona bajo Windows como bajo Linux. El backend se mantiene en el repositorio de llama.cpp. La generación es similar a ROCm, el procesamiento del prompt es un poco más lento.
- vLLM : no es una opción realista en RDNA 2; la documentación vLLM se centra en las tarjetas para centros de datos y las RDNA 3 recientes.
Órdenes de magnitud medidos por la comunidad en la 6700 XT, por confirmar en tu máquina:
- 8B en Q4_K_M : 35 a 45 tokens/segundo en generación.
- 14B en Q4_K_M : 18 a 25 tokens/segundo.
- MoE 30B-A3B con expertos en CPU : 12 a 20 tokens/segundo, estimado.
- 24B en Q4 con parte del modelo transferida a la RAM del sistema : 4 a 8 tokens/segundo, estimado.
Para una interfaz de chat sobre Ollama, Open WebUI se despliega en un contenedor y gestiona el historial, los documentos y varios modelos.
Licencias y casos de uso concretos
La licencia determina qué puedes hacer con las salidas y si el modelo puede usarse en un producto. El catálogo muestra la licencia de cada ficha; las principales familias de licencias presentes en modelos de tamaños compatibles con 12 GB son Apache 2.0, MIT, Llama Community y algunas licencias propias. El filtro por licencia del catálogo permite excluir de forma inmediata las licencias con cláusulas de restricción comercial.
Lo que hace bien una 6700 XT en el día a día:
- Asistente de código : un modelo de 7 a 14B en Q4 responde lo bastante rápido para autocompletar y revisar código en un editor. Las puntuaciones de HumanEval y LiveCodeBench de las fichas ayudan a decidir entre los candidatos.
- Resumen y RAG sobre documentos privados : el contexto de 8k a 16k cabe en VRAM con un 8B en Q5; más allá, reducir la cuantización de la caché KV.
- Chat en francés preferir modelos cuya ficha indique un puntaje MMLU multilingüe o evaluación en francés, en lugar del puntaje MMLU en inglés solo.
- Procesamiento en lote fuera de línea : clasificación, extracción de campos, reformulación, donde la tasa de procesamiento importa menos que la confidencialidad.
Para comparar puntuaciones entre modelos, el Open LLM Leaderboard sigue siendo la referencia pública, con la reserva habitual: un benchmark mide una tarea precisa, no tu uso.
¿Se necesita cambiar de tarjeta?
Si te encuentras con el límite de 12 GB, existen tres niveles en la gama de AMD.
- 16 GB : RX 6800 XT de segunda mano, RX 7800 XT, o RX 9060 XT nueva. El benchmark de la 9060 XT 16 GB muestra qué aportan 4 GB más y RDNA 4 en los modelos 24B.
- 20 GB : RX 7900 XT, que permite alojar un 27B en Q5.
- 24 GB : RX 7900 XTX, la única tarjeta AMD de consumo que carga un modelo de 32B en Q4 con un contexto útil.
Le comparador muestra dos fichas una junto a la otra para ver qué desbloquea realmente la VRAM adicional en un modelo dado.
FAQ
P: ¿Es compatible la RX 6700 XT con ROCm?
No oficialmente. AMD no lista el gfx1031 entre los destinos compatibles con ROCm. En la práctica, Ollama y llama.cpp compilados para ROCm funcionan forzando HSA_OVERRIDE_GFX_VERSION=10.3.0, que presenta la tarjeta como un gfx1030. Si este ajuste causa problemas, el backend Vulkan de llama.cpp ofrece una velocidad similar sin depender de ROCm.
P: ¿Cuál es el tamaño máximo de modelo que cabe en 12 GB?
Un 14B en Q4 o Q5 permanece completamente en VRAM con 8k de contexto. Un 24B o 27B requiere un Q3 agresivo o una transferencia parcial a la CPU, con una caída notable de la velocidad de generación. Los MoE de 30B con 3B activos son el mejor equilibrio por encima de 14B, siempre que se trasladen los expertos a la CPU.
P: ¿Se puede ejecutar DeepSeek R1 671B o Qwen 3 235B en una 6700 XT?
No. DeepSeek R1 671B requiere aproximadamente 400 GB en Q4, Qwen 3 235B-A22B alrededor de 142 GB. Ninguna combinación de RAM + 12 GB de VRAM en un PC de escritorio es suficiente. Los modelos MoE de alrededor de 120B con 6 a 10B activos son el límite absoluto, con 64 GB de RAM y una velocidad de unos pocos tokens por segundo.
P: ¿Windows o Linux para un LLM en una 6700 XT?
Ambos funcionan. En Windows, el backend Vulkan de llama.cpp y las versiones recientes de Ollama evitan tener que instalar ROCm. En Linux, ROCm con la variable de sobrescritura ofrece un procesamiento del prompt un poco más rápido. La diferencia de velocidad de generación se estima en torno al 10 % y no justifica por sí sola un cambio de sistema.
P: ¿Cuánta RAM del sistema se debe prever como complemento?
32 GB bastan para los modelos que caben en la VRAM y para un MoE 30B-A3B con expertos en la CPU. Pasar a 64 GB solo tiene sentido para probar modelos MoE de unos 120B con descarga completa a la RAM del sistema, como Qwen3.8 Flash Next 125B-A6B, a costa de una menor velocidad de generación.
P: ¿Es posible un contexto largo con 12 GB?
Sí, con algunas concesiones. La caché KV de un 8B ocupa aproximadamente 1 GB por bloque de 8k tokens en 16 bits; al cuantizarla a 8 bits, un 8B en Q4 alcanza 32k de contexto en los 12 GB. Un 14B se limita a 16k en las mismas condiciones. Las fichas del catálogo indican el contexto máximo admitido por cada modelo.
Conclusión
Para la consulta 6700xt llm, la respuesta se resume en una frase: un modelo de 7 a 14 mil millones de parámetros en Q4 o Q5, cargado mediante Ollama con el override de ROCm o mediante llama.cpp con Vulkan, se ejecuta íntegramente en VRAM a una velocidad cómoda. Los modelos MoE con expertos transferidos a la RAM amplían las posibilidades, pero la parte superior del catálogo sigue fuera de alcance. Para obtener la lista exacta de modelos compatibles con tus 12 GB, tu RAM y la licencia que buscas, utiliza el configurador quelllm.fr.
El hardware para ejecutar un LLM localmente
Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:
Enlaces de afiliación — QuéLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene un beneficio de las compras que cumplen los requisitos.