Ollama + GPU AMD (ROCm): configurar Radeon RX 6000 a 9000
AMD estuvo durante mucho tiempo por detrás de CUDA, pero ROCm 6 ha recuperado suficiente terreno como para que las Radeon RX 6000, 7000 y 9000 sean plenamente utilizables para la inferencia de LLM. Esta guía cubre una instalación limpia, la configuración de Ollama y el ajuste forzado (override) que permite utilizar tarjetas que no figuran en la lista oficial.
#¿Por qué ROCm?
Para usar la GPU AMD, Ollama (que se basa en llama.cpp) debe utilizar ROCm, el equivalente de CUDA para AMD. Sin ROCm, la tarjeta no es visible para la inferencia y todo se ejecuta en la CPU.
#Tarjetas oficialmente compatibles
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
- RX 7900 XTX / XT / GRE
- gfx1100. Soporte oficial. Aproximadamente el 80 % del rendimiento de una RTX 4080.
- RX 7800 / 7700 XT
- gfx1101. Soporte oficial desde ROCm 6.1.
- RX 6900 / 6800 / 6700 XT
- gfx1030/1031. Soporte oficial para las tarjetas grandes, ajuste manual (override) para las pequeñas.
- Instinct MI200 / MI300
- Tarjetas para centros de datos. Soporte nativo completo.
#1. Instalar ROCm
Las dos distribuciones mejor soportadas son Ubuntu 22.04/24.04 y RHEL/Fedora. Las versiones Debian, Arch y similares requieren ajustes adicionales.
#2. Ollama y ROCm
Ollama 0.3+ detecta automáticamente ROCm. Si instalaste Ollama ANTES de ROCm, reinstálalo: el script detectará entonces la GPU AMD e instalará las bibliotecas correctas.
#3. Forzar el uso de una tarjeta no admitida
Si rocminfo no muestra tu GPU, o si Ollama sigue usando la CPU, la variable HSA_OVERRIDE_GFX_VERSION obliga a ROCm a fingir.
- RX 6600 / 6700
- HSA_OVERRIDE_GFX_VERSION=10.3.0
- RX 5700 XT
- HSA_OVERRIDE_GFX_VERSION=10.1.0 (soporte inestable)
- RX 6800 / 6900
- Compatibilidad nativa, sin necesidad de aplicar un override.
#4. Rendimiento esperado
Con Qwen 3.5 9B Q4_K_M (6,6 GB, la opción de referencia para 8 GB en 2026), estas son las cifras aproximadas en tokens/segundo durante la inferencia:
- RX 7900 XTX (24 GB)
- ~90 tok/s. Comparable a una RTX 4080.
- RX 7800 XT (16 GB)
- ~62 tok/s. Entre RTX 4070 y 4070 Ti.
- RX 6900 XT (16 GB)
- ~52 tok/s. Equivalente a RTX 3080 10 GB.
- RX 6700 XT (12 GB, override)
- ~33 tok/s. Entre RTX 3060 y 3060 Ti.
#Solución de problemas
- rocminfo está vacío
- Los controladores no están instalados o el usuario no pertenece al grupo render. Comprueba groups $USER.
- Ollama utiliza el CPU a pesar de ROCm
- A menudo hay incompatibilidad de arquitectura. Prueba el HSA_OVERRIDE correspondiente a la generación superior.
- Crash con modelos grandes (OOM)
- rocm-smi para ver la VRAM consumida. Si superas el límite, reduce num_ctx o cambia a Q3_K_M.
- Versión de ROCm incompatible con Ollama
- Ollama empaquetado para ROCm 6.x. ROCm 5 no funciona. Actualiza.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.