Principiante 11 minRadeon RX 9000

Qué LLM usar en una Radeon RX 9060 XT (8 / 16 GB) ?

Respuesta directa

La RX 9060 XT se puede usar para LLMs locales, siempre que se elija la versión de 16 GB: los mismos 320 GB/s que la de 8 GB según AMD, pero con suficiente memoria para modelos de 12 a 24 mil millones de parámetros en Q4. La versión de 8 GB se limita a modelos de 9 mil millones. Está soportada por ROCm 7 bajo Linux.

La RX 9060 XT es la Radeon RDNA 4 de gama de entrada para la IA local. Esta guía compara sus dos versiones de memoria, indica qué cabe en cada una, muestra el límite de velocidad que permiten sus 320 GB/s y especifica su compatibilidad con Linux y Windows.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.

¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#RX 9060 XT: la versión de 16 GB es la única seria para los LLM

Para ejecutar LLM localmente, elige la Radeon RX 9060 XT en versión de 16 GB. Ambas versiones comparten el mismo procesador gráfico y el mismo ancho de banda de 320 GB/s; solo cambia la capacidad, y es esta la que determina qué puedes cargar. Con 8 GB, estás limitado a modelos de 7 a 9 mil millones de parámetros en Q4, con un contexto corto. Con 16 GB, pasas a modelos de 12 a 24 mil millones de parámetros, a un contexto más largo y a una cuantización más fiel. En el lanzamiento, AMD anunciaba 299 dólares para la versión de 8 GB y 349 dólares para la de 16 GB: una diferencia de 50 dólares para duplicar la memoria.

RX 9060 XT 8 GB y 16 GB según AMD
Característica8 GB16 GB
Memoria8 GB GDDR616 GB GDDR6
Bus de memoria y ancho de banda128 bits, hasta 320 GB/s128 bits, hasta 320 GB/s
Potencia típica de la tarjeta150 W160 W
Fuente de alimentación mínima recomendada450 W450 W
Precio recomendado en Estados Unidos en el momento del lanzamiento (mayo de 2025)299 $349 $

Los precios cambian; para conocer el precio del día y el precio por gigabyte de VRAM, consulta el seguimiento de precios de tarjetas gráficas para IA local. La idea que debes recordar: en una tarjeta económica, el sobreprecio de la versión de 16 GB es pequeño en comparación con las posibilidades que ofrece.

#Compatibilidad con ROCm, Vulkan y Windows

La RX 9060 XT figura en la matriz de compatibilidad de ROCm 7.2.1 para las Radeon, con Ubuntu 22.04, 24.04 y 25.10. Ollama también la incluye entre las tarjetas compatibles con ROCm en Linux, con el controlador ROCm v7. En Linux, la instalación de Ollama con ROCm sigue, por tanto, el mismo procedimiento que con las demás Radeon: la guía de Ollama con GPU AMD detalla los pasos.

En Windows, precaución. La lista de tarjetas que la documentación de Ollama proporciona para ROCm en Windows termina en RX 7000 y no menciona las RX 9000. Ollama indica además que Vulkan ofrece soporte adicional en Windows y Linux, activado por defecto. Una RX 9060 XT puede funcionar bajo Windows mediante Vulkan; verifica con ollama ps que el modelo esté realmente en la GPU y no en el procesador. LM Studio y llama.cpp también ofrecen un backend Vulkan.

i
Un punto que debes verificar tú mismo
El sitio no prueba las tarjetas: la compatibilidad anterior es la anunciada por AMD y Ollama. Después de la instalación, dos comandos son suficientes para confirmar: rocm-smi en Linux para ver la tarjeta, y ollama ps tras una respuesta para leer el porcentaje asignado al GPU.

#Lo que cabe en 8 GB y en 16 GB

Los pesos que se muestran a continuación provienen del catálogo QuelLLM, en Q4 salvo que se indique lo contrario. A estos pesos se añaden la caché KV, que crece con el contexto, y un margen de aproximadamente un gigabyte para el sistema y los búferes. Por tanto, un modelo cuyos pesos ocupan el 100 % de la memoria de la tarjeta es demasiado grande.

Tamaño de los modelos (catálogo QuelLLM) y veredicto por versión
ModeloTamaño del modelo8 GB16 GB
Qwen 3.5 9B Q46 GBCabe justo, con contexto cortoCómodo
Qwen 3.5 9B Q810 GBNoCómodo
Gemma 4 12B Q47 GBDemasiado ajustadoCómodo
Gemma 4 12B Q813 GBNoAjustado
gpt-oss 20B Q413 GBNoSí, contexto moderado
Mistral Small 24B Q414 GBNoMargen ajustado, 2 GB para el contexto
Qwen 3.8 27B Q416 GBNoNo, supera la capacidad

La conclusión práctica cabe en una frase: la tarjeta de 16 GB abre la categoría de 12 a 24 mil millones de parámetros, donde se encuentran modelos claramente más capaces para el razonamiento, el código y el francés. La guía sobre los 16 GB de VRAM proporciona la lista completa, y la de los 8 GB ofrece trucos para aprovechar al máximo la memoria.

#Velocidad esperada: el ancho de banda establece el límite

La generación de texto lee, con cada token, la mayor parte de los pesos del modelo: la velocidad máxima es, por tanto, el ancho de banda dividido por el tamaño de los pesos leídos. Con 320 GB/s, el límite es de aproximadamente 53 tokens por segundo para un Qwen 3.5 9B en Q4 (6 GB), 46 para un Gemma 4 12B (7 GB), 23 para un Mistral Small 24B (14 GB) y aproximadamente 32 para el mismo Qwen 3.5 9B en Q8 (10 GB). Estos valores son límites teóricos que nunca se alcanzan exactamente; los modelos MoE, que solo leen sus pesos activos, escapan en parte a esta limitación.

La única referencia pública comparable es la tabla de la comunidad llama.cpp sobre ROCm: para la RX 9060 XT, un participante registra 1 420 tokens por segundo en la lectura del prompt y 68 en la generación con un Llama 2 7B en Q4_0, sin Flash Attention. Este pequeño modelo es mucho más ligero que los de la tabla anterior. Da una idea del orden de magnitud, pero no de la velocidad de un 12B o un 24B en tu instalación, que variará según el controlador, el sistema y la tarjeta del fabricante.

Límite teórico con un ancho de banda de 320 GB/s (ancho de banda ÷ peso Q4 del catálogo)
ModeloPesos leídos por tokenLímite teórico
Qwen 3.5 9B Q46 GB≈ 53 tokens/s
Qwen 3.5 9B Q810 GB≈ 32 tokens/s
Gemma 4 12B Q47 GB≈ 46 tokens/s
Mistral Small 24B Q414 GB≈ 23 tokens/s
→
Q8 o Q4: el verdadero costo
Pasar de Q4 a Q8 casi duplica la cantidad de pesos leídos por token, por lo que reduce aproximadamente a la mitad el límite de velocidad. En una tarjeta de 320 GB/s, Q4_K_M sigue siendo el mejor equilibrio para el chat; reserva el Q8 para tareas donde la precisión importa más que la fluidez.

#Configurar Ollama para no superar los 16 GB

Con 16 GB, cada gigabyte de margen cuenta. Tres ajustes evitan que el procesamiento pase silenciosamente al procesador, lo que hace caer la velocidad sin ningún mensaje de error. El primero es el tamaño del contexto: la documentación de Ollama indica una ventana predeterminada de 4.096 tokens, modificable con OLLAMA_CONTEXT_LENGTH; cada vez que se duplica el contexto, aumenta la caché KV. El segundo es la propia caché KV, que se puede cuantizar con OLLAMA_KV_CACHE_TYPE (f16 por defecto, q8_0 para reducirla) cuando Flash Attention está activada. El tercero es la comprobación: después de una respuesta, ollama ps muestra la distribución entre GPU y procesador.

Servidor con contexto de 16k y caché KV en q8_0
OLLAMA_CONTEXT_LENGTH=16384 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve
# dans un autre terminal
ollama run <nom-du-modèle>
ollama ps

Un ejemplo de razonamiento: un modelo de 14 GB como Mistral Small 24B en Q4 en una tarjeta de 16 GB deja aproximadamente 2 GB para el contexto, la caché y los búferes. Si ollama ps muestra un reparto entre GPU y procesador, reduce primero el contexto, luego cuantiza la caché KV y después baja un nivel de cuantización, en lugar de dejar que parte del modelo pase a la RAM del sistema. La guía sobre la cuantización de la caché KV detalla el procedimiento.

#Comprar, esperar o buscar 24 GB

Hay tres situaciones posibles. Si ya tienes un ordenador de escritorio reciente y una fuente de alimentación de 450 W o más, la 9060 XT de 16 GB es una forma sencilla de pasar de un uso limitado a modelos pequeños a un uso serio del chat, la traducción y la programación ligera. Si buscas modelos de entre 27 y 35 mil millones de parámetros, ni los 16 GB ni sus 320 GB/s bastan: mira las tarjetas de 24 GB, incluida la guía de la RX 7900 XTX. Si el precio no te permite decidir, compara el coste por gigabyte de VRAM en el seguimiento de precios del sitio: es el criterio adecuado para la IA local.

#Dos RX 9060 XT: ¿32 GB por menos dinero?

La pregunta aparece con frecuencia en las búsquedas. En llama.cpp, el modo de reparto predeterminado divide el modelo por capas entre las tarjetas, en pipeline, y una opción ajusta la proporción por tarjeta. Dos 9060 XT de 16 GB proporcionan 32 GB de VRAM en total con una potencia típica de unos 320 W según AMD, lo que permite cargar un Qwen 3.8 27B en Q4 (16 GB de pesos) con mucho contexto, o un MoE de 30 a 35 mil millones de parámetros (19 a 21 GB).

Hay dos limitaciones que debes conocer. La velocidad por token no se duplica: las tarjetas trabajan una tras otra en cada token, y cada una conserva su ancho de banda de 320 GB/s. Además, la placa base debe ofrecer dos ranuras PCIe utilizables y el equipo debe contar con una caja ventilada. Una sola tarjeta de 24 GB, como la 7900 XTX, ofrece 960 GB/s en un solo bus; si el modelo cabe en ella, genera mucho más rápido.

#FP8: una ventaja sobre el papel, poca repercusión con Ollama

Las Radeon RX 9000 pertenecen a la generación RDNA 4, y AMD indica para la 9060 XT una capacidad de cálculo FP8 de 205 TFLOPs, algo que no menciona la ficha de la RX 7900 XTX. Para un uso habitual con Ollama o LM Studio, este punto importa poco: los modelos en formato GGUF están cuantizados en enteros (Q4, Q5, Q8), no en FP8. Resulta útil con motores que aprovechan pesos FP8, como vLLM, cuya documentación incluye las RX 9000. No lo uses como argumento de compra si sigues usando Ollama.

#RX 9060 XT o RTX 5060 Ti: el duelo con 16 GB

NVIDIA ofrece la RTX 5060 Ti en versiones de 16 GB y de 8 GB, con memoria GDDR7 y un bus de 128 bits, frente a la memoria GDDR6 y el bus de 128 bits de la tarjeta AMD. La memoria más rápida da a NVIDIA la ventaja en ancho de banda y, por tanto, en velocidad de generación; consulta la ficha técnica de NVIDIA para conocer el ancho de banda exacto. La otra ventaja está en el software: CUDA es la plataforma de destino predeterminada de la mayoría de los proyectos de IA.

Criterios de decisión con 16 GB
Tu prioridadOpcionesRazón
Velocidad máxima de generación, CUDA requeridoRTX 5060 Ti 16 GBMemoria GDDR7, ecosistema CUDA
Linux, Ollama o llama.cpp, presupuesto ajustadoRX 9060 XT 16 GBROCm 7 y Vulkan cubren el uso común
Windows, sin ganas de depurarRTX 5060 Ti 16 GBLos controladores y las herramientas más universales
Modelos de más de 16 GBNi una ni la otraBusca 24 GB: RX 7900 XTX o RTX 3090
Presupuesto muy ajustadoRX 9060 XT 8 GBReservar para modelos de 9 mil millones de parámetros
!
No hay recomendación de compra sin conocer el precio del día
Las diferencias de precio entre estas tarjetas cambian cada semana y pueden cambiar la decisión. Compáralas en el seguimiento de precios del sitio antes de decidir.

#Preguntas frecuentes

Preguntas frecuentes
¿RX 9060 XT de 8 GB o de 16 GB para los LLM?+
Elige la de 16 GB. Ambas tienen 320 GB/s de ancho de banda según AMD, pero la de 8 GB se limita a modelos de 9 mil millones de parámetros en Q4 con un contexto corto. La de 16 GB carga Gemma 4 12B, gpt-oss 20B o Mistral Small 24B en Q4. En el momento del lanzamiento, la diferencia entre los precios recomendados era de 50 dólares.
¿Cuántos tokens por segundo da una RX 9060 XT?+
Depende del modelo. El límite teórico es el ancho de banda (320 GB/s) dividido entre los pesos: aproximadamente 53 tokens/s para un 9B en Q4 y 23 para un 24B. Con un Llama 2 7B en Q4_0, un participante en la tabla de llama.cpp registra 68 tokens/s en generación con ROCm.
¿Funciona la RX 9060 XT con Ollama?+
Sí, en Linux: Ollama la incluye entre las tarjetas compatibles con ROCm v7. En Windows, su lista de compatibilidad con ROCm llega hasta las RX 7000, pero Vulkan, activado por defecto, ofrece compatibilidad adicional. Verifica con ollama ps que el modelo esté cargado al 100 % en la GPU.
¿La RX 9060 XT admite FP8?+
La ficha de AMD indica 205 TFLOPs de cálculo matricial FP8, un dato que no aparece en la ficha de la RX 7900 XTX. Ollama y los modelos GGUF en Q4 no lo aprovechan directamente. El FP8 interesa principalmente a vLLM, que incluye las Radeon RX 9000 entre los dispositivos compatibles.
¿Se pueden conectar dos RX 9060 XT para tener 32 GB?+
Sí, con llama.cpp, que por defecto distribuye las capas entre las GPU. Obtienes 32 GB de capacidad, pero no el doble de velocidad: cada tarjeta mantiene sus 320 GB/s y trabaja por turnos. Calcula unos 320 W para las dos tarjetas según AMD, más el consumo del resto del PC.
¿Qué fuente de alimentación para una RX 9060 XT?+
AMD recomienda al menos 450 W para las dos versiones, con un consumo típico de 150 W para la de 8 GB y de 160 W para la de 16 GB. Añade el consumo del procesador y los discos para dimensionar la fuente de alimentación y luego consulta la ficha de tu modelo exacto, ya que algunos fabricantes de tarjetas recomiendan más que el mínimo de AMD.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.