Qué LLM usar en una Radeon RX 9060 XT (8 / 16 GB) ?
La RX 9060 XT se puede usar para LLMs locales, siempre que se elija la versión de 16 GB: los mismos 320 GB/s que la de 8 GB según AMD, pero con suficiente memoria para modelos de 12 a 24 mil millones de parámetros en Q4. La versión de 8 GB se limita a modelos de 9 mil millones. Está soportada por ROCm 7 bajo Linux.
La RX 9060 XT es la Radeon RDNA 4 de gama de entrada para la IA local. Esta guía compara sus dos versiones de memoria, indica qué cabe en cada una, muestra el límite de velocidad que permiten sus 320 GB/s y especifica su compatibilidad con Linux y Windows.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Alternativa de compra para esta guía: Radeon RX 9070 XT 16 GB.
¿Por qué esta elección? Nuestra ficha completa sobre Radeon RX 9070 XT 16 GB →
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#RX 9060 XT: la versión de 16 GB es la única seria para los LLM
Para ejecutar LLM localmente, elige la Radeon RX 9060 XT en versión de 16 GB. Ambas versiones comparten el mismo procesador gráfico y el mismo ancho de banda de 320 GB/s; solo cambia la capacidad, y es esta la que determina qué puedes cargar. Con 8 GB, estás limitado a modelos de 7 a 9 mil millones de parámetros en Q4, con un contexto corto. Con 16 GB, pasas a modelos de 12 a 24 mil millones de parámetros, a un contexto más largo y a una cuantización más fiel. En el lanzamiento, AMD anunciaba 299 dólares para la versión de 8 GB y 349 dólares para la de 16 GB: una diferencia de 50 dólares para duplicar la memoria.
| Característica | 8 GB | 16 GB |
|---|---|---|
| Memoria | 8 GB GDDR6 | 16 GB GDDR6 |
| Bus de memoria y ancho de banda | 128 bits, hasta 320 GB/s | 128 bits, hasta 320 GB/s |
| Potencia típica de la tarjeta | 150 W | 160 W |
| Fuente de alimentación mínima recomendada | 450 W | 450 W |
| Precio recomendado en Estados Unidos en el momento del lanzamiento (mayo de 2025) | 299 $ | 349 $ |
Los precios cambian; para conocer el precio del día y el precio por gigabyte de VRAM, consulta el seguimiento de precios de tarjetas gráficas para IA local. La idea que debes recordar: en una tarjeta económica, el sobreprecio de la versión de 16 GB es pequeño en comparación con las posibilidades que ofrece.
#Compatibilidad con ROCm, Vulkan y Windows
La RX 9060 XT figura en la matriz de compatibilidad de ROCm 7.2.1 para las Radeon, con Ubuntu 22.04, 24.04 y 25.10. Ollama también la incluye entre las tarjetas compatibles con ROCm en Linux, con el controlador ROCm v7. En Linux, la instalación de Ollama con ROCm sigue, por tanto, el mismo procedimiento que con las demás Radeon: la guía de Ollama con GPU AMD detalla los pasos.
En Windows, precaución. La lista de tarjetas que la documentación de Ollama proporciona para ROCm en Windows termina en RX 7000 y no menciona las RX 9000. Ollama indica además que Vulkan ofrece soporte adicional en Windows y Linux, activado por defecto. Una RX 9060 XT puede funcionar bajo Windows mediante Vulkan; verifica con ollama ps que el modelo esté realmente en la GPU y no en el procesador. LM Studio y llama.cpp también ofrecen un backend Vulkan.
#Lo que cabe en 8 GB y en 16 GB
Los pesos que se muestran a continuación provienen del catálogo QuelLLM, en Q4 salvo que se indique lo contrario. A estos pesos se añaden la caché KV, que crece con el contexto, y un margen de aproximadamente un gigabyte para el sistema y los búferes. Por tanto, un modelo cuyos pesos ocupan el 100 % de la memoria de la tarjeta es demasiado grande.
| Modelo | Tamaño del modelo | 8 GB | 16 GB |
|---|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | Cabe justo, con contexto corto | Cómodo |
| Qwen 3.5 9B Q8 | 10 GB | No | Cómodo |
| Gemma 4 12B Q4 | 7 GB | Demasiado ajustado | Cómodo |
| Gemma 4 12B Q8 | 13 GB | No | Ajustado |
| gpt-oss 20B Q4 | 13 GB | No | Sí, contexto moderado |
| Mistral Small 24B Q4 | 14 GB | No | Margen ajustado, 2 GB para el contexto |
| Qwen 3.8 27B Q4 | 16 GB | No | No, supera la capacidad |
La conclusión práctica cabe en una frase: la tarjeta de 16 GB abre la categoría de 12 a 24 mil millones de parámetros, donde se encuentran modelos claramente más capaces para el razonamiento, el código y el francés. La guía sobre los 16 GB de VRAM proporciona la lista completa, y la de los 8 GB ofrece trucos para aprovechar al máximo la memoria.
#Velocidad esperada: el ancho de banda establece el límite
La generación de texto lee, con cada token, la mayor parte de los pesos del modelo: la velocidad máxima es, por tanto, el ancho de banda dividido por el tamaño de los pesos leídos. Con 320 GB/s, el límite es de aproximadamente 53 tokens por segundo para un Qwen 3.5 9B en Q4 (6 GB), 46 para un Gemma 4 12B (7 GB), 23 para un Mistral Small 24B (14 GB) y aproximadamente 32 para el mismo Qwen 3.5 9B en Q8 (10 GB). Estos valores son límites teóricos que nunca se alcanzan exactamente; los modelos MoE, que solo leen sus pesos activos, escapan en parte a esta limitación.
La única referencia pública comparable es la tabla de la comunidad llama.cpp sobre ROCm: para la RX 9060 XT, un participante registra 1 420 tokens por segundo en la lectura del prompt y 68 en la generación con un Llama 2 7B en Q4_0, sin Flash Attention. Este pequeño modelo es mucho más ligero que los de la tabla anterior. Da una idea del orden de magnitud, pero no de la velocidad de un 12B o un 24B en tu instalación, que variará según el controlador, el sistema y la tarjeta del fabricante.
| Modelo | Pesos leídos por token | Límite teórico |
|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | ≈ 53 tokens/s |
| Qwen 3.5 9B Q8 | 10 GB | ≈ 32 tokens/s |
| Gemma 4 12B Q4 | 7 GB | ≈ 46 tokens/s |
| Mistral Small 24B Q4 | 14 GB | ≈ 23 tokens/s |
#Configurar Ollama para no superar los 16 GB
Con 16 GB, cada gigabyte de margen cuenta. Tres ajustes evitan que el procesamiento pase silenciosamente al procesador, lo que hace caer la velocidad sin ningún mensaje de error. El primero es el tamaño del contexto: la documentación de Ollama indica una ventana predeterminada de 4.096 tokens, modificable con OLLAMA_CONTEXT_LENGTH; cada vez que se duplica el contexto, aumenta la caché KV. El segundo es la propia caché KV, que se puede cuantizar con OLLAMA_KV_CACHE_TYPE (f16 por defecto, q8_0 para reducirla) cuando Flash Attention está activada. El tercero es la comprobación: después de una respuesta, ollama ps muestra la distribución entre GPU y procesador.
Un ejemplo de razonamiento: un modelo de 14 GB como Mistral Small 24B en Q4 en una tarjeta de 16 GB deja aproximadamente 2 GB para el contexto, la caché y los búferes. Si ollama ps muestra un reparto entre GPU y procesador, reduce primero el contexto, luego cuantiza la caché KV y después baja un nivel de cuantización, en lugar de dejar que parte del modelo pase a la RAM del sistema. La guía sobre la cuantización de la caché KV detalla el procedimiento.
#Comprar, esperar o buscar 24 GB
Hay tres situaciones posibles. Si ya tienes un ordenador de escritorio reciente y una fuente de alimentación de 450 W o más, la 9060 XT de 16 GB es una forma sencilla de pasar de un uso limitado a modelos pequeños a un uso serio del chat, la traducción y la programación ligera. Si buscas modelos de entre 27 y 35 mil millones de parámetros, ni los 16 GB ni sus 320 GB/s bastan: mira las tarjetas de 24 GB, incluida la guía de la RX 7900 XTX. Si el precio no te permite decidir, compara el coste por gigabyte de VRAM en el seguimiento de precios del sitio: es el criterio adecuado para la IA local.
#Dos RX 9060 XT: ¿32 GB por menos dinero?
La pregunta aparece con frecuencia en las búsquedas. En llama.cpp, el modo de reparto predeterminado divide el modelo por capas entre las tarjetas, en pipeline, y una opción ajusta la proporción por tarjeta. Dos 9060 XT de 16 GB proporcionan 32 GB de VRAM en total con una potencia típica de unos 320 W según AMD, lo que permite cargar un Qwen 3.8 27B en Q4 (16 GB de pesos) con mucho contexto, o un MoE de 30 a 35 mil millones de parámetros (19 a 21 GB).
Hay dos limitaciones que debes conocer. La velocidad por token no se duplica: las tarjetas trabajan una tras otra en cada token, y cada una conserva su ancho de banda de 320 GB/s. Además, la placa base debe ofrecer dos ranuras PCIe utilizables y el equipo debe contar con una caja ventilada. Una sola tarjeta de 24 GB, como la 7900 XTX, ofrece 960 GB/s en un solo bus; si el modelo cabe en ella, genera mucho más rápido.
#FP8: una ventaja sobre el papel, poca repercusión con Ollama
Las Radeon RX 9000 pertenecen a la generación RDNA 4, y AMD indica para la 9060 XT una capacidad de cálculo FP8 de 205 TFLOPs, algo que no menciona la ficha de la RX 7900 XTX. Para un uso habitual con Ollama o LM Studio, este punto importa poco: los modelos en formato GGUF están cuantizados en enteros (Q4, Q5, Q8), no en FP8. Resulta útil con motores que aprovechan pesos FP8, como vLLM, cuya documentación incluye las RX 9000. No lo uses como argumento de compra si sigues usando Ollama.
#RX 9060 XT o RTX 5060 Ti: el duelo con 16 GB
NVIDIA ofrece la RTX 5060 Ti en versiones de 16 GB y de 8 GB, con memoria GDDR7 y un bus de 128 bits, frente a la memoria GDDR6 y el bus de 128 bits de la tarjeta AMD. La memoria más rápida da a NVIDIA la ventaja en ancho de banda y, por tanto, en velocidad de generación; consulta la ficha técnica de NVIDIA para conocer el ancho de banda exacto. La otra ventaja está en el software: CUDA es la plataforma de destino predeterminada de la mayoría de los proyectos de IA.
| Tu prioridad | Opciones | Razón |
|---|---|---|
| Velocidad máxima de generación, CUDA requerido | RTX 5060 Ti 16 GB | Memoria GDDR7, ecosistema CUDA |
| Linux, Ollama o llama.cpp, presupuesto ajustado | RX 9060 XT 16 GB | ROCm 7 y Vulkan cubren el uso común |
| Windows, sin ganas de depurar | RTX 5060 Ti 16 GB | Los controladores y las herramientas más universales |
| Modelos de más de 16 GB | Ni una ni la otra | Busca 24 GB: RX 7900 XTX o RTX 3090 |
| Presupuesto muy ajustado | RX 9060 XT 8 GB | Reservar para modelos de 9 mil millones de parámetros |
- ¿Qué LLM para 16 GB de VRAM? La lista completa
- ¿Qué LLM para 8 GB de VRAM? Consejos y límites
- Ollama con GPU AMD (ROCm): instalación paso a paso
- LLM en RTX 5060 Ti (8 / 16 GB)
- LLM en RX 7900 XTX (24 GB)
- Precios de las tarjetas gráficas para IA local
- Fuente: ficha de AMD de la RX 9060 XT (16 GB)
- Fuente: documentación GPU de Ollama
- Fuente: compatibilidad con ROCm en Radeon
- Fuente: tabla de rendimiento de llama.cpp en ROCm
#Preguntas frecuentes
¿RX 9060 XT de 8 GB o de 16 GB para los LLM?+
¿Cuántos tokens por segundo da una RX 9060 XT?+
¿Funciona la RX 9060 XT con Ollama?+
¿La RX 9060 XT admite FP8?+
¿Se pueden conectar dos RX 9060 XT para tener 32 GB?+
¿Qué fuente de alimentación para una RX 9060 XT?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.