Intermedio 14 minAPU

Ryzen AI Max+ 395 (Strix Halo): 128 GB de memoria para LLM locaux

El Ryzen AI Max+ 395 (nombre en clave Strix Halo) es la APU con la que AMD compite de frente en el terreno de la IA local, hasta ahora dominado por los Mac con memoria unificada y las GPU de 24 GB. Su gran baza: hasta 128 GB de memoria compartida entre CPU, GPU y NPU, cuya inmensa mayoría se puede asignar al modelo. Esta guía ofrece un balance honesto de lo que realmente permite el Ryzen AI Max+ 395 para los LLM: qué modelos de 70B y MoE se vuelven accesibles, a qué velocidad, cómo se compara con las GPU dedicadas y los Mac, y cómo configurarlo con ROCm y Vulkan.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto → · Nuestra ficha mini-PC Ryzen AI Max 128 GB →

Por Samir K.·Actualización 2026-08-27·Probado en Windows, macOS y Linux
Hardware recomendado

Alternativa de compra para esta guía: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliación — posible comisión sin coste adicional para ti. Como socio de Amazon, QuéLLM obtiene beneficios de las compras que cumplen las condiciones requeridas.

#¿Por qué el Ryzen AI Max+ 395 cambia la situación para el LLM local?

Ejecutar un modelo grande en local casi siempre supone toparse con la misma barrera: la memoria de vídeo. Una RTX 4090 tiene un límite de 24 GB y una RTX 5090, de 32 GB; para superar esas capacidades hay que combinar varias tarjetas o recurrir a un Mac Studio. El Ryzen AI Max+ 395 aborda esta barrera desde otro ángulo: en lugar de una VRAM dedicada limitada, comparte una gran reserva de memoria unificada entre la CPU, la GPU integrada y la NPU. En un equipo con 128 GB, se pueden reservar más de 90 GB para la GPU durante la inferencia.

En la práctica, esto abre una categoría de máquinas que no existía en el mundo del PC: mini-PC y portátiles con precios muy variables, cuya capacidad para cargar un modelo de 70B, o incluso mezclas de expertos mucho más grandes, hay que verificar, sin tarjeta gráfica dedicada ni configuración multi-GPU. Es el primer competidor x86 creíble del Mac Studio para la IA local con gran capacidad de memoria.

i
Strix Halo, Ryzen AI Max, Radeon 8060S: ¿de qué estamos hablando?
«Strix Halo» es el nombre en clave de la generación. «Ryzen AI Max+ 395» es el modelo de gama alta de la serie Ryzen AI Max. Su GPU integrada se llama Radeon 8060S. Los tres nombres designan facetas del mismo chip: encontrarás los tres según la ficha de producto que consultes.

#El chip en detalle

El Ryzen AI Max+ 395 es una APU monolítica que combina tres motores de cálculo en un solo die, todos conectados al mismo controlador de memoria. Para el LLM, lo que más importa es la GPU y la memoria, pero el conjunto forma un todo coherente.

CPU — 16 núcleos Zen 5
16 núcleos / 32 hilos Zen 5, útiles para el preprocesamiento, el offload parcial a la CPU y todo lo que no sea la propia inferencia en GPU.
GPU — Radeon 8060S (RDNA 3.5)
40 unidades de cálculo con arquitectura RDNA 3.5. Es la GPU integrada más grande del mercado de PC y se encarga de la inferencia mediante ROCm o Vulkan.
NPU — XDNA 2, ~50 TOPS
Un acelerador de bajo consumo dedicado a la IA. Adecuado para ciertas cargas optimizadas, pero la mayoría de los runtimes de LLM (Ollama, llama.cpp) están orientados hoy a la GPU, no a la NPU.
Memoria — LPDDR5X hasta 128 GB
Bus de 256 bits, LPDDR5X a 8000 MT/s, lo que equivale a unos 256 GB/s de ancho de banda compartido. Memoria unificada entre CPU, GPU y NPU.
!
La memoria está soldada: hay que elegirla al comprar el equipo
La LPDDR5X del Strix Halo está soldada en la placa: no hay módulos SO-DIMM ni posibilidad de ampliar la memoria después. Si buscas modelos de 70B o más, elige desde el principio la variante de 128 GB. Las variantes de 32 o 64 GB limitan las ventajas de la plataforma para los LLM grandes.
i
Por qué este chip es histórico
Desde hace diez años, ejecutar un modelo grande en casa significaba acumular GPU de precios desorbitados para conseguir algo más de VRAM. Strix Halo cambia las reglas del juego: AMD integra 16 núcleos Zen 5, una GPU de la categoría de las RTX 4060-4070 y una NPU de 50 TOPS en torno a un único bloque de memoria de 128 GB; de repente, un modelo de 70B cuantizado cabe entero, mientras que una RTX 5090 que cuesta ≈ 5 700 € a finales de septiembre de 2026 se queda en 32 GB. Es el primer chip de consumo diseñado para la inferencia local, no adaptado a ella.

#Memoria unificada de 128 GB, el verdadero argumento

En una GPU convencional, la VRAM y la RAM del sistema son dos espacios de memoria separados: un modelo que excede la capacidad de la VRAM pasa a la RAM a través de PCIe, y el rendimiento de la inferencia se desploma. En el Ryzen AI Max+ 395, solo hay un único espacio físico de memoria. La GPU accede directamente a la memoria unificada, exactamente como ocurre con la memoria unificada de un Mac Apple Silicon. No hay copias entre dos espacios ni cuellos de botella de PCIe.

La cantidad realmente disponible para el modelo depende del reparto entre la memoria «del sistema» y la memoria «de la GPU». Según el firmware y el sistema operativo, se reserva una parte fija para la GPU (parámetro UMA en la BIOS) y/o se deja que el controlador asigne dinámicamente el resto (GTT en Linux). En la práctica, en una máquina de 128 GB, es habitual poner 96 GB, y a menudo más, a disposición de la GPU para la inferencia.

Un solo pool
128 GB compartidos. Lo que el modelo no utiliza queda disponible para el sistema, y viceversa.
Asignación generosa de GPU
90 GB y más disponibles para los pesos del modelo y el caché de contexto, según la configuración BIOS/controlador.
Sin barrera PCIe
A diferencia de una GPU dedicada que descarga parte del modelo a la RAM, aquí todo cabe en el mismo espacio de memoria de alta velocidad.
Uso cómodo de contextos largos
El margen de memoria permite ventanas de contexto amplias en los casos en que una GPU de 24 GB debe sacrificar el tamaño del modelo o el contexto.

#Qué modelos caben (70B Q4, MoE)

Con unos 90 GB utilizables, el Ryzen AI Max+ 395 cambia por completo la lista de modelos viables frente a una GPU de 16–24 GB. Estos son los niveles concretos, tomando como referencia las cifras habituales de VRAM en Q4: 7B ≈ 5 GB, 14B ≈ 9 GB, 32B ≈ 19 GB, 70B ≈ 40 GB.

70B en Q4_K_M (~40 GB)
Cabe de sobra, con margen para un contexto grande. Es el caso de uso principal: un modelo denso de 70B o equivalente, imposible de ejecutar en una sola RTX 4090.
70B en Q8_0 (~75 GB)
También cabe, casi sin pérdida de calidad. Impensable en una GPU de consumo sin recurrir a varias GPU.
MoE como Qwen 3.6 35B-A3B o GLM 4.7 Flash
Las mezclas de expertos son el escenario ideal: se cargan todos los pesos en memoria (ocupan mucho espacio), pero solo unos pocos miles de millones de parámetros están activos por token, por lo que la velocidad sigue siendo buena.
MoE grandes (200B+ en Q4)
Modelos como Qwen3-235B-A22B en cuantización agresiva pueden caber en 90 GB. La velocidad depende del número de parámetros activos, no del tamaño total.
DeepSeek 671B y similares
Demasiado grandes incluso en Q4 (muy por encima de 100 GB para los pesos). Siguen fuera de alcance sin descarga a disco; opta por un Mac Studio con una capacidad de memoria muy elevada o una estación dedicada a llama.cpp.
→
Los MoE están diseñados para esta máquina
Un modelo denso de 70B lee 40 GB de pesos por cada token: el ancho de banda se convierte en el factor limitante. Un MoE con la misma huella de memoria, pero con solo 3B de parámetros activos, solo lee una fracción de la memoria por token, por lo que funciona mucho más rápido. En Strix Halo, prioriza las arquitecturas MoE cuando la velocidad importe.

#Rendimiento real: el ancho de banda es decisivo

Este es el punto que hay que entender antes de cualquier compra. La generación de tokens de un modelo denso está limitada por el ancho de banda de la memoria, no por la potencia de cálculo bruta. La velocidad máxima teórica se calcula aproximadamente dividiendo el ancho de banda por el tamaño del modelo en memoria.

El Ryzen AI Max+ 395 ofrece aproximadamente 256 GB/s. Un modelo de 70B en Q4 (~40 GB) tiene, por tanto, un límite teórico de unos 6 tokens/s, y en la práctica se observan más bien entre 4 y 5 tokens/s durante la generación: se puede leer, pero no es rápido. En cambio, un MoE 30B-A3B solo lee una pequeña parte de los pesos por token y alcanza fácilmente varias decenas de tokens/s. El preprocesamiento del prompt, por su parte, se apoya en las 40 CU de la GPU y mantiene un rendimiento aceptable.

Modelo denso 70B Q4
≈ 4–5 tok/s en generación. Cómodo para redacción y análisis, lento para chats muy interactivos.
Modelo denso 32B Q4
Mucho más fluido (~19 GB leídos/token), buen equilibrio entre calidad y velocidad para el día a día.
MoE 30B-A3B
Decenas de tok/s: la velocidad depende de los ~3B activos, no de los 30B totales.
Comparación RTX
Una RTX 4090 (~1000 GB/s) supera con creces al Strix Halo en velocidad pura de procesamiento, pero está limitada a 24 GB y simplemente no puede cargar un 70B por sí sola.
i
Capacidad vs. velocidad: el equilibrio adecuado
El Ryzen AI Max+ 395 gana capacidad de memoria, no velocidad. Si tu necesidad es «ejecutar un modelo grande que ninguna tarjeta de 24 GB pueda cargar», es excelente. Si tu necesidad es «máximo de tokens/s en un 7B–14B», un GPU dedicado sigue siendo más rápido y más barato.

#Mini-PC versus portátil versus Mac Studio, el comparativo honesto

El Ryzen AI Max+ 395 se ofrece en varios formatos. La elección depende de la movilidad, la capacidad de mantener la refrigeración y el precio, ya que el chip es el mismo. Frente a él, la referencia a superar sigue siendo el Mac Studio y sus variantes M-Max/Ultra con gran capacidad de memoria unificada.

Mini-PC (p. ej., Framework Desktop, GMKtec EVO-X2)
La mejor relación entre rendimiento sostenido y precio. Refrigeración estable para sesiones largas de inferencia, compacto, silencioso, ideal como servidor doméstico 24/7.
Portátil (por ejemplo, HP ZBook Ultra G1a, Asus ROG Flow Z13)
La misma capacidad de memoria en un equipo portátil, pero con reducción de la frecuencia por motivos térmicos bajo cargas prolongadas y autonomía limitada durante la inferencia. Práctico para trabajar en cualquier lugar, menos para usarlo como servidor.
Mac Studio (M-Max / Ultra)
Ancho de banda de memoria muy superior (varios cientos de GB/s, hasta ~800 GB/s en Ultra) y ecosistema MLX muy optimizado. Más rápido con modelos densos, pero considerablemente más caro con la misma capacidad de memoria.
Mac mini M4 Pro
Menos memoria máxima, pero excelente para modelos de hasta 32B. A tener en cuenta si no necesitas modelos de 70B o más.

En resumen: el Strix Halo gana en precio cuando se necesita una gran capacidad de memoria y en el ecosistema x86/Linux; el Mac Studio gana en velocidad de generación y madurez del software. Para usar modelos de 70B de forma «accesible» sin arruinarse, el Ryzen AI Max+ 395 en un mini-PC de 128 GB es hoy la opción x86 más adecuada.

#Configuración de ROCm y Vulkan en Linux

En Linux, hay dos vías para utilizar la GPU integrada: ROCm (la pila de cálculo de AMD) y Vulkan (portable y a menudo más sencillo de hacer funcionar en esta GPU reciente). El paso clave, común a ambas, es poner suficiente memoria a disposición de la GPU.

  1. 01
    Configurar la asignación de memoria de la GPU en el BIOS
    Entra en el BIOS/UEFI y busca el parámetro UMA Frame Buffer Size (o «Dedicated GPU Memory»). Reserva una parte generosa de la memoria para la GPU. El controlador amdgpu asignará el resto dinámicamente a través de la memoria GTT.
  2. 02
    Verificar la memoria GTT que ve el controlador
    En Linux, la memoria que se puede asignar dinámicamente a la GPU pasa por el mecanismo GTT del controlador amdgpu. Un kernel reciente (6.10+) y un firmware amdgpu actualizado maximizan la parte utilizable para la inferencia.
  3. 03
    Instalar una pila de software orientada a la GPU
    Lo más sencillo es usar una compilación de Ollama o de llama.cpp con backend Vulkan, que detecta el Radeon 8060S sin una configuración compleja de ROCm. Para ROCm, instala el paquete oficial y comprueba que la GPU aparezca en la lista.
  4. 04
    Forzar la arquitectura de destino de la GPU si es necesario
    La tarjeta gráfica integrada no está siempre en la lista oficial de dispositivos compatibles con ROCm, por lo que a veces es necesario indicar la versión de arquitectura GFX mediante una variable de entorno para que Ollama/llama.cpp la reconozca.
  5. 05
    Ejecutar un modelo y verificar el offload
    Inicia un modelo y confirma que se ejecuta realmente en la GPU (y no en la CPU) antes de sacar cualquier conclusión sobre el rendimiento.
Terminal — verificar el GPU y lanzar un modelo
# Vérifier que le GPU AMD est détecté par ROCm
rocminfo | grep -i "gfx"

# Voir l'occupation mémoire du GPU en temps réel
rocm-smi

# Lancer un gros MoE 2026 avec Ollama
ollama run qwen3.6:35b

# Confirmer que le modèle est sur GPU (et pas CPU)
ollama ps
Terminal — forzar el objetivo GFX para ROCm (si no se detecta)
# Le Radeon 8060S (RDNA 3.5) n'est pas toujours reconnu par défaut.
# Indiquez la version GFX pour qu'Ollama accepte le GPU.
export HSA_OVERRIDE_GFX_VERSION=11.0.0
ollama serve
→
Vulkan primero, luego ROCm
En esta plataforma muy reciente, el backend Vulkan de llama.cpp/Ollama suele ser la vía más rápida para que la GPU funcione: menos dependencias y detección automática. Reserva ROCm para afinar el rendimiento una vez que todo funcione. La guía de Vulkan del sitio explica la compilación en detalle.

#Configuración en Windows

En Windows, la experiencia es más «plug and play» en cuanto al controlador, pero la asignación de memoria sigue siendo el punto delicado. La lógica es la misma: asignar suficiente memoria a la GPU y luego usar un runtime que la aproveche.

  1. 01
    Instalar el último controlador AMD Adrenalin
    Utiliza el controlador más reciente para el Ryzen AI Max+ 395: la compatibilidad de la GPU integrada con los LLM y la asignación de memoria mejoran con cada versión. Los controladores recientes exponen una parte importante de la memoria unificada como VRAM.
  2. 02
    Ajustar la memoria gráfica dedicada
    En la BIOS (UMA Frame Buffer Size) o mediante la utilidad de AMD, aumenta la memoria gráfica dedicada para dejar espacio a los modelos grandes. Un ajuste demasiado bajo hará que parte del modelo pase a ejecutarse en la CPU.
  3. 03
    Instalar LM Studio o Ollama
    LM Studio detecta la tarjeta gráfica AMD y propone un backend adecuado; es la opción más sencilla sin línea de comandos. Ollama para Windows también funciona y expone su endpoint en http://localhost:11434.
  4. 04
    Cargar un GGUF y verificar el offload GPU
    En LM Studio, carga un modelo de 70B en Q4 y lleva al máximo el control deslizante de offload a la GPU. Comprueba que las capas estén realmente en la GPU y no en la CPU.
PowerShell — Ollama en Windows
# Vérifier la version d'Ollama
ollama --version

# Lancer un gros MoE 2026 ; l'endpoint local reste sur :11434
ollama run qwen3.6:35b

# Vérifier l'exécution sur GPU
ollama ps
i
Pila recomendada
La combinación más cómoda sigue siendo Ollama (el daemon de inferencia, con un endpoint compatible con OpenAI en :11434) junto con una interfaz como Open WebUI o LM Studio. Aquí no hay nada específico de Strix Halo: una vez que se aprovecha la GPU, el resto del flujo de trabajo es igual que en cualquier otra máquina.

#Solución de problemas y consejos

El modelo funciona en CPU, no en GPU
Comprueba «ollama ps» / «rocm-smi». A menudo, la memoria asignada a la GPU es insuficiente: aumenta el UMA Frame Buffer en la BIOS o comprueba la GTT en Linux.
ROCm no detecta el Radeon 8060S
La GPU integrada RDNA 3.5 no está siempre en la lista oficial. Exporta HSA_OVERRIDE_GFX_VERSION, o cambia al backend Vulkan que la detecta sin sobrecarga.
Generación anormalmente lenta en un 70B denso
Es lo esperable: ~4–5 tok/s es el límite realista a 256 GB/s. Para mayor velocidad, pasa a un modelo MoE o a uno más pequeño: no es un error.
Imposible asignar 90 GB a la GPU
Un firmware del BIOS y un controlador/kernel demasiado antiguos limitan la asignación. Actualiza el BIOS, el controlador Adrenalin (Windows) o el núcleo/firmware amdgpu (Linux).
Un contexto largo que provoca un fallo
La caché KV se suma a los pesos en memoria. Reduce num_ctx o el tamaño del modelo si te acercas al límite de unos 90 GB.

#Las máquinas que incorporan Strix Halo (agosto 2026)

El éxito del chip se refleja en su catálogo: más de una docena de equipos ya lo incorporan, desde el mini-PC con una propuesta agresiva hasta la estación de trabajo de marca, desde la consola portátil hasta la caja modular. Los precios orientativos que figuran a continuación son los observados en agosto de 2026 para las configuraciones de 128 GB: cambian rápidamente.

Máquinas Ryzen AI Max+ 395 disponibles o anunciadas (precios orientativos de agosto de 2026, configuración de 128 GB)
MáquinaFormatoParticularidadPrecio orientativo
Bosgame M5Mini-PCEl más barato del segmento~1 700 $
GMKtec EVO-X2Mini-PC4 salidas 8Kprecio muy variable, pendiente de verificar
Beelink GTR9 ProMini-PCDoble 10 GbE~2 000 $
Framework DesktopChasis modularReparable, de culto entre los desarrolladoresprecio muy variable, pendiente de verificar
Corsair AI Workstation 300SFFMarca establecida, garantía sólida2 000-3 400 $
Minisforum MS-S1 MAXMini-PCRanura PCIe x16: el único equipo ampliable~2 500 $
HP Z2 Mini G1aEstación de trabajo de 2,7 LCon certificación ISV, canal profesional (PRO 395)2 400-3 500 $
Geekom A9 MegaMini-PC2 TB de SSD de fábrica~3 200 $
Peladn YO1Mini-PC de 2,4 litrosVendido para «desplegar un 70B»~1 850 $
Acemagic M1A Pro+Mini-PCHasta 24 TB de almacenamienton.c.
Aoostar NEX395Mini-PCTDP 140 W (el más potente)China; próximamente en la UE
GPD Win 5Consola portátilUn 70B en las manosanunciado
Minix ER939-AIMini-PCVariante doble 10 GbEn.c.

Nuestro consejo de compra se resume en una línea: a igualdad de especificaciones (el chip es el mismo en todos los casos), elige según el precio, la garantía y la refrigeración. Las pruebas de cada máquina se publican progresivamente en nuestra sección Opiniones y pruebas.

#Preguntas frecuentes

¿Los 128 GB de memoria son realmente utilizables para un LLM?+
En gran medida, sí. La memoria es unificada: se pueden asignar hasta 96 GB a la GPU en Windows, y aún más en Linux con los ajustes adecuados. Por tanto, un modelo de 70B con cuantización Q4 (~40 GB) cabe por completo en la memoria de la GPU, con espacio para el contexto.
¿Cuál es el modelo más grande usable en Strix Halo?+
Un modelo de 70B cuantizado funciona cómodamente. AMD ha demostrado hasta ~120 mil millones de parámetros mediante LM Studio al aumentar la asignación de memoria. Más allá, el límite ya no es la capacidad sino la velocidad: el ancho de banda de 256 GB/s hace que la generación sea lenta en modelos densos muy grandes. Los MoE (como GLM o Qwen3-30B-A3B) funcionan especialmente bien en este entorno: pocos parámetros activos, muchos parámetros alojados en memoria.
¿Strix Halo reemplaza a una RTX 5090?+
No: no juegan al mismo juego. La RTX 5090 es mucho más rápida en todo lo que cabe en sus 32 GB. Strix Halo gana en cuanto el modelo supera este límite: ejecuta lo que la 5090 simplemente no puede cargar, con un precio del equipo completo inferior al de la tarjeta por sí sola.
¿Qué máquina Strix Halo elegir?+
Como el chip es idéntico en todos los equipos, los criterios que realmente importan son el precio (el Bosgame M5 es el más competitivo), la garantía y la fiabilidad del servicio posventa (Corsair, HP y Framework inspiran confianza), las posibilidades de ampliación (el Minisforum MS-S1 MAX es el único con una ranura PCIe x16) y la refrigeración. Consulta nuestras reseñas de cada equipo antes de comprar.
¿Windows o Linux para la IA local en Strix Halo?+
Ambos funcionan. Linux ofrece la asignación más generosa de memoria GPU y el mejor rendimiento con llama.cpp/ROCm; Windows es más sencillo con LM Studio, que admite el chip de forma nativa. Nuestra guía de configuración cubre los dos sistemas, sección por sección.

#Para ir más allá

El Ryzen AI Max+ 395 forma parte de una reflexión más amplia sobre el hardware y los modelos para la IA local. Estas guías del sitio amplían el contenido de esta guía:

Elegir tu GPU para IA local
La guía de compra que pone el Strix Halo en perspectiva frente a las RTX y los Mac, según tu presupuesto y los modelos que quieras utilizar.
Ollama con GPU AMD (ROCm)
La configuración detallada de ROCm, útil para sacar el máximo partido al Radeon 8060S una vez que dispongas de la plataforma.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para elegir entre Q4, rápido, y Q8, casi sin pérdida, cuando no falta memoria: exactamente el caso de un equipo de 128 GB.

Los precios cambian rápidamente: nuestro seguimiento registra cada lunes y cada jueves el precio más bajo de las tarjetas gráficas para IA local, junto con el precio por GB de VRAM.

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.