Intermedio 12 minGPU

LLM local en GPU Intel Arc (B580, A770) con Ollama y IPEX-LLM

Ejecutar un LLM local en una GPU Intel Arc no es sencillo: el ecosistema está diseñado para CUDA. Pero con IPEX-LLM y su backend SYCL, la combinación Intel Arc + Ollama se vuelve realmente utilizable, y la relación VRAM/euro de una A770 de 16 GB o una B580 de 12 GB es difícil de superar. Esta guía muestra cómo instalar la pila de software, qué se obtiene concretamente en tokens/segundo y cuáles son los límites reales.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Thomas P.·Actualización 2026-08-27·Probado en Windows, macOS y Linux
Hardware recomendado

Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.

¿Por qué esta elección? Nuestra ficha completa sobre GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

Comparar todas las opciones por presupuesto, de 800 a 3 500 € →

Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.

Cuando te desplazas: qué portátil elegir para la IA local →

Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.

#¿Por qué Intel Arc para IA local?

En 2026, la partida de gasto que determina qué puedes ejecutar es la VRAM. Y es precisamente ahí donde Intel Arc compite con fuerza: la Arc A770 incluye 16 GB de GDDR6 y se encuentra frecuentemente de segunda mano por menos de 300 €, mientras que la nueva Arc B580 (arquitectura Battlemage) ofrece 12 GB por un precio de lanzamiento de alrededor de 250 €. A este precio, ninguna tarjeta NVIDIA nueva ofrece tanta memoria.

La idea es, por tanto, sencilla: la VRAM determina el tamaño del modelo que puedes cargar sin tener que recurrir a la CPU. Con 16 GB, un Qwen 3.5 9B o un Granite 4.2 8B en Q4_K_M caben holgadamente en memoria, y un Gemma 4 12B en Q4 sigue siendo perfectamente viable. La contrapartida está en el software: Intel no tiene CUDA, hay que usar su propia pila oneAPI/SYCL y la biblioteca IPEX-LLM.

i
VRAM y tamaño del modelo
Referencia rápida en Q4_K_M: un modelo 7B ocupa ≈5 GB, un 14B ≈9 GB y un 32B ≈19 GB. Los 16 GB de una A770 permiten ejecutar cómodamente modelos de hasta 14B; los 12 GB de una B580 ofrecen margen suficiente para modelos 7B-8B y permiten ejecutar un 14B con un margen algo justo.

#B580 vs A770: ¿cuál elegir?

Las dos tarjetas no desempeñan exactamente el mismo papel. La B580 es más reciente, más eficiente energéticamente y cuenta con mejor soporte en los controladores actuales, pero su límite es de 12 GB. La A770 es más antigua (Alchemist, 2022) y consume más energía, pero sus 16 GB abren la puerta a modelos más grandes o a un contexto más largo.

Arc B580 (Battlemage)
12 GB GDDR6, ~250 € nueva. Mejor eficiencia y controladores más maduros. La opción adecuada si buscas principalmente modelos 7B-8B rápidos.
Arc A770 (Alchemist)
16 GB GDDR6, a menudo por menos de 300 € de segunda mano. Más VRAM para modelos de 14B y contexto ampliado, a costa de un consumo más alto.
Arc A750 / B570
8 GB / 10 GB: pueden servir como solución provisional para un 7B en Q4 con muy poco margen, pero el margen de VRAM se agota rápidamente. Reservar para presupuestos reducidos.
→
El criterio decisivo
Si tienes dudas, decide en función de la VRAM, no del nombre: los 16 GB (A770) te darán más margen para pasar a modelos 14B y RAG que los 12 GB de una B580, aunque esta última sea más moderna.

#Requisitos de hardware y controladores

Antes de instalar cualquier cosa, asegúrate de partir de una configuración adecuada. Lo más importante es Resizable BAR (ReBAR): en las GPU Arc, no es opcional. Sin él, el rendimiento se desploma y algunas cargas fallan.

  1. 01
    Activar el Resizable BAR
    En el BIOS/UEFI de la placa base, activa «Resizable BAR» (y «Above 4G Decoding»). Es indispensable para que la tarjeta Arc funcione correctamente.
  2. 02
    Actualizar los controladores GPU
    En Windows, instala los últimos controladores Intel Arc (Intel Arc Control). En Linux, usa un kernel reciente (6.2+) con el controlador i915/xe y el entorno de ejecución de cómputo de Intel (intel-opencl-icd, level-zero).
  3. 03
    Verificar la detección
    En Linux, el comando clinfo o sycl-ls debe mostrar tu GPU Arc como dispositivo Level Zero. Esto demuestra que la capa oneAPI detecta correctamente la tarjeta.
Terminal — verificar la tarjeta (Linux)
# Lister les périphériques SYCL visibles par oneAPI
sycl-ls

# Sortie attendue : une ligne [level_zero:gpu] ... Intel(R) Arc(TM) ...
# Si le GPU n'apparaît pas, le compute runtime n'est pas installé.
!
Resizable BAR obligatorio
Es la causa número 1 del bajo rendimiento en Arc. Si tu tasa de tokens/segundo es ridículamente baja o si el modelo se niega a cargarse en la GPU, comprueba ReBAR en la BIOS antes de cualquier otra cosa.

#Instalar IPEX-LLM y el backend SYCL

IPEX-LLM es la biblioteca de Intel que optimiza la inferencia de LLM en sus GPU. Se basa en oneAPI y en el backend SYCL de llama.cpp, y proporciona una versión de Ollama precompilada para Arc. Es esta versión «IPEX-LLM» de Ollama la que hay que usar, no el binario estándar de Ollama, que solo reconoce CUDA/ROCm/Metal.

La vía más sencilla es utilizar el paquete de Python ipex-llm[cpp], que instala el comando init-ollama, encargado de generar los binarios de Ollama vinculados al backend de Intel. Crea un entorno dedicado para no romper nada.

Terminal — instalar IPEX-LLM (conda/Linux)
# Environnement isolé
conda create -n ipex-llm python=3.11 -y
conda activate ipex-llm

# Installer IPEX-LLM avec le backend llama.cpp/Ollama
pip install --pre --upgrade ipex-llm[cpp]

# Générer les binaires Ollama optimisés Intel dans le dossier courant
mkdir ollama-arc && cd ollama-arc
init-ollama

En Windows, Intel también distribuye un archivo comprimido «Ollama portátil» listo para usar: descomprímelo y ejecuta directamente start-ollama.bat, sin instalar Python. Es la opción más rápida para probar.

i
oneAPI ya incluido
Los paquetes recientes de ipex-llm[cpp] incluyen las dependencias de oneAPI necesarias. Por lo general, ya no necesitas instalar por separado oneAPI Base Toolkit ni cargar setvars.sh mediante source para un uso básico de Ollama.

#Iniciar Ollama en Arc

Una vez generados los binarios, se inicia el daemon de Ollama como de costumbre —escucha en http://localhost:11434—, pero configurando algunas variables de entorno que indican a SYCL que utilice la GPU y que transfiera todo el procesamiento a ella.

Terminal — iniciar el servidor
# Sélectionner le GPU Arc via Level Zero
export ONEAPI_DEVICE_SELECTOR=level_zero:0
# Cache de compilation SYCL (accélère les lancements suivants)
export SYCL_CACHE_PERSISTENT=1
# Forcer l'offload de toutes les couches sur le GPU
export OLLAMA_NUM_GPU=999

# Démarrer le daemon (depuis le dossier ollama-arc)
./ollama serve

En un segundo terminal, descarga un modelo e inicia una conversación. Empieza con un modelo pequeño para validar todo el proceso antes de cargar uno de 12B.

Terminal — primer modelo
# Télécharger et lancer un modèle 8-9B en Q4_K_M
./ollama run qwen3.5:9b

# ou un modèle plus léger pour un premier test
./ollama run granite4.2:3b

Con el primer prompt, la compilación de los kernels SYCL introduce un ligero retraso; gracias a SYCL_CACHE_PERSISTENT, los siguientes arranques son mucho más rápidos. Para confirmar que la GPU está trabajando, supervisa su utilización con la herramienta específica de Intel.

Terminal — supervisar el GPU (Linux)
# Occupation et mémoire du GPU Intel en temps réel
sudo xpu-smi dump -d 0 -m 0,1,2

# Alternative légère si xpu-smi n'est pas installé
intel_gpu_top
→
Conectar una interfaz
El daemon expone la API estándar de Ollama en el puerto 11434. Por tanto, puedes conectar Open WebUI o LM Studio a ella exactamente como en una máquina NVIDIA: nada cambia del lado del cliente.

#Tokens/segundo medidos en B580 y A770

Las cifras siguientes son valores aproximados observados en modelos habituales en Q4_K_M, con contexto corto y generación pura (sin incluir el tiempo de carga). Varían según el controlador, la versión de IPEX-LLM y la refrigeración, pero ofrecen una imagen realista de lo que se obtiene.

Granite 4.2 3B (Q4) — B580
≈ 45-55 tok/s. Fluido para chat y tareas rápidas.
Granite 4.2 8B (Q4) — B580
≈ 25-32 tok/s. Cómodo para uso diario como asistente.
Qwen 3.5 9B (Q4) — A770
≈ 20-28 tok/s. Un paso por debajo de la B580 en el formato pequeño, pero muy usable, y con visión incluida.
Gemma 4 12B (Q4) — A770
≈ 11-16 tok/s. Los 16 GB marcan la diferencia: el modelo multimodal cabe sin descargar parte del procesamiento a la CPU.
Gemma 4 12B (Q4) — B580
≈ 9-13 tok/s, al límite de los 12 GB según el contexto; un contexto largo puede forzar un offload y reducir la velocidad.

El veredicto es claro: con los modelos de 8 a 9B, las dos tarjetas ofrecen una experiencia en tiempo real agradable, a menudo comparable a una RTX 3060 de 12 GB. Para los modelos de 12B, la A770 mantiene la ventaja gracias a su VRAM. Como referencia, la RTX 3060 de 12 GB sigue siendo la referencia de gama de entrada de NVIDIA: la Arc compite en esta categoría, no contra una RTX 4080.

i
Procesamiento de prompt
En Arc, el punto débil suele ser la velocidad de procesamiento del prompt (prompt eval), más que la generación. Para RAG con contextos largos, espera un tiempo inicial de «reflexión» más largo que en NVIDIA con la misma VRAM.

#Las limitaciones frente a NVIDIA

Seamos honestos: Arc es una opción económica inteligente, pero sustituir una tarjeta CUDA por ella implica hacer concesiones. Estos son los puntos que debes conocer antes de comprar.

Ecosistema de software
Dependes de IPEX-LLM y del backend SYCL. Algunos proyectos recientes (nuevos runtimes, funcionalidades de llama.cpp) llegan con retraso respecto a CUDA. La versión «estándar» de Ollama no es suficiente.
Cuantizaciones compatibles
Los formatos GGUF clásicos funcionan (Q4_K_M, Q5_K_M, Q8_0, FP16). En cambio, algunas cuantizaciones exóticas o muy recientes pueden no estar optimizadas e incluso acabar ejecutándose en la CPU.
Fine-tuning y frameworks avanzados
El entrenamiento/LoRA es posible mediante IPEX-LLM, pero está mucho menos documentado y dispone de muchas menos herramientas que en NVIDIA. Para un fine-tuning serio, CUDA sigue siendo la mejor vía.
Madurez de los controladores
La situación mejora rápidamente, pero un controlador o una versión de IPEX-LLM puede introducir una regresión. Fija una versión que funcione antes de actualizar a ciegas.
!
Para quién Arc NO es la opción adecuada
Si quieres la máxima compatibilidad, de esas que «funcionan a la primera», hacer fine-tuning intensivo o ejecutar los proyectos de investigación más recientes, sigue con NVIDIA. Arc recompensa a quienes aceptan trastear un poco a cambio de VRAM barata.

#Solución de problemas habituales

El modelo corre en CPU en lugar de en GPU
Verifica ONEAPI_DEVICE_SELECTOR=level_zero:0 y OLLAMA_NUM_GPU=999, y comprueba que sycl-ls muestre la tarjeta en la lista. Tener ReBAR desactivado también puede forzar el uso de la CPU.
Velocidad muy baja a pesar del GPU activo
Casi siempre se debe a que Resizable BAR no está activado en la BIOS. Es lo primero que debes comprobar.
Error «out of memory» con VRAM aparentemente suficiente
El contexto (num_ctx) consume memoria. Reduce la ventana de contexto o pasa a una cuantización más ligera (Q4 en lugar de Q5/Q8).
Primer prompt muy lento; después, velocidad normal
Compilación de los núcleos SYCL. Asegúrate de que la variable SYCL_CACHE_PERSISTENT=1 esté correctamente exportada para no volver a incurrir en este coste en cada ejecución.
El GPU no aparece en sycl-ls
Falta el entorno de ejecución de cómputo: instala intel-opencl-icd y level-zero (Linux), o reinstala los controladores Arc (Windows).

#Para ir más allá

Una vez que Ollama esté operativo en tu Arc, los siguientes pasos son los mismos que en cualquier otra máquina. Estas guías del sitio complementan esta:

Elegir tu cuantización (Q4, Q5, Q8, FP16)
Decisivo en Arc, donde la VRAM es limitada: entender el equilibrio entre calidad y memoria para aprovechar al máximo tus 12 o 16 GB.
Elegir tu GPU para IA local
Comparar Arc con las RTX y los Mac para confirmar que es una compra adecuada para tu uso.
Instalar Ollama: Windows, macOS y Linux
La guía de instalación básica y del uso de la API en el puerto 11434, útil para conectar Open WebUI al sistema que utiliza tu Arc.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.