LLM local en GPU Intel Arc (B580, A770) con Ollama y IPEX-LLM
Ejecutar un LLM local en una GPU Intel Arc no es sencillo: el ecosistema está diseñado para CUDA. Pero con IPEX-LLM y su backend SYCL, la combinación Intel Arc + Ollama se vuelve realmente utilizable, y la relación VRAM/euro de una A770 de 16 GB o una B580 de 12 GB es difícil de superar. Esta guía muestra cómo instalar la pila de software, qué se obtiene concretamente en tokens/segundo y cuáles son los límites reales.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
Buena relación calidad-precio para la IA local: un GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
Un mini-PC es una máquina completa: verifica la memoria disponible y la compatibilidad del motor. No sustituye a macOS/MLX o CUDA.
Comparar todas las opciones por presupuesto, de 800 a 3 500 € →
Presupuesto ajustado: RTX 5060 · Modelos grandes: RTX 5090 · Mac Studio.
Cuando te desplazas: qué portátil elegir para la IA local →
Enlaces de afiliados — posible comisión sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.
#¿Por qué Intel Arc para IA local?
En 2026, la partida de gasto que determina qué puedes ejecutar es la VRAM. Y es precisamente ahí donde Intel Arc compite con fuerza: la Arc A770 incluye 16 GB de GDDR6 y se encuentra frecuentemente de segunda mano por menos de 300 €, mientras que la nueva Arc B580 (arquitectura Battlemage) ofrece 12 GB por un precio de lanzamiento de alrededor de 250 €. A este precio, ninguna tarjeta NVIDIA nueva ofrece tanta memoria.
La idea es, por tanto, sencilla: la VRAM determina el tamaño del modelo que puedes cargar sin tener que recurrir a la CPU. Con 16 GB, un Qwen 3.5 9B o un Granite 4.2 8B en Q4_K_M caben holgadamente en memoria, y un Gemma 4 12B en Q4 sigue siendo perfectamente viable. La contrapartida está en el software: Intel no tiene CUDA, hay que usar su propia pila oneAPI/SYCL y la biblioteca IPEX-LLM.
#B580 vs A770: ¿cuál elegir?
Las dos tarjetas no desempeñan exactamente el mismo papel. La B580 es más reciente, más eficiente energéticamente y cuenta con mejor soporte en los controladores actuales, pero su límite es de 12 GB. La A770 es más antigua (Alchemist, 2022) y consume más energía, pero sus 16 GB abren la puerta a modelos más grandes o a un contexto más largo.
- Arc B580 (Battlemage)
- 12 GB GDDR6, ~250 € nueva. Mejor eficiencia y controladores más maduros. La opción adecuada si buscas principalmente modelos 7B-8B rápidos.
- Arc A770 (Alchemist)
- 16 GB GDDR6, a menudo por menos de 300 € de segunda mano. Más VRAM para modelos de 14B y contexto ampliado, a costa de un consumo más alto.
- Arc A750 / B570
- 8 GB / 10 GB: pueden servir como solución provisional para un 7B en Q4 con muy poco margen, pero el margen de VRAM se agota rápidamente. Reservar para presupuestos reducidos.
#Requisitos de hardware y controladores
Antes de instalar cualquier cosa, asegúrate de partir de una configuración adecuada. Lo más importante es Resizable BAR (ReBAR): en las GPU Arc, no es opcional. Sin él, el rendimiento se desploma y algunas cargas fallan.
- 01Activar el Resizable BAREn el BIOS/UEFI de la placa base, activa «Resizable BAR» (y «Above 4G Decoding»). Es indispensable para que la tarjeta Arc funcione correctamente.
- 02Actualizar los controladores GPUEn Windows, instala los últimos controladores Intel Arc (Intel Arc Control). En Linux, usa un kernel reciente (6.2+) con el controlador i915/xe y el entorno de ejecución de cómputo de Intel (intel-opencl-icd, level-zero).
- 03Verificar la detecciónEn Linux, el comando clinfo o sycl-ls debe mostrar tu GPU Arc como dispositivo Level Zero. Esto demuestra que la capa oneAPI detecta correctamente la tarjeta.
#Instalar IPEX-LLM y el backend SYCL
IPEX-LLM es la biblioteca de Intel que optimiza la inferencia de LLM en sus GPU. Se basa en oneAPI y en el backend SYCL de llama.cpp, y proporciona una versión de Ollama precompilada para Arc. Es esta versión «IPEX-LLM» de Ollama la que hay que usar, no el binario estándar de Ollama, que solo reconoce CUDA/ROCm/Metal.
La vía más sencilla es utilizar el paquete de Python ipex-llm[cpp], que instala el comando init-ollama, encargado de generar los binarios de Ollama vinculados al backend de Intel. Crea un entorno dedicado para no romper nada.
En Windows, Intel también distribuye un archivo comprimido «Ollama portátil» listo para usar: descomprímelo y ejecuta directamente start-ollama.bat, sin instalar Python. Es la opción más rápida para probar.
#Iniciar Ollama en Arc
Una vez generados los binarios, se inicia el daemon de Ollama como de costumbre —escucha en http://localhost:11434—, pero configurando algunas variables de entorno que indican a SYCL que utilice la GPU y que transfiera todo el procesamiento a ella.
En un segundo terminal, descarga un modelo e inicia una conversación. Empieza con un modelo pequeño para validar todo el proceso antes de cargar uno de 12B.
Con el primer prompt, la compilación de los kernels SYCL introduce un ligero retraso; gracias a SYCL_CACHE_PERSISTENT, los siguientes arranques son mucho más rápidos. Para confirmar que la GPU está trabajando, supervisa su utilización con la herramienta específica de Intel.
#Tokens/segundo medidos en B580 y A770
Las cifras siguientes son valores aproximados observados en modelos habituales en Q4_K_M, con contexto corto y generación pura (sin incluir el tiempo de carga). Varían según el controlador, la versión de IPEX-LLM y la refrigeración, pero ofrecen una imagen realista de lo que se obtiene.
- Granite 4.2 3B (Q4) — B580
- ≈ 45-55 tok/s. Fluido para chat y tareas rápidas.
- Granite 4.2 8B (Q4) — B580
- ≈ 25-32 tok/s. Cómodo para uso diario como asistente.
- Qwen 3.5 9B (Q4) — A770
- ≈ 20-28 tok/s. Un paso por debajo de la B580 en el formato pequeño, pero muy usable, y con visión incluida.
- Gemma 4 12B (Q4) — A770
- ≈ 11-16 tok/s. Los 16 GB marcan la diferencia: el modelo multimodal cabe sin descargar parte del procesamiento a la CPU.
- Gemma 4 12B (Q4) — B580
- ≈ 9-13 tok/s, al límite de los 12 GB según el contexto; un contexto largo puede forzar un offload y reducir la velocidad.
El veredicto es claro: con los modelos de 8 a 9B, las dos tarjetas ofrecen una experiencia en tiempo real agradable, a menudo comparable a una RTX 3060 de 12 GB. Para los modelos de 12B, la A770 mantiene la ventaja gracias a su VRAM. Como referencia, la RTX 3060 de 12 GB sigue siendo la referencia de gama de entrada de NVIDIA: la Arc compite en esta categoría, no contra una RTX 4080.
#Las limitaciones frente a NVIDIA
Seamos honestos: Arc es una opción económica inteligente, pero sustituir una tarjeta CUDA por ella implica hacer concesiones. Estos son los puntos que debes conocer antes de comprar.
- Ecosistema de software
- Dependes de IPEX-LLM y del backend SYCL. Algunos proyectos recientes (nuevos runtimes, funcionalidades de llama.cpp) llegan con retraso respecto a CUDA. La versión «estándar» de Ollama no es suficiente.
- Cuantizaciones compatibles
- Los formatos GGUF clásicos funcionan (Q4_K_M, Q5_K_M, Q8_0, FP16). En cambio, algunas cuantizaciones exóticas o muy recientes pueden no estar optimizadas e incluso acabar ejecutándose en la CPU.
- Fine-tuning y frameworks avanzados
- El entrenamiento/LoRA es posible mediante IPEX-LLM, pero está mucho menos documentado y dispone de muchas menos herramientas que en NVIDIA. Para un fine-tuning serio, CUDA sigue siendo la mejor vía.
- Madurez de los controladores
- La situación mejora rápidamente, pero un controlador o una versión de IPEX-LLM puede introducir una regresión. Fija una versión que funcione antes de actualizar a ciegas.
#Solución de problemas habituales
- El modelo corre en CPU en lugar de en GPU
- Verifica ONEAPI_DEVICE_SELECTOR=level_zero:0 y OLLAMA_NUM_GPU=999, y comprueba que sycl-ls muestre la tarjeta en la lista. Tener ReBAR desactivado también puede forzar el uso de la CPU.
- Velocidad muy baja a pesar del GPU activo
- Casi siempre se debe a que Resizable BAR no está activado en la BIOS. Es lo primero que debes comprobar.
- Error «out of memory» con VRAM aparentemente suficiente
- El contexto (num_ctx) consume memoria. Reduce la ventana de contexto o pasa a una cuantización más ligera (Q4 en lugar de Q5/Q8).
- Primer prompt muy lento; después, velocidad normal
- Compilación de los núcleos SYCL. Asegúrate de que la variable SYCL_CACHE_PERSISTENT=1 esté correctamente exportada para no volver a incurrir en este coste en cada ejecución.
- El GPU no aparece en sycl-ls
- Falta el entorno de ejecución de cómputo: instala intel-opencl-icd y level-zero (Linux), o reinstala los controladores Arc (Windows).
#Para ir más allá
Una vez que Ollama esté operativo en tu Arc, los siguientes pasos son los mismos que en cualquier otra máquina. Estas guías del sitio complementan esta:
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Decisivo en Arc, donde la VRAM es limitada: entender el equilibrio entre calidad y memoria para aprovechar al máximo tus 12 o 16 GB.
- Elegir tu GPU para IA local
- Comparar Arc con las RTX y los Mac para confirmar que es una compra adecuada para tu uso.
- Instalar Ollama: Windows, macOS y Linux
- La guía de instalación básica y del uso de la API en el puerto 11434, útil para conectar Open WebUI al sistema que utiliza tu Arc.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.