llama.cpp con Vulkan (GPU universel)
Vulkan es una API gráfica compatible con distintos fabricantes: funciona en NVIDIA, AMD, Intel Arc e incluso en las iGPU. Compilar llama.cpp con el backend Vulkan permite evitar por completo los problemas de CUDA/ROCm y disponer de una solución que funciona en todas esas plataformas. A cambio, el rendimiento es entre un 10 y un 20 % inferior al de un backend nativo, lo que suele ser un buen compromiso para configuraciones heterogéneas.
#¿Por qué Vulkan?
- Vendor-agnostic
- El mismo binario funciona en GeForce, Radeon, Arc, Iris. Útil para distribuir una herramienta o probar un modelo antes de comprar una tarjeta.
- Instalación sencilla
- Los controladores Vulkan están incluidos en los controladores gráficos estándar. No es necesario instalar un Toolkit de varios gigabytes.
- Tarjetas antiguas
- Una GTX 1060 de 6 GB o una RX 580 funciona mediante Vulkan, incluso cuando CUDA ha dejado de ofrecer soporte o ROCm no admite la tarjeta.
- Intel Arc
- Las Arc A580/A750/A770 cuentan con un buen soporte mediante Vulkan, mientras que con oneAPI el soporte es menos fiable.
#GPU compatibles
- NVIDIA
- Toda tarjeta Maxwell+ (GTX 900 y más reciente). Vulkan está soportado en todos los controladores NVIDIA recientes.
- AMD
- Polaris (RX 400/500), Vega, Navi (RX 5000/6000/7000/9000). Mesa en Linux, drivers oficiales en Windows.
- Intel Arc
- Alchemist (A380-A770) y Battlemage. Excelente relación rendimiento/precio para la IA local.
- iGPU Intel
- Xe (Tiger Lake+), Xe2 (Lunar Lake, Arrow Lake). Útil para modelos pequeños en portátiles sin GPU dedicada.
#Prerrequisitos
#1. Compilación
Los shaders Vulkan se compilan durante la compilación. Calcula entre 3 y 8 minutos según la CPU.
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
#2. Probar
Al iniciar, llama.cpp muestra la GPU detectada mediante Vulkan: ggml_vulkan: Found 1 Vulkan devices: ... Intel(R) Arc(TM) A770. Si tienes varias GPU, usa -mg N (índice de la GPU principal) para elegir.
#3. Rendimiento vs CUDA / ROCm
Tokens/segundo con Qwen 3.5 9B Q4_K_M, con Flash Attention activado (órdenes de magnitud):
- RTX 4070 — CUDA nativo
- ~82 tok/s (referencia)
- RTX 4070 — Vulkan
- ~70 tok/s (-15 %).
- RX 7800 XT — ROCm
- ~56 tok/s.
- RX 7800 XT — Vulkan
- ~48 tok/s (-15 %). A veces el más rápido cuando ROCm se bloquea.
- Arc A770 16 GB — Vulkan
- ~43 tok/s. Mejor relación calidad-precio.
- iGPU Intel Xe (Lunar Lake)
- ~8-13 tok/s. Utilizable para un 2-3B, a duras penas en un 9B.
#¿Cuándo elegir Vulkan?
- Tienes una tarjeta Intel Arc
- Vulkan > oneAPI en 2026. Rendimiento estable, sin instalaciones exóticas.
- ROCm se niega a colaborar
- Tarjeta AMD sin compatibilidad oficial, override que falla: Vulkan es el plan B que funciona.
- Configuración con varios fabricantes
- Una máquina con GeForce + Intel Arc, un portátil con Thunderbolt y una eGPU que puede variar. Vulkan admite todo.
- Distribución de una herramienta
- Desarrollas una app que debe ejecutarse en máquinas desconocidas: el binario Vulkan es el más compatible.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.