Avanzado 12 minllama.cpp

llama.cpp con Vulkan (GPU universel)

Vulkan es una API gráfica compatible con distintos fabricantes: funciona en NVIDIA, AMD, Intel Arc e incluso en las iGPU. Compilar llama.cpp con el backend Vulkan permite evitar por completo los problemas de CUDA/ROCm y disponer de una solución que funciona en todas esas plataformas. A cambio, el rendimiento es entre un 10 y un 20 % inferior al de un backend nativo, lo que suele ser un buen compromiso para configuraciones heterogéneas.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué Vulkan?

Vendor-agnostic
El mismo binario funciona en GeForce, Radeon, Arc, Iris. Útil para distribuir una herramienta o probar un modelo antes de comprar una tarjeta.
Instalación sencilla
Los controladores Vulkan están incluidos en los controladores gráficos estándar. No es necesario instalar un Toolkit de varios gigabytes.
Tarjetas antiguas
Una GTX 1060 de 6 GB o una RX 580 funciona mediante Vulkan, incluso cuando CUDA ha dejado de ofrecer soporte o ROCm no admite la tarjeta.
Intel Arc
Las Arc A580/A750/A770 cuentan con un buen soporte mediante Vulkan, mientras que con oneAPI el soporte es menos fiable.

#GPU compatibles

NVIDIA
Toda tarjeta Maxwell+ (GTX 900 y más reciente). Vulkan está soportado en todos los controladores NVIDIA recientes.
AMD
Polaris (RX 400/500), Vega, Navi (RX 5000/6000/7000/9000). Mesa en Linux, drivers oficiales en Windows.
Intel Arc
Alchemist (A380-A770) y Battlemage. Excelente relación rendimiento/precio para la IA local.
iGPU Intel
Xe (Tiger Lake+), Xe2 (Lunar Lake, Arrow Lake). Útil para modelos pequeños en portátiles sin GPU dedicada.

#Prerrequisitos

Ubuntu / Debian
sudo apt update
sudo apt install libvulkan-dev vulkan-tools glslang-tools \
  cmake build-essential git
Fedora
sudo dnf install vulkan-headers vulkan-tools \
  glslang-devel cmake gcc-c++ git
Windows
# Installer le SDK Vulkan LunarG (fournit les headers et shaderc)
winget install KhronosGroup.VulkanSDK
Verificar que Vulkan vea la tarjeta gráfica
vulkaninfo | grep -i "deviceName"
# Doit afficher votre GPU

#1. Compilación

Terminal
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp

cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j

Los shaders Vulkan se compilan durante la compilación. Calcula entre 3 y 8 minutos según la CPU.

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

#2. Probar

Iniciar
./build/bin/llama-cli \
  -m ./models/qwen3.5-9b-q4_k_m.gguf \
  -p "Bonjour" -n 128 -ngl 99

Al iniciar, llama.cpp muestra la GPU detectada mediante Vulkan: ggml_vulkan: Found 1 Vulkan devices: ... Intel(R) Arc(TM) A770. Si tienes varias GPU, usa -mg N (índice de la GPU principal) para elegir.

#3. Rendimiento vs CUDA / ROCm

Tokens/segundo con Qwen 3.5 9B Q4_K_M, con Flash Attention activado (órdenes de magnitud):

RTX 4070 — CUDA nativo
~82 tok/s (referencia)
RTX 4070 — Vulkan
~70 tok/s (-15 %).
RX 7800 XT — ROCm
~56 tok/s.
RX 7800 XT — Vulkan
~48 tok/s (-15 %). A veces el más rápido cuando ROCm se bloquea.
Arc A770 16 GB — Vulkan
~43 tok/s. Mejor relación calidad-precio.
iGPU Intel Xe (Lunar Lake)
~8-13 tok/s. Utilizable para un 2-3B, a duras penas en un 9B.

#¿Cuándo elegir Vulkan?

Tienes una tarjeta Intel Arc
Vulkan > oneAPI en 2026. Rendimiento estable, sin instalaciones exóticas.
ROCm se niega a colaborar
Tarjeta AMD sin compatibilidad oficial, override que falla: Vulkan es el plan B que funciona.
Configuración con varios fabricantes
Una máquina con GeForce + Intel Arc, un portátil con Thunderbolt y una eGPU que puede variar. Vulkan admite todo.
Distribución de una herramienta
Desarrollas una app que debe ejecutarse en máquinas desconocidas: el binario Vulkan es el más compatible.
i
No es para Mac
En macOS, Vulkan pasa por MoltenVK (capa de traducción hacia Metal). Usa en su lugar el backend Metal nativo de llama.cpp — es más rápido.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.