Principiante 10 minConceptos

CUDA: ¿qué es y hay que instalarlo para la IA ?

Respuesta directa

CUDA es la plataforma de software propietaria que NVIDIA lanzó en 2007 para aprovechar sus GPU en cálculos de propósito general, no solo en gráficos. Solo funciona en hardware NVIDIA y sirve de base para casi todo el software de IA. Para la inferencia con Ollama o LM Studio, basta con un controlador NVIDIA actualizado: las bibliotecas CUDA ya están incluidas. El Toolkit completo solo sirve para compilar código a partir del código fuente.

CUDA es la plataforma de software de NVIDIA que permite usar una tarjeta gráfica para cálculos generales, y ya no solo para mostrar imágenes. Lanzada en 2007, solo funciona en hardware de NVIDIA. Casi todos los programas de IA se desarrollan pensando primero en ella, lo que explica que las tarjetas GeForce sean la vía más sencilla para la IA local. A fecha de 20 de septiembre de 2026, sigue existiendo una confusión muy extendida: para ejecutar Ollama o LM Studio, no tienes que «instalar CUDA». Esta página explica qué es CUDA, qué debes instalar realmente y cómo leer los números de versión.

Por Mohamed Meguedmi·Actualización 2026-09-28·Probado en Windows, macOS y Linux

#¿Qué es CUDA?

Una tarjeta gráfica contiene miles de pequeños procesadores diseñados para aplicar la misma operación a muchísimos datos al mismo tiempo, en lugar de realizar una operación compleja cada vez como una CPU. Al principio, solo se podían aprovechar a través de las interfaces gráficas: había que disfrazar un cálculo de imagen para hacerlo pasar por el pipeline 3D. CUDA, siglas de Compute Unified Device Architecture, eliminó ese disfraz desde su lanzamiento en 2007. Un programador escribe código normal, en C, en C++ o invocado desde Python, y este se ejecuta directamente en esos procesadores, sin pasar por el renderizado gráfico.

En el uso común, «CUDA» se refiere a cuatro cosas a la vez: el modelo de programación, el compilador nvcc, la parte del controlador que ejecuta el código y un conjunto de bibliotecas optimizadas como cuBLAS para el álgebra lineal y cuDNN para las redes neuronales. Los frameworks como PyTorch se basan en estas bibliotecas, y las aplicaciones de IA se basan a su vez en los frameworks: se trata de una pila de capas sucesivas, en la que cada capa oculta la complejidad de la que está debajo. Cuando una herramienta anuncia que es «compatible con CUDA», significa concretamente que sus cálculos más exigentes, especialmente las multiplicaciones de matrices y las convoluciones, acaban ejecutándose en estas bibliotecas propietarias de NVIDIA en lugar de en código genérico.

#¿Y los «núcleos CUDA»?

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Es el nombre de marketing que NVIDIA da a los procesadores paralelos de una GPU, sus unidades de cálculo básicas. Una RTX 4060 tiene 3.072 y una RTX 5090 tiene 21.760, casi siete veces más, según las fichas técnicas del fabricante. Más núcleos significan más cálculos por segundo, lo que influye directamente en la generación de imágenes, el entrenamiento de un modelo y la lectura del prompt por un LLM, la fase en la que la GPU debe procesar de una sola vez todo el texto ya escrito.

Esto importa mucho menos para lo que más se nota al usar un LLM a diario: la velocidad de escritura, token tras token. Aquí, el límite es la velocidad a la que se leen los pesos en memoria, no aquella a la que se multiplican una vez leídos. Por eso, una tarjeta con menos núcleos pero con una VRAM de mayor capacidad y más rápida suele escribir más rápido en la práctica que una tarjeta más potente sobre el papel, pero con menor ancho de banda de memoria.

#Controlador, bibliotecas, Toolkit: ¿qué hay que instalar?

ComponenteQué es¿Quién lo necesita?
Controlador NVIDIAConecta el sistema y la tarjeta; contiene la parte de ejecución de CUDATodo poseedor de una tarjeta NVIDIA
Bibliotecas de ejecucióncuBLAS, cuDNN y otrosYa incluidas en la mayoría de las aplicaciones y en los paquetes PyTorch: casi nunca las instalas tú mismo
CUDA ToolkitEl compilador nvcc, los encabezados, las herramientas de perfiladoSolo quienes compilan código CUDA, por ejemplo llama.cpp a partir del código fuente
→
En pocas palabras
Para Ollama, LM Studio, ComfyUI Desktop o un simple pip install torch: actualiza el controlador y listo. Instalar el Toolkit de varios gigabytes «por si acaso» es el paso innecesario más frecuente en los tutoriales de IA local.

#Leer sus números de versión

Dos comandos, dos datos diferentes
nvidia-smi        # version du pilote, et version MAXIMALE de CUDA qu'il sait exécuter
nvcc --version    # version du Toolkit, s'il est installé

Estos dos números son distintos por una razón válida, y el primero confunde a casi todo el mundo. Cuando nvidia-smi muestra «CUDA Version: 13.0», significa que tu controlador puede ejecutar software compilado para CUDA hasta la versión 13.0. No significa que el Toolkit esté instalado. Y el software compilado para una versión más antigua de CUDA funciona sin problemas con un controlador reciente.

i
CUDA 13 cambió una costumbre
Para CUDA 13.x, NVIDIA exige un controlador de la versión 580 o superior, según sus notas de versión oficiales. Además, desde esa misma versión 13.0, el controlador de pantalla de Windows ya no se incluye en el paquete del Toolkit: ahora hay que instalarlo por separado desde el sitio de NVIDIA. Esto es una causa frecuente de fallos de compilación entre quienes reutilizan un paquete antiguo del Toolkit descargado antes de este cambio.

#Capacidad de cálculo, generación por generación

Cada GPU NVIDIA tiene un número de «capacidad de cómputo» (compute capability) que identifica su arquitectura y las instrucciones que comprende de forma nativa. Los programas se compilan para capacidades específicas, generalmente un rango de versiones cubiertas por un mismo paquete, y los proyectos abandonan regularmente el soporte de las más antiguas a medida que se actualizan. Es esto, mucho más que la velocidad de cálculo bruta, lo que pone fin a la vida útil de una tarjeta para la IA local: una RTX 2060 sigue funcionando físicamente años después de su compra, pero algunas herramientas recientes no permiten instalarse en ella por falta de código compilado para su generación.

Tarjetas procedentes de la base de datos de hardware de QuelLLM · 20/09/2026
GeneraciónTarjetasCapacidad de cálculoSituación de la IA local en 2026
PascalGTX 1060, 1070, 1080 Ti6.1Ejecuta herramientas basadas en llama.cpp; sin aceleración FP16; abandonada por algunos frameworks recientes
TuringGTX 1660, RTX 2060 a 2080 Ti7.5Mínimo requerido por vLLM (7.0); buena compatibilidad
AmpereRTX 3050 a 3090 Ti8.6Compatibilidad plena; incorpora BF16
Ada LovelaceRTX 4060 a 40908.9Plena compatibilidad; incorpora FP8
BlackwellRTX 5050 a 509012.0Plenamente compatible con el software reciente; las versiones antiguas deben actualizarse o recompilarse; incorpora FP4

La última línea explica la oleada de mensajes «mi RTX 50 no se detecta»: un binario compilado antes de la existencia de esta arquitectura no contiene ningún código para la capacidad 12.0. La solución es una versión más reciente de la herramienta o una versión de PyTorch compilada para una versión reciente de CUDA.

!
La trampa de «Blackwell»: dos familias incompatibles bajo el mismo nombre
NVIDIA vende dos chips distintos bajo el nombre Blackwell, y confundirlos hace que una instalación deje de funcionar. Las GeForce RTX 50 de consumo utilizan la capacidad de cómputo 12.x (sm_120). Las tarjetas B100 y B200 para centros de datos utilizan la capacidad 10.x (sm_100). Son dos familias distintas: un binario compilado para sm_100 no se ejecuta en una RTX 5090, y viceversa. Si un tutorial de fine-tuning menciona «Blackwell» sin especificar sm_120 o sm_100, compruébalo antes de instalar un paquete precompilado: es una fuente frecuente de errores «no kernel image is available» en las tarjetas de consumo más recientes.

#CUDA frente a ROCm, Metal y Vulkan

PlataformaFabricanteHardwareEstado para los LLM locales
CUDANVIDIAGPU NVIDIALa plataforma de referencia: todas las herramientas la admiten primero
ROCmAMDRadeon recientes e InstinctBuen funcionamiento en Linux con las tarjetas compatibles; lista de tarjetas más reducida
MetalAppleApple SiliconExcelente con llama.cpp y MLX
VulkanKhronos, estándar abiertoCasi todas las GPU, incluidas las integradasFunciona en casi todas las plataformas con llama.cpp; en general es más lento que la solución nativa
SYCL / oneAPIIntelIntel Arc y GPU integradosFuncional, ecosistema más reducido

La ventaja de CUDA no se debe a que las otras plataformas sean incapaces de realizar los cálculos. Se debe a casi veinte años de bibliotecas, herramientas y código probado, desarrollados GPU tras GPU desde 2007 según la página oficial del proyecto. Para la inferencia con las herramientas habituales, la diferencia se ha reducido mucho: llama.cpp funciona en las cinco plataformas, con un rendimiento similar al usar la misma cuantización en hardware comparable. Para el entrenamiento, el fine-tuning y el código de investigación recién publicado en GitHub, en cambio, CUDA sigue siendo la única vía que funciona desde el primer día: casi siempre es la primera plataforma a la que se dirigen, a veces la única, los repositorios que acompañan a un nuevo artículo científico, a menudo varios meses antes de que aparezca una adaptación a las otras plataformas, si es que llega a aparecer algún día.

#Lo que cambia al comprar

Quieres que todo funcione sin tener que solucionar problemas
Elige una tarjeta NVIDIA y prioriza la capacidad de VRAM sobre el número de núcleos CUDA indicado en la caja: esa capacidad determina si un modelo se puede cargar, no la potencia de cálculo bruta.
Principalmente ejecutas GGUF en Ollama o LM Studio
Un Mac con Apple Silicon, o una Radeon reciente en Linux con ROCm, es una opción válida: llama.cpp ofrece un soporte adecuado para ambas plataformas, y apenas pierdes comodidad en el uso diario.
Piensas hacer fine-tuning, usar vLLM o seguir repositorios de investigación
La ausencia de CUDA te hará perder tiempo cada semana, entre las dependencias que no se compilan y los notebooks publicados dando por hecho que hay una GPU NVIDIA disponible por defecto.
Compras una tarjeta de ocasión
Evita cualquier tarjeta con una capacidad de cómputo inferior a 7.5, independientemente del precio indicado: además de la lentitud, algunos frameworks recientes directamente no permiten su instalación.

#FAQ

¿Qué significa CUDA?+
Compute Unified Device Architecture. NVIDIA la lanzó en 2007 para que sus GPU pudieran programarse para tareas de propósito general, con lenguajes como C, C++ o Python, y no solo controlarse a través de una interfaz gráfica. Esta transición hizo posible, una década después, el auge del deep learning en tarjetas gráficas, ya que antes había que disfrazar cada cálculo de operación de visualización para ejecutarlo en una GPU.
¿Se necesita instalar CUDA para ejecutar una IA local?+
En general, no. Ollama, LM Studio y las aplicaciones similares ya incluyen las bibliotecas CUDA que necesitan para la inferencia: basta con un controlador NVIDIA actualizado, sin descargar nada más. El CUDA Toolkit completo, que ocupa varios gigabytes, solo es necesario para compilar software a partir de su código fuente, por ejemplo llama.cpp con la aceleración GPU activada manualmente.
¿Funciona CUDA en una tarjeta AMD o Intel?+
No, nunca: CUDA es una tecnología propietaria que solo funciona en hardware NVIDIA, por decisión comercial del fabricante. El equivalente en AMD se llama ROCm; en Apple, Metal; en Intel, oneAPI. Vulkan sigue siendo la opción para hardware de distintos fabricantes, compatible con la mayoría de las herramientas basadas en llama.cpp, incluso en hardware más antiguo o GPU integradas.
¿Por qué nvidia-smi y nvcc no muestran la misma versión?+
nvidia-smi indica la versión máxima de CUDA que el controlador instalado sabe ejecutar, no la que realmente está instalada en la máquina. nvcc, por su parte, indica la versión del Toolkit de CUDA realmente presente, si lo hay. Ambos números son independientes, y un software compilado para una versión más antigua de CUDA continúa funcionando sin problemas con un controlador más reciente.
¿Es mejor tener más núcleos CUDA para un LLM?+
Esto acelera sobre todo la lectura del prompt y la generación de imágenes, dos tareas que requieren mucha capacidad de cálculo. La velocidad de escritura de un LLM, lo que más se percibe al usarlo, depende más bien de la capacidad y del ancho de banda de la memoria de la tarjeta: para los modelos de lenguaje locales, la VRAM suele importar más que el número bruto de núcleos CUDA anunciado.
¿Tienen las RTX 50 y las tarjetas Blackwell para centros de datos la misma capacidad de cómputo?+
No, y esta confusión hace que las instalaciones fallen con frecuencia. Las GeForce RTX 50 de consumo utilizan la capacidad de cómputo 12.x (sm_120); las tarjetas para centros de datos B100 y B200 utilizan la 10.x (sm_100). Un binario o un paquete precompilado para una no se ejecuta en la otra: conviene comprobar cualquier tutorial de fine-tuning que mencione solo «Blackwell» sin especificar cuál antes de instalar nada.

Hardware recomendado: RTX 5070 Ti 16 GB — tarjeta NVIDIA reciente con 16 GB de VRAM, compatible con CUDA. Todo el hardware de IA →

¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.