CUDA: ¿qué es y hay que instalarlo para la IA ?
CUDA es la plataforma de software propietaria que NVIDIA lanzó en 2007 para aprovechar sus GPU en cálculos de propósito general, no solo en gráficos. Solo funciona en hardware NVIDIA y sirve de base para casi todo el software de IA. Para la inferencia con Ollama o LM Studio, basta con un controlador NVIDIA actualizado: las bibliotecas CUDA ya están incluidas. El Toolkit completo solo sirve para compilar código a partir del código fuente.
CUDA es la plataforma de software de NVIDIA que permite usar una tarjeta gráfica para cálculos generales, y ya no solo para mostrar imágenes. Lanzada en 2007, solo funciona en hardware de NVIDIA. Casi todos los programas de IA se desarrollan pensando primero en ella, lo que explica que las tarjetas GeForce sean la vía más sencilla para la IA local. A fecha de 20 de septiembre de 2026, sigue existiendo una confusión muy extendida: para ejecutar Ollama o LM Studio, no tienes que «instalar CUDA». Esta página explica qué es CUDA, qué debes instalar realmente y cómo leer los números de versión.
#¿Qué es CUDA?
Una tarjeta gráfica contiene miles de pequeños procesadores diseñados para aplicar la misma operación a muchísimos datos al mismo tiempo, en lugar de realizar una operación compleja cada vez como una CPU. Al principio, solo se podían aprovechar a través de las interfaces gráficas: había que disfrazar un cálculo de imagen para hacerlo pasar por el pipeline 3D. CUDA, siglas de Compute Unified Device Architecture, eliminó ese disfraz desde su lanzamiento en 2007. Un programador escribe código normal, en C, en C++ o invocado desde Python, y este se ejecuta directamente en esos procesadores, sin pasar por el renderizado gráfico.
En el uso común, «CUDA» se refiere a cuatro cosas a la vez: el modelo de programación, el compilador nvcc, la parte del controlador que ejecuta el código y un conjunto de bibliotecas optimizadas como cuBLAS para el álgebra lineal y cuDNN para las redes neuronales. Los frameworks como PyTorch se basan en estas bibliotecas, y las aplicaciones de IA se basan a su vez en los frameworks: se trata de una pila de capas sucesivas, en la que cada capa oculta la complejidad de la que está debajo. Cuando una herramienta anuncia que es «compatible con CUDA», significa concretamente que sus cálculos más exigentes, especialmente las multiplicaciones de matrices y las convoluciones, acaban ejecutándose en estas bibliotecas propietarias de NVIDIA en lugar de en código genérico.
#¿Y los «núcleos CUDA»?
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Es el nombre de marketing que NVIDIA da a los procesadores paralelos de una GPU, sus unidades de cálculo básicas. Una RTX 4060 tiene 3.072 y una RTX 5090 tiene 21.760, casi siete veces más, según las fichas técnicas del fabricante. Más núcleos significan más cálculos por segundo, lo que influye directamente en la generación de imágenes, el entrenamiento de un modelo y la lectura del prompt por un LLM, la fase en la que la GPU debe procesar de una sola vez todo el texto ya escrito.
Esto importa mucho menos para lo que más se nota al usar un LLM a diario: la velocidad de escritura, token tras token. Aquí, el límite es la velocidad a la que se leen los pesos en memoria, no aquella a la que se multiplican una vez leídos. Por eso, una tarjeta con menos núcleos pero con una VRAM de mayor capacidad y más rápida suele escribir más rápido en la práctica que una tarjeta más potente sobre el papel, pero con menor ancho de banda de memoria.
#Controlador, bibliotecas, Toolkit: ¿qué hay que instalar?
| Componente | Qué es | ¿Quién lo necesita? |
|---|---|---|
| Controlador NVIDIA | Conecta el sistema y la tarjeta; contiene la parte de ejecución de CUDA | Todo poseedor de una tarjeta NVIDIA |
| Bibliotecas de ejecución | cuBLAS, cuDNN y otros | Ya incluidas en la mayoría de las aplicaciones y en los paquetes PyTorch: casi nunca las instalas tú mismo |
| CUDA Toolkit | El compilador nvcc, los encabezados, las herramientas de perfilado | Solo quienes compilan código CUDA, por ejemplo llama.cpp a partir del código fuente |
#Leer sus números de versión
Estos dos números son distintos por una razón válida, y el primero confunde a casi todo el mundo. Cuando nvidia-smi muestra «CUDA Version: 13.0», significa que tu controlador puede ejecutar software compilado para CUDA hasta la versión 13.0. No significa que el Toolkit esté instalado. Y el software compilado para una versión más antigua de CUDA funciona sin problemas con un controlador reciente.
#Capacidad de cálculo, generación por generación
Cada GPU NVIDIA tiene un número de «capacidad de cómputo» (compute capability) que identifica su arquitectura y las instrucciones que comprende de forma nativa. Los programas se compilan para capacidades específicas, generalmente un rango de versiones cubiertas por un mismo paquete, y los proyectos abandonan regularmente el soporte de las más antiguas a medida que se actualizan. Es esto, mucho más que la velocidad de cálculo bruta, lo que pone fin a la vida útil de una tarjeta para la IA local: una RTX 2060 sigue funcionando físicamente años después de su compra, pero algunas herramientas recientes no permiten instalarse en ella por falta de código compilado para su generación.
| Generación | Tarjetas | Capacidad de cálculo | Situación de la IA local en 2026 |
|---|---|---|---|
| Pascal | GTX 1060, 1070, 1080 Ti | 6.1 | Ejecuta herramientas basadas en llama.cpp; sin aceleración FP16; abandonada por algunos frameworks recientes |
| Turing | GTX 1660, RTX 2060 a 2080 Ti | 7.5 | Mínimo requerido por vLLM (7.0); buena compatibilidad |
| Ampere | RTX 3050 a 3090 Ti | 8.6 | Compatibilidad plena; incorpora BF16 |
| Ada Lovelace | RTX 4060 a 4090 | 8.9 | Plena compatibilidad; incorpora FP8 |
| Blackwell | RTX 5050 a 5090 | 12.0 | Plenamente compatible con el software reciente; las versiones antiguas deben actualizarse o recompilarse; incorpora FP4 |
La última línea explica la oleada de mensajes «mi RTX 50 no se detecta»: un binario compilado antes de la existencia de esta arquitectura no contiene ningún código para la capacidad 12.0. La solución es una versión más reciente de la herramienta o una versión de PyTorch compilada para una versión reciente de CUDA.
#CUDA frente a ROCm, Metal y Vulkan
| Plataforma | Fabricante | Hardware | Estado para los LLM locales |
|---|---|---|---|
| CUDA | NVIDIA | GPU NVIDIA | La plataforma de referencia: todas las herramientas la admiten primero |
| ROCm | AMD | Radeon recientes e Instinct | Buen funcionamiento en Linux con las tarjetas compatibles; lista de tarjetas más reducida |
| Metal | Apple | Apple Silicon | Excelente con llama.cpp y MLX |
| Vulkan | Khronos, estándar abierto | Casi todas las GPU, incluidas las integradas | Funciona en casi todas las plataformas con llama.cpp; en general es más lento que la solución nativa |
| SYCL / oneAPI | Intel | Intel Arc y GPU integrados | Funcional, ecosistema más reducido |
La ventaja de CUDA no se debe a que las otras plataformas sean incapaces de realizar los cálculos. Se debe a casi veinte años de bibliotecas, herramientas y código probado, desarrollados GPU tras GPU desde 2007 según la página oficial del proyecto. Para la inferencia con las herramientas habituales, la diferencia se ha reducido mucho: llama.cpp funciona en las cinco plataformas, con un rendimiento similar al usar la misma cuantización en hardware comparable. Para el entrenamiento, el fine-tuning y el código de investigación recién publicado en GitHub, en cambio, CUDA sigue siendo la única vía que funciona desde el primer día: casi siempre es la primera plataforma a la que se dirigen, a veces la única, los repositorios que acompañan a un nuevo artículo científico, a menudo varios meses antes de que aparezca una adaptación a las otras plataformas, si es que llega a aparecer algún día.
- Ollama en GPU AMD con ROCm
- llama.cpp con Vulkan, el backend universal
- En Mac: ¿MLX o llama.cpp?
- Fuente: Wikipedia, historia y arquitectura de CUDA
- Fuente: tabla de capacidades de cálculo CUDA por GPU (GPUSmith)
#Lo que cambia al comprar
- Quieres que todo funcione sin tener que solucionar problemas
- Elige una tarjeta NVIDIA y prioriza la capacidad de VRAM sobre el número de núcleos CUDA indicado en la caja: esa capacidad determina si un modelo se puede cargar, no la potencia de cálculo bruta.
- Principalmente ejecutas GGUF en Ollama o LM Studio
- Un Mac con Apple Silicon, o una Radeon reciente en Linux con ROCm, es una opción válida: llama.cpp ofrece un soporte adecuado para ambas plataformas, y apenas pierdes comodidad en el uso diario.
- Piensas hacer fine-tuning, usar vLLM o seguir repositorios de investigación
- La ausencia de CUDA te hará perder tiempo cada semana, entre las dependencias que no se compilan y los notebooks publicados dando por hecho que hay una GPU NVIDIA disponible por defecto.
- Compras una tarjeta de ocasión
- Evita cualquier tarjeta con una capacidad de cómputo inferior a 7.5, independientemente del precio indicado: además de la lentitud, algunos frameworks recientes directamente no permiten su instalación.
#FAQ
¿Qué significa CUDA?+
¿Se necesita instalar CUDA para ejecutar una IA local?+
¿Funciona CUDA en una tarjeta AMD o Intel?+
¿Por qué nvidia-smi y nvcc no muestran la misma versión?+
¿Es mejor tener más núcleos CUDA para un LLM?+
¿Tienen las RTX 50 y las tarjetas Blackwell para centros de datos la misma capacidad de cómputo?+
Hardware recomendado: RTX 5070 Ti 16 GB — tarjeta NVIDIA reciente con 16 GB de VRAM, compatible con CUDA. Todo el hardware de IA →
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.