Stable Diffusion en local: instalación y modelos
Stable Diffusion es una familia de modelos de imagen con pesos abiertos, no una aplicación: se ejecuta en una interfaz local. Para empezar, usa SDXL (archivo de 6,94 GB; 8 GB de VRAM para trabajar con comodidad) en Fooocus, en ComfyUI Desktop o, en Mac, en Draw Things. SD 1.5 es adecuado para tarjetas de poca capacidad; SD 3.5, anunciado el 22 de octubre de 2024, para tarjetas de 12 GB o más. Las familias más recientes, como Flux o Z-Image, se ejecutan principalmente a través de ComfyUI.
Stability AI anunció el lanzamiento público de Stable Diffusion el 22 de agosto de 2022: un modelo que transforma texto en imagen en tu propio ordenador, sin cuenta ni límite de volumen. A fecha del 28 de septiembre de 2026, el nombre abarca tres generaciones de modelos, cuatro o cinco interfaces posibles y licencias que difieren entre sí. Esta guía te ayuda a elegir una versión y una interfaz, a instalarlo todo en Windows, Mac o Linux y a saber qué tienes derecho a hacer con las imágenes.
#Stable Diffusion, ¿qué es?
Stable Diffusion es un modelo de difusión latente. Parte de una imagen de ruido puro y elimina el ruido paso a paso, guiado por tu texto, hasta que aparece una imagen coherente. El cálculo se realiza en un espacio comprimido, llamado latente, lo que explica que baste una tarjeta gráfica de consumo, mientras que los primeros modelos de difusión requerían un centro de cálculo.
Lo que la hizo famosa no fue su calidad bruta sino su apertura. Al lanzarse en 2022, Stability AI eligió una licencia CreativeML OpenRAIL-M, que describe como «permisiva» y que permite tanto usos comerciales como no comerciales: se pueden descargar, modificar y reentrenar los pesos. Existen miles de variantes especializadas. Stable Diffusion no es una aplicación: es un archivo de modelo que ejecutas a través de la interfaz que elijas.
El nombre puede dar lugar a una confusión terminológica. El repositorio de referencia de SD 1.5 en Hugging Face se presenta hoy como un espejo del antiguo repositorio de RunwayML, obsoleto y sin vínculo con esta empresa. Y desde 2024, los modelos de imagen abiertos más comentados provienen de otros laboratorios: Flux, Qwen Image o Z-Image. Funcionan en las mismas interfaces, pero no llevan el nombre Stable Diffusion.
#Las versiones y cuál elegir
Imágenes y vídeos de IA en local, sin límites: ComfyUI, Flux, Z-Image, Wan 2.2 en tu GPU o tu Mac — flujos de trabajo listos para cargar, marco legal incluido.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
| Versión | Fecha de lanzamiento | Archivo principal | Resolución nativa | VRAM holgada | Puntos clave |
|---|---|---|---|---|---|
| SD 1.5 | 2022 | 4,27 GB (v1-5-pruned-emaonly) | 512 × 512 | 4 a 6 GB | Ligero, con una enorme biblioteca de variantes y de LoRA. Los detalles y las manos aún pueden mejorar. |
| SDXL 1.0 | julio de 2023 | 6,94 GB (sd_xl_base_1.0) | 1024 × 1024 | 8 GB: Stability AI anuncia un funcionamiento correcto en tarjetas de 8 GB | Punto de partida adecuado: calidad claramente superior, ecosistema maduro. |
| SD 3.5 | 22 de octubre de 2024 | Medium: 2,5 mil millones de parámetros; Large: 8,1 mil millones; Large Turbo: versión de 4 pasos | Medium: de 0,25 a 2 megapíxeles; Large: 1 megapíxel | Medium: 9,9 GB sin incluir los codificadores de texto (Stability AI). Large: más de 16 GB en 16 bits (nuestro cálculo) | Mejor seguimiento del prompt. Licencia diferente, ver más abajo. |
Dos detalles evitan errores de compra o descarga. Primero, SD 1.5 existe en dos archivos: v1-5-pruned-emaonly.safetensors (4,27 GB), que la ficha del modelo describe como un archivo que utiliza menos VRAM y es adecuado para la inferencia, y v1-5-pruned.safetensors (7,7 GB), destinado al reentrenamiento. Para generar imágenes, elige el primero. Después, SD 3.5 Large, con sus 8,1 mil millones de parámetros, no debe evaluarse a partir de la ficha de Medium: no cuentes con él en una tarjeta de 8 GB.
Si empiezas con una tarjeta de 8 GB, empieza con SDXL: es la mejor relación entre calidad, velocidad y documentación disponible. Con 12 a 16 GB, mira también los modelos recientes de ComfyUI: su README indica soporte nativo para Flux.1, Flux.2, Qwen Image y Z-Image.
#El equipo necesario
| Tu equipo | Lo que funciona bien |
|---|---|
| Tarjeta NVIDIA de 4 a 6 GB (GTX 1660, RTX 2060, RTX 3050) | SD 1.5. Fooocus, bajo SDXL, indica 4 GB de VRAM y 8 GB de RAM como mínimo, basándose en la memoria virtual de Windows: lento, pero posible. |
| Tarjeta NVIDIA de 8 GB (RTX 3060 Ti, RTX 4060, RTX 5060) | SDXL de forma cómoda, umbral anunciado por Stability AI |
| Tarjeta NVIDIA de 12 a 16 GB (RTX 3060 12 GB, RTX 4070, RTX 5070 Ti) | SDXL con LoRA y ampliación, SD 3.5 Medium, Z-Image Turbo (16 GB según su ficha), Flux en FP8 |
| Tarjeta AMD reciente (RX 7000, RX 9000) | Buen rendimiento en Linux con ROCm; en Windows, soporte oficial de ROCm en ComfyUI Desktop desde enero de 2026 |
| Mac Apple Silicon | Cualquier chip M: la memoria unificada hace las veces de VRAM. Más lento que una tarjeta NVIDIA de gama comparable. |
| Sin tarjeta gráfica | Técnicamente posible, pero mucho más lento: reservar para pruebas |
Ten en cuenta también el espacio en disco. Un solo archivo SDXL pesa 6,94 GB, y las colecciones de LoRA y variantes crecen rápido. Fooocus recomienda tener al menos 40 GB libres en cada disco si encuentras el error «RuntimeError: CPUAllocator».
#¿Qué interfaz instalar?
| Interfaz | Para quién | Fortalezas | Límites |
|---|---|---|---|
| Fooocus | Para principiantes | Un campo de texto, un botón, ajustes predeterminados bien pensados; menos de tres clics entre la descarga y la primera imagen, según su README | SDXL exclusivamente: el proyecto tiene soporte a largo plazo limitado, solo correcciones de errores |
| Forge (repositorio de lllyasviel) | Usuarios de la interfaz de pestañas | Interfaz de AUTOMATIC1111, más eficiente en memoria, con soporte de Flux | No hay commits en la rama principal desde junio de 2025; el desarrollo continúa mediante forks como Forge Neo |
| AUTOMATIC1111 | Los que siguen tutoriales antiguos | La interfaz histórica, la más documentada | Última versión publicada en febrero de 2025, sin compatibilidad con Flux |
| ComfyUI | Usuarios avanzados y curiosos | Soporte nativo para modelos recientes, flujos reproductibles, proyecto muy activo | Curva de aprendizaje |
| Draw Things | Mac, iPhone, iPad | Aplicación nativa, edición gratuita que realiza los cálculos en local y sin conexión, entrenamiento de LoRA en el dispositivo | Solo para el ecosistema Apple; hay opciones de pago en la nube, que conviene evitar si quieres mantener un funcionamiento 100 % local. |
- Fooocus: instalarlo y generar tu primera imagen
- ComfyUI: instalación y primeros pasos
- AUTOMATIC1111: instalar Stable Diffusion WebUI
- Panorama: generar imágenes localmente
#El camino más corto por sistema
- 01Windows con una tarjeta NVIDIAEl más rápido: Fooocus. Descarga el archivo desde la página oficial de GitHub, descomprímelo y ejecuta run.bat. En el primer inicio, los modelos se descargan en Fooocus\models\checkpoints. Si buscas una herramienta que se mantenga al día con los nuevos modelos, instala mejor ComfyUI Desktop, recomendado para nuevos usuarios por el README de ComfyUI.
- 02Tarjeta RTX 50: verifica PyTorchLos archivos todo en uno de Forge anuncian CUDA 12.1 y PyTorch 2.3.1 como versión recomendada. Sin embargo, las tarjetas RTX 50 requieren un PyTorch reciente: un colaborador de AUTOMATIC1111 menciona PyTorch 2.7.0 como la primera versión oficial compatible con ellas. En una RTX 50, opta por ComfyUI, cuya documentación requiere CUDA 13.0 para las tarjetas NVIDIA recientes.
- 03Mac Apple SiliconInstala Draw Things desde la App Store: su edición gratuita calcula localmente y sin conexión, sin línea de comandos. No actives sus opciones de nube si quieres que nada salga del Mac. ComfyUI Desktop también existe para macOS en Apple Silicon.
- 04Linux, o tarjeta AMDInstalación manual de ComfyUI: clonación del repositorio, entorno Python y PyTorch en versión CUDA o ROCm según la tarjeta. El procedimiento detallado está en nuestra guía de ComfyUI. Fooocus también ofrece una instalación en Linux mediante Anaconda.
- 05Comprobar que se está utilizando la GPUDurante una generación, el comando nvidia-smi debe mostrar la VRAM ocupada y la GPU cerca del 100 % de utilización. Si la imagen tarda varios minutos, la interfaz se está ejecutando en el procesador: casi siempre se debe a una versión inadecuada de PyTorch.
#Dónde encontrar los modelos y cuáles evitar
Dos fuentes dominan. Hugging Face aloja los modelos oficiales de los laboratorios. Civitai reúne las variantes comunitarias: modelos afinados, LoRA, estilos. Un LoRA es un pequeño archivo que añade un estilo o un tema a un modelo base sin reemplazarlo. Debe corresponder a la familia adecuada: un LoRA SDXL no funciona en SD 1.5.
#Escribir un prompt que funcione
- Describe, no des órdenes
- Estos modelos no siguen instrucciones. «Retrato de una mujer mayor, luz de ventana, objetivo de 85 mm, poca profundidad de campo» funciona; «hazme una foto bonita» no.
- Escribe en inglés
- La ficha de SD 1.5 indica «Language(s): English» y un codificador de texto CLIP ViT-L/14 congelado. Comprende el francés, pero con menos precisión.
- Tema, luego marco, luego estilo
- El orden cuenta: lo que viene primero pesa más.
- Prompt negativo
- Lista lo que no deseas ver. Útil especialmente en SD 1.5 y SDXL; verifica en la ficha de un modelo reciente si lo tiene en cuenta.
- Guarda la semilla
- Misma semilla, mismos ajustes, misma imagen. Para comparar dos prompts, fija la semilla y cambia solo una cosa a la vez.
#Licencias y uso comercial
| Modelo | Licencia | Uso comercial de imágenes |
|---|---|---|
| SD 1.5 | CreativeML OpenRAIL-M | Autorizado: Stability AI la describe como permisiva para usos comerciales y no comerciales, con restricciones éticas de uso enumeradas en la licencia |
| SDXL 1.0 | CreativeML OpenRAIL++-M | Autorizado, mismos principios |
| SD 3.5 | Stability AI Community License | Gratuito para uso no comercial y para uso comercial hasta 1 millón de dólares de ingresos anuales; por encima de ese límite, contactar con Stability AI para obtener una licencia empresarial. Conservas la propiedad de las imágenes generadas. |
La licencia del modelo no lo resuelve todo. Los derechos de autor sobre una imagen generada y el uso de la imagen de una persona real se rigen por la legislación de tu país, no por la licencia del software. Esta guía describe las licencias publicadas por sus autores y no constituye asesoramiento jurídico.
- El kit Imágenes IA: ajustes por tarjeta gráfica y flujos de trabajo listos para usar
- Fuente: el anuncio de Stable Diffusion 3.5 y su licencia
- Fuente: el anuncio del lanzamiento público de 2022
#FAQ
¿Es Stable Diffusion gratuito?+
¿Se puede usar Stable Diffusion sin tarjeta gráfica?+
¿Qué versión elegir entre SD 1.5, SDXL y SD 3.5?+
¿Mis imágenes siguen siendo privadas?+
¿Stable Diffusion o Flux?+
¿Se puede usar Stable Diffusion en Mac?+
¿Se pueden vender las imágenes generadas?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.