Principiante 11 minImagen

Stable Diffusion en local: instalación y modelos

Respuesta directa

Stable Diffusion es una familia de modelos de imagen con pesos abiertos, no una aplicación: se ejecuta en una interfaz local. Para empezar, usa SDXL (archivo de 6,94 GB; 8 GB de VRAM para trabajar con comodidad) en Fooocus, en ComfyUI Desktop o, en Mac, en Draw Things. SD 1.5 es adecuado para tarjetas de poca capacidad; SD 3.5, anunciado el 22 de octubre de 2024, para tarjetas de 12 GB o más. Las familias más recientes, como Flux o Z-Image, se ejecutan principalmente a través de ComfyUI.

Stability AI anunció el lanzamiento público de Stable Diffusion el 22 de agosto de 2022: un modelo que transforma texto en imagen en tu propio ordenador, sin cuenta ni límite de volumen. A fecha del 28 de septiembre de 2026, el nombre abarca tres generaciones de modelos, cuatro o cinco interfaces posibles y licencias que difieren entre sí. Esta guía te ayuda a elegir una versión y una interfaz, a instalarlo todo en Windows, Mac o Linux y a saber qué tienes derecho a hacer con las imágenes.

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux

#Stable Diffusion, ¿qué es?

Stable Diffusion es un modelo de difusión latente. Parte de una imagen de ruido puro y elimina el ruido paso a paso, guiado por tu texto, hasta que aparece una imagen coherente. El cálculo se realiza en un espacio comprimido, llamado latente, lo que explica que baste una tarjeta gráfica de consumo, mientras que los primeros modelos de difusión requerían un centro de cálculo.

Lo que la hizo famosa no fue su calidad bruta sino su apertura. Al lanzarse en 2022, Stability AI eligió una licencia CreativeML OpenRAIL-M, que describe como «permisiva» y que permite tanto usos comerciales como no comerciales: se pueden descargar, modificar y reentrenar los pesos. Existen miles de variantes especializadas. Stable Diffusion no es una aplicación: es un archivo de modelo que ejecutas a través de la interfaz que elijas.

El nombre puede dar lugar a una confusión terminológica. El repositorio de referencia de SD 1.5 en Hugging Face se presenta hoy como un espejo del antiguo repositorio de RunwayML, obsoleto y sin vínculo con esta empresa. Y desde 2024, los modelos de imagen abiertos más comentados provienen de otros laboratorios: Flux, Qwen Image o Z-Image. Funcionan en las mismas interfaces, pero no llevan el nombre Stable Diffusion.

#Las versiones y cuál elegir

El kit Imágenes IA

Imágenes y vídeos de IA en local, sin límites: ComfyUI, Flux, Z-Image, Wan 2.2 en tu GPU o tu Mac — flujos de trabajo listos para cargar, marco legal incluido.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida
Las tres generaciones de Stable Diffusion en local, según Stability AI y las fichas de Hugging Face
VersiónFecha de lanzamientoArchivo principalResolución nativaVRAM holgadaPuntos clave
SD 1.520224,27 GB (v1-5-pruned-emaonly)512 × 5124 a 6 GBLigero, con una enorme biblioteca de variantes y de LoRA. Los detalles y las manos aún pueden mejorar.
SDXL 1.0julio de 20236,94 GB (sd_xl_base_1.0)1024 × 10248 GB: Stability AI anuncia un funcionamiento correcto en tarjetas de 8 GBPunto de partida adecuado: calidad claramente superior, ecosistema maduro.
SD 3.522 de octubre de 2024Medium: 2,5 mil millones de parámetros; Large: 8,1 mil millones; Large Turbo: versión de 4 pasosMedium: de 0,25 a 2 megapíxeles; Large: 1 megapíxelMedium: 9,9 GB sin incluir los codificadores de texto (Stability AI). Large: más de 16 GB en 16 bits (nuestro cálculo)Mejor seguimiento del prompt. Licencia diferente, ver más abajo.

Dos detalles evitan errores de compra o descarga. Primero, SD 1.5 existe en dos archivos: v1-5-pruned-emaonly.safetensors (4,27 GB), que la ficha del modelo describe como un archivo que utiliza menos VRAM y es adecuado para la inferencia, y v1-5-pruned.safetensors (7,7 GB), destinado al reentrenamiento. Para generar imágenes, elige el primero. Después, SD 3.5 Large, con sus 8,1 mil millones de parámetros, no debe evaluarse a partir de la ficha de Medium: no cuentes con él en una tarjeta de 8 GB.

Si empiezas con una tarjeta de 8 GB, empieza con SDXL: es la mejor relación entre calidad, velocidad y documentación disponible. Con 12 a 16 GB, mira también los modelos recientes de ComfyUI: su README indica soporte nativo para Flux.1, Flux.2, Qwen Image y Z-Image.

#El equipo necesario

Lo que funciona según tu tarjeta · tarjetas de la base de datos de hardware de QuelLLM
Tu equipoLo que funciona bien
Tarjeta NVIDIA de 4 a 6 GB (GTX 1660, RTX 2060, RTX 3050)SD 1.5. Fooocus, bajo SDXL, indica 4 GB de VRAM y 8 GB de RAM como mínimo, basándose en la memoria virtual de Windows: lento, pero posible.
Tarjeta NVIDIA de 8 GB (RTX 3060 Ti, RTX 4060, RTX 5060)SDXL de forma cómoda, umbral anunciado por Stability AI
Tarjeta NVIDIA de 12 a 16 GB (RTX 3060 12 GB, RTX 4070, RTX 5070 Ti)SDXL con LoRA y ampliación, SD 3.5 Medium, Z-Image Turbo (16 GB según su ficha), Flux en FP8
Tarjeta AMD reciente (RX 7000, RX 9000)Buen rendimiento en Linux con ROCm; en Windows, soporte oficial de ROCm en ComfyUI Desktop desde enero de 2026
Mac Apple SiliconCualquier chip M: la memoria unificada hace las veces de VRAM. Más lento que una tarjeta NVIDIA de gama comparable.
Sin tarjeta gráficaTécnicamente posible, pero mucho más lento: reservar para pruebas

Ten en cuenta también el espacio en disco. Un solo archivo SDXL pesa 6,94 GB, y las colecciones de LoRA y variantes crecen rápido. Fooocus recomienda tener al menos 40 GB libres en cada disco si encuentras el error «RuntimeError: CPUAllocator».

#¿Qué interfaz instalar?

Interfaces que conviene conocer, situación a 28 de septiembre de 2026
InterfazPara quiénFortalezasLímites
FooocusPara principiantesUn campo de texto, un botón, ajustes predeterminados bien pensados; menos de tres clics entre la descarga y la primera imagen, según su READMESDXL exclusivamente: el proyecto tiene soporte a largo plazo limitado, solo correcciones de errores
Forge (repositorio de lllyasviel)Usuarios de la interfaz de pestañasInterfaz de AUTOMATIC1111, más eficiente en memoria, con soporte de FluxNo hay commits en la rama principal desde junio de 2025; el desarrollo continúa mediante forks como Forge Neo
AUTOMATIC1111Los que siguen tutoriales antiguosLa interfaz histórica, la más documentadaÚltima versión publicada en febrero de 2025, sin compatibilidad con Flux
ComfyUIUsuarios avanzados y curiososSoporte nativo para modelos recientes, flujos reproductibles, proyecto muy activoCurva de aprendizaje
Draw ThingsMac, iPhone, iPadAplicación nativa, edición gratuita que realiza los cálculos en local y sin conexión, entrenamiento de LoRA en el dispositivoSolo para el ecosistema Apple; hay opciones de pago en la nube, que conviene evitar si quieres mantener un funcionamiento 100 % local.
!
Fooocus: ten cuidado con sitios falsos
El README de Fooocus advierte de que aparecen muchos sitios falsos al buscar su nombre y señala que fooocus.com, fooocus.net, fooocus.ai y fooocus.org son todos falsos. La única fuente oficial es el repositorio de GitHub del proyecto. El mismo consejo se aplica a los demás programas: empieza por el repositorio, no por un anuncio.

#El camino más corto por sistema

  1. 01
    Windows con una tarjeta NVIDIA
    El más rápido: Fooocus. Descarga el archivo desde la página oficial de GitHub, descomprímelo y ejecuta run.bat. En el primer inicio, los modelos se descargan en Fooocus\models\checkpoints. Si buscas una herramienta que se mantenga al día con los nuevos modelos, instala mejor ComfyUI Desktop, recomendado para nuevos usuarios por el README de ComfyUI.
  2. 02
    Tarjeta RTX 50: verifica PyTorch
    Los archivos todo en uno de Forge anuncian CUDA 12.1 y PyTorch 2.3.1 como versión recomendada. Sin embargo, las tarjetas RTX 50 requieren un PyTorch reciente: un colaborador de AUTOMATIC1111 menciona PyTorch 2.7.0 como la primera versión oficial compatible con ellas. En una RTX 50, opta por ComfyUI, cuya documentación requiere CUDA 13.0 para las tarjetas NVIDIA recientes.
  3. 03
    Mac Apple Silicon
    Instala Draw Things desde la App Store: su edición gratuita calcula localmente y sin conexión, sin línea de comandos. No actives sus opciones de nube si quieres que nada salga del Mac. ComfyUI Desktop también existe para macOS en Apple Silicon.
  4. 04
    Linux, o tarjeta AMD
    Instalación manual de ComfyUI: clonación del repositorio, entorno Python y PyTorch en versión CUDA o ROCm según la tarjeta. El procedimiento detallado está en nuestra guía de ComfyUI. Fooocus también ofrece una instalación en Linux mediante Anaconda.
  5. 05
    Comprobar que se está utilizando la GPU
    Durante una generación, el comando nvidia-smi debe mostrar la VRAM ocupada y la GPU cerca del 100 % de utilización. Si la imagen tarda varios minutos, la interfaz se está ejecutando en el procesador: casi siempre se debe a una versión inadecuada de PyTorch.

#Dónde encontrar los modelos y cuáles evitar

Dos fuentes dominan. Hugging Face aloja los modelos oficiales de los laboratorios. Civitai reúne las variantes comunitarias: modelos afinados, LoRA, estilos. Un LoRA es un pequeño archivo que añade un estilo o un tema a un modelo base sin reemplazarlo. Debe corresponder a la familia adecuada: un LoRA SDXL no funciona en SD 1.5.

!
Tres precauciones
Descarga solo archivos .safetensors: según el repositorio del formato, este almacena los tensores « safely (as opposed to pickle) », mientras que el antiguo formato .ckpt puede ejecutar código al abrirse. Lee después la ficha de cada modelo de la comunidad, ya que muchos están entrenados con contenidos cuyo uso comercial está prohibido o es jurídicamente incierto. Por último, elige el archivo correcto: para SD 1.5, la variante «emaonly» sirve para generar y la otra para reentrenar.

#Escribir un prompt que funcione

Describe, no des órdenes
Estos modelos no siguen instrucciones. «Retrato de una mujer mayor, luz de ventana, objetivo de 85 mm, poca profundidad de campo» funciona; «hazme una foto bonita» no.
Escribe en inglés
La ficha de SD 1.5 indica «Language(s): English» y un codificador de texto CLIP ViT-L/14 congelado. Comprende el francés, pero con menos precisión.
Tema, luego marco, luego estilo
El orden cuenta: lo que viene primero pesa más.
Prompt negativo
Lista lo que no deseas ver. Útil especialmente en SD 1.5 y SDXL; verifica en la ficha de un modelo reciente si lo tiene en cuenta.
Guarda la semilla
Misma semilla, mismos ajustes, misma imagen. Para comparar dos prompts, fija la semilla y cambia solo una cosa a la vez.

#Licencias y uso comercial

Licencias de las tres generaciones, según las publicaciones de Stability AI y las fichas de Hugging Face
ModeloLicenciaUso comercial de imágenes
SD 1.5CreativeML OpenRAIL-MAutorizado: Stability AI la describe como permisiva para usos comerciales y no comerciales, con restricciones éticas de uso enumeradas en la licencia
SDXL 1.0CreativeML OpenRAIL++-MAutorizado, mismos principios
SD 3.5Stability AI Community LicenseGratuito para uso no comercial y para uso comercial hasta 1 millón de dólares de ingresos anuales; por encima de ese límite, contactar con Stability AI para obtener una licencia empresarial. Conservas la propiedad de las imágenes generadas.

La licencia del modelo no lo resuelve todo. Los derechos de autor sobre una imagen generada y el uso de la imagen de una persona real se rigen por la legislación de tu país, no por la licencia del software. Esta guía describe las licencias publicadas por sus autores y no constituye asesoramiento jurídico.

#FAQ

FAQ
¿Es Stable Diffusion gratuito?+
Sí. Los modelos se descargan gratis y las interfaces que los ejecutan son de código abierto. En local, no pagas suscripciones ni créditos, solo tu hardware y la electricidad. Una excepción de licencia: SD 3.5 es gratuito para uso comercial hasta 1 millón de dólares de facturación anual, con una licencia empresarial por encima de ese umbral. Existen servicios en línea de pago, pero no son necesarios.
¿Se puede usar Stable Diffusion sin tarjeta gráfica?+
Técnicamente sí, pero la generación se vuelve mucho más lenta. Para un uso real, cuenta con una tarjeta NVIDIA de 8 GB para SDXL, umbral que Stability AI anuncia para un funcionamiento correcto, o con un Mac Apple Silicon. Fooocus puede funcionar con tan solo 4 GB de VRAM y 8 GB de RAM en Windows, a costa de la lentitud. Sin GPU, limita el ensayo a unas pocas imágenes de prueba.
¿Qué versión elegir entre SD 1.5, SDXL y SD 3.5?+
SDXL para una primera prueba: 8 GB de VRAM bastan y el ecosistema es maduro. SD 1.5 si tu tarjeta tiene de 4 a 6 GB, con imágenes más modestas. SD 3.5 Medium requiere 9,9 GB de VRAM sin contar los codificadores de texto, según Stability AI: resérvalo para tarjetas de 12 GB o más, o cuando necesites que se respete el prompt.
¿Mis imágenes siguen siendo privadas?+
Sí, si trabajas en local: el prompt y la imagen no salen de tu máquina. Draw Things anuncia que funciona sin conexión en su edición gratuita, y el README de ComfyUI indica que su núcleo no descarga nada sin que se lo solicites. Las únicas fugas posibles proceden de opciones en línea que actives o de una extensión maliciosa: instala desde repositorios oficiales.
¿Stable Diffusion o Flux?+
Stable Diffusion sigue siendo más ligero y mejor documentado: SDXL cabe en 8 GB. Flux.1 dev pesa 23,8 GB en precisión completa, y el checkpoint FP8 de Comfy-Org 17,2 GB, lo que apunta más a tarjetas de 12 a 16 GB o más. Elige Flux por fidelidad al prompt si tu tarjeta lo permite, SDXL en caso contrario, con el ecosistema de LoRA más amplio.
¿Se puede usar Stable Diffusion en Mac?+
Sí, en los chips Apple Silicon. Draw Things es una aplicación cuya edición gratuita realiza los cálculos sin conexión en Mac, iPhone y iPad. ComfyUI Desktop también existe para macOS, y la wiki de AUTOMATIC1111 documenta una instalación en Mac en la que el entrenamiento sigue siendo muy lento. Las tarjetas NVIDIA siguen siendo más rápidas a igualdad de gama, pero un Mac basta para aprender.
¿Se pueden vender las imágenes generadas?+
A menudo sí, pero depende del modelo. SD 1.5 y SDXL, bajo licencias OpenRAIL, permiten usos comerciales con restricciones de uso. SD 3.5 es gratuito si la facturación anual es inferior a 1 millón de dólares. Lee también las fichas de los modelos y los LoRA comunitarios añadidos, y recuerda que los derechos de autor sobre una imagen generada se rigen por la legislación de tu país.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.