Intermedio 11 minImagen

Generar imágenes localmente: Ollama, Stable Difusión

La búsqueda «ollama image generation» aparece una y otra vez, y la respuesta cabe en una frase: Ollama no genera imágenes, sino que sirve modelos de texto y de visión. Pero generar imágenes en local, sin nube ni suscripción, es totalmente posible con otras herramientas. Esta guía ofrece información verificada sobre lo que Ollama puede y no puede hacer y, a continuación, enumera las opciones reales (Stable Diffusion, ComfyUI, Draw Things en Mac), la VRAM realmente necesaria, la instalación más sencilla según tu sistema y qué puedes esperar en cuanto a calidad frente a Midjourney o DALL-E.

Por Mohamed Meguedmi·Actualización 2026-09-08·Probado en Windows, macOS y Linux

#Ollama y las imágenes: lo que puede y no puede hacer

Empecemos por aclarar la confusión más frecuente detrás de la consulta «ollama image generation». Ollama es un entorno de ejecución para grandes modelos de lenguaje: descarga y ejecuta modelos en formato GGUF, expone una API compatible con OpenAI en http://localhost:11434 y gestiona su carga en memoria y su descarga de ella. Su ámbito es el texto y, desde la llegada de los modelos multimodales, la lectura de imágenes de entrada.

La distinción importante es entre entender una imagen y crear una imagen. Ollama hace lo primero mediante modelos de visión como Qwen VL, Gemma o Llama Vision: envías una foto y el modelo la describe, realiza OCR sobre ella o responde a preguntas sobre ella. Eso es generación de texto a partir de una imagen. La generación de imágenes —producir un archivo PNG a partir de un prompt— se basa en una arquitectura completamente diferente (modelos de difusión, no transformadores de lenguaje), que Ollama no ejecuta.

!
No busques un modelo de imagen en ollama.com
No existe un « ollama run stable-diffusion ». La biblioteca de Ollama solo contiene LLM y modelos de visión y lenguaje. Cualquier tutorial que afirme generar imágenes directamente con el comando ollama run se equivoca de herramienta. Para crear imágenes, se necesita un motor de difusión dedicado.

En resumen: conserva Ollama para el texto y el análisis de imágenes, y añade una herramienta de difusión para la creación. Ambos conviven muy bien en la misma máquina y pueden incluso compartir la GPU siempre que no los utilices al mismo tiempo.


#¿Por qué generar imágenes localmente?

El kit de imágenes IA

Tu primera imagen ya ha salido de tu máquina. El kit de imágenes IA desarrolla los siguientes pasos: un flujo texto→imagen que controlas (cap. 5), ajustarte a la capacidad de tu memoria de vídeo y ganar velocidad (cap. 7), y después entrenar tu propio estilo (cap. 11).

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Generar en local requiere un poco más de esfuerzo que abrir Midjourney, pero las razones para hacerlo son concretas y se acumulan rápidamente en cuanto se supera el uso ocasional.

Sin coste de uso
una vez que el hardware y los modelos estén listos, puedes generar tantas imágenes como quieras sin créditos ni suscripción. Ningún límite mensual, ninguna facturación por imagen.
Confidencialidad total
Tus prompts y tus imágenes nunca abandonan la máquina. Esencial para visuales de productos no anunciados, contenido de clientes bajo NDA o datos sensibles.
Ninguna censura del lado del servidor
Los filtros de contenido de los servicios en la nube suelen ser amplios y opacos. En local, es tu máquina, tus reglas, dentro del marco legal que sigue siendo aplicable a ti.
Control y reproducibilidad
semilla fija, ajustes exactos, modelos y LoRA seleccionados: reproduces una imagen con precisión de píxel, algo que los servicios en la nube no garantizan de una actualización a otra.
Sin conexión
Una vez descargados los modelos, todo funciona sin conexión. Útil cuando estás de viaje o en un equipo aislado.

#Las verdaderas opciones locales para generar imágenes

Puesto que Ollama queda descartado para la creación, estas son las herramientas serias que realmente generan imágenes en local en 2026. Todas se basan en modelos de difusión (familia Stable Diffusion, SDXL o arquitecturas recientes como FLUX); lo que cambia según la herramienta es la interfaz y el público al que se dirige.

AUTOMATIC1111 (Stable Diffusion WebUI)
La interfaz web histórica, rica en funciones y documentada. Pestañas txt2img / img2img, extensiones en abundancia y una comunidad enorme. Algo anticuada, pero sigue siendo la referencia para aprender.
ComfyUI
una interfaz basada en un grafo de nodos: conectas visualmente el pipeline (modelo → sampler → VAE → salida). Curva de aprendizaje más pronunciada, pero control total y el mejor soporte para modelos recientes como FLUX.
Fooocus
Concebido para la simplicidad como Midjourney: un campo de prompt, presets, y la herramienta maneja el resto. Ideal para comenzar sin entender el funcionamiento interno de la difusión.
Draw Things (macOS / iOS)
aplicación nativa para Apple Silicon, gratuita y optimizada para Metal y la memoria unificada. Con diferencia, la vía más sencilla en Mac: todo está integrado, incluida la descarga de los modelos.
SD.Next
un fork de AUTOMATIC1111 con un mantenimiento más activo y mejor compatibilidad con varios backends (CUDA, ROCm, Intel). Una buena alternativa si usas una GPU que no sea de NVIDIA.
→
¿Qué herramienta para quién?
Principiante en Windows/Linux → Fooocus. En Mac → Draw Things. Quieres aprender y experimentar → AUTOMATIC1111. Quieres el control máximo y los modelos más recientes → ComfyUI. Los modelos (.safetensors) se comparten entre estas herramientas: nada impide probar varias.

#VRAM necesaria según el modelo de difusión

La generación de imágenes consume mucha VRAM, pero ese consumo varía de forma menos lineal que en los LLM: lo que cuenta es el modelo de difusión elegido y la resolución deseada. Aquí tienes algunas referencias realistas para generar imágenes cómodamente en 2026.

Stable Diffusion 1.5 — 4 GB de VRAM
el modelo más ligero. Funciona incluso en una tarjeta modesta, con imágenes nativas de 512×512. Antiguo, pero rápido y muy poco exigente en cuanto al hardware.
SDXL — 8 a 12 GB de VRAM
el referente en calidad y accesibilidad. Imágenes nativas de 1024×1024, con un buen nivel de detalle. Una RTX 3060 de 12 GB es más que suficiente; una RTX 4070 permite trabajar con comodidad.
FLUX (dev / schnell) — 12 a 24 GB de VRAM
la generación reciente, con una calidad fotorrealista y una fidelidad al prompt claramente superiores. Las versiones cuantizadas (GGUF, fp8) reducen el consumo de memoria, pero entre 16 y 24 GB siguen siendo lo necesario para trabajar con verdadera comodidad.
Mac Apple Silicon — memoria unificada
un M4 Pro de 24-48 GB comparte su memoria entre CPU y GPU: SDXL funciona sin problemas, y FLUX también, con un poco de paciencia. Más lento que una RTX de gama alta, pero silencioso y de bajo consumo.
i
Sin GPU dedicado, es posible pero lento
La generación solo con CPU funciona (el modo --use-cpu de AUTOMATIC1111, o Draw Things en un Mac de gama básica), pero calcula varios minutos por imagen frente a unos pocos segundos con GPU. Para un uso regular, una tarjeta con al menos 8 GB de VRAM lo cambia todo.

#Instalación más sencilla según tu sistema operativo

El camino más corto varía según la máquina. Aquí tienes la opción menos dolorosa para cada sistema, sin buscar exhaustividad.

#macOS (Apple Silicon): Draw Things

En Mac, no hace falta utilizar Python ni la línea de comandos. Draw Things es una app nativa que se puede descargar desde el Mac App Store: gestiona la instalación de los modelos, la optimización con Metal y la interfaz en un solo paquete.

  1. 01
    1. Instalar la aplicación
    Busca «Draw Things» en la Mac App Store e instálala. Es gratuita.
  2. 02
    2. Descargar un modelo
    La primera vez que abres la aplicación, te propone descargar un modelo base (SDXL es un buen punto de partida). La descarga se realiza desde la interfaz.
  3. 03
    3. Generar
    Escribe un prompt, deja los ajustes por defecto y haz clic en Generate. La primera imagen se genera en unas decenas de segundos, según el chip.

#Windows / Linux con GPU NVIDIA: Fooocus o ComfyUI

En un PC con una tarjeta NVIDIA, Fooocus es el más rápido de poner en marcha. Descarga su modelo predeterminado la primera vez que se ejecuta y apenas ofrece ajustes que configurar.

Terminal — instalar Fooocus
# Prérequis : Python 3.10+ et un GPU NVIDIA avec pilotes récents
git clone https://github.com/lllyasviel/Fooocus.git
cd Fooocus
python -m venv venv
source venv/bin/activate    # Windows : venv\Scripts\activate
pip install -r requirements_versions.txt
python entry_with_update.py

Al iniciarse, Fooocus descarga automáticamente un modelo SDXL y luego abre una interfaz web en el navegador (por defecto en http://127.0.0.1:7865). Escribes un prompt y generas: eso es todo.

Si prefieres el control por nodos y los modelos más recientes, ComfyUI se inicia de forma similar:

Terminal — instalar ComfyUI
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python -m venv venv
source venv/bin/activate
pip install -r requirements.txt
# Placez vos modèles .safetensors dans models/checkpoints/
python main.py
# Interface : http://127.0.0.1:8188
!
GPU AMD en Windows: más delicado
El soporte de ROCm en Windows sigue siendo desigual. Para una GPU AMD, prioriza Linux con ROCm o una variante DirectML/SD.Next en Windows. Ten en cuenta que tendrás que hacer algunos ajustes de configuración: la misma lógica que para ejecutar un LLM en una GPU AMD.

#Tus primeros resultados en 30 minutos

Una vez instalada la herramienta, estos son los pasos que debes seguir para obtener imágenes aceptables rápidamente, en lugar de adentrarte en los ajustes avanzados desde el principio.

  1. 01
    1. Empieza con un modelo SDXL
    Es el mejor equilibrio entre calidad / VRAM / velocidad para empezar. Guarda FLUX para más adelante, cuando quieras más realismo y conozcas los límites de tu GPU.
  2. 02
    2. Escribe un prompt descriptivo
    Los modelos de difusión prefieren descripciones concretas: sujeto, estilo, encuadre, iluminación. Por ejemplo, «un zorro rojo dormido en un bosque de abedules, luz dorada de la mañana, fotografía, poca profundidad de campo».
  3. 03
    3. Deja los ajustes por defecto
    Steps en torno a 25-30 y guidance (CFG) en torno a 7 para SDXL. No toques nada más en tus primeras pruebas: los valores predeterminados de la herramienta son razonables.
  4. 04
    4. Fija una semilla para iterar
    Un seed idéntico + un prompt ligeramente modificado permite ver el efecto de una palabra. Este es el verdadero ciclo de trabajo: cambiar un detalle a la vez.
  5. 05
    5. Pasa a img2img para afinar
    Toma una imagen generada como base y vuelve a generarla con un «denoising» parcial para corregirla sin empezar desde cero.
→
El prompt negativo hace la mitad del trabajo
La mayoría de las herramientas ofrecen un campo de prompt negativo: enumera ahí lo que no quieres («desenfoque, manos deformadas, texto, marca de agua, baja resolución»). En SD 1.5 y SDXL, a menudo es lo que marca la diferencia entre una imagen fallida y una imagen limpia.

#Calidad esperada frente a Midjourney y DALL-E

Seamos directos: en cuanto a calidad bruta «en un clic», Midjourney sigue por delante. Sus imágenes son estéticamente atractivas por defecto, sin esfuerzo de configuración. DALL-E, integrado en ChatGPT, destaca por seguir prompts complejos y por el texto dentro de las imágenes. Es lo que se obtiene con modelos masivos entrenados y ajustados por equipos dedicados, ofrecidos desde la nube.

Pero la diferencia ya no es la que se imagina. FLUX en local genera imágenes fotorrealistas que rivalizan con Midjourney en muchos temas, y SDXL con prompts bien formulados basta de sobra para la mayoría de los usos. Sobre todo, la ejecución local ofrece ventajas en aspectos que la nube no puede ofrecer.

Control fino
ControlNet (imponer una pose, una profundidad, unos contornos), inpainting preciso, LoRA especializados: la generación en local ofrece un nivel de control que Midjourney y DALL-E no ponen a disposición del usuario.
Personalización
Miles de modelos y adaptaciones LoRA comunitarias (estilos, personajes, estéticas) se pueden descargar libremente. Adaptas el modelo a tus necesidades exactas.
Volumen y costo
Generar mil variantes solo cuesta electricidad. En la nube, ese mismo volumen se traduce en créditos consumidos.
Esfuerzo inicial
es la verdadera contrapartida: Midjourney ofrece un resultado bonito de inmediato, mientras que generar imágenes en local exige aprender a redactar prompts y ajustar la configuración. La recompensa por ese esfuerzo es el control y la gratuidad de uso.

El enfoque adecuado: generar imágenes en local no sustituye a Midjourney cuando quieres una imagen bonita de forma puntual y sin complicaciones. Lo supera en cuanto necesitas confidencialidad, volumen, reproducibilidad o un control preciso, y su calidad más avanzada, con FLUX, ya no tiene nada de anecdótica.


#Solución de problemas habituales

«CUDA out of memory»
el modelo o la resolución requiere más VRAM de la que tienes disponible. Reduce la resolución, activa el modo «medvram» / «lowvram» de la herramienta o pasa a un modelo más ligero (SDXL → SD 1.5, o FLUX cuantizado).
Imágenes borrosas o distorsionadas
Aumenta ligeramente el número de pasos, ajusta el CFG y, sobre todo, refuerza el prompt negativo. En SDXL, comprueba que estás generando en 1024×1024 y no en 512.
Generación muy lenta
comprueba que se esté utilizando la GPU (y no la CPU por defecto). Si usas NVIDIA, verifica los controladores y la versión de PyTorch compilada para CUDA; el instalador de Fooocus/ComfyUI normalmente se encarga de ello.
Manos y rostros mal generados
debilidad típica de los modelos de difusión. Usa un módulo de restauración facial, el inpainting en la zona afectada, o un modelo/LoRA conocido por manejar mejor la anatomía.

#Para ir más allá

La generación de imágenes convive de forma natural con el resto de una pila de IA local. Estas guías del sitio complementan lo que acabas de poner en marcha:

Analizar imágenes en lugar de crearlas
« LLM multimodal de visión en local: analizar imágenes con Ollama » cubre la otra mitad del tema de las imágenes: la lectura y el OCR con un modelo de visión.
Entender la VRAM y la elección del GPU
Las referencias de memoria de esta guía se basan en la misma lógica que «Elegir la cuantización (Q4, Q5, Q8, FP16)», útil para dimensionar tu tarjeta.
El resto de la pila de software para texto
« Instalar Ollama en 5 minutos » sigue siendo la base para la parte de lenguaje, para ejecutarlo junto a tu motor de difusión en la misma máquina.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.