Intermedio 12 minImagen

Qwen-Image-Edit local: ComfyUI y VRAM necesario

Qwen-Image-Edit es el modelo abierto de edición de imágenes de Alibaba: le das una foto y una instrucción en lenguaje natural, y modifica la imagen conservando el resto. Funciona en local en ComfyUI, pero es un modelo de 20 000 millones de parámetros, y la pregunta que bloquea a todo el mundo es la misma: qué versión descargar, FP8 o GGUF, y cuánta memoria de vídeo prever. Esta guía sigue el procedimiento oficial de ComfyUI, indica dónde consultar los tamaños de los archivos y las necesidades de VRAM en las fuentes, y enumera los errores de nodos más frecuentes. No cubre la instalación de ComfyUI en sí, que se trata en una guía específica.

Por Marie L.·Actualización 2026-10-08·Probado en Windows, macOS y Linux

#Por qué Qwen-Image-Edit y qué contiene la familia

La familia Qwen-Image reúne dos usos. Qwen-Image genera una imagen a partir de un texto, con un punto fuerte reconocido en su informe técnico: la representación de texto dentro de la imagen, incluidas frases enteras y alfabetos no latinos. Qwen-Image-Edit parte de este mismo modelo para modificar una imagen existente. El repositorio de GitHub QwenLM/Qwen-Image y la ficha de Hugging Face Qwen/Qwen-Image-Edit distinguen dos tipos de edición: la edición semántica, que cambia el contenido o el estilo manteniendo la identidad del sujeto, y la edición de apariencia, que añade, elimina o sustituye un elemento sin tocar el resto. El modelo también sabe corregir o sustituir texto en una imagen conservando la fuente y la composición.

La arquitectura y la licencia son los dos hechos que conviene recordar antes de descargar nada. El modelo de difusión es un transformador multimodal (MMDiT) de aproximadamente 20 000 millones de parámetros. El codificador de texto no es un CLIP pequeño: es Qwen2.5-VL 7B, un modelo completo de visión y lenguaje que lee tanto la instrucción como la imagen de entrada. Ambos se publican bajo la licencia Apache 2.0, que autoriza el uso comercial de los pesos. Cada componente se descarga por separado, y esta dispersión en tres archivos es la causa de la mayoría de los errores de nodos descritos más abajo.

La familia evoluciona rápidamente. La primera versión de Qwen-Image-Edit se publicó en agosto de 2025. En septiembre de 2025 le siguió una versión con fecha 2509: acepta varias imágenes de entrada e incluye de forma nativa condiciones de tipo ControlNet, como un mapa de profundidad, contornos o una pose. A finales de 2025 llegó una versión 2511 con una mejor coherencia del sujeto, y el modelo de generación recibió por su parte una revisión 2512. En 2026 se anunciaron versiones 2.x. Esta guía se basa en la familia documentada paso a paso por ComfyUI, desde la versión de agosto de 2025 hasta la 2511: los nodos y la organización de los archivos son los mismos. Antes de elegir, lea la parte superior del README de GitHub, que enumera las versiones con su fecha de publicación.

i
Lo que esta guía no mide
Aquí no se anuncia ningún tiempo de generación ni consumo de VRAM como resultado de QuelLLM. Los tamaños de archivo citados son los que aparecen en las páginas de Hugging Face de los repositorios mencionados, redondeados; las necesidades de memoria se deducen de esos tamaños y de las reglas de ComfyUI, no de una prueba de rendimiento. Los repositorios evolucionan: vuelva a consultar la página del archivo antes de descargarlo.

#Nativo, FP8 o GGUF: qué versión de Qwen-Image-Edit descargar

El kit de imágenes IA

Imágenes y vídeos de IA en local, sin límites: ComfyUI, Flux, Z-Image, Wan 2.2 en tu GPU o tu Mac — flujos de trabajo listos para cargar, marco legal incluido.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Circulan tres formas del mismo modelo y no se utilizan de la misma manera.

Nativo (bf16, formato Diffusers)
El repositorio Qwen/Qwen-Image-Edit en Hugging Face, dividido en varios archivos safetensors y pensado para la biblioteca Diffusers en Python. En bf16, 20 000 millones de parámetros representan aproximadamente 40 GB solo para el transformador, más el codificador de texto. Es la vía de los scripts de Python y de las tarjetas de 48 GB o más, o de una descarga parcial a la RAM. No es la vía de ComfyUI.
FP8 reempaquetado por Comfy Org
El repositorio Comfy-Org/Qwen-Image-Edit_ComfyUI de Hugging Face incluye los pesos en un único archivo FP8 (formato e4m3fn), con el codificador de texto y el VAE divididos en subcarpetas. Esta es la versión que utilizan los workflows oficiales de ComfyUI. El archivo del modelo de difusión pesa algo más de 20 GB. En el mismo repositorio existe una variante bf16 de aproximadamente 41 GB para las tarjetas que disponen de espacio.
GGUF comunitario
Conversiones al formato GGUF, el formato de los LLM cuantizados, publicadas por colaboradores como city96, QuantStack o Unsloth. Llegan hasta Q8_0, Q6_K, Q5_K_M, Q4_K_M, Q3_K_M o Q2_K, y requieren la extensión ComfyUI-GGUF. Es la opción más realista con menos de 16 GB de VRAM y la más cómoda en Mac.

La regla de elección es sencilla. Tarjeta de 24 GB: FP8 oficial, sin darle más vueltas. Tarjeta de 16 GB: FP8 funciona gracias a la transferencia de memoria de ComfyUI, pero un GGUF Q6_K o Q5_K_M evita las ralentizaciones. Tarjeta de 12 GB: GGUF Q4_K_M o inferior. Mac Apple Silicon: GGUF, porque ComfyUI no calcula en FP8 sobre Metal y descuantiza estos pesos al cargarlos, lo que duplica la memoria ocupada.

#VRAM necesaria: dónde leer las cifras y cómo interpretarlas

Ni el README de GitHub ni la ficha de Qwen en Hugging Face proporcionan una tabla del tipo «tanta VRAM para tal tarjeta». La documentación de ComfyUI tampoco lo hace para este modelo: sus tutoriales enumeran los archivos que hay que descargar, la carpeta de destino y el flujo de trabajo, y a veces indican el hardware y el tiempo de sus propias pruebas, que deben tomarse como referencia y no como promesa. El dato fiable, fechado y verificable es el tamaño de cada archivo que aparece en su página de Hugging Face. Todo lo demás se deduce de ahí.

El modelo de difusión
Aproximadamente 20 GB en FP8 (archivo qwen_image_edit_fp8_e4m3fn.safetensors del repositorio Comfy-Org, publicado en agosto de 2025), aproximadamente 41 GB en bf16. En GGUF, el peso se calcula así: 20 mil millones de parámetros multiplicados por el número de bits por parámetro, dividido entre ocho. Un Q8_0 de 8,5 bits ocupa aproximadamente 21 GB, un Q4_K_M de 4,5 a 5 bits aproximadamente 12 GB, un Q3_K_M aproximadamente 9 a 10 GB y un Q2_K aproximadamente 7 GB. La página de cada repositorio GGUF muestra el valor exacto de cada archivo.
El codificador de texto
El archivo qwen_2.5_vl_7b_fp8_scaled.safetensors del repositorio Comfy-Org pesa aproximadamente 9,4 GB. No necesita permanecer en la VRAM durante el proceso de eliminación de ruido: ComfyUI lo carga allí para codificar el prompt y la imagen, y luego lo descarga si falta espacio. Por eso un modelo de 20 GB y un codificador de 9 GB pueden funcionar en una tarjeta de 24 GB.
El VAE
El archivo qwen_image_vae.safetensors ocupa aproximadamente 250 MB. Es insignificante en memoria, pero indispensable y específico de esta familia: un VAE de Flux o de SDXL produce ruido de color.
Las activaciones
El cálculo en sí requiere espacio adicional al de los pesos, y aún más a alta resolución. El flujo de trabajo oficial reduce la imagen de entrada a aproximadamente un megapíxel, lo que limita esta parte. Duplica la resolución de salida y este margen aumenta.

ComfyUI activa por defecto una gestión dinámica de la VRAM, descrita en nuestra guía de instalación: cuando los pesos superan la capacidad de la tarjeta, una parte permanece en la RAM y se transfiere bajo demanda. El modelo funciona entonces en una tarjeta de 12 o 16 GB, pero cada cambio de un medio a otro cuesta tiempo, y la RAM del sistema se convierte en el límite real: con un modelo de 20 GB y un codificador de 9 GB, 32 GB de RAM son el mínimo y 64 GB resultan cómodos. La tabla de referencia siguiente resume la lógica, sin pretender ser una medición.

24 GB o más (RTX 3090, 4090, 5090)
FP8 oficial completo, codificador FP8 e imagen de salida de un megapíxel sin descarga externa. El bf16 de 41 GB sigue reservado para tarjetas profesionales de 48 GB.
16 GB (RTX 4080, 5080, 4060 Ti 16 GB)
FP8 con descarga, o GGUF Q6_K a Q5_K_M que caben en la tarjeta con el codificador descargado entre etapas.
12 GB (RTX 3060 12 GB, 4070, 5070, 5070 Ti)
GGUF Q4_K_M o Q3_K_M, codificador FP8 cargado y después descargado, 32 GB de RAM. Calcula generaciones claramente más largas que con SDXL.
8 GB
Posible en Q2_K o Q3 con una descarga masiva de capas, a costa de una menor velocidad y calidad. Solo para ediciones ocasionales.
Mac Apple Silicon
La memoria unificada sirve como VRAM. Un GGUF Q4_K_M de 12 GB más el codificador de 9 GB requieren un Mac de 32 GB; 48 GB o más para trabajar sin estrecheces.

#Prerrequisitos

ComfyUI actualizado
Los nodos propios de Qwen-Image, como TextEncodeQwenImageEdit, llegaron a ComfyUI en agosto de 2025, y los de la versión 2509 en septiembre de 2025. Una instalación más antigua los ignora y muestra nodos rojos. Actualiza antes de nada: Desktop se actualiza solo, el archivo portátil mediante el script update y la instalación manual mediante git pull.
Una tarjeta NVIDIA de al menos 12 GB, o un Mac de 32 GB
Por debajo de eso, la edición sigue siendo posible, pero se convierte en un ejercicio de paciencia. AMD funciona en Linux con ROCm y, desde enero de 2026, en Windows con la aplicación Desktop.
Espacio en el disco
FP8: algo más de 30 GB para el conjunto de modelo, codificador y VAE. Añade de 10 a 21 GB por cada variante GGUF que pruebes.
Una instalación de ComfyUI que ya funciona
Primera imagen producida con SDXL o Flux. Si no es así, empieza por la guía de instalación: esta guía comienza cuando ComfyUI se abre en http://127.0.0.1:8188.

#Pasos 1 y 2: descargar los archivos correctos y organizarlos

La ruta más corta es la biblioteca de modelos de workflows integrada en ComfyUI: menú Workflow, Explorar modelos, categoría Image y, después, el modelo Qwen-Image-Edit, o su variante 2509 o 2511 según la versión que le interese. ComfyUI detecta los archivos que faltan y propone descargarlos directamente en la carpeta correcta. Si prefiere descargarlos manualmente, por ejemplo para conservar el control sobre la variante elegida, esta es la organización esperada, tal como la documenta el tutorial Qwen-Image-Edit de docs.comfy.org.

Estructura esperada (instalación manual o portátil)
ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── qwen_image_edit_fp8_e4m3fn.safetensors        # ou qwen_image_edit_2509_fp8_e4m3fn.safetensors
    ├── text_encoders/
    │   └── qwen_2.5_vl_7b_fp8_scaled.safetensors
    ├── vae/
    │   └── qwen_image_vae.safetensors
    └── loras/
        └── Qwen-Image-Lightning-4steps-V1.0.safetensors    # facultatif, accélère
  1. 01
    Descargar el modelo de difusión
    En Hugging Face, repositorio Comfy-Org/Qwen-Image-Edit_ComfyUI, carpeta split_files/diffusion_models. Elige el archivo FP8 correspondiente a la versión deseada. Comprueba el tamaño que aparece en la página antes de hacer clic y compáralo con el archivo recibido: una descarga interrumpida produce un archivo truncado y un error ilegible al cargarlo.
  2. 02
    Descargar el codificador de texto y el VAE
    Mismo repositorio, carpetas split_files/text_encoders y split_files/vae. El codificador es común a Qwen-Image y a todas las versiones de Qwen-Image-Edit: basta con un solo ejemplar, aunque instales varias versiones del modelo. Lo mismo ocurre con el VAE.
  3. 03
    Guardar cada archivo en su subcarpeta
    Modelo en diffusion_models, codificador en text_encoders, VAE en vae. Con ComfyUI Desktop, la carpeta models se encuentra en la ubicación elegida durante la instalación, visible en los ajustes de la aplicación. Un archivo depositado en checkpoints en lugar de diffusion_models no aparece en el nodo de carga.
  4. 04
    Opcional: LoRA Lightning
    El repositorio lightx2v/Qwen-Image-Lightning publica LoRA que reducen la generación a 4 u 8 pasos en lugar de 20, tanto para Qwen-Image como para Qwen-Image-Edit. Archivo en models/loras. Las versiones posteriores del modelo de edición tienen sus propios LoRA Lightning: elige el que lleve el nombre de tu versión.
  5. 05
    Actualizar ComfyUI
    Después de copiar los archivos, haz clic en el botón de actualización de la interfaz o vuelve a cargar la página. Los nodos de carga vuelven a leer las carpetas en ese momento, no continuamente.
→
Compartir los archivos con Qwen-Image
Si también utilizas Qwen-Image para generar, solo difiere el modelo de difusión: qwen_image_fp8_e4m3fn.safetensors en lugar de la versión edit, en la misma carpeta diffusion_models. El codificador Qwen2.5-VL y el VAE son los mismos archivos. El repositorio Comfy-Org/Qwen-Image_ComfyUI ofrece además una versión destilada, prevista para menos pasos.

#Paso 3: cargar el flujo de trabajo de edición y entender sus nodos

Abra el modelo de workflow Qwen-Image-Edit desde la biblioteca. Si ha descargado los archivos manualmente, ComfyUI puede proponer descargarlos de nuevo: rechace la propuesta y, después, seleccione sus archivos en los nodos de carga. El grafo cuenta con alrededor de diez nodos, y cada uno tiene una función precisa.

Cargar modelo de difusión
Carga el archivo desde models/diffusion_models. El menú desplegable debe mostrar tu archivo Qwen-Image-Edit; si está vacío, el archivo está mal colocado o la interfaz no se ha actualizado.
Load CLIP, type qwen_image
Carga el codificador Qwen2.5-VL desde models/text_encoders. El campo type debe tener el valor qwen_image. Con otro tipo, el codificador se carga sin errores, pero el prompt se interpreta mal y obtienes cualquier cosa.
Cargar VAE
El VAE de Qwen-Image. Nada más.
Load Image, después Scale Image to Total Pixels
La imagen que desea modificar, reducida a aproximadamente un megapíxel. Este redimensionamiento no es opcional: el modelo se entrenó a esta escala, y una entrada mucho más grande degrada la coherencia y aumenta la VRAM.
TextEncodeQwenImageEdit
El nodo propio de esta familia. Recibe el codificador, el VAE, la imagen y tu instrucción, y produce el condicionamiento. Hay dos: uno para la instrucción positiva y otro para la negativa. Para la versión 2509 y las siguientes, el nodo se llama TextEncodeQwenImageEditPlus y acepta hasta tres imágenes.
ModelSamplingAuraFlow y CFGNorm
Dos nodos de ajuste del desruido, preconfigurados en el flujo de trabajo oficial, uno de ellos con un desplazamiento (shift) de alrededor de 3. No los retires: sin ellos, las imágenes salen deslavadas o saturadas.
KSampler, VAE Decode, Save Image
El desenfoque, la decodificación y el guardado, como en cualquier flujo de trabajo de ComfyUI. La imagen aparece en la carpeta output con el flujo de trabajo completo inscrito en el PNG.

Redacta la indicación como una instrucción, no como una descripción de la imagen final: « replace the text on the sign with OUVERT, keep the same font », « change the jacket to red leather, keep everything else », « remove the person on the left ». El modelo entiende principalmente chino e inglés; el francés suele funcionar, pero el inglés sigue siendo más fiable para las instrucciones precisas. Deja vacía la indicación negativa o hazla muy breve.

#Paso 4: los ajustes y el LoRA Lightning para ir rápido

El flujo de trabajo oficial parte de 20 pasos, un CFG de 2,5, el muestreador euler y el planificador simple. Estos valores son un buen punto de partida: el CFG de este modelo es bajo por diseño, y subirlo a 7, como con SDXL, produce imágenes saturadas y deformadas. Cambia primero la semilla (seed) para obtener variantes y, después, el número de pasos si al resultado le falta detalle.

  1. 01
    Primera edición sin LoRA
    Ejecuta el flujo de trabajo tal cual sobre una imagen sencilla, con una instrucción breve. Mira el terminal: la primera ejecución carga 30 GB de pesos desde el disco, lo que puede tardar varios minutos. Las ejecuciones siguientes reutilizan lo que está en memoria.
  2. 02
    Añadir el LoRA Lightning
    Inserta un nodo LoraLoaderModelOnly entre Load Diffusion Model y ModelSamplingAuraFlow, selecciona el LoRA Lightning 4 pasos, fuerza 1. Cambia el KSampler a 4 pasos y el CFG a 1,0: estos LoRA están entrenados para funcionar sin guía. El número de pasos se divide por cinco, por lo que el tiempo de eliminación de ruido se reduce en la misma proporción, a costa de una posible pérdida de fidelidad en los detalles finos y el texto, que el repositorio del LoRA no cuantifica.
  3. 03
    Fijar la semilla para comparar
    Configura KSampler con una semilla fija antes de comparar dos indicaciones o dos variantes del modelo. De lo contrario, atribuirás a la configuración diferencias que en realidad provienen del azar.
  4. 04
    Encadenar varias ediciones
    Para corregir en varias pasadas, vuelve a cargar la imagen de salida como nueva entrada. Cada pasada vuelve a pasar por el VAE y pierde un poco de detalle: limítate a dos o tres y conserva el original.
!
La imagen aparece desplazada o recortada
Un defecto conocido de la primera versión de Qwen-Image-Edit: la salida queda ligeramente desplazada o ampliada respecto a la entrada, sobre todo cuando las dimensiones no son múltiplos sencillos. La versión 2509 y su nodo TextEncodeQwenImageEditPlus han reducido notablemente el problema. Si sigues usando la primera versión, mantén el redimensionamiento a un megapíxel del flujo de trabajo oficial y usa dimensiones múltiplo de 16.

#Paso 5: la variante GGUF para tarjetas de 12 a 16 GB y Mac

ComfyUI no lee GGUF de forma nativa: hace falta la extensión ComfyUI-GGUF de city96, disponible en ComfyUI-Manager o mediante un clon de Git en la carpeta custom_nodes. Añade nodos de carga específicos y la lógica de organización sigue siendo la misma.

Terminal (instalación manual, entorno de ComfyUI activado)
cd ComfyUI/custom_nodes
git clone https://github.com/city96/ComfyUI-GGUF
pip install -r ComfyUI-GGUF/requirements.txt
# puis redémarrer ComfyUI
  1. 01
    Elegir la cuantización
    En el repositorio GGUF elegido, por ejemplo city96/Qwen-Image-Edit-gguf o QuantStack/Qwen-Image-Edit-2509-GGUF, la página muestra cada archivo con su tamaño. Elija el más grande que deje aproximadamente 2 GB de margen en su VRAM después de descontar la resolución prevista: Q6_K o Q5_K_M para 16 GB, Q4_K_M para 12 GB. Como ocurre con los LLM, Q4_K_M es el equilibrio habitual; por debajo de Q3, los textos y los pequeños detalles se resienten.
  2. 02
    Guardar el archivo
    El GGUF del modelo de difusión va en models/diffusion_models, o en models/unet, que la extensión también lee. El codificador de texto y el VAE siguen siendo los de la etapa 1, en safetensors.
  3. 03
    Sustituir el nodo de carga
    En el flujo de trabajo oficial, elimina Load Diffusion Model y coloca en su lugar Unet Loader (GGUF). Conecta su salida model donde estaba la anterior. El resto del grafo no cambia: TextEncodeQwenImageEdit, VAE, KSampler, todo funciona exactamente igual.
  4. 04
    Mantener el codificador en safetensors
    Existen GGUF de Qwen2.5-VL 7B, pero los producidos para llama.cpp están pensados para el diálogo y no incorporan necesariamente la parte de visión que la edición necesita para leer la imagen de entrada. Con el archivo oficial qwen_2.5_vl_7b_fp8_scaled.safetensors, descartas una causa de error. Pasa a un codificador GGUF solo si el repositorio indica explícitamente su compatibilidad con Qwen-Image-Edit en ComfyUI-GGUF.

En Mac se aplica el mismo procedimiento, con una sola diferencia: vigila la presión de memoria en el Monitor de Actividad. Cuando la memoria unificada se desborda, macOS escribe en el SSD y cada imagen tarda varias veces más, sin mostrar ningún mensaje de error.

#Errores frecuentes de nodos con Qwen-Image-Edit

Nodos rojos: TextEncodeQwenImageEdit o TextEncodeQwenImageEditPlus no encontrado
ComfyUI es demasiado antiguo. Estos nodos forman parte del núcleo de ComfyUI, no de una extensión: ningún gestor los encontrará. Actualiza ComfyUI y reinicia.
La validación de las salidas del prompt falló; el valor no está en la lista
El archivo seleccionado en un nodo de carga no existe en la carpeta esperada. Esto ocurre al abrir un flujo de trabajo descargado cuyos nombres de archivo difieren de los tuyos. Vuelve a abrir el menú desplegable de cada nodo de carga y elige tu archivo.
El tipo qwen_image no aparece en Load CLIP
La misma causa: versión de ComfyUI anterior a agosto de 2025. Actualice.
CUDA out of memory al principio del proceso de eliminación de ruido
Los pesos superan la VRAM y el desplazamiento no ha sido suficiente. En este orden: reduce la resolución de salida, cambia a una cuantización GGUF más pequeña, cierra las demás aplicaciones que ocupan la GPU y luego prueba las opciones de memoria de ComfyUI descritas en nuestra guía de instalación, como la reserva de VRAM o la desactivación de la VRAM dinámica.
Imagen de salida formada por ruido de colores o completamente negra
VAE o codificador de otra familia. Comprueba que Load VAE apunte a qwen_image_vae.safetensors y Load CLIP al codificador Qwen2.5-VL con el tipo qwen_image.
La imagen no se modifica, o apenas
Instrucción demasiado vaga o CFG reducido a 1 sin LoRA Lightning. Suba el CFG a 2,5 sin LoRA, reformule la instrucción como una orden directa y compruebe que la imagen está conectada correctamente al nodo TextEncodeQwenImageEdit, no solo al VAE Encode.
El texto reescrito es incorrecto o ilegible
Ponga el texto deseado entre comillas en la instrucción y especifique que se debe conservar la fuente. Las cuantizaciones más agresivas, Q2 y Q3, perjudican primero esta capacidad: vuelva a Q4 o FP8 para las ediciones de texto.
El flujo de trabajo de la versión 2509 solo acepta una imagen
Ha cargado el nodo antiguo TextEncodeQwenImageEdit. Sustitúyalo por TextEncodeQwenImageEditPlus, que expone las entradas image1, image2 e image3.
Falta Unet Loader (GGUF) después de instalar la extensión
Dependencias de Python no instaladas o ComfyUI no reiniciado. Vuelve a ejecutar pip install sobre el archivo requirements.txt de la extensión en el entorno de ComfyUI y, después, reinicia. El terminal muestra al iniciar la lista de extensiones cargadas y sus posibles errores de importación.
i
Diffusers en lugar de ComfyUI
Para programar la edición en Python, la ficha de Hugging Face Qwen/Qwen-Image-Edit ofrece un ejemplo con la clase QwenImageEditPipeline de Diffusers, en bf16 sobre CUDA, con el parámetro true_cfg_scale a 4 y 50 pasos. Esta vía carga el modelo nativo, es decir, unos 40 GB solo para el transformador: está pensada para tarjetas profesionales o para trasladarlo a la RAM mediante las opciones de Diffusers, y no aporta nada al usuario de ComfyUI.
Ejemplo de la ficha de Hugging Face (bf16, CUDA)
import torch
from PIL import Image
from diffusers import QwenImageEditPipeline

pipeline = QwenImageEditPipeline.from_pretrained("Qwen/Qwen-Image-Edit")
pipeline.to(torch.bfloat16)
pipeline.to("cuda")

image = Image.open("./input.png").convert("RGB")
prompt = "Change the rabbit's color to purple, with a flash light background."
inputs = {
    "image": image,
    "prompt": prompt,
    "generator": torch.manual_seed(0),
    "true_cfg_scale": 4.0,
    "negative_prompt": " ",
    "num_inference_steps": 50,
}
with torch.inference_mode():
    output = pipeline(**inputs)
    output.output_images[0].save("output_image_edit.png")

#Para ir más allá

Instalar ComfyUI y entender sus opciones de memoria
Sobremesa, portátil o manual; carpetas de modelos, VRAM dinámica y opciones de línea de comandos. https://quelllm.fr/guide/comfyui-installation-guide-debutant
Generar imágenes localmente: el panorama
Stable Diffusion, Flux, ComfyUI y Draw Things en Mac: qué opción para qué hardware. https://quelllm.fr/guide/generer-images-en-local-guide
ControlNet: dominar la composición
Posición, contornos, profundidad: lo que la versión 2509 de Qwen-Image-Edit integra de forma nativa, explicado en Stable Diffusion. https://quelllm.fr/guide/controlnet-guide-stable-diffusion
VRAM: qué es y cuánta se necesita
Leer la memoria de su tarjeta, entender el traslado a la RAM y elegir una tarjeta. https://quelllm.fr/guide/vram-c-est-quoi-combien-pour-ia
Fuentes oficiales
Repositorio GitHub QwenLM/Qwen-Image (lista de versiones y fechas), ficha de Hugging Face Qwen/Qwen-Image-Edit (licencia Apache 2.0, ejemplo de Diffusers), repositorios Comfy-Org/Qwen-Image-Edit_ComfyUI y Comfy-Org/Qwen-Image_ComfyUI (archivos FP8, tamaños), tutoriales Qwen-Image y Qwen-Image-Edit en docs.comfy.org (estructura de directorios, flujos de trabajo), extensión github.com/city96/ComfyUI-GGUF.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.