Principiante 11 minImagen

Real-ESRGAN: ampliar tus imágenes en local

Respuesta directa

Real-ESRGAN es un modelo libre (BSD-3-Clause) que amplía una imagen ×4 reconstruyendo detalles plausibles. La opción más sencilla es el ejecutable portátil ncnn-vulkan, sin CUDA ni PyTorch, para tarjetas Intel, AMD o NVIDIA. Elige el modelo según la imagen: realesrgan-x4plus para fotos, la variante anime para ilustraciones. El proyecto no ha publicado nuevas versiones desde septiembre de 2022 y los detalles añadidos son inventados: nunca debe usarse para texto ni como prueba.

Real-ESRGAN amplía una imagen reconstruyendo detalles plausibles en lugar de estirar píxeles. Es un modelo libre, pequeño y rápido, que se ha convertido en la pieza que se añade al final de una cadena de generación de imágenes local o que se usa para restaurar fotos antiguas. Esta guía, actualizada al 28 de septiembre de 2026, indica qué modelo elegir, cómo lanzarlo sin instalar PyTorch, qué inventa, qué errores esperar y en qué situación se encuentra el proyecto frente a alternativas recientes.

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux

#Qué hace un ampliador de imágenes con IA

Una ampliación clásica interpola: calcula píxeles intermedios a partir de sus vecinos, lo que da una imagen más grande y más borrosa. Un ampliador basado en aprendizaje hace otra cosa. Ha sido entrenado para recuperar una imagen nítida a partir de una versión degradada y reconstruye lo que más se parece al original: texturas, bordes, grano. La diferencia se resume en una frase: la interpolación no crea información, el modelo la inventa. Es exactamente lo que se le pide, y por eso hay que saber dónde no usarlo.

Real-ESRGAN proviene de un artículo de Xintao Wang, Liangbin Xie, Chao Dong y Ying Shan (Tencent ARC Lab), publicado en arXiv en julio de 2021 y presentado en ICCV Workshops: «Training Real-World Blind Super-Resolution with Pure Synthetic Data». Su resumen describe la idea: un modelo entrenado únicamente con datos sintéticos, con una modelización de degradaciones «de orden superior» que simula mejor los defectos reales (desenfoque, ruido, compresión) y un discriminador U-Net. «Blind» significa que el modelo no necesita saber qué degradación ha sufrido la imagen. El repositorio cuenta con más de 36 000 estrellas.

#Los modelos, y cuál elegir

El kit Imágenes IA

Imágenes y vídeos de IA en local, sin límites: ComfyUI, Flux, Z-Image, Wan 2.2 en tu GPU o tu Mac — flujos de trabajo listos para cargar, marco legal incluido.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida
Modelos del repositorio oficial, según su Model Zoo
ModeloEscalaDescripción del proyectoPara usarlo en
RealESRGAN_x4plus×4Modelo ×4 para imágenes generalesFotos, imágenes generadas: la opción por defecto
RealESRGAN_x2plus×2Modelo ×2 para imágenes generalesCuando ×4 es demasiado, sin recurrir a un redimensionamiento posterior
RealESRNet_x4plus×4Modelo ×4 con pérdida MSE, efectos de suavizado excesivoRara vez: el resultado queda alisado y apagado
realesr-general-x4v3×4, usable en ×1, ×2, ×3Modelo pequeño, consume mucha menos memoria de la GPU y requiere mucho menos tiempo, con menor capacidad de reducción de ruidoMáquinas modestas, lotes de imágenes; la opción -dn ajusta la reducción de ruido
RealESRGAN_x4plus_anime_6B×4Optimizado para imágenes de anime, red más pequeña (6 bloques RRDB)Ilustraciones, láminas, dibujos 2D
realesr-animevideov3×4, usable en ×1, ×2, ×3Modelo de tamaño XS para videos de animaciónSecuencias de animación

El catálogo del proyecto separa los modelos para fotos de los modelos para ilustraciones, y esta elección es la que más influye en el resultado. La variante anime se presenta como optimizada para este tipo de imagen, con una red más pequeña, y el proyecto la compara con waifu2x. Para un dibujo, pruébala primero: un modelo para fotos puede añadir textura a zonas de color uniforme que deberían permanecer lisas; compruébalo en tu imagen.

!
El modelo predeterminado del programa portátil no es el que creemos
El README principal cita realesrgan-x4plus como modelo predeterminado del ejecutable portátil, pero el texto de ayuda del programa indica por defecto realesr-animevideov3, el modelo de animación. En una foto, este modelo da un resultado inadecuado. Especifícalo siempre con la opción -n, en lugar de confiar en el predeterminado.

#Tres formas de lanzarlo

El README describe tres opciones: una demostración en línea, el ejecutable portátil ncnn y el script Python. Para uso local regular, solo las dos últimas son relevantes.

Las dos vías locales, según el README
VíaLo que se necesitaVentajasLímites
Ejecutable portátil (ncnn-vulkan)Un GPU Intel, AMD o NVIDIA compatible con Vulkan. Archivos para Windows, Linux y macOS. Sin CUDA, sin PyTorch.Nada que instalar, los modelos están incluidosNo gestiona todas las funciones del script Python, como --outscale, y puede crear incoherencias entre bloques
Script Python (inference_realesrgan.py)Python 3.7 o superior, PyTorch 1.7 o superior, basicsr, facexlib y gfpgan para carasEscala arbitraria, rostros, procesamiento por bloques, imágenes con canal alfa, en escala de grises o de 16 bitsDependencias frágiles, ver la sección de solución de problemas

#Las órdenes exactas

El ejecutable portátil se utiliza en línea de comandos. El texto de ayuda muestra las opciones: -i para la entrada (archivo o carpeta), -o para la salida, -s para la escala (2, 3 o 4), -n para el modelo, -t para el tamaño del bloque de imagen, -g para elegir la GPU, -f para el formato de salida.

Terminal
# Exécutable portable : photo agrandie ×4 avec le modèle généraliste
./realesrgan-ncnn-vulkan.exe -i input.jpg -o output.png -n realesrgan-x4plus

# Script Python : échelle arbitraire (ici ×3,5) avec amélioration des visages
python inference_realesrgan.py -n RealESRGAN_x4plus -i inputs --outscale 3.5 --face_enhance

El script de Python ofrece la opción --outscale: el modelo siempre amplía la imagen ×4 y luego el programa redimensiona el resultado a la escala deseada mediante un redimensionamiento de bajo costo computacional. También está --tile para dividir la imagen y ahorrar memoria, y --fp32 para usar precisión completa, que es obligatoria cuando se ejecuta en la CPU (ver más abajo).

En ComfyUI, los modelos de ampliación se guardan en ComfyUI/models/upscale_models y se aplican mediante un nodo de carga seguido de un nodo de ampliación basado en el modelo. Si buscas una interfaz de escritorio, el README menciona varios proyectos que incluyen Real-ESRGAN, entre ellos Upscayl, un software libre para Linux, macOS y Windows que cuenta con unas 50.000 estrellas y se ha actualizado en los últimos días.

#Usarlo bien

  1. 01
    Elegir el modelo según el tipo de imagen
    Foto o ilustración: este es el ajuste que más cambia el resultado, mucho más que el factor de ampliación. Añade siempre -n al comando.
  2. 02
    No acumular pasadas
    Ampliar una imagen dos veces seguidas por un factor de ×4 le da un aspecto de plástico, no más detalle. Basta con una pasada con el factor adecuado; si ×4 es demasiado, usa el modelo ×2 o la opción de escala.
  3. 03
    Limpiar antes de agrandar
    Una ligera reducción de ruido previa evita que el modelo trate el ruido como un detalle que debe reconstruir. Con realesr-general-x4v3, la opción -dn regula la intensidad de la reducción de ruido para evitar un resultado demasiado suavizado.
  4. 04
    Reservar face_enhance para rostros reales
    La opción face_enhance se basa en GFPGAN y solo sirve para rostros reales: las preguntas frecuentes del proyecto desaconsejan usarla en animación, donde consume memoria de la GPU sin aportar nada.
  5. 05
    Comparar al 100 %
    Una ampliación se evalúa píxel a píxel, no en una miniatura. Muchos resultados que parecen espectaculares a tamaño reducido se ven lisos y artificiales de cerca.

#Qué tamaño elegir: un cálculo antes de empezar

Una ampliación ×4 solo es útil si el tamaño final responde a un uso concreto. Este es el factor necesario según el destino, a partir de un cálculo sencillo: pixels = centímetros ÷ 2,54 × resolución en puntos por pulgada, y luego factor = lado mayor deseado ÷ lado mayor inicial.

Factor necesario a partir de una imagen cuyo lado mayor mide 1 024 píxeles (cálculo, impresión a 300 ppp)
UsoLongitud objetivo del lado mayorFactor necesario
Pantalla 4K, pantalla completa3 840 px×3,75: una pasada ×4 sirve
Impresión A4 a 300 ppp3 508 px×3,4 : una pasada ×4, o --outscale 3,4
Impresión A3 a 300 ppp4 961 px×4,8: supera una pasada ×4; acepta una impresión un poco más pequeña en lugar de encadenar dos pasadas
Página web o miniatura1.600 a 2.000 px×1,6 a ×2: el modelo ×2 o --outscale basta

Recuerda el principio: buscar el tamaño útil, no el tamaño máximo. Una imagen de 1 024 × 1 024 ampliada ×4 pasa a 4 096 × 4 096, es decir, unos 16,8 millones de píxeles, dieciséis veces más que al principio: un archivo proporcionalmente mayor que almacenar, cargar y retocar, para una mejora a menudo imperceptible en pantalla. Con la opción --outscale del script de Python, se elige la escala exacta en lugar de ampliar demasiado y luego reducir.

#En una cadena de generación de imágenes

En la generación local, el escalador de imágenes es la última etapa: se genera a una resolución que la tarjeta admite y luego se amplía la imagen, lo que requiere menos memoria que generarla directamente a gran tamaño. Las resoluciones nativas de los modelos de imagen, por ejemplo 512 × 512 para SD 1.5 o 1024 × 1024 para SDXL, se detallan en la guía de Stable Diffusion. Después, una ampliación ×2 de una imagen SDXL de 1024 × 1024 da 2048 × 2048 sin volver a pasar por el modelo de difusión.

#Lo que inventa

El texto
Al ampliarlos, los caracteres pequeños se convierten en caracteres plausibles pero incorrectos. Para un documento, lo que se necesita es reconocimiento óptico de caracteres, no una herramienta de ampliación.
Los rostros
Un rostro borroso, al ampliarse, se convierte en un rostro nítido que no corresponde exactamente a la misma persona. Ningún uso para identificación es aceptable.
Detalles finos
Motivos de tela, hojas, cabello: el modelo genera una textura creíble, no la textura original.
Los defectos
Un artefacto de compresión muy visible a veces se ampliará con esmero, en lugar de eliminarse.
!
Una imagen ampliada no es prueba
En un contexto jurídico, médico o de identificación, el detalle añadido por un modelo no existe en el original. La ampliación mejora la comodidad de lectura; no añade ninguna información que pueda utilizarse como prueba.

#Solución de problemas: errores comunes

Errores conocidos, según el FAQ y los informes de errores del proyecto
SíntomaCausaCorrección
Error «slow_conv2d_cpu not implemented for Half»Real-ESRGAN utiliza por defecto precisión media (fp16), que algunos operadores no admiten en la CPUAñadir la opción --fp32 al comando
ModuleNotFoundError : torchvision.transforms.functional_tensorbasicsr importa un módulo que torchvision eliminó a partir de la versión 0.17 (informe del 28 de agosto de 2024; un parche se propone en una solicitud de fusión del repositorio BasicSR)Instalar una versión de torchvision compatible o usar el ejecutable portátil ncnn que no la requiere
Bloques visibles o uniones en la imagenEl ejecutable divide la imagen en bloques y luego los vuelve a unir, lo que el README señala como fuente de incoherenciasAjustar el tamaño de los bloques con -t (0 para automático): los bloques más grandes reducen las uniones visibles si la memoria lo permite
Imagen de salida negraEl TODO del repositorio ncnn indica que algunos PC producen imágenes negrasProbar la otra vía (Python o ncnn) u otra tarjeta con -g
Caras distorsionadas en una ilustraciónOpción face_enhance activa en contenido no fotográficoQuitarla: está diseñada para rostros reales

#¿En qué estado está el proyecto en 2026?

Hay que ser honestos sobre su antigüedad. La última versión publicada, la v0.3.0, data del 20 de septiembre de 2022, y el último commit del repositorio principal, del 2 de abril de 2024, elimina un archivo de configuración de integración continua. La implementación ncnn, cuyo README indica una licencia MIT, no ha recibido actualizaciones desde mayo de 2024. Esto no hace que el modelo sea malo: hace su trabajo, es pequeño y funciona en tarjetas modestas. Pero no se puede contar con correcciones para incompatibilidades recientes, como la de torchvision.

En cuanto a alternativas, el README de ComfyUI enumera SeedVR2 y SUPIR entre sus modelos compatibles. SeedVR2 se presenta como una restauración de vídeo en una etapa mediante post-entrenamiento adversarial de difusión, y SUPIR busca la restauración fotorrealista de imágenes «in the wild». Se trata de enfoques basados en la difusión: no tenemos una comparación cuantificada fiable con Real-ESRGAN, y el riesgo de detalles inventados es al menos tan alto. Lee la licencia de SUPIR, que GitHub clasifica como «Other», antes de un uso comercial. Para la mayoría de las fotos e ilustraciones del día a día, Real-ESRGAN sigue ofreciendo un buen equilibrio entre simplicidad, velocidad y hardware requerido.

#FAQ

FAQ
¿Es Real-ESRGAN gratuito?+
Sí. El repositorio está bajo licencia BSD-3-Clause, la implementación ncnn-vulkan está bajo licencia MIT, y la ejecución es local, sin costo de uso ni cuenta. Sin embargo, revisa los derechos sobre las imágenes que amplíes y la licencia de cada modelo de terceros o aplicación de escritorio que incluya Real-ESRGAN, como Upscayl, que está bajo licencia AGPL-3.0.
¿Se necesita una tarjeta gráfica?+
No necesariamente. El script de Python se ejecuta en el procesador con la opción --fp32, pero mucho más lentamente. El ejecutable ncnn requiere una GPU compatible con Vulkan, de Intel, AMD o NVIDIA, y no necesita CUDA ni PyTorch. El pequeño modelo realesr-general-x4v3 está diseñado para consumir mucha menos memoria de GPU y requerir mucho menos tiempo, lo que lo hace adecuado para máquinas modestas.
¿Se puede ampliar texto escaneado?+
Técnicamente sí, pero no es lo que hay que hacer: los caracteres reconstruidos son plausibles y a veces incorrectos. Para un documento escaneado, utiliza el reconocimiento óptico de caracteres, que lee el texto en lugar de volver a dibujarlo. La herramienta de ampliación puede usarse antes del OCR únicamente para facilitar la visualización, nunca para validar el texto leído.
¿Por qué mi ilustración tiene grano después de ampliarla?+
Probablemente has usado el modelo destinado a las fotos. Para dibujos, utiliza RealESRGAN_x4plus_anime_6B, optimizado para imágenes de anime con una red más pequeña. Con el ejecutable portátil, presta atención también al modelo predeterminado: especifícalo con -n, porque el texto de ayuda muestra realesr-animevideov3 como valor predeterminado.
¿Se puede usar en video?+
Sí, imagen por imagen. Para la animación, el proyecto proporciona el modelo realesr-animevideov3 y un script de video. Con el ejecutable ncnn, el método documentado consiste en extraer las imágenes con ffmpeg, procesarlas y luego reensamblarlas. Al procesarse de forma independiente, las imágenes sucesivas pueden producir parpadeos: comprueba el resultado durante la reproducción, no solo con el video en pausa.
¿Aún se mantiene Real-ESRGAN?+
Muy poco. Su última versión, la v0.3.0, data de septiembre de 2022, y su último commit, de abril de 2024, solo afecta a la integración continua. El modelo sigue siendo utilizable, pero el proyecto no corrige las incompatibilidades de dependencias como torchvision. Para evitar estos problemas, el ejecutable portátil ncnn es la opción más estable.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.