Real-ESRGAN: ampliar tus imágenes en local
Real-ESRGAN es un modelo libre (BSD-3-Clause) que amplía una imagen ×4 reconstruyendo detalles plausibles. La opción más sencilla es el ejecutable portátil ncnn-vulkan, sin CUDA ni PyTorch, para tarjetas Intel, AMD o NVIDIA. Elige el modelo según la imagen: realesrgan-x4plus para fotos, la variante anime para ilustraciones. El proyecto no ha publicado nuevas versiones desde septiembre de 2022 y los detalles añadidos son inventados: nunca debe usarse para texto ni como prueba.
Real-ESRGAN amplía una imagen reconstruyendo detalles plausibles en lugar de estirar píxeles. Es un modelo libre, pequeño y rápido, que se ha convertido en la pieza que se añade al final de una cadena de generación de imágenes local o que se usa para restaurar fotos antiguas. Esta guía, actualizada al 28 de septiembre de 2026, indica qué modelo elegir, cómo lanzarlo sin instalar PyTorch, qué inventa, qué errores esperar y en qué situación se encuentra el proyecto frente a alternativas recientes.
#Qué hace un ampliador de imágenes con IA
Una ampliación clásica interpola: calcula píxeles intermedios a partir de sus vecinos, lo que da una imagen más grande y más borrosa. Un ampliador basado en aprendizaje hace otra cosa. Ha sido entrenado para recuperar una imagen nítida a partir de una versión degradada y reconstruye lo que más se parece al original: texturas, bordes, grano. La diferencia se resume en una frase: la interpolación no crea información, el modelo la inventa. Es exactamente lo que se le pide, y por eso hay que saber dónde no usarlo.
Real-ESRGAN proviene de un artículo de Xintao Wang, Liangbin Xie, Chao Dong y Ying Shan (Tencent ARC Lab), publicado en arXiv en julio de 2021 y presentado en ICCV Workshops: «Training Real-World Blind Super-Resolution with Pure Synthetic Data». Su resumen describe la idea: un modelo entrenado únicamente con datos sintéticos, con una modelización de degradaciones «de orden superior» que simula mejor los defectos reales (desenfoque, ruido, compresión) y un discriminador U-Net. «Blind» significa que el modelo no necesita saber qué degradación ha sufrido la imagen. El repositorio cuenta con más de 36 000 estrellas.
#Los modelos, y cuál elegir
Imágenes y vídeos de IA en local, sin límites: ComfyUI, Flux, Z-Image, Wan 2.2 en tu GPU o tu Mac — flujos de trabajo listos para cargar, marco legal incluido.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
| Modelo | Escala | Descripción del proyecto | Para usarlo en |
|---|---|---|---|
| RealESRGAN_x4plus | ×4 | Modelo ×4 para imágenes generales | Fotos, imágenes generadas: la opción por defecto |
| RealESRGAN_x2plus | ×2 | Modelo ×2 para imágenes generales | Cuando ×4 es demasiado, sin recurrir a un redimensionamiento posterior |
| RealESRNet_x4plus | ×4 | Modelo ×4 con pérdida MSE, efectos de suavizado excesivo | Rara vez: el resultado queda alisado y apagado |
| realesr-general-x4v3 | ×4, usable en ×1, ×2, ×3 | Modelo pequeño, consume mucha menos memoria de la GPU y requiere mucho menos tiempo, con menor capacidad de reducción de ruido | Máquinas modestas, lotes de imágenes; la opción -dn ajusta la reducción de ruido |
| RealESRGAN_x4plus_anime_6B | ×4 | Optimizado para imágenes de anime, red más pequeña (6 bloques RRDB) | Ilustraciones, láminas, dibujos 2D |
| realesr-animevideov3 | ×4, usable en ×1, ×2, ×3 | Modelo de tamaño XS para videos de animación | Secuencias de animación |
El catálogo del proyecto separa los modelos para fotos de los modelos para ilustraciones, y esta elección es la que más influye en el resultado. La variante anime se presenta como optimizada para este tipo de imagen, con una red más pequeña, y el proyecto la compara con waifu2x. Para un dibujo, pruébala primero: un modelo para fotos puede añadir textura a zonas de color uniforme que deberían permanecer lisas; compruébalo en tu imagen.
#Tres formas de lanzarlo
El README describe tres opciones: una demostración en línea, el ejecutable portátil ncnn y el script Python. Para uso local regular, solo las dos últimas son relevantes.
| Vía | Lo que se necesita | Ventajas | Límites |
|---|---|---|---|
| Ejecutable portátil (ncnn-vulkan) | Un GPU Intel, AMD o NVIDIA compatible con Vulkan. Archivos para Windows, Linux y macOS. Sin CUDA, sin PyTorch. | Nada que instalar, los modelos están incluidos | No gestiona todas las funciones del script Python, como --outscale, y puede crear incoherencias entre bloques |
| Script Python (inference_realesrgan.py) | Python 3.7 o superior, PyTorch 1.7 o superior, basicsr, facexlib y gfpgan para caras | Escala arbitraria, rostros, procesamiento por bloques, imágenes con canal alfa, en escala de grises o de 16 bits | Dependencias frágiles, ver la sección de solución de problemas |
#Las órdenes exactas
El ejecutable portátil se utiliza en línea de comandos. El texto de ayuda muestra las opciones: -i para la entrada (archivo o carpeta), -o para la salida, -s para la escala (2, 3 o 4), -n para el modelo, -t para el tamaño del bloque de imagen, -g para elegir la GPU, -f para el formato de salida.
El script de Python ofrece la opción --outscale: el modelo siempre amplía la imagen ×4 y luego el programa redimensiona el resultado a la escala deseada mediante un redimensionamiento de bajo costo computacional. También está --tile para dividir la imagen y ahorrar memoria, y --fp32 para usar precisión completa, que es obligatoria cuando se ejecuta en la CPU (ver más abajo).
En ComfyUI, los modelos de ampliación se guardan en ComfyUI/models/upscale_models y se aplican mediante un nodo de carga seguido de un nodo de ampliación basado en el modelo. Si buscas una interfaz de escritorio, el README menciona varios proyectos que incluyen Real-ESRGAN, entre ellos Upscayl, un software libre para Linux, macOS y Windows que cuenta con unas 50.000 estrellas y se ha actualizado en los últimos días.
#Usarlo bien
- 01Elegir el modelo según el tipo de imagenFoto o ilustración: este es el ajuste que más cambia el resultado, mucho más que el factor de ampliación. Añade siempre -n al comando.
- 02No acumular pasadasAmpliar una imagen dos veces seguidas por un factor de ×4 le da un aspecto de plástico, no más detalle. Basta con una pasada con el factor adecuado; si ×4 es demasiado, usa el modelo ×2 o la opción de escala.
- 03Limpiar antes de agrandarUna ligera reducción de ruido previa evita que el modelo trate el ruido como un detalle que debe reconstruir. Con realesr-general-x4v3, la opción -dn regula la intensidad de la reducción de ruido para evitar un resultado demasiado suavizado.
- 04Reservar face_enhance para rostros realesLa opción face_enhance se basa en GFPGAN y solo sirve para rostros reales: las preguntas frecuentes del proyecto desaconsejan usarla en animación, donde consume memoria de la GPU sin aportar nada.
- 05Comparar al 100 %Una ampliación se evalúa píxel a píxel, no en una miniatura. Muchos resultados que parecen espectaculares a tamaño reducido se ven lisos y artificiales de cerca.
#Qué tamaño elegir: un cálculo antes de empezar
Una ampliación ×4 solo es útil si el tamaño final responde a un uso concreto. Este es el factor necesario según el destino, a partir de un cálculo sencillo: pixels = centímetros ÷ 2,54 × resolución en puntos por pulgada, y luego factor = lado mayor deseado ÷ lado mayor inicial.
| Uso | Longitud objetivo del lado mayor | Factor necesario |
|---|---|---|
| Pantalla 4K, pantalla completa | 3 840 px | ×3,75: una pasada ×4 sirve |
| Impresión A4 a 300 ppp | 3 508 px | ×3,4 : una pasada ×4, o --outscale 3,4 |
| Impresión A3 a 300 ppp | 4 961 px | ×4,8: supera una pasada ×4; acepta una impresión un poco más pequeña en lugar de encadenar dos pasadas |
| Página web o miniatura | 1.600 a 2.000 px | ×1,6 a ×2: el modelo ×2 o --outscale basta |
Recuerda el principio: buscar el tamaño útil, no el tamaño máximo. Una imagen de 1 024 × 1 024 ampliada ×4 pasa a 4 096 × 4 096, es decir, unos 16,8 millones de píxeles, dieciséis veces más que al principio: un archivo proporcionalmente mayor que almacenar, cargar y retocar, para una mejora a menudo imperceptible en pantalla. Con la opción --outscale del script de Python, se elige la escala exacta en lugar de ampliar demasiado y luego reducir.
#En una cadena de generación de imágenes
En la generación local, el escalador de imágenes es la última etapa: se genera a una resolución que la tarjeta admite y luego se amplía la imagen, lo que requiere menos memoria que generarla directamente a gran tamaño. Las resoluciones nativas de los modelos de imagen, por ejemplo 512 × 512 para SD 1.5 o 1024 × 1024 para SDXL, se detallan en la guía de Stable Diffusion. Después, una ampliación ×2 de una imagen SDXL de 1024 × 1024 da 2048 × 2048 sin volver a pasar por el modelo de difusión.
- Stable Diffusion: versiones, resoluciones nativas y licencias
- Generar imágenes localmente: el panorama
#Lo que inventa
- El texto
- Al ampliarlos, los caracteres pequeños se convierten en caracteres plausibles pero incorrectos. Para un documento, lo que se necesita es reconocimiento óptico de caracteres, no una herramienta de ampliación.
- Los rostros
- Un rostro borroso, al ampliarse, se convierte en un rostro nítido que no corresponde exactamente a la misma persona. Ningún uso para identificación es aceptable.
- Detalles finos
- Motivos de tela, hojas, cabello: el modelo genera una textura creíble, no la textura original.
- Los defectos
- Un artefacto de compresión muy visible a veces se ampliará con esmero, en lugar de eliminarse.
#Solución de problemas: errores comunes
| Síntoma | Causa | Corrección |
|---|---|---|
| Error «slow_conv2d_cpu not implemented for Half» | Real-ESRGAN utiliza por defecto precisión media (fp16), que algunos operadores no admiten en la CPU | Añadir la opción --fp32 al comando |
| ModuleNotFoundError : torchvision.transforms.functional_tensor | basicsr importa un módulo que torchvision eliminó a partir de la versión 0.17 (informe del 28 de agosto de 2024; un parche se propone en una solicitud de fusión del repositorio BasicSR) | Instalar una versión de torchvision compatible o usar el ejecutable portátil ncnn que no la requiere |
| Bloques visibles o uniones en la imagen | El ejecutable divide la imagen en bloques y luego los vuelve a unir, lo que el README señala como fuente de incoherencias | Ajustar el tamaño de los bloques con -t (0 para automático): los bloques más grandes reducen las uniones visibles si la memoria lo permite |
| Imagen de salida negra | El TODO del repositorio ncnn indica que algunos PC producen imágenes negras | Probar la otra vía (Python o ncnn) u otra tarjeta con -g |
| Caras distorsionadas en una ilustración | Opción face_enhance activa en contenido no fotográfico | Quitarla: está diseñada para rostros reales |
#¿En qué estado está el proyecto en 2026?
Hay que ser honestos sobre su antigüedad. La última versión publicada, la v0.3.0, data del 20 de septiembre de 2022, y el último commit del repositorio principal, del 2 de abril de 2024, elimina un archivo de configuración de integración continua. La implementación ncnn, cuyo README indica una licencia MIT, no ha recibido actualizaciones desde mayo de 2024. Esto no hace que el modelo sea malo: hace su trabajo, es pequeño y funciona en tarjetas modestas. Pero no se puede contar con correcciones para incompatibilidades recientes, como la de torchvision.
En cuanto a alternativas, el README de ComfyUI enumera SeedVR2 y SUPIR entre sus modelos compatibles. SeedVR2 se presenta como una restauración de vídeo en una etapa mediante post-entrenamiento adversarial de difusión, y SUPIR busca la restauración fotorrealista de imágenes «in the wild». Se trata de enfoques basados en la difusión: no tenemos una comparación cuantificada fiable con Real-ESRGAN, y el riesgo de detalles inventados es al menos tan alto. Lee la licencia de SUPIR, que GitHub clasifica como «Other», antes de un uso comercial. Para la mayoría de las fotos e ilustraciones del día a día, Real-ESRGAN sigue ofreciendo un buen equilibrio entre simplicidad, velocidad y hardware requerido.
- ControlNet: dominar la composición antes de la generación
- El kit Imágenes IA
- Fuente: repositorio oficial de Real-ESRGAN
- Fuente: el artículo de investigación en arXiv
- Fuente: implementación ncnn-vulkan
#FAQ
¿Es Real-ESRGAN gratuito?+
¿Se necesita una tarjeta gráfica?+
¿Se puede ampliar texto escaneado?+
¿Por qué mi ilustración tiene grano después de ampliarla?+
¿Se puede usar en video?+
¿Aún se mantiene Real-ESRGAN?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.