Qwen3-VL en local: el modelo de visión de referencia con Ollama
Qwen3-VL es el modelo de visión-lenguaje con pesos abiertos más sólido para ejecutar en local en 2026. Con Ollama, se instala con un solo comando y puedes enviarle imágenes, capturas de pantalla o documentos escaneados directamente desde el terminal o una interfaz. Esta guía cubre la elección de la variante según tu VRAM, la instalación de Qwen3-VL con Ollama paso a paso, casos de uso concretos (descripción de imágenes, OCR, lectura de tablas) y una exposición honesta de sus limitaciones frente a los modelos en la nube.
#¿Por qué Qwen3-VL en local?
Un modelo de visión y lenguaje (VLM) acepta tanto texto como imágenes de entrada. Le muestras una foto, una captura de pantalla o un escaneo y le haces una pregunta sobre ello en lenguaje natural. Qwen3-VL, desarrollado por el equipo Qwen de Alibaba, se ha consolidado como la referencia de pesos abiertos para este uso: combina una buena comprensión visual, un OCR multilingüe robusto (francés incluido) y un razonamiento sólido sobre lo que ve.
La ventaja de ejecutarlo localmente es la misma que para cualquier LLM autoalojado, pero aquí pesa aún más: las imágenes que analizas suelen ser sensibles —capturas de pantalla de trabajo, documentos administrativos, fotos de facturas, documentos de identidad—. Con Qwen3-VL en tu máquina, nada abandona tu disco. No hay subida a la nube, ni cuotas de uso, ni suscripción.
- Confidencialidad
- Las imágenes permanecen en tu máquina. Ideal para documentos de RRHH, médicos, jurídicos o cualquier escaneo personal.
- Sin coste de uso
- No hay costo por imagen ni por token. Puedes procesar 10 o 10.000 capturas sin que suba la factura.
- Sin conexión
- Una vez descargado el modelo, todo funciona sin conexión a internet.
- Automatizable
- La API de Ollama compatible con OpenAI permite automatizar el procesamiento masivo de imágenes mediante scripts en Python o shell.
#Requisitos y VRAM necesaria
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Un VLM consume más recursos que un modelo de texto de tamaño equivalente: además de los pesos del modelo de lenguaje, carga un codificador visual y debe procesar los «tokens de imagen» generados por cada foto. Una imagen de alta resolución puede representar varios miles de tokens, lo que consume contexto y memoria durante la inferencia. Por tanto, reserva un margen de VRAM adicional al tamaño de los pesos.
Con cuantización Q4_K_M (el mejor equilibrio entre calidad y memoria para la mayoría de los usos), estas son las referencias de consumo de memoria según el tamaño del modelo de lenguaje subyacente. Añade ~1 a 2 GB para el codificador visual y el procesamiento de imágenes.
- Variante ~3-4B
- ≈ 2-3 GB de VRAM. Cabe holgadamente en una RTX 3060 de 12 GB o en un Mac de la serie M con 16 GB. El punto de entrada para la visión local.
- Variante ~7-8B
- ≈ 5-6 GB de VRAM. Cómodo en RTX 3060/4070 12 GB o RTX 4080 16 GB. Mejor relación calidad/recursos para uso diario.
- Variante ~30-32B
- ≈ 19-20 GB de VRAM. Apunta a una RTX 4090 de 24 GB, una tarjeta profesional o un Mac con abundante memoria unificada (M4 Pro/Max de 32 GB o más).
En cuanto al software, necesitas tener instalada una versión reciente de Ollama que admita entradas multimodales (el demonio escucha por defecto en http://localhost:11434). Una interfaz como Open WebUI o LM Studio hace que enviar imágenes sea más cómodo que por línea de comandos, pero no es obligatoria.
#Elegir la variante adecuada según la VRAM
Qwen3-VL está disponible en varios tamaños. Lo adecuado no es elegir la variante más grande que tu máquina pueda cargar técnicamente, sino aquella que deje margen para el contexto y el procesamiento de imágenes. Así puedes decidir.
- 01Tienes 8-12 GB de VRAMEmpieza con una variante de 3-4B en Q4_K_M. Describe correctamente una imagen, realiza OCR sobre texto nítido y responde rápidamente. Suficiente para la mayoría de usos simples (descripción, extracción de texto).
- 02Tienes 12-16 GB de VRAMBusca una variante de 7-8B en Q4_K_M o Q5_K_M. Es el punto ideal: mucho mejor en documentos complejos, tablas y razonamiento visual, sin perder fluidez.
- 03Tienes 24 GB de VRAM o un Mac con mucha memoriaUna variante de 30-32B en Q4_K_M permite alcanzar la mejor calidad disponible en local: lectura fiable de documentos densos, tablas de múltiples columnas y razonamiento preciso sobre esquemas. Es ahí donde más se reduce la diferencia con la nube.
- 04En caso de dudaComienza con la variante 7-8B. Si la calidad es suficiente, has ahorrado VRAM; si alcanza su límite con tus documentos, sube un nivel.
#Instalar Qwen3-VL con Ollama
La instalación se hace con un solo comando. Ollama descarga el modelo desde su biblioteca, incluido el codificador visual, y lo deja disponible para la inferencia. Reemplaza la etiqueta por la variante elegida en el paso anterior.
Una vez dentro de la sesión interactiva, enviar una imagen se hace indicando su ruta en el prompt. Ollama detecta la ruta de archivo, codifica la imagen y la añade al contexto. Luego puedes hacer tantas preguntas como quieras sobre ella.
#Describir imágenes y capturas de pantalla
Este es el uso más inmediato. Qwen3-VL describe el contenido de una foto, identifica objetos, lee texto presente en la imagen y razona sobre lo que observa. Para capturas de pantalla — interfaces, dashboards, mensajes de error — es especialmente útil: lee la interfaz, detecta elementos y puede explicar lo que se muestra.
- Descripción general
- « ¿Qué muestra esta imagen? » — inventario de elementos, ambiente, contexto. Útil para etiquetar o clasificar fotos
- Lectura de capturas de pantalla
- Interpretar un dashboard, transcribir un mensaje de error, explicar una interfaz desconocida a partir de una captura.
- Extracción selectiva
- «¿Cuál es el monto total?», «Lista los nombres visibles» — el modelo aísla la información solicitada en lugar de describir todo.
- Preguntas de seguimiento
- Una vez que la imagen está en contexto, sigue haciendo preguntas sin volver a enviarla. El modelo mantiene la referencia visual.
#Leer documentos escaneados y tablas
El OCR y la comprensión de documentos son los ámbitos en los que Qwen3-VL realmente destaca y justifica el paso a una variante de 7-8B o más. No se limita a transcribir el texto: entiende la estructura (títulos, columnas, casillas), lo que permite extraer datos de una tabla o de un formulario en un formato limpio.
- Factura o comprobante escaneado
- Extraer el proveedor, la fecha, el importe sin/con impuestos y las líneas de artículos, y pedir una salida en JSON directamente utilizable.
- Tabla en imagen
- Reconstituir una tabla capturada en foto en formato Markdown o CSV, preservando las filas y columnas.
- Documento manuscrito
- El OCR procesa el texto impreso sin dificultad; los resultados con texto manuscrito siguen siendo menos predecibles, pero funciona si la escritura es clara.
- Formulario administrativo
- Identificar los campos completados y su valor, incluyendo las casillas marcadas.
#Automatizar mediante la API
Para procesar imágenes en masa —clasificar una carpeta de capturas, extraer datos de decenas de facturas—, la API de Ollama permite automatizar todo esto mediante scripts. Ollama expone una API compatible con OpenAI en el puerto 11434; la imagen se transmite codificada en base64. Aquí tienes un ejemplo mínimo en Python.
A partir de ahí, un simple bucle que recorra una carpeta te permite procesar todo un lote de imágenes y agrupar los resultados. Como la inferencia es local, no se aplica ningún límite de tasa de solicitudes: la única restricción es la velocidad de tu GPU.
#Lo que la visión local aún no sabe hacer
Seamos honestos: Qwen3-VL en local es excelente, pero sigue habiendo diferencias con los mejores modelos de visión en la nube y tareas en las que hay que rebajar las expectativas. Conocer estas limitaciones evita sorpresas desagradables.
- Detalles pequeños y baja resolución
- En una imagen borrosa, muy densa o de baja resolución, el OCR falla. Un escaneo limpio y bien enmarcado cambia todo. El modelo no «adivina» lo que no ve claramente.
- Conteo preciso
- Contar exactamente muchos objetos idénticos («¿cuántas personas en esta foto?») sigue siendo poco fiable más allá de unos pocos elementos. Es una limitación conocida de los VLM.
- Razonamiento espacial preciso
- Posiciones relativas exactas, mediciones, geometría precisa: el modelo da una idea, no una respuesta metrológica.
- Vídeo y tiempo real
- Ollama procesa imágenes fijas. Para analizar vídeo, tienes que dividirlo tú mismo en fotogramas, sin comprensión temporal nativa.
- Alucinaciones visuales
- Como todo LLM, puede afirmar que ve un elemento ausente, especialmente si tu pregunta lo sugiere. Haz preguntas neutras, que no induzcan la respuesta.
#Solución de problemas
- «Archivo no encontrado» al usar una imagen existente
- Ruta relativa resuelta incorrectamente. Proporciona la ruta absoluta completa. En Windows, utiliza barras diagonales (C:/...).
- Respuesta lenta o intermitente
- El modelo excede la capacidad de la VRAM y una parte se ejecuta en la CPU. Compruébalo con ollama ps; si es así, pasa a una variante más pequeña o a una cuantización de menos bits.
- OCR mediocre
- Imagen de resolución demasiado baja o cuantización demasiado agresiva. Proporciona un escaneo más nítido y usa como mínimo Q4_K_M.
- El modelo ignora la imagen
- Quizás hayas cargado por error una variante de texto de Qwen. Asegúrate de que la etiqueta contenga -vl y de que tu versión de Ollama admita funciones multimodales.
- Out of memory al cargar
- La variante supera tu VRAM. Cambia a un tamaño menor — recuerda añadir el margen para el codificador visual y los tokens de imagen.
#Para ir más allá
Qwen3-VL se basa en el mismo entorno Ollama que el resto de tus modelos locales. Estas guías complementan de forma natural tu configuración de visión:
- LLM multimodal de visión en local: analizar imágenes con Ollama
- Panorama de los VLM que puedes alojar en tu propia infraestructura (Qwen-VL, Llama-Vision, Llama 4 Scout) para comparar y elegir según tus necesidades.
- Instalar Ollama: Windows, macOS y Linux
- Si Ollama aún no está instalado, la guía completa de instalación con los requisitos de GPU.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para ajustar el consumo de memoria de tu variante Qwen3-VL a tu VRAM.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.