Intermedio 11 minQwen

Qwen3-VL en local: el modelo de visión de referencia con Ollama

Qwen3-VL es el modelo de visión-lenguaje con pesos abiertos más sólido para ejecutar en local en 2026. Con Ollama, se instala con un solo comando y puedes enviarle imágenes, capturas de pantalla o documentos escaneados directamente desde el terminal o una interfaz. Esta guía cubre la elección de la variante según tu VRAM, la instalación de Qwen3-VL con Ollama paso a paso, casos de uso concretos (descripción de imágenes, OCR, lectura de tablas) y una exposición honesta de sus limitaciones frente a los modelos en la nube.

Por Léa B.·Actualización 2026-08-06·Probado en Windows, macOS y Linux

#¿Por qué Qwen3-VL en local?

Un modelo de visión y lenguaje (VLM) acepta tanto texto como imágenes de entrada. Le muestras una foto, una captura de pantalla o un escaneo y le haces una pregunta sobre ello en lenguaje natural. Qwen3-VL, desarrollado por el equipo Qwen de Alibaba, se ha consolidado como la referencia de pesos abiertos para este uso: combina una buena comprensión visual, un OCR multilingüe robusto (francés incluido) y un razonamiento sólido sobre lo que ve.

La ventaja de ejecutarlo localmente es la misma que para cualquier LLM autoalojado, pero aquí pesa aún más: las imágenes que analizas suelen ser sensibles —capturas de pantalla de trabajo, documentos administrativos, fotos de facturas, documentos de identidad—. Con Qwen3-VL en tu máquina, nada abandona tu disco. No hay subida a la nube, ni cuotas de uso, ni suscripción.

Confidencialidad
Las imágenes permanecen en tu máquina. Ideal para documentos de RRHH, médicos, jurídicos o cualquier escaneo personal.
Sin coste de uso
No hay costo por imagen ni por token. Puedes procesar 10 o 10.000 capturas sin que suba la factura.
Sin conexión
Una vez descargado el modelo, todo funciona sin conexión a internet.
Automatizable
La API de Ollama compatible con OpenAI permite automatizar el procesamiento masivo de imágenes mediante scripts en Python o shell.

#Requisitos y VRAM necesaria

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Un VLM consume más recursos que un modelo de texto de tamaño equivalente: además de los pesos del modelo de lenguaje, carga un codificador visual y debe procesar los «tokens de imagen» generados por cada foto. Una imagen de alta resolución puede representar varios miles de tokens, lo que consume contexto y memoria durante la inferencia. Por tanto, reserva un margen de VRAM adicional al tamaño de los pesos.

Con cuantización Q4_K_M (el mejor equilibrio entre calidad y memoria para la mayoría de los usos), estas son las referencias de consumo de memoria según el tamaño del modelo de lenguaje subyacente. Añade ~1 a 2 GB para el codificador visual y el procesamiento de imágenes.

Variante ~3-4B
≈ 2-3 GB de VRAM. Cabe holgadamente en una RTX 3060 de 12 GB o en un Mac de la serie M con 16 GB. El punto de entrada para la visión local.
Variante ~7-8B
≈ 5-6 GB de VRAM. Cómodo en RTX 3060/4070 12 GB o RTX 4080 16 GB. Mejor relación calidad/recursos para uso diario.
Variante ~30-32B
≈ 19-20 GB de VRAM. Apunta a una RTX 4090 de 24 GB, una tarjeta profesional o un Mac con abundante memoria unificada (M4 Pro/Max de 32 GB o más).
i
GPU vs Mac Apple Silicon
En Mac, la memoria unificada sirve tanto de RAM como de VRAM: un M4 Pro de 24 GB o un M4 Max de 48 GB ejecuta las variantes grandes que pocas GPU de consumo pueden ejecutar. En PC, lo que cuenta es la VRAM de la GPU: si el modelo no cabe en ella, Ollama traslada una parte a la CPU y el rendimiento cae en picado.

En cuanto al software, necesitas tener instalada una versión reciente de Ollama que admita entradas multimodales (el demonio escucha por defecto en http://localhost:11434). Una interfaz como Open WebUI o LM Studio hace que enviar imágenes sea más cómodo que por línea de comandos, pero no es obligatoria.

#Elegir la variante adecuada según la VRAM

Qwen3-VL está disponible en varios tamaños. Lo adecuado no es elegir la variante más grande que tu máquina pueda cargar técnicamente, sino aquella que deje margen para el contexto y el procesamiento de imágenes. Así puedes decidir.

  1. 01
    Tienes 8-12 GB de VRAM
    Empieza con una variante de 3-4B en Q4_K_M. Describe correctamente una imagen, realiza OCR sobre texto nítido y responde rápidamente. Suficiente para la mayoría de usos simples (descripción, extracción de texto).
  2. 02
    Tienes 12-16 GB de VRAM
    Busca una variante de 7-8B en Q4_K_M o Q5_K_M. Es el punto ideal: mucho mejor en documentos complejos, tablas y razonamiento visual, sin perder fluidez.
  3. 03
    Tienes 24 GB de VRAM o un Mac con mucha memoria
    Una variante de 30-32B en Q4_K_M permite alcanzar la mejor calidad disponible en local: lectura fiable de documentos densos, tablas de múltiples columnas y razonamiento preciso sobre esquemas. Es ahí donde más se reduce la diferencia con la nube.
  4. 04
    En caso de duda
    Comienza con la variante 7-8B. Si la calidad es suficiente, has ahorrado VRAM; si alcanza su límite con tus documentos, sube un nivel.
→
La cuantización cuenta
Para un VLM, mantente en Q4_K_M o Q5_K_M. Bajar demasiado (Q3 y por debajo) empeora significativamente el OCR y la lectura de caracteres pequeños — precisamente lo que se pide a un modelo de visión. Si dudas sobre la cuantización, mejor una versión más pequeña en Q4_K_M que una grande en Q3.

#Instalar Qwen3-VL con Ollama

La instalación se hace con un solo comando. Ollama descarga el modelo desde su biblioteca, incluido el codificador visual, y lo deja disponible para la inferencia. Reemplaza la etiqueta por la variante elegida en el paso anterior.

Terminal — instalar y ejecutar
# Télécharger la variante (exemple ~8B ; adaptez le tag à votre VRAM)
ollama pull qwen3-vl:8b

# Lancer une session interactive
ollama run qwen3-vl:8b

# Vérifier ce qui est chargé et sur quel matériel (GPU/CPU)
ollama ps

Una vez dentro de la sesión interactiva, enviar una imagen se hace indicando su ruta en el prompt. Ollama detecta la ruta de archivo, codifica la imagen y la añade al contexto. Luego puedes hacer tantas preguntas como quieras sobre ella.

Sesión Ollama — analizar una imagen
>>> Décris cette image en détail : /home/moi/captures/dashboard.png

>>> Quel est le chiffre affiché en haut à droite ?

>>> Y a-t-il une alerte visible ? Résume-la.
!
Ruta absoluta recomendada
Según el sistema, Ollama puede no resolver correctamente una ruta relativa. Si aparece «archivo no encontrado» aunque la imagen exista, proporciona la ruta absoluta completa. En Windows, usa caracteres de escape o barras normales (C:/Users/...).

#Describir imágenes y capturas de pantalla

Este es el uso más inmediato. Qwen3-VL describe el contenido de una foto, identifica objetos, lee texto presente en la imagen y razona sobre lo que observa. Para capturas de pantalla — interfaces, dashboards, mensajes de error — es especialmente útil: lee la interfaz, detecta elementos y puede explicar lo que se muestra.

Descripción general
« ¿Qué muestra esta imagen? » — inventario de elementos, ambiente, contexto. Útil para etiquetar o clasificar fotos
Lectura de capturas de pantalla
Interpretar un dashboard, transcribir un mensaje de error, explicar una interfaz desconocida a partir de una captura.
Extracción selectiva
«¿Cuál es el monto total?», «Lista los nombres visibles» — el modelo aísla la información solicitada en lugar de describir todo.
Preguntas de seguimiento
Una vez que la imagen está en contexto, sigue haciendo preguntas sin volver a enviarla. El modelo mantiene la referencia visual.
→
Un prompt preciso vale más que un prompt vago
«Describe la imagen» da una respuesta genérica. «Enumera únicamente los errores que aparecen en esta captura, con su código» da un resultado útil. Como con un LLM de texto, cuanto más delimitada esté la instrucción, mejor será la salida; esto es aún más cierto en visión, donde el modelo puede distraerse con detalles innecesarios.

#Leer documentos escaneados y tablas

El OCR y la comprensión de documentos son los ámbitos en los que Qwen3-VL realmente destaca y justifica el paso a una variante de 7-8B o más. No se limita a transcribir el texto: entiende la estructura (títulos, columnas, casillas), lo que permite extraer datos de una tabla o de un formulario en un formato limpio.

Factura o comprobante escaneado
Extraer el proveedor, la fecha, el importe sin/con impuestos y las líneas de artículos, y pedir una salida en JSON directamente utilizable.
Tabla en imagen
Reconstituir una tabla capturada en foto en formato Markdown o CSV, preservando las filas y columnas.
Documento manuscrito
El OCR procesa el texto impreso sin dificultad; los resultados con texto manuscrito siguen siendo menos predecibles, pero funciona si la escritura es clara.
Formulario administrativo
Identificar los campos completados y su valor, incluyendo las casillas marcadas.
Sesión Ollama — extraer una tabla en Markdown
>>> Voici un tableau scanné : /home/moi/docs/tableau-ventes.png
... Reproduis-le exactement au format Markdown, sans rien ajouter
... ni interpréter. Conserve toutes les colonnes et l'ordre des lignes.
!
Siempre verificar los números críticos
Ningún OCR local es fiable al 100 %. En importes, referencias o números, un dígito puede leerse mal (un 8 confundido con un 6, una coma desplazada). Para un uso contable o jurídico, revisa siempre los valores extraídos: el modelo agiliza la introducción de datos, pero no es una fuente de verdad.

#Automatizar mediante la API

Para procesar imágenes en masa —clasificar una carpeta de capturas, extraer datos de decenas de facturas—, la API de Ollama permite automatizar todo esto mediante scripts. Ollama expone una API compatible con OpenAI en el puerto 11434; la imagen se transmite codificada en base64. Aquí tienes un ejemplo mínimo en Python.

Python — analizar una imagen mediante script
import base64
import requests

with open("facture.png", "rb") as f:
    img_b64 = base64.b64encode(f.read()).decode()

resp = requests.post("http://localhost:11434/api/generate", json={
    "model": "qwen3-vl:8b",
    "prompt": "Extrais fournisseur, date et montant TTC au format JSON.",
    "images": [img_b64],
    "stream": False,
})

print(resp.json()["response"])

A partir de ahí, un simple bucle que recorra una carpeta te permite procesar todo un lote de imágenes y agrupar los resultados. Como la inferencia es local, no se aplica ningún límite de tasa de solicitudes: la única restricción es la velocidad de tu GPU.

→
Pide un formato estructurado
Para la automatización, exige siempre un formato de salida (JSON, CSV) en el prompt y especifica las claves esperadas. Así evitarás tener que analizar texto libre. Añade «responde solo con el JSON, sin texto adicional» para facilitar el procesamiento posterior.

#Lo que la visión local aún no sabe hacer

Seamos honestos: Qwen3-VL en local es excelente, pero sigue habiendo diferencias con los mejores modelos de visión en la nube y tareas en las que hay que rebajar las expectativas. Conocer estas limitaciones evita sorpresas desagradables.

Detalles pequeños y baja resolución
En una imagen borrosa, muy densa o de baja resolución, el OCR falla. Un escaneo limpio y bien enmarcado cambia todo. El modelo no «adivina» lo que no ve claramente.
Conteo preciso
Contar exactamente muchos objetos idénticos («¿cuántas personas en esta foto?») sigue siendo poco fiable más allá de unos pocos elementos. Es una limitación conocida de los VLM.
Razonamiento espacial preciso
Posiciones relativas exactas, mediciones, geometría precisa: el modelo da una idea, no una respuesta metrológica.
Vídeo y tiempo real
Ollama procesa imágenes fijas. Para analizar vídeo, tienes que dividirlo tú mismo en fotogramas, sin comprensión temporal nativa.
Alucinaciones visuales
Como todo LLM, puede afirmar que ve un elemento ausente, especialmente si tu pregunta lo sugiere. Haz preguntas neutras, que no induzcan la respuesta.
i
Local vs. nube: la verdadera disyuntiva
Los modelos de visión en la nube mantienen la ventaja en los casos más difíciles (documentos muy densos, razonamiento visual complejo, conteo). Pero para el 90 % de los usos habituales —describir, extraer texto, leer una tabla nítida— Qwen3-VL en local cumple su función, gratis y sin exponer tus imágenes. La elección depende de la sensibilidad de los datos y de la dificultad real de tus imágenes.

#Solución de problemas

«Archivo no encontrado» al usar una imagen existente
Ruta relativa resuelta incorrectamente. Proporciona la ruta absoluta completa. En Windows, utiliza barras diagonales (C:/...).
Respuesta lenta o intermitente
El modelo excede la capacidad de la VRAM y una parte se ejecuta en la CPU. Compruébalo con ollama ps; si es así, pasa a una variante más pequeña o a una cuantización de menos bits.
OCR mediocre
Imagen de resolución demasiado baja o cuantización demasiado agresiva. Proporciona un escaneo más nítido y usa como mínimo Q4_K_M.
El modelo ignora la imagen
Quizás hayas cargado por error una variante de texto de Qwen. Asegúrate de que la etiqueta contenga -vl y de que tu versión de Ollama admita funciones multimodales.
Out of memory al cargar
La variante supera tu VRAM. Cambia a un tamaño menor — recuerda añadir el margen para el codificador visual y los tokens de imagen.
Diagnósticos rápidos
# Le modèle est-il bien chargé et sur GPU ?
ollama ps

# Lister les modèles vision installés
ollama list

# Tester l'API en local
curl http://localhost:11434/api/tags

#Para ir más allá

Qwen3-VL se basa en el mismo entorno Ollama que el resto de tus modelos locales. Estas guías complementan de forma natural tu configuración de visión:

LLM multimodal de visión en local: analizar imágenes con Ollama
Panorama de los VLM que puedes alojar en tu propia infraestructura (Qwen-VL, Llama-Vision, Llama 4 Scout) para comparar y elegir según tus necesidades.
Instalar Ollama: Windows, macOS y Linux
Si Ollama aún no está instalado, la guía completa de instalación con los requisitos de GPU.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Para ajustar el consumo de memoria de tu variante Qwen3-VL a tu VRAM.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.