🇨🇳 Qwen 3 VL 30B-A3B
Visión MoE 30B/3B activos. Punto óptimo para visión en Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
Ranking actualizado el 22/09/2026
Clasificación de LLM con pesos abiertos capaces de analizar imágenes de entrada: OCR, descripción, VQA, análisis de gráficos, extracción de datos a partir de capturas de pantalla. Todos se pueden alojar en infraestructura propia.
Visión MoE 30B/3B activos. Punto óptimo para visión en Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
Variante MoE de Gemma 4. 26B/4B activos. Multimodal completo (texto+imagen+audio).
ollama run gemma4:26b
Primer dLLM abierto con licencia Apache 2.0: MoE 16B/1B + decodificador de difusión de 6.2B. Texto+visión unificados. Lanzamiento: 22 de abril de 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B: modelo denso multimodal (texto + visión), 262k de contexto, ~16 GB de VRAM en Q4 (18 GB de pesos en Ollama). Apache 2.0, programación con agentes y visión.
ollama run qwen3.8:27b
Modelo denso multimodal de 31B (texto+imagen+audio). Más de 140 idiomas, contexto de 256k. N.º 3 en Chatbot Arena open.
ollama run gemma4:31b
VLM de visión denso de 8B de Qwen 3. El mejor VLM pequeño de la tercera generación de Qwen.
ollama run qwen3-vl:8b
| Puesto | Modelo | Params | VRAM Q4 | Contexto | Licencia |
|---|---|---|---|---|---|
| #1 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 |
| #2 | Gemma 4 26B-A4B MoE | 26B | 16 GB | 128 000 | Apache 2.0 |
| #3 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 |
| #4 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #5 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #6 | Gemma 4 31B | 31B | 18 GB | 256 000 | Apache 2.0 |
| #7 | Qwen 3 VL 8B | 8B | 6 GB | 262 144 | Apache 2.0 |
Has elegido tu modelo de visión. El kit IA Local dedica un capítulo entero a hacerlo funcionar correctamente en tu casa: conversar usando imágenes en local, paso a paso (cap. 7).
Filtro por la etiqueta «visión». La puntuación favorece a los modelos recientes (los VLM evolucionan muy rápido) y a los de mayor tamaño (representan mejor los detalles finos).
Criterios considerados:
La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.
¿Cuál es el mejor LLM open-source para analizar imágenes?
Qwen 3 VL 30B-A3B es nuestro #1 para 30B de parámetros. Para una configuración más ligera, Qwen 2.5 VL 7B funciona muy bien en 8-12 GB de VRAM.
¿Se puede hacer OCR con estos modelos?
Sí — los VLM modernos saben leer texto en imágenes (documentos escaneados, capturas de pantalla). Para OCR masivo/industrial, DeepSeek OCR es un modelo especializado. Para texto manuscrito en francés, opta por Qwen 2.5 VL, que maneja bien el francés.
¿Se necesita Ollama o llama.cpp para la visión?
Ambos soportan modelos de visión (Llama 3.2 Vision, LLaVA, Qwen VL). LM Studio también. Utiliza la API a través de -images o el parámetro images dentro de Ollama.
¿Cuánta VRAM se necesita para un VLM decente?
8 GB para un 7B VL (Qwen 2.5 VL 7B), 12-16 GB para un 11B (Llama 3.2 Vision), 40+ GB para los grandes 72B. La visión añade ~1-2 GB de VRAM además del modelo de texto.
Profundiza con nuestras comparativas detalladas entre los finalistas: