Inicio › Catálogo › Mejor LLM local con visión en 2026

Mejor LLM local con visión en 2026

◆ IA Local — Tu ChatGPT privado y gratuito, en tu máquina, en 1 h · 24 € · o todos los kits 49 € →

Ranking actualizado el 22/09/2026

Clasificación de LLM con pesos abiertos capaces de analizar imágenes de entrada: OCR, descripción, VQA, análisis de gráficos, extracción de datos a partir de capturas de pantalla. Todos se pueden alojar en infraestructura propia.

Clasificación

1

🇨🇳 Qwen 3 VL 30B-A3B

Alibaba · 30B de parámetros · Apache 2.0 · 262 144 tokens ctx

Visión MoE 30B/3B activos. Punto óptimo para visión en Qwen 3. 256k ctx.

Por qué esta posición Soporta entradas de imagen nativamente. 30B parámetros para un análisis detallado.
ollama run qwen3-vl:30b
VRAM Q4
19 GB
35 GB en Q8
2

🇺🇸 Gemma 4 26B-A4B MoE

Google · 26B de parámetros · Apache 2.0 · 128 000 tokens ctx

Variante MoE de Gemma 4. 26B/4B activos. Multimodal completo (texto+imagen+audio).

Por qué esta posición Admite imágenes como entrada de forma nativa. 26B parámetros para un análisis correcto.
ollama run gemma4:26b
VRAM Q4
16 GB
28 GB en Q8
3

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16 mil millones de parámetros · Apache 2.0 · 8 192 tokens ctx

Primer dLLM abierto con licencia Apache 2.0: MoE 16B/1B + decodificador de difusión de 6.2B. Texto+visión unificados. Lanzamiento: 22 de abril de 2026.

Por qué esta posición Admite entradas de imagen de forma nativa. 16B de parámetros para un análisis correcto.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
VRAM Q4
18 GB
30 GB en Q8
4

🇨🇳 Qwen 3.6 27B

Alibaba · 27 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Modelo denso multimodal de 27B, lanzado el 22 de abril de 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Por qué esta posición Admite imágenes como entrada de forma nativa. 27B parámetros para un análisis correcto.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB en Q8
5

🇨🇳 Qwen 3.8 27B

Alibaba · 27 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B: modelo denso multimodal (texto + visión), 262k de contexto, ~16 GB de VRAM en Q4 (18 GB de pesos en Ollama). Apache 2.0, programación con agentes y visión.

Por qué esta posición Admite imágenes como entrada de forma nativa. 27B parámetros para un análisis correcto.
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB en Q8
6

🇺🇸 Gemma 4 31B

Google · 31 mil millones de parámetros · Apache 2.0 · 256 000 tokens ctx

Modelo denso multimodal de 31B (texto+imagen+audio). Más de 140 idiomas, contexto de 256k. N.º 3 en Chatbot Arena open.

Por qué esta posición Admite imágenes como entrada de forma nativa. 31B de parámetros para un análisis detallado.
ollama run gemma4:31b
VRAM Q4
18 GB
33 GB en Q8
7

🇨🇳 Qwen 3 VL 8B

Alibaba · 8 mil millones de parámetros · Apache 2.0 · 262 144 tokens ctx

VLM de visión denso de 8B de Qwen 3. El mejor VLM pequeño de la tercera generación de Qwen.

Por qué esta posición Admite imágenes como entrada de forma nativa. 8B parámetros para un análisis correcto.
ollama run qwen3-vl:8b
VRAM Q4
6 GB
10 GB en Q8

Tabla comparativa

Puesto Modelo Params VRAM Q4 Contexto Licencia
#1 Qwen 3 VL 30B-A3B 30B 19 GB 262 144 Apache 2.0
#2 Gemma 4 26B-A4B MoE 26B 16 GB 128 000 Apache 2.0
#3 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0
#4 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#5 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#6 Gemma 4 31B 31B 18 GB 256 000 Apache 2.0
#7 Qwen 3 VL 8B 8B 6 GB 262 144 Apache 2.0
El kit de IA Local

Has elegido tu modelo de visión. El kit IA Local dedica un capítulo entero a hacerlo funcionar correctamente en tu casa: conversar usando imágenes en local, paso a paso (cap. 7).

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Metodología del ranking

Filtro por la etiqueta «visión». La puntuación favorece a los modelos recientes (los VLM evolucionan muy rápido) y a los de mayor tamaño (representan mejor los detalles finos).

Criterios considerados:

  • Comprensión de imágenes
  • OCR / extracción de texto
  • VQA (preguntas sobre imágenes)
  • Compatible con Ollama / llama.cpp

La puntuación es totalmente transparente: consulta nuestra metodología para conocer los detalles del cálculo de VRAM/tokens/seg.

Preguntas frecuentes

¿Cuál es el mejor LLM open-source para analizar imágenes?

Qwen 3 VL 30B-A3B es nuestro #1 para 30B de parámetros. Para una configuración más ligera, Qwen 2.5 VL 7B funciona muy bien en 8-12 GB de VRAM.

¿Se puede hacer OCR con estos modelos?

Sí — los VLM modernos saben leer texto en imágenes (documentos escaneados, capturas de pantalla). Para OCR masivo/industrial, DeepSeek OCR es un modelo especializado. Para texto manuscrito en francés, opta por Qwen 2.5 VL, que maneja bien el francés.

¿Se necesita Ollama o llama.cpp para la visión?

Ambos soportan modelos de visión (Llama 3.2 Vision, LLaVA, Qwen VL). LM Studio también. Utiliza la API a través de -images o el parámetro images dentro de Ollama.

¿Cuánta VRAM se necesita para un VLM decente?

8 GB para un 7B VL (Qwen 2.5 VL 7B), 12-16 GB para un 11B (Llama 3.2 Vision), 40+ GB para los grandes 72B. La visión añade ~1-2 GB de VRAM además del modelo de texto.

Comparativas cara a cara

Profundiza con nuestras comparativas detalladas entre los finalistas:

Para ir más allá

Los kits de QuelLLM La guía de referencia según el uso
Todos los kits de por vida — 49 €