Intermedio 12 minEdge

MiniCPM en local (Ollama): el multimodal compact

Respuesta directa

MiniCPM-V es la serie de modelos compactos de visión y lenguaje de OpenBMB, bajo licencia Apache 2.0. En Ollama, la etiqueta minicpm-v aún carga la versión 2.6 (8 mil millones, 5,5 GB), minicpm-v4.5 una versión de 8 mil millones de 6,1 GB, y minicpm-v4.6 un modelo de aproximadamente 1,3 mil millones de parámetros de 1,6 GB. Empieza por el 4.6 en una máquina pequeña y luego compara usando tus imágenes.

MiniCPM es la familia de modelos compactos de OpenBMB, con modelos de visión-lenguaje diseñados para ejecutarse donde los modelos grandes no caben. La familia ha evolucionado mucho: la versión que carga la etiqueta histórica de Ollama ya no es la más reciente, y ahora existe un modelo de 1,3 mil millones de parámetros. Esta página indica qué etiqueta instalar, cómo valorar las cifras anunciadas y cuáles son los límites del OCR de un modelo generalista.

Por Samir K.·Actualización 2026-09-29·Probado en Windows, macOS y Linux

#¿Qué versión de MiniCPM instalar en 2026?

MiniCPM-V es la serie de modelos compactos de visión y lenguaje de OpenBMB, desarrollada por THUNLP (Universidad Tsinghua) y ModelBest, cuyos pesos y código están publicados bajo licencia Apache 2.0. En Ollama, coexisten tres tags que generan confusión. El tag minicpm-v, sin sufijo, sigue correspondiendo a MiniCPM-V 2.6, un modelo de 8 mil millones de parámetros que pesa 5,5 GB y tiene 32K de contexto. El tag minicpm-v4.5 carga una versión más reciente de 8 mil millones de parámetros (6,1 GB, 40K de contexto). El tag minicpm-v4.6, incorporado a la biblioteca oficial de Ollama el 25 de junio de 2026 según el repositorio del proyecto, pesa 1,6 GB y tiene aproximadamente 1,3 mil millones de parámetros. Para descubrir la visión local en una máquina pequeña, comienza por el 4.6; conserva el 4.5 para comparar resultados con tus documentos densos, porque nada garantiza que un modelo de 1,3 mil millones de parámetros lea tan bien como uno de 8 mil millones cuando el texto está muy apretado.

Las etiquetas de Ollama de la familia MiniCPM (fichas de la biblioteca, septiembre de 2026)
Tag OllamaVersiónParámetrosDescargaContexto anunciadoPuntos clave
minicpm-vMiniCPM-V 2.68 mil millones5,5 GB32KVersión de 2024: múltiples imágenes y video; es lo que carga la etiqueta sin sufijo
minicpm-v4.5MiniCPM-V 4.58 mil millones6,1 GB40KBasado en Qwen3-8B y SigLIP2-400M; vídeo con alta tasa de fotogramas; el editor anuncia 77,0 en OpenCompass
minicpm-v4.6MiniCPM-V 4.6aproximadamente 1.300 millones1,6 GB256KEl más ligero y más reciente; compresión de tokens visuales; versiones móviles
openbmb/minicpm-o4.5MiniCPM-o 4.59 mil millones6,1 GB40KVersión omni (voz, flujo en tiempo real); la ficha Ollama indica solo texto e imagen de entrada
i
Tres nombres que no hay que confundir
MiniCPM-V designa los modelos de visión, MiniCPM-o los modelos omni que añaden voz y flujo en tiempo real, y MiniCPM 5 la nueva serie de modelos de texto puro para dispositivos (MiniCPM5-1B y MiniCPM5-2B, este último con aproximadamente 2.500 millones de parámetros, ambos disponibles en OpenBMB en Ollama). Para el análisis de imágenes y el OCR, necesitas MiniCPM-V.

#Lo que aporta la serie y lo que hay que relativizar

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

La serie busca la mejor relación entre capacidad y tamaño. Según el repositorio de OpenBMB, MiniCPM-V 4.5 alcanza 77,0 en OpenCompass y supera, con 8 mil millones de parámetros, a GPT-4o-latest, Gemini 2.0 Pro y Qwen2.5-VL 72B. Para la versión 4.6, el proyecto indica un codificador visual cuyas necesidades de cálculo se reducen en más del 50 %, una compresión de tokens visuales a elegir (4 veces o 16 veces) y una tasa de generación de tokens de aproximadamente 1,5 veces la de Qwen3.5-0.8B. La ficha de Ollama del mismo modelo anuncia 2,4 veces: ambas cifras proceden del proyecto y estas páginas no detallan ningún protocolo de medición. Son anuncios, no mediciones independientes: mide los tiempos en tu equipo.

Multimodal compacto
Texto e imagen, múltiples imágenes a la vez y video. La versión 4.5 comprime hasta 6 imágenes de video en 64 tokens según el repositorio, lo que permite leer más imágenes sin costo adicional para el modelo de lenguaje.
OCR de alta resolución
El 4.5 procesa imágenes de cualquier proporción hasta 1,8 millones de píxeles (por ejemplo, 1344 x 1344). El editor afirma que lidera OCRBench y el análisis de PDF (OmniDocBench) entre los modelos multimodales generalistas; se dice que el 4.6 alcanza el nivel de Qwen3.5 2B en varios benchmarks, entre ellos OCRBench.
Licencia permisiva
El repositorio anuncia pesos y código bajo la licencia Apache 2.0, y las fichas de Hugging Face de las versiones 4.5 y 4.6 incluyen la misma mención. Comprueba la licencia exacta de la versión concreta que descargues.
Muchos formatos
El proyecto ofrece variantes GGUF, BNB, AWQ y GPTQ, y compatibilidad anunciada con SGLang, vLLM, llama.cpp y Ollama.

#¿Cuánta memoria, realmente?

Memoria anunciada por OpenBMB y peso mostrado por Ollama
Modelo y formatoMemoria anunciadaFuente
MiniCPM-V 4.6, Transformers (GPU)4 GBTabla de modelos del repositorio
MiniCPM-V 4.6, GGUF (CPU)2 GBTabla de modelos del repositorio
MiniCPM-V 4.6, BNB, AWQ o GPTQ (GPU)3 GBTabla de modelos del repositorio
MiniCPM-o 4.5, GGUF10 GBTabla de modelos del repositorio
MiniCPM-o 4.5, GPU19 GBTabla de modelos del repositorio
minicpm-v4.6 en Ollama1,6 GB de descargaFicha Ollama
minicpm-v4.5 en Ollama6,1 GB de descargaFicha Ollama

Estas cifras describen los pesos y la ejecución básica: el contexto y las imágenes requieren memoria adicional. Las imágenes se convierten en tokens visuales que ocupan la ventana de contexto, y la documentación de Ollama especifica que aplica por defecto 4.000 tokens de contexto cuando hay menos de 24 GiB de VRAM; aumentar este valor incrementa la memoria necesaria. Por tanto, el contexto anunciado de 256K para la versión 4.6 no se asigna automáticamente. Por último, la tabla del repositorio indica una ejecución en CPU para la versión GGUF de 4.6, sin publicar una velocidad: mide antes de prometer un funcionamiento en tiempo real.

→
La descarga parcial del modelo a la CPU
Si Ollama distribuye el modelo entre GPU y CPU, el comando ollama ps muestra la distribución en la columna PROCESSOR. El culpable suele ser la imagen o el contexto, no los pesos: reduce la resolución de la imagen o el valor de num_ctx antes de bajar la cuantización.

#Instalar MiniCPM-V con Ollama

Ollama gestiona la descarga, el proyector visual y el servidor de API: no hay nada más que instalar. Comienza por actualizar Ollama, ya que la versión 4.6 es reciente en la biblioteca. La página de la etiqueta minicpm-v ya menciona que exigía Ollama 0.3.10 o una versión posterior.

  1. 01
    Descargar el modelo
    ollama pull minicpm-v4.6 recupera los pesos del modelo de lenguaje y el proyector visual, es decir, aproximadamente 1,6 GB. Para la versión 4.5, utiliza minicpm-v4.5 (6,1 GB).
  2. 02
    Iniciar un primer chat
    ollama run minicpm-v4.6 abre una sesión interactiva. Haz una pregunta de texto antes de probar la visión.
  3. 03
    Enviar una imagen
    La documentación de Ollama muestra la ruta del archivo antes de la pregunta, por ejemplo ollama run minicpm-v4.6 ./photo.jpg seguido de «Describe esta imagen».
  4. 04
    Conectar una interfaz
    Una vez descargado, el modelo aparece en Open WebUI o en cualquier cliente que apunte al puerto 11434.
Terminal
# Le plus léger (1,6 Go)
ollama pull minicpm-v4.6

# La version 8 milliards, pour comparer
ollama pull minicpm-v4.5

# Vérifier ce qui est installé, puis discuter
ollama list
ollama run minicpm-v4.6 ./photo.jpg Décris cette image

#Visión y OCR en el día a día

MiniCPM-V se desenvuelve bien en tareas documentales: leer una factura, transcribir una captura de pantalla, extraer las filas de una tabla, describir una foto. Las imágenes de alta resolución importan mucho en OCR, porque un texto de letra pequeña que resulta ilegible en una miniatura se vuelve aprovechable a plena resolución. Formula prompts precisos: «Describe esta imagen» da una descripción general, mientras que «Transcribe fielmente todo el texto visible, conservando la disposición del contenido» produce un resultado mucho más limpio. Para extraer datos, pide un formato explícito: JSON, Markdown o tabla.

API de Ollama: extraer los campos de una factura
import base64, requests

with open("facture.png", "rb") as f:
    img = base64.b64encode(f.read()).decode()

r = requests.post("http://localhost:11434/api/generate", json={
    "model": "minicpm-v4.6",
    "prompt": "Extrais le total, la date et le numéro de facture en JSON.",
    "images": [img],
    "stream": False,
})
print(r.json()["response"])

La API REST de Ollama espera la imagen codificada en base64 en el campo images, como indica su documentación; los SDK aceptan además una ruta de archivo. Si usas Transformers en lugar de Ollama, el repositorio documenta un ajuste útil para la versión 4.6: el parámetro downsample_mode tiene un valor predeterminado de 16x, y 4x conserva cuatro veces más tokens visuales para un detalle más fino. Es el ajuste que debes probar cuando un texto muy pequeño no se lee bien.

!
Revisa siempre el OCR
No existe ningún modelo de visión compacto que sea fiable al 100 % en datos críticos: montos, referencias, fechas. Un modelo de visión puede generar un valor bien formado que no esté en la página. Para uso contable o jurídico, mantén una revisión humana o un control de coherencia en los campos sensibles.

¿Cuándo preferir un motor de OCR especializado? Si procesas miles de páginas y la trazabilidad es prioritaria, un motor especializado produce errores visibles en lugar de valores plausibles. PaddleOCR-VL, un modelo con menos de mil millones de parámetros, alcanza un 96,33 % en OmniDocBench v1.6 según su desarrollador, y Tesseract sigue siendo la opción ligera para texto limpio. MiniCPM-V mantiene la ventaja cuando también quieres describir la imagen o responder a una pregunta sobre ella.

#Frente a Qwen3-VL y los demás modelos compactos

El competidor directo de MiniCPM-V en la categoría de modelos de visión compactos es Qwen3-VL, disponible en Ollama especialmente en 2, 4 y 8 mil millones de parámetros. Ambos cubren el mismo terreno: descripción de imágenes, OCR, preguntas sobre un documento. El README de OpenBMB afirma que MiniCPM-V 4.6 supera en rendimiento a un modelo más grande, Gemma4-E2B-it, y se muestra más eficiente que Qwen3.5-0.8B: son comparaciones publicadas por el editor, basadas en sus propias evaluaciones.

Modelos de visión compactos disponibles en Ollama
ModeloTamaño mostradoLo que se puede decirGuía del sitio
minicpm-v4.61,6 GBEl desarrollador afirma que está al nivel de Qwen3.5 2B en varias pruebas de rendimiento visual, entre ellas OCRBenchEsta página
qwen3-vl:2b1,9 GBMisma clase de tamaño, contexto de 256K mostradoQwen3-VL local
qwen3-vl:8b6,1 GBEquivalente en tamaño al minicpm-v4.5Qwen3-VL local
MoondreamVer guíaModelo ligero de visión, tratado en una guía específica del sitioMoondream

La elección depende más de tus imágenes que de una ficha técnica. Ambas familias funcionan con el mismo Ollama y la misma API: pasar de una a otra consiste en cambiar el nombre del modelo en la solicitud; nada impide mantener las dos y dirigir las solicitudes según la tarea.

Comparar usando la misma imagen
ollama run minicpm-v4.6 ./ticket.jpg Transcris le texte de ce ticket
ollama run qwen3-vl:2b ./ticket.jpg Transcris le texte de ce ticket

#Edge, móvil y servidor: lo que documenta el proyecto

MiniCPM se diseñó para ejecutarse en el dispositivo. El repositorio indica que MiniCPM-V 4.6 se despliega en iOS, Android y HarmonyOS, con el código de adaptación abierto, y muestra grabaciones de pantalla sin editar en un iPhone 17 Pro Max, un Redmi K70 y un HUAWEI nova 14. Un repositorio de aplicaciones ofrece la descarga y la guía de despliegue. Para atender a varios usuarios, el proyecto anuncia compatibilidad con vLLM y SGLang, además de llama.cpp y Ollama.

  1. 01
    Digitalización local de documentos
    Un mini-PC o un NAS con una GPU de gama básica transforma una carpeta de documentos escaneados en texto en el que se pueden realizar búsquedas, sin enviar ningún documento sensible a la nube.
  2. 02
    Asistente offline
    En un portátil Apple Silicon o con una tarjeta gráfica modesta, la versión 4.6 lee la pantalla y responde a partir de capturas, incluso sin conexión.
  3. 03
    Preprocesamiento de un pipeline
    Antes de un sistema más pesado, clasifica: tipo de documento, campos evidentes. Solo los casos difíciles pasan a un modelo grande.
  4. 04
    Texto alternativo en masa
    Generar descripciones de imágenes para un sitio o una mediateca, por lotes, sin coste por llamada una vez amortizado el hardware.
i
MiniCPM-o 4.5: la voz requiere otra pila
MiniCPM-o 4.5 añade la conversación por voz y el flujo simultáneo de vídeo y audio, pero la ficha de Ollama solo anuncia texto e imágenes como entradas. Para la voz, el repositorio remite a Transformers o a llama.cpp-omni, y sus limitaciones documentadas son reales: a veces hay errores de pronunciación en modo omni y, a veces, las respuestas mezclan inglés y chino.

#Solución de problemas

El modelo ignora la imagen
Comprueba la ruta del archivo y que sea accesible desde donde se ejecuta Ollama. Al usar la API, la imagen debe estar en base64 en el campo images.
OCR defectuoso o truncado
La imagen probablemente está demasiado comprimida o de resolución demasiado baja. Proporciona una versión más clara y grande, y pide explícitamente una transcripción fidedigna con el formato. Con Transformers, intenta downsample_mode 4x.
Respuestas lentas
Si usas solo la CPU, es lo esperado. Si usas la GPU, comprueba con ollama ps que no se haya trasladado parte del modelo a la RAM del sistema debido a un contexto o una imagen demasiado grandes.
Salida no estructurada
Para obtener un JSON fiable, impón el esquema en el prompt y, si tu cliente lo permite, utiliza el formato estructurado de Ollama.
Versión inesperada
La etiqueta minicpm-v sin sufijo todavía apunta a la versión 2.6. Especifica explícitamente minicpm-v4.6 o minicpm-v4.5 para obtener un comportamiento reproducible.

#Para ir más allá

FAQ
¿Qué tag de Ollama instalar para MiniCPM-V?+
Para un equipo pequeño, minicpm-v4.6: alrededor de 1,6 GB y un modelo de aproximadamente 1,3 mil millones de parámetros. Para comparar con un modelo de 8 mil millones de parámetros, minicpm-v4.5 pesa 6,1 GB. Atención: la etiqueta minicpm-v sin sufijo sigue cargando la versión 2.6. Indica siempre la versión; de lo contrario, no sabrás qué estás probando.
¿Es MiniCPM-V gratuito, incluso para uso comercial?+
El repositorio anuncia pesos y código bajo licencia Apache 2.0, y las fichas de Hugging Face de las versiones 4.5 y 4.6 incluyen esta mención. Apache 2.0 permite el uso comercial. No obstante, vuelve a leer la licencia de la versión exacta que descargues, ya que una versión más antigua podría haber tenido condiciones diferentes.
¿Cuánta VRAM se necesita realmente?+
La tabla del repositorio indica 4 GB de memoria de GPU para la versión 4.6 en Transformers y 2 GB para su versión GGUF en CPU; la versión 4.5 pesa 6,1 GB en Ollama. Añade el contexto y las imágenes: Ollama asigna por defecto 4.000 tokens cuando hay menos de 24 GiB de VRAM. Compruébalo con ollama ps.
¿MiniCPM-V lee bien el texto de los documentos?+
El editor anuncia muy buenos resultados en OCR, con imágenes de hasta 1,8 millones de píxeles para la versión 4.5. Son sus propias evaluaciones. Como cualquier modelo de visión, puede generar un valor plausible que no aparezca en la página: mantén una revisión de las cifras críticas o utiliza un motor de OCR especializado para grandes volúmenes.
¿Se puede usar en un teléfono?+
Sí, el repositorio indica que MiniCPM-V 4.6 se despliega en iOS, Android y HarmonyOS, con código de adaptación abierto y un repositorio de aplicaciones. Las demostraciones publicadas son grabaciones de pantalla. Espera tareas puntuales en lugar de un flujo continuo de imágenes y mide la latencia en tu dispositivo.
¿Permite MiniCPM-o hablar con un modelo en Ollama?+
No según la ficha de Ollama, que solo anuncia texto e imagen como entradas para minicpm-o4.5. La conversación por voz y el flujo simultáneo de audio y vídeo funcionan mediante Transformers o llama.cpp-omni, según el repositorio. También requiere mucha más memoria: 19 GB en GPU, 10 GB en GGUF.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.