MiniCPM en local (Ollama): el multimodal compact
MiniCPM-V es la serie de modelos compactos de visión y lenguaje de OpenBMB, bajo licencia Apache 2.0. En Ollama, la etiqueta minicpm-v aún carga la versión 2.6 (8 mil millones, 5,5 GB), minicpm-v4.5 una versión de 8 mil millones de 6,1 GB, y minicpm-v4.6 un modelo de aproximadamente 1,3 mil millones de parámetros de 1,6 GB. Empieza por el 4.6 en una máquina pequeña y luego compara usando tus imágenes.
MiniCPM es la familia de modelos compactos de OpenBMB, con modelos de visión-lenguaje diseñados para ejecutarse donde los modelos grandes no caben. La familia ha evolucionado mucho: la versión que carga la etiqueta histórica de Ollama ya no es la más reciente, y ahora existe un modelo de 1,3 mil millones de parámetros. Esta página indica qué etiqueta instalar, cómo valorar las cifras anunciadas y cuáles son los límites del OCR de un modelo generalista.
#¿Qué versión de MiniCPM instalar en 2026?
MiniCPM-V es la serie de modelos compactos de visión y lenguaje de OpenBMB, desarrollada por THUNLP (Universidad Tsinghua) y ModelBest, cuyos pesos y código están publicados bajo licencia Apache 2.0. En Ollama, coexisten tres tags que generan confusión. El tag minicpm-v, sin sufijo, sigue correspondiendo a MiniCPM-V 2.6, un modelo de 8 mil millones de parámetros que pesa 5,5 GB y tiene 32K de contexto. El tag minicpm-v4.5 carga una versión más reciente de 8 mil millones de parámetros (6,1 GB, 40K de contexto). El tag minicpm-v4.6, incorporado a la biblioteca oficial de Ollama el 25 de junio de 2026 según el repositorio del proyecto, pesa 1,6 GB y tiene aproximadamente 1,3 mil millones de parámetros. Para descubrir la visión local en una máquina pequeña, comienza por el 4.6; conserva el 4.5 para comparar resultados con tus documentos densos, porque nada garantiza que un modelo de 1,3 mil millones de parámetros lea tan bien como uno de 8 mil millones cuando el texto está muy apretado.
| Tag Ollama | Versión | Parámetros | Descarga | Contexto anunciado | Puntos clave |
|---|---|---|---|---|---|
| minicpm-v | MiniCPM-V 2.6 | 8 mil millones | 5,5 GB | 32K | Versión de 2024: múltiples imágenes y video; es lo que carga la etiqueta sin sufijo |
| minicpm-v4.5 | MiniCPM-V 4.5 | 8 mil millones | 6,1 GB | 40K | Basado en Qwen3-8B y SigLIP2-400M; vídeo con alta tasa de fotogramas; el editor anuncia 77,0 en OpenCompass |
| minicpm-v4.6 | MiniCPM-V 4.6 | aproximadamente 1.300 millones | 1,6 GB | 256K | El más ligero y más reciente; compresión de tokens visuales; versiones móviles |
| openbmb/minicpm-o4.5 | MiniCPM-o 4.5 | 9 mil millones | 6,1 GB | 40K | Versión omni (voz, flujo en tiempo real); la ficha Ollama indica solo texto e imagen de entrada |
#Lo que aporta la serie y lo que hay que relativizar
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
La serie busca la mejor relación entre capacidad y tamaño. Según el repositorio de OpenBMB, MiniCPM-V 4.5 alcanza 77,0 en OpenCompass y supera, con 8 mil millones de parámetros, a GPT-4o-latest, Gemini 2.0 Pro y Qwen2.5-VL 72B. Para la versión 4.6, el proyecto indica un codificador visual cuyas necesidades de cálculo se reducen en más del 50 %, una compresión de tokens visuales a elegir (4 veces o 16 veces) y una tasa de generación de tokens de aproximadamente 1,5 veces la de Qwen3.5-0.8B. La ficha de Ollama del mismo modelo anuncia 2,4 veces: ambas cifras proceden del proyecto y estas páginas no detallan ningún protocolo de medición. Son anuncios, no mediciones independientes: mide los tiempos en tu equipo.
- Multimodal compacto
- Texto e imagen, múltiples imágenes a la vez y video. La versión 4.5 comprime hasta 6 imágenes de video en 64 tokens según el repositorio, lo que permite leer más imágenes sin costo adicional para el modelo de lenguaje.
- OCR de alta resolución
- El 4.5 procesa imágenes de cualquier proporción hasta 1,8 millones de píxeles (por ejemplo, 1344 x 1344). El editor afirma que lidera OCRBench y el análisis de PDF (OmniDocBench) entre los modelos multimodales generalistas; se dice que el 4.6 alcanza el nivel de Qwen3.5 2B en varios benchmarks, entre ellos OCRBench.
- Licencia permisiva
- El repositorio anuncia pesos y código bajo la licencia Apache 2.0, y las fichas de Hugging Face de las versiones 4.5 y 4.6 incluyen la misma mención. Comprueba la licencia exacta de la versión concreta que descargues.
- Muchos formatos
- El proyecto ofrece variantes GGUF, BNB, AWQ y GPTQ, y compatibilidad anunciada con SGLang, vLLM, llama.cpp y Ollama.
#¿Cuánta memoria, realmente?
| Modelo y formato | Memoria anunciada | Fuente |
|---|---|---|
| MiniCPM-V 4.6, Transformers (GPU) | 4 GB | Tabla de modelos del repositorio |
| MiniCPM-V 4.6, GGUF (CPU) | 2 GB | Tabla de modelos del repositorio |
| MiniCPM-V 4.6, BNB, AWQ o GPTQ (GPU) | 3 GB | Tabla de modelos del repositorio |
| MiniCPM-o 4.5, GGUF | 10 GB | Tabla de modelos del repositorio |
| MiniCPM-o 4.5, GPU | 19 GB | Tabla de modelos del repositorio |
| minicpm-v4.6 en Ollama | 1,6 GB de descarga | Ficha Ollama |
| minicpm-v4.5 en Ollama | 6,1 GB de descarga | Ficha Ollama |
Estas cifras describen los pesos y la ejecución básica: el contexto y las imágenes requieren memoria adicional. Las imágenes se convierten en tokens visuales que ocupan la ventana de contexto, y la documentación de Ollama especifica que aplica por defecto 4.000 tokens de contexto cuando hay menos de 24 GiB de VRAM; aumentar este valor incrementa la memoria necesaria. Por tanto, el contexto anunciado de 256K para la versión 4.6 no se asigna automáticamente. Por último, la tabla del repositorio indica una ejecución en CPU para la versión GGUF de 4.6, sin publicar una velocidad: mide antes de prometer un funcionamiento en tiempo real.
#Instalar MiniCPM-V con Ollama
Ollama gestiona la descarga, el proyector visual y el servidor de API: no hay nada más que instalar. Comienza por actualizar Ollama, ya que la versión 4.6 es reciente en la biblioteca. La página de la etiqueta minicpm-v ya menciona que exigía Ollama 0.3.10 o una versión posterior.
- 01Descargar el modeloollama pull minicpm-v4.6 recupera los pesos del modelo de lenguaje y el proyector visual, es decir, aproximadamente 1,6 GB. Para la versión 4.5, utiliza minicpm-v4.5 (6,1 GB).
- 02Iniciar un primer chatollama run minicpm-v4.6 abre una sesión interactiva. Haz una pregunta de texto antes de probar la visión.
- 03Enviar una imagenLa documentación de Ollama muestra la ruta del archivo antes de la pregunta, por ejemplo ollama run minicpm-v4.6 ./photo.jpg seguido de «Describe esta imagen».
- 04Conectar una interfazUna vez descargado, el modelo aparece en Open WebUI o en cualquier cliente que apunte al puerto 11434.
#Visión y OCR en el día a día
MiniCPM-V se desenvuelve bien en tareas documentales: leer una factura, transcribir una captura de pantalla, extraer las filas de una tabla, describir una foto. Las imágenes de alta resolución importan mucho en OCR, porque un texto de letra pequeña que resulta ilegible en una miniatura se vuelve aprovechable a plena resolución. Formula prompts precisos: «Describe esta imagen» da una descripción general, mientras que «Transcribe fielmente todo el texto visible, conservando la disposición del contenido» produce un resultado mucho más limpio. Para extraer datos, pide un formato explícito: JSON, Markdown o tabla.
La API REST de Ollama espera la imagen codificada en base64 en el campo images, como indica su documentación; los SDK aceptan además una ruta de archivo. Si usas Transformers en lugar de Ollama, el repositorio documenta un ajuste útil para la versión 4.6: el parámetro downsample_mode tiene un valor predeterminado de 16x, y 4x conserva cuatro veces más tokens visuales para un detalle más fino. Es el ajuste que debes probar cuando un texto muy pequeño no se lee bien.
¿Cuándo preferir un motor de OCR especializado? Si procesas miles de páginas y la trazabilidad es prioritaria, un motor especializado produce errores visibles en lugar de valores plausibles. PaddleOCR-VL, un modelo con menos de mil millones de parámetros, alcanza un 96,33 % en OmniDocBench v1.6 según su desarrollador, y Tesseract sigue siendo la opción ligera para texto limpio. MiniCPM-V mantiene la ventaja cuando también quieres describir la imagen o responder a una pregunta sobre ella.
- PaddleOCR: el OCR que entiende la página
- Tesseract OCR: leer un escaneo localmente
- Extraer los datos de una factura de principio a fin
#Frente a Qwen3-VL y los demás modelos compactos
El competidor directo de MiniCPM-V en la categoría de modelos de visión compactos es Qwen3-VL, disponible en Ollama especialmente en 2, 4 y 8 mil millones de parámetros. Ambos cubren el mismo terreno: descripción de imágenes, OCR, preguntas sobre un documento. El README de OpenBMB afirma que MiniCPM-V 4.6 supera en rendimiento a un modelo más grande, Gemma4-E2B-it, y se muestra más eficiente que Qwen3.5-0.8B: son comparaciones publicadas por el editor, basadas en sus propias evaluaciones.
| Modelo | Tamaño mostrado | Lo que se puede decir | Guía del sitio |
|---|---|---|---|
| minicpm-v4.6 | 1,6 GB | El desarrollador afirma que está al nivel de Qwen3.5 2B en varias pruebas de rendimiento visual, entre ellas OCRBench | Esta página |
| qwen3-vl:2b | 1,9 GB | Misma clase de tamaño, contexto de 256K mostrado | Qwen3-VL local |
| qwen3-vl:8b | 6,1 GB | Equivalente en tamaño al minicpm-v4.5 | Qwen3-VL local |
| Moondream | Ver guía | Modelo ligero de visión, tratado en una guía específica del sitio | Moondream |
La elección depende más de tus imágenes que de una ficha técnica. Ambas familias funcionan con el mismo Ollama y la misma API: pasar de una a otra consiste en cambiar el nombre del modelo en la solicitud; nada impide mantener las dos y dirigir las solicitudes según la tarea.
- Qwen3-VL en local: el modelo de visión de referencia
- Moondream: el modelo de visión que cabe en cualquier parte
#Edge, móvil y servidor: lo que documenta el proyecto
MiniCPM se diseñó para ejecutarse en el dispositivo. El repositorio indica que MiniCPM-V 4.6 se despliega en iOS, Android y HarmonyOS, con el código de adaptación abierto, y muestra grabaciones de pantalla sin editar en un iPhone 17 Pro Max, un Redmi K70 y un HUAWEI nova 14. Un repositorio de aplicaciones ofrece la descarga y la guía de despliegue. Para atender a varios usuarios, el proyecto anuncia compatibilidad con vLLM y SGLang, además de llama.cpp y Ollama.
- 01Digitalización local de documentosUn mini-PC o un NAS con una GPU de gama básica transforma una carpeta de documentos escaneados en texto en el que se pueden realizar búsquedas, sin enviar ningún documento sensible a la nube.
- 02Asistente offlineEn un portátil Apple Silicon o con una tarjeta gráfica modesta, la versión 4.6 lee la pantalla y responde a partir de capturas, incluso sin conexión.
- 03Preprocesamiento de un pipelineAntes de un sistema más pesado, clasifica: tipo de documento, campos evidentes. Solo los casos difíciles pasan a un modelo grande.
- 04Texto alternativo en masaGenerar descripciones de imágenes para un sitio o una mediateca, por lotes, sin coste por llamada una vez amortizado el hardware.
#Solución de problemas
- El modelo ignora la imagen
- Comprueba la ruta del archivo y que sea accesible desde donde se ejecuta Ollama. Al usar la API, la imagen debe estar en base64 en el campo images.
- OCR defectuoso o truncado
- La imagen probablemente está demasiado comprimida o de resolución demasiado baja. Proporciona una versión más clara y grande, y pide explícitamente una transcripción fidedigna con el formato. Con Transformers, intenta downsample_mode 4x.
- Respuestas lentas
- Si usas solo la CPU, es lo esperado. Si usas la GPU, comprueba con ollama ps que no se haya trasladado parte del modelo a la RAM del sistema debido a un contexto o una imagen demasiado grandes.
- Salida no estructurada
- Para obtener un JSON fiable, impón el esquema en el prompt y, si tu cliente lo permite, utiliza el formato estructurado de Ollama.
- Versión inesperada
- La etiqueta minicpm-v sin sufijo todavía apunta a la versión 2.6. Especifica explícitamente minicpm-v4.6 o minicpm-v4.5 para obtener un comportamiento reproducible.
#Para ir más allá
- Instalar Ollama en 5 minutos
- LLM multimodal con visión en local con Ollama
- Elegir tu cuantización
- Open WebUI con Ollama
- Fuente: repositorio oficial de MiniCPM-V de OpenBMB
- Fuente: ficha Ollama de minicpm-v4.6
- Fuente: ficha de Hugging Face de MiniCPM-V 4.6
- Fuente: documentación de Ollama sobre la visión
¿Qué tag de Ollama instalar para MiniCPM-V?+
¿Es MiniCPM-V gratuito, incluso para uso comercial?+
¿Cuánta VRAM se necesita realmente?+
¿MiniCPM-V lee bien el texto de los documentos?+
¿Se puede usar en un teléfono?+
¿Permite MiniCPM-o hablar con un modelo en Ollama?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.