Cómo instalar Ollama: guía completa (Windows, Mac, Linux)
¿Buscas ejecutar modelos LLM de código abierto en local? Aprender cómo instalar ollama es el primer paso para democratizar el acceso a los pesos abiertos en tu propia máquina. Esta herramienta simplifica enormemente el proceso de descarga y ejecución de diversos modelos, tanto si usas Windows como macOS o Linux. Esta guía completa detalla cada método de instalación para que puedas comenzar a experimentar con arquitecturas potentes como DeepSeek V4 Pro 1.6T o MiMo V2.5 Pro. Vamos a explorar los pasos técnicos, el rendimiento y cómo aprovechar esta plataforma local.
¿Qué es Ollama y por qué usarlo para LLM locales?
Ollama es una herramienta diseñada para simplificar el despliegue de grandes modelos lingüísticos (LLM) en entornos personales o servidores locales. En lugar de gestionar manualmente las dependencias complejas, los frameworks de cuantización como llama.cpp, y las configuraciones específicas de cada modelo, Ollama ofrece una interfaz CLI sencilla. Actúa como un servidor local que permite interactuar con diferentes LLM a través de una API estandarizada.
Para quienes desean profundizar en la experimentación local, es útil saber que herramientas como llama.cpp (GitHub oficial) suelen ser la base del funcionamiento interno de Ollama. Tanto si quieres probar un modelo de alto rendimiento como DeepSeek V4 Flash 0731 304B o explorar las capacidades de Kimi K2.5, Ollama hace que el acceso a estos pesos sea más directo.
La ventaja principal radica en la simplicidad: un comando basta para descargar y ejecutar un modelo, lo que es ideal para los usuarios que desean pasar rápidamente del concepto a la ejecución local en su PC o Mac. Si deseas comparar diferentes arquitecturas antes de elegir tu instalación, nuestro catálogo reúne cientos de modelos con sus especificaciones de VRAM y licencias respectivas. Puedes consultar los trabajos de DeepSeek en Hugging Face para ver la variedad de sus creaciones disponibles localmente.
Guía detallada de instalación para cada sistema operativo
El proceso varía ligeramente según tu sistema operativo, pero el principio sigue siendo el mismo: instalar el ejecutable de Ollama y luego usar la línea de comandos para descargar los modelos.
Instalación en macOS (Mac)
Para los usuarios de Mac, tanto con chips de la serie M como con máquinas Intel, la instalación es especialmente sencilla. Puedes descargar el script de instalación oficial desde Ollama (GitHub oficial). Una vez instalado, Ollama se inicia en segundo plano y ya estás listo para interactuar con los modelos a través de tu terminal. Para configuraciones específicas en Mac, especialmente para optimizar el uso de la GPU Apple Silicon, consulta nuestra guía llm-mac-mini-m4.
Instalación en Windows
En Windows, tienes dos vías principales: usar el binario nativo o recurrir a WSL2 (Windows Subsystem for Linux 2). Si eliges la instalación nativa, sigue las instrucciones del sitio oficial. Para una integración más robusta y una mejor compatibilidad con las herramientas de desarrollo basadas en Linux, solemos recomendar el uso de WSL2. Nuestra guía ollama-wsl2-vs-windows-natif detalla este enfoque.
Instalación en Linux
La instalación en Linux es generalmente la más directa mediante un script de repositorio o un binario precompilado, siguiendo las instrucciones proporcionadas por Ollama (GitHub oficial). Para obtener documentación paso a paso sobre los comandos de shell, consulta nuestro tutorial específico: installer-ollama-linux.
Ejecutar y probar tus primeros modelos LLM con Ollama
Una vez instalado Ollama, usas el comando ollama run <nom_du_modele> para comenzar. Aquí eliges el cerebro de tu sesión local.
Por ejemplo, si quieres probar un modelo muy potente como DeepSeek V4 Pro 0813 1.7T, ejecutarás el comando correspondiente. Es importante señalar que los modelos suelen estar disponibles en diferentes versiones (cuantizaciones) para equilibrar tamaño y rendimiento. Por ejemplo, modelos como GLM 5.2 753B-A40B requerirán una configuración de hardware considerable.
Para evaluar la potencia bruta, puedes consultar el Open LLM Leaderboard (Hugging Face). Si tu objetivo es establecer un entorno completo para el desarrollo de agentes, hemos preparado tutoriales sobre la integración con CrewAI o los agentes locales crewai-ollama-multi-agents.
Ejemplos de modelos para probar: * Para una capacidad de razonamiento avanzada, prueba Inkling (975B) o DeepSeek V4 Pro 1.6T (1600B). También puedes revisar las capacidades de Kimi K3. * Si te interesa el código, Kimi K2.7 Code es un buen punto de partida para probar modelos especializados en programación. * Para modelos más ligeros y rápidos en local, revisa las variantes como Mixtral 8x22B Instruct.
Optimización y uso avanzado de Ollama
El uso de LLM locales no se limita a conversaciones simples en el terminal. Ollama puede integrarse en workflows más complejos. Si deseas una interfaz gráfica amigable, te recomendamos explorar herramientas como Open WebUI (GitHub oficial), que se integra perfectamente con el servidor Ollama.
Para los usuarios avanzados que deseen automatizar tareas o desarrollar aplicaciones, es posible configurar llamadas directas a la API de tu instancia de Ollama. Nuestra guía appel-outil-ollama-tutoriel te muestra cómo integrar estos LLM en scripts Python.
Si tienes problemas de rendimiento, especialmente relacionados con el uso de la GPU (aceleración por GPU), consulta nuestra guía depanner-ollama-gpu-erreurs. Para una comparación directa entre Ollama y otras soluciones como LM Studio, tenemos una comparativa en nuestras guías interfaces-graphiques-ollama-comparatif. Si buscas alternativas más específicas, nuestra página alternatives-ollama-tour-horizon es un recurso útil.
FAQ: preguntas frecuentes sobre la instalación de Ollama
P: ¿Cuál es el requisito de hardware mínimo para comenzar con Ollama?
R: Para pruebas básicas, un sistema moderno es suficiente. Sin embargo, si deseas ejecutar modelos más grandes como GLM 5.3 Flash 320B-A18B (que requiere aproximadamente 186 GB en Q4), se necesita una tarjeta gráfica con mucha VRAM. Para configuraciones modestas, opta por modelos cuantizados o usa solo la CPU si tienes paciencia durante las inferencias.
P: ¿Cómo elegir un modelo tras instalar Ollama?
R: La elección depende de tu uso (chat, código, razonamiento) y de tus recursos de hardware. Si la velocidad es clave, considera las versiones "Flash" como DeepSeek V4 Flash 284B. Para obtener la máxima calidad en tareas complejas, explora modelos más grandes como Kimi K3 o DeepSeek V4 Pro 0813 1.7T, verificando siempre sus especificaciones en nuestro catálogo.
P: ¿Ollama funciona únicamente con modelos GGUF?
R: Aunque Ollama utiliza ampliamente el formato GGUF (optimizado para la inferencia en CPU/GPU mediante llama.cpp), también soporta otros formatos y puede interactuar con pesos provenientes de diversas fuentes, basándose en las convenciones definidas por la comunidad de modelos LLM de código abierto Hugging Face Hub (documentación).
P: ¿Puedo usar Ollama para hacer RAG?
R: Sí, absolutamente. Aunque Ollama sea el motor de inferencia, debes integrarlo en un marco de RAG (Retrieval Augmented Generation) como LangChain o LlamaIndex. Tenemos tutoriales específicos sobre este tema, por ejemplo anythingllm-rag-tutoriel-complet.
P: ¿Es Ollama gratuito y de código abierto?
R: La herramienta en sí, Ollama, está diseñada para ser accesible y fácil de usar. Los modelos que ejecuta se distribuyen mayoritariamente con licencias abiertas (MIT, Apache 2.0) o según las políticas de apertura de proveedores como Moonshot AI en Hugging Face, lo que garantiza un uso libre en local para la experimentación.
Conclusión: Tu puerta de entrada hacia los LLM locales
En resumen, cómo instalar Ollama es un proceso simple pero potente que desbloquea el acceso a modelos de punta en tu propia infraestructura. Ya seas principiante o experto buscando integrar sistemas complejos como los basados en Llama 3.1 405B Instruct, Ollama es la solución de orquestación ideal. Una vez finalizada la instalación, explora nuestro configurador para encontrar el modelo perfecto adaptado a tu hardware y tus necesidades específicas.
El hardware para ejecutar un LLM localmente
Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:
Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.