Cómo instalar Ollama: guía paso a paso para principiantes
Quieres saber cómo instalar Ollama para ejecutar modelos LLM localmente en tu máquina? Esta guía está diseñada específicamente para ti, usuario de Mac o PC, que deseas explorar el mundo de los modelos de pesos abiertos sin depender de servicios en línea. Ollama simplifica drásticamente este proceso complejo. Detallaremos cada paso necesario para que puedas comenzar a interactuar con modelos potentes hoy mismo. Esta guía cubre la instalación, la primera ejecución y las buenas prácticas de uso en tu entorno local.
¿Qué es Ollama y por qué usarlo?
Ollama es una herramienta open-source que permite descargar, configurar y ejecutar modelos LLM (Large Language Models) directamente en local en tu ordenador. En lugar de tener que gestionar manualmente dependencias complejas como PyTorch, CUDA o formatos específicos de cuantización, Ollama ofrece una interfaz CLI simple y estandarizada.
Para un usuario que desea probar la potencia de los modelos de pesos abiertos sin necesitar una infraestructura de servidores de gran envergadura, esta es la solución ideal. Así puedes experimentar con arquitecturas avanzadas como MiMo V2.5 Pro (1020B) o versiones más ligeras como Mistral Small 4 (119B), comprobando las especificaciones de consumo necesarias para tu hardware ver la documentación oficial de Ollama.
El principal beneficio es la simplicidad: a menudo basta con un comando para descargar e iniciar un modelo, lo que hace que la experimentación sea mucho más accesible para principiantes. Veremos cómo funciona concretamente en las secciones siguientes. Para profundizar en los modelos disponibles, consulta nuestro catálogo de referencia.
Guía de instalación detallada para Mac y Windows
El proceso cómo instalar Ollama varía ligeramente según tu sistema operativo, pero el principio sigue siendo el mismo: descargar el ejecutable adecuado e iniciar el servicio.
Para los usuarios de macOS (Apple Silicon)
- Ve a la página oficial de Ollama ici.
- Haz clic en el enlace de descarga para macOS.
- Ejecuta la aplicación descargada. Ollama se instalará y se iniciará en segundo plano, configurando automáticamente las rutas necesarias.
Para los usuarios de Windows (mediante WSL o de forma nativa)
Aunque Ollama suele usarse en entornos Linux, existe una instalación para Windows. Se recomienda encarecidamente usar el Subsistema de Windows para Linux (WSL2) para garantizar la mejor compatibilidad con los comandos CLI estándar y evitar problemas con las rutas de acceso a las bibliotecas GPU.
- Asegúrate de que WSL2 esté activado en tu sistema.
- Descarga e instala Ollama siguiendo las instrucciones específicas para Windows proporcionadas por el equipo de desarrollo en su documentación de GitHub.
- Una vez que el servicio esté activo, abre tu terminal WSL para comenzar las operaciones.
Nota técnica: La eficiencia de los modelos depende en gran medida de la capacidad del hardware. Por ejemplo, ejecutar DeepSeek V4 Pro 1.6T (1600B) en Q4 requiere una cantidad significativa de VRAM, aunque su configuración puede optimizarse para diferentes entornos ver las especificaciones detalladas en nuestro sitio. Para información técnica más detallada sobre la inferencia local, consulta recursos como los disponibles en HuggingFace Documentación de HuggingFace.
Primeros pasos: Ejecutar un modelo a través de la línea de comandos
Una vez instalado Ollama y el servicio activo, estás listo para interactuar con LLMs de código abierto. La sintaxis es extremadamente sencilla. Para probar tu instalación, descargaremos y lanzaremos un pequeño modelo.
El comando básico para cómo instalar ollama termina con el uso de un modelo específico. Por ejemplo, para ejecutar el modelo llama3, usarás:
ollama run llama3
Ollama verificará si este modelo está presente localmente. Si no lo está, descargará automáticamente la versión predeterminada (a menudo una cuantización optimizada) y luego iniciará una sesión de chat interactiva con el LLM.
Elegir y probar modelos de alto rendimiento
El catálogo de quelllm.fr ofrece cientos de opciones para afinar tu elección según tus necesidades:
- Para generación creativa o conversacional: Podrías probar Kimi K2.5 (1000B) si dispones de recursos suficientes, o un modelo más ligero como Mistral Medium 3.5 128B.
- Para tareas lógicas y técnicas: Modelos especializados como Qwen3-Coder-Next 80B-A3B son excelentes para el código. Para benchmarks precisos, puedes consultar las comparaciones de rendimiento.
- Para obtener el máximo rendimiento (si el hardware lo permite): Los pesos más grandes, como DeepSeek V4 Pro 1.6T, ofrecen un contexto y una capacidad de razonamiento superiores.
Antes de iniciar una descarga de gran tamaño, se recomienda consultar las fichas de los modelos para verificar la licencia (MIT, Apache 2.0, etc.) y la estimación del consumo de VRAM en nuestra plataforma. Si buscas información sobre el desarrollo de estos modelos, consulta su página respectiva en GitHub Repositorios de LLM en GitHub.
Optimización y gestión de recursos de LLM locales
Uno de los principales desafíos al usar Ollama es la gestión de los recursos de hardware (VRAM y RAM del sistema). Los modelos suelen cuantizarse para reducir su huella de memoria, pero esto afecta a la calidad de la salida.
Entender los formatos de cuantización
Cuando descargas un modelo a través de Ollama, generalmente se proporciona en una versión cuantizada (por ejemplo, Q4_K_M). La cuantización reduce el número de bits utilizados para representar cada peso de la red neuronal, lo que disminuye drásticamente la VRAM requerida. Sin embargo, esto puede provocar una ligera pérdida de precisión en comparación con la versión FP16 o BF16 original.
Por ejemplo, si comparas Nemotron 3 Ultra (550B) en Q4 (~319 GB VRAM), obtendrás un buen equilibrio entre rendimiento y tamaño. Si tienes una tarjeta gráfica muy potente, probar la versión no cuantizada o BF16 puede ser útil para evaluar el potencial máximo del modelo, como con Nemotron 3 Ultra Base (BF16).
Casos de uso concretos y benchmarks
Ollama destaca en los siguientes casos:
- Prototipado rápido: Probar rápidamente si un LLM responde bien a tus prompts sin una configuración compleja.
- Entornos offline: Trabajar con datos sensibles sin exponer solicitudes externas, lo cual es crucial para la confidencialidad.
- Desarrollo local: Integrar capacidades de generación de texto en scripts Python u otras aplicaciones locales.
Para una comparación estructurada entre diferentes modelos en términos de capacidad y tamaño, te invitamos a consultar nuestro herramienta de comparación. Para un análisis profundo de las arquitecturas recientes, consulta las publicaciones sobre arXiv.
FAQ: preguntas frecuentes sobre la instalación de Ollama
P: ¿Necesito una tarjeta gráfica muy potente para usar Ollama?
R : Depende del modelo que quieras ejecutar. Para los modelos más pequeños (por ejemplo: Mixtral 8x22B Instruct, ~82 GB de VRAM), una GPU decente puede ser suficiente. Los modelos de varios cientos de miles de millones de parámetros, como DeepSeek V4 Pro 1.6T, requerirán una cantidad enorme de VRAM o deberán ejecutarse usando la RAM del sistema, lo que es mucho más lento.
P: ¿Cómo puedo saber qué modelo elegir para mi configuración?
R : Consulta nuestro configurador en quelllm.fr. Allí introducirás las especificaciones de tu máquina (VRAM, RAM) y nosotros te recomendaremos modelos optimizados, por ejemplo, comparando Llama 3.1 405B Instruct à Qwen 3.5 397B-A17B.
P: ¿Ollama funciona únicamente con modelos en inglés?
R : No, muchos LLM de pesos abiertos son multilingües. Modelos como Kimi K2.6 o Ling 2.6 1T han demostrado capacidades sólidas en francés y en otros idiomas, aunque el rendimiento puede variar según el modelo específico elegido y su entrenamiento inicial.
P: ¿Es gratuito Ollama?
R : Sí, Ollama en sí mismo es una herramienta de código abierto y su uso para ejecutar los modelos listados en nuestra plataforma (que tienen licencias abiertas como MIT o Apache 2.0) es gratuito. Los posibles costes están relacionados con el consumo de energía de tu máquina durante la inferencia.
P: ¿Cómo actualizar mis modelos después de la instalación?
R : La actualización se realiza muy fácilmente a través de la línea de comandos. Si deseas una versión más reciente de un modelo, utiliza ollama pull nom_du_modele:version o simplemente ollama run nom_du_modele para que Ollama verifique y descargue automáticamente las últimas iteraciones disponibles desde el registro comunitario.
Conclusión: Tu camino hacia un LLM local comienza aquí
Al seguir esta guía, sabes cómo instalar Ollama en tu sistema Mac o PC para comenzar inmediatamente con modelos LLM potentes en local. Ya sea que desees probar la robustez de GLM 5.2 753B-A40B o la eficiencia de MiniMax M3, Ollama es el puente entre el modelo y tu terminal. Para pasar al siguiente paso y comparar el rendimiento técnico (VRAM, tokens/segundo) de los modelos disponibles, visita nuestro catálogo completo. ¡Que disfrutes explorando!
El hardware para ejecutar un LLM localmente
Para ejecutar estos modelos cómodamente en local, un RTX 5070 Ti ofrece una excelente relación precio/rendimiento. Compara los precios:
Enlaces de afiliados — QuelLLM puede percibir una comisión por las compras, sin coste adicional para ti. Como socio de Amazon, QuelLLM obtiene un beneficio de las compras que cumplen las condiciones requeridas.