Ollama Cloud: precios, opiniones y límites (2026)
Ollama Cloud propone algo sencillo: ejecutar en los servidores de Ollama modelos demasiado grandes para tu máquina —120B, 480B, 671B parámetros— con la misma CLI que la versión local. Es práctico. Pero cambia dos cosas fundamentales: tus prompts salen de tu ordenador y pagas por uso. Esta guía explica exactamente qué es, cuánto cuesta y por qué, en la mayoría de los casos, el autoalojamiento sigue siendo preferible.
#Qué es Ollama Cloud
Desde 2025, Ollama ofrece un servicio de pago llamado Ollama Cloud que permite llamar a modelos alojados en su infraestructura GPU, manteniendo exactamente los mismos comandos que para un modelo local. La promesa: ejecutar modelos masivos de pesos abiertos (cientos de miles de millones de parámetros) sin necesidad de un Mac Studio Ultra ni de un clúster H100.
En concreto, instalas Ollama como de costumbre, te autenticas y descargas un modelo marcado como "cloud" (por ejemplo gpt-oss:120b-cloud). La inferencia ya no se realiza en tu GPU, sino en los servidores de Ollama: tu máquina solo envía los tokens del prompt y recibe los tokens de respuesta.
#¿Qué modelos funcionan en la nube?
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
El catálogo en la nube se centra precisamente en los modelos que funcionan con dificultad en local. Evoluciona, pero la lógica sigue siendo la misma: modelos de pesos abiertos o abiertos, de tamaño muy grande, o multimodales con grandes requisitos de VRAM.
- Modelos de 100B+ parámetros
- Como gpt-oss:120b, qwen3-coder:480b y kimi-k2, que requieren entre 60 y 250 GB de VRAM en Q4, fuera del alcance de una estación de trabajo individual.
- Modelos de frontera MoE
- DeepSeek V3/V4, Llama 4 Maverick: las versiones completas, no los modelos destilados de 7B/32B que se instalan en local.
- Modelos especializados pesados
- Modelos gigantes de programación, modelos de razonamiento («thinking») con contexto largo, modelos de visión de alta resolución.
Los modelos "normales" (Mistral 7B, Llama 3.1 8B, Qwen 14B, Phi-4, etc.) siguen siendo recomendables para su uso en local: caben en una RTX 3060 de 12 GB o en un MacBook Air, y no hay ningún beneficio en ejecutarlos en remoto.
#Precios y límites
Ollama Cloud se sitúa entre una suscripción mensual de tarifa fija (con una cuota de solicitudes por hora) y un modelo de facturación por consumo para usos intensivos. Los precios exactos cambian —compruébalos en ollama.com/cloud antes de comprometerte—, pero hay algunos aspectos constantes que conviene señalar.
- Cuotas por hora
- Los planes básicos limitan el número de solicitudes por hora o por día. El límite permite usar el chat cómodamente de forma manual, pero se alcanza rápidamente con un script que recorre 10.000 documentos.
- Facturación por duración de inferencia
- Los modelos muy grandes a veces se facturan por el tiempo de GPU consumido. Una consulta con contexto largo (32k tokens, razonamiento profundo) cuesta necesariamente más que un "hola".
- No se muestra por defecto un precio por token
- A diferencia de OpenAI o Anthropic, en Ollama Cloud la API no cobra sistemáticamente por token. Esto hace que la planificación presupuestaria sea menos precisa.
- Sin SLA para el público general
- La oferta es reciente y, al escribir estas líneas, no hay una garantía de disponibilidad comparable a las de los grandes proveedores de servicios en la nube.
#Confidencialidad: lo que realmente cambia
Es aquí donde la diferencia con el autoalojamiento se vuelve estructural, no anecdótica. Cuando usas Ollama en local, tus prompts nunca salen del puerto 11434 en localhost; puedes comprobarlo en el cortafuegos. En la nube, transitan por Internet y se procesan en una infraestructura de terceros.
- Tus prompts salen del perímetro
- Todos los datos enviados —extracto de contrato, código fuente propietario, expediente de un paciente, correo electrónico— abandonan tu máquina. Para un despacho de abogados, un médico, un departamento de RR. HH. o un laboratorio de investigación y desarrollo, esto es inaceptable.
- Política de retención
- Ollama afirma que no entrena sus modelos con tus prompts. Pero la retención para depuración, detección de abusos o registros varía según el plan. Lee los términos y condiciones antes de enviar datos sensibles.
- RGPD y alojamiento
- Los servidores de Ollama Cloud están mayoritariamente en Estados Unidos. Para los datos personales europeos, esto plantea cuestiones relativas a las transferencias fuera de la UE que el autoalojamiento elimina de golpe.
- No es posible auditar la infraestructura
- En local, puedes usar tcpdump en el puerto 11434 y demostrar que nada sale. En la nube, debes confiar: no hay ningún medio técnico para verificar lo que se registra.
#Alternativas autoalojadas para cada modelo en la nube
Para casi todos los modelos ofrecidos en la nube, existe una alternativa local, ya sea equivalente (un modelo más pequeño de la misma familia) o aceptable (otro modelo comparable de pesos abiertos). Aquí tienes las correspondencias útiles.
- gpt-oss:120b-cloud → llama3.1:8b o qwen2.5:14b en local
- Para el 90 % de los usos conversacionales, un 8B-14B Q4 en una RTX 3060 de 12 GB basta. La diferencia se nota principalmente en tareas de razonamiento largo o de conocimiento enciclopédico.
- qwen3-coder:480b-cloud → qwen2.5-coder:14b o 32b
- El 32B en Q4 (≈19 GB de VRAM) funciona en una RTX 4090 o en un Mac M-Max. Para el autocompletado de código en un IDE, es más que suficiente — ver la guía de Continue.dev.
- deepseek-v3:671b-cloud → deepseek-r1:32b o 70b destilado
- Las versiones destiladas de DeepSeek R1 reproducen un 80-90 % del razonamiento del modelo completo en benchmarks habituales, en local en una 4090 o en un Mac Studio.
- Modelos de visión gigantes → qwen2.5-vl:7b o llama3.2-vision:11b
- Para OCR, etiquetado de imágenes y descripciones, estos dos modelos funcionan con entre 8 y 12 GB de VRAM. Consultar la guía sobre LLM multimodales de visión en local.
- Contexto largo de 1M de tokens → modelos locales de 128k + chunking
- Muy pocos usos reales requieren 1M de tokens de una sola vez. Un buen pipeline RAG con chunking + reranker procesa corpus enormes con un modelo local de 32k.
#Tabla de decisión
Para decidir entre Ollama Cloud y el autoalojamiento, hazte estas cinco preguntas en orden. La primera cuya respuesta sea "self-host" resuelve el debate.
- 1. ¿Son los datos sensibles?
- Código propietario, datos de clientes, salud, ámbito jurídico, RR. HH., I+D → autoalojamiento, punto final.
- 2. ¿Estás sujeto al RGPD o a una normativa sectorial?
- Hospital, banco, sector público, datos europeos → auto-hospedaje, o nube soberana dedicada (no Ollama Cloud)
- 3. ¿Es el volumen previsible y elevado?
- Más de unos miles de llamadas al día → un GPU de 1500 € se amortiza en unos meses frente a una factura cloud variable.
- 4. ¿Necesitas funcionar offline?
- Instalación sin conexión fiable, demostraciones sobre el terreno, requisitos de aislamiento de red (air-gap) → alojamiento propio obligatorio.
- 5. ¿Necesitas absolutamente un modelo de 100B o más?
- Si la respuesta es afirmativa, y solo en ese caso, y después de haber probado un 32B local: Ollama Cloud pasa a ser una opción que puedes considerar.
#Cuándo usar uno, cuándo usar el otro
#Los pocos casos en los que Ollama Cloud es una buena opción
- Evaluación puntual de un modelo gigante
- Quieres comprobar en 10 minutos si un modelo de programación de 480B merece la pena antes de invertir en una máquina: la nube evita la compra impulsiva.
- Demostración para un cliente sin hardware en el lugar
- Un vendedor que muestra un POC en su portátil sin llevar consigo un Mac Studio.
- Tarea única muy exigente
- Un informe de 500 páginas que se debe resumir una vez cada trimestre, con contexto largo y sin datos confidenciales dentro.
- Aprendizaje y exploración
- Descubrir lo que un modelo de 670B sabe hacer, para luego volver a ejecutarlo todo en local sabiendo qué capacidades buscar.
#Los casos en los que gana el alojamiento propio
- Cualquier uso recurrente
- Asistente de programación para el día a día, chat interno del equipo, RAG sobre documentos de la empresa: la estabilidad de la factura importa.
- Cualquier uso con datos sensibles
- No hay debate: los datos jurídicos, sanitarios, de RR. HH., de finanzas y de I+D, así como el código propietario, se quedan en local.
- Cualquier uso automatizado
- Pipelines por lotes, agentes que ejecutan bucles, n8n, scripts ETL: las cuotas de la nube se disparan y los costes se vuelven impredecibles.
- Cualquier uso sin conexión o en edge
- Raspberry Pi en un taller, portátil durante los desplazamientos, lugar sin una conexión fiable a Internet.
- Cualquier necesidad de personalización
- Fine-tuning, un Modelfile personalizado, prompts de sistema para el equipo, integración profunda con tus herramientas: la nube no lo permite.
#Para ir más allá
Si concluyes que el autoalojamiento es la opción adecuada para tu caso (lo cual es probable), estas guías te ayudan a empezar con buen pie:
- Elegir la GPU adecuada
- La guía «Elegir una GPU para la IA local» detalla los compromisos entre VRAM, presupuesto y rendimiento, desde la RTX 3060 de 12 GB hasta el Mac Studio Ultra.
- Comprender la cuantización
- La guía Elegir tu cuantización (Q4, Q5, Q8, FP16) explica cómo hacer que un modelo de 32B quepa en una GPU de 16 GB sin degradar la calidad.
- Confidencialidad operativa
- La Checklist de privacidad enumera las comprobaciones concretas para asegurarte de que ningún paquete salga de tu máquina: una prueba basada en hechos.
¿Es gratuito Ollama Cloud?+
¿Cómo usar Ollama sin pasar por la nube?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.