Principiante 8 minOllama

Ollama Cloud: precios, opiniones y límites (2026)

Ollama Cloud propone algo sencillo: ejecutar en los servidores de Ollama modelos demasiado grandes para tu máquina —120B, 480B, 671B parámetros— con la misma CLI que la versión local. Es práctico. Pero cambia dos cosas fundamentales: tus prompts salen de tu ordenador y pagas por uso. Esta guía explica exactamente qué es, cuánto cuesta y por qué, en la mayoría de los casos, el autoalojamiento sigue siendo preferible.

Por Mohamed Meguedmi·Actualización 2026-09-05·Probado en Windows, macOS y Linux
i
En resumen
Ollama Cloud ejecuta en los servidores de Ollama modelos demasiado grandes para tu máquina (120B, 480B, 671B), con la misma CLI que en local. · La oferta se sitúa entre un plan mensual con una cuota de horas y una facturación por tiempo de inferencia para usos intensivos: consulta los precios en ollama.com/cloud, ya que cambian. · A diferencia de la ejecución local, tus prompts salen de tu máquina y pasan por servidores ubicados mayoritariamente en Estados Unidos. · Para un uso recurrente o datos sensibles, el autoalojamiento sigue siendo mucho más recomendable.

#Qué es Ollama Cloud

Desde 2025, Ollama ofrece un servicio de pago llamado Ollama Cloud que permite llamar a modelos alojados en su infraestructura GPU, manteniendo exactamente los mismos comandos que para un modelo local. La promesa: ejecutar modelos masivos de pesos abiertos (cientos de miles de millones de parámetros) sin necesidad de un Mac Studio Ultra ni de un clúster H100.

En concreto, instalas Ollama como de costumbre, te autenticas y descargas un modelo marcado como "cloud" (por ejemplo gpt-oss:120b-cloud). La inferencia ya no se realiza en tu GPU, sino en los servidores de Ollama: tu máquina solo envía los tokens del prompt y recibe los tokens de respuesta.

Ejemplo de llamada a la nube (sintaxis general)
# Authentification (une seule fois)
ollama signin

# Lancer un modèle hébergé
ollama run gpt-oss:120b-cloud
i
No es una «nube local»
Ollama Cloud no es un modo híbrido que ejecute parte del modelo en tu dispositivo. Es inferencia remota pura: tus prompts se envían por Internet, como con la API de OpenAI o Anthropic. La única cosa "local" es la CLI.

#¿Qué modelos funcionan en la nube?

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

El catálogo en la nube se centra precisamente en los modelos que funcionan con dificultad en local. Evoluciona, pero la lógica sigue siendo la misma: modelos de pesos abiertos o abiertos, de tamaño muy grande, o multimodales con grandes requisitos de VRAM.

Modelos de 100B+ parámetros
Como gpt-oss:120b, qwen3-coder:480b y kimi-k2, que requieren entre 60 y 250 GB de VRAM en Q4, fuera del alcance de una estación de trabajo individual.
Modelos de frontera MoE
DeepSeek V3/V4, Llama 4 Maverick: las versiones completas, no los modelos destilados de 7B/32B que se instalan en local.
Modelos especializados pesados
Modelos gigantes de programación, modelos de razonamiento («thinking») con contexto largo, modelos de visión de alta resolución.

Los modelos "normales" (Mistral 7B, Llama 3.1 8B, Qwen 14B, Phi-4, etc.) siguen siendo recomendables para su uso en local: caben en una RTX 3060 de 12 GB o en un MacBook Air, y no hay ningún beneficio en ejecutarlos en remoto.

#Precios y límites

Ollama Cloud se sitúa entre una suscripción mensual de tarifa fija (con una cuota de solicitudes por hora) y un modelo de facturación por consumo para usos intensivos. Los precios exactos cambian —compruébalos en ollama.com/cloud antes de comprometerte—, pero hay algunos aspectos constantes que conviene señalar.

Cuotas por hora
Los planes básicos limitan el número de solicitudes por hora o por día. El límite permite usar el chat cómodamente de forma manual, pero se alcanza rápidamente con un script que recorre 10.000 documentos.
Facturación por duración de inferencia
Los modelos muy grandes a veces se facturan por el tiempo de GPU consumido. Una consulta con contexto largo (32k tokens, razonamiento profundo) cuesta necesariamente más que un "hola".
No se muestra por defecto un precio por token
A diferencia de OpenAI o Anthropic, en Ollama Cloud la API no cobra sistemáticamente por token. Esto hace que la planificación presupuestaria sea menos precisa.
Sin SLA para el público general
La oferta es reciente y, al escribir estas líneas, no hay una garantía de disponibilidad comparable a las de los grandes proveedores de servicios en la nube.
!
La trampa del «casi gratis»
Una cuota gratuita o un plan básico barato invita a hacerlo todo a través de la nube. Pero en cuanto automatizas (procesamiento por lotes, agente que ejecuta un bucle, RAG sobre 100 000 fragmentos), la factura sube rápidamente y la latencia de red se añade a cada llamada.

#Confidencialidad: lo que realmente cambia

Es aquí donde la diferencia con el autoalojamiento se vuelve estructural, no anecdótica. Cuando usas Ollama en local, tus prompts nunca salen del puerto 11434 en localhost; puedes comprobarlo en el cortafuegos. En la nube, transitan por Internet y se procesan en una infraestructura de terceros.

Tus prompts salen del perímetro
Todos los datos enviados —extracto de contrato, código fuente propietario, expediente de un paciente, correo electrónico— abandonan tu máquina. Para un despacho de abogados, un médico, un departamento de RR. HH. o un laboratorio de investigación y desarrollo, esto es inaceptable.
Política de retención
Ollama afirma que no entrena sus modelos con tus prompts. Pero la retención para depuración, detección de abusos o registros varía según el plan. Lee los términos y condiciones antes de enviar datos sensibles.
RGPD y alojamiento
Los servidores de Ollama Cloud están mayoritariamente en Estados Unidos. Para los datos personales europeos, esto plantea cuestiones relativas a las transferencias fuera de la UE que el autoalojamiento elimina de golpe.
No es posible auditar la infraestructura
En local, puedes usar tcpdump en el puerto 11434 y demostrar que nada sale. En la nube, debes confiar: no hay ningún medio técnico para verificar lo que se registra.
→
Prueba de tcpdump
Para una instalación de Ollama autoalojada, ejecuta `sudo tcpdump -i any port 443` mientras utilizas el modelo. No debe aparecer ningún paquete saliente. Con Ollama Cloud, verás tráfico hacia los servidores ollama.com. La prueba de confidencialidad es binaria y observable.

#Alternativas autoalojadas para cada modelo en la nube

Para casi todos los modelos ofrecidos en la nube, existe una alternativa local, ya sea equivalente (un modelo más pequeño de la misma familia) o aceptable (otro modelo comparable de pesos abiertos). Aquí tienes las correspondencias útiles.

gpt-oss:120b-cloud → llama3.1:8b o qwen2.5:14b en local
Para el 90 % de los usos conversacionales, un 8B-14B Q4 en una RTX 3060 de 12 GB basta. La diferencia se nota principalmente en tareas de razonamiento largo o de conocimiento enciclopédico.
qwen3-coder:480b-cloud → qwen2.5-coder:14b o 32b
El 32B en Q4 (≈19 GB de VRAM) funciona en una RTX 4090 o en un Mac M-Max. Para el autocompletado de código en un IDE, es más que suficiente — ver la guía de Continue.dev.
deepseek-v3:671b-cloud → deepseek-r1:32b o 70b destilado
Las versiones destiladas de DeepSeek R1 reproducen un 80-90 % del razonamiento del modelo completo en benchmarks habituales, en local en una 4090 o en un Mac Studio.
Modelos de visión gigantes → qwen2.5-vl:7b o llama3.2-vision:11b
Para OCR, etiquetado de imágenes y descripciones, estos dos modelos funcionan con entre 8 y 12 GB de VRAM. Consultar la guía sobre LLM multimodales de visión en local.
Contexto largo de 1M de tokens → modelos locales de 128k + chunking
Muy pocos usos reales requieren 1M de tokens de una sola vez. Un buen pipeline RAG con chunking + reranker procesa corpus enormes con un modelo local de 32k.
i
La diferencia de calidad se reduce cada trimestre
Un modelo de 14B de 2026 supera a uno de 70B de 2024 en la mayoría de los benchmarks. El razonamiento «necesito un 400B» es cada vez menos habitual. Antes de pagar por un servicio en la nube, comprueba de verdad si un 14B local es suficiente: a menudo te sorprenderás.

#Tabla de decisión

Para decidir entre Ollama Cloud y el autoalojamiento, hazte estas cinco preguntas en orden. La primera cuya respuesta sea "self-host" resuelve el debate.

1. ¿Son los datos sensibles?
Código propietario, datos de clientes, salud, ámbito jurídico, RR. HH., I+D → autoalojamiento, punto final.
2. ¿Estás sujeto al RGPD o a una normativa sectorial?
Hospital, banco, sector público, datos europeos → auto-hospedaje, o nube soberana dedicada (no Ollama Cloud)
3. ¿Es el volumen previsible y elevado?
Más de unos miles de llamadas al día → un GPU de 1500 € se amortiza en unos meses frente a una factura cloud variable.
4. ¿Necesitas funcionar offline?
Instalación sin conexión fiable, demostraciones sobre el terreno, requisitos de aislamiento de red (air-gap) → alojamiento propio obligatorio.
5. ¿Necesitas absolutamente un modelo de 100B o más?
Si la respuesta es afirmativa, y solo en ese caso, y después de haber probado un 32B local: Ollama Cloud pasa a ser una opción que puedes considerar.
→
Regla práctica
Si dudas, comienza en local con un modelo 14B Q4. Pronto descubrirás si sus limitaciones realmente impiden el uso que quieres darle; en el 80 % de los casos, no. La nube sigue siendo la excepción, no la regla.

#Cuándo usar uno, cuándo usar el otro

#Los pocos casos en los que Ollama Cloud es una buena opción

Evaluación puntual de un modelo gigante
Quieres comprobar en 10 minutos si un modelo de programación de 480B merece la pena antes de invertir en una máquina: la nube evita la compra impulsiva.
Demostración para un cliente sin hardware en el lugar
Un vendedor que muestra un POC en su portátil sin llevar consigo un Mac Studio.
Tarea única muy exigente
Un informe de 500 páginas que se debe resumir una vez cada trimestre, con contexto largo y sin datos confidenciales dentro.
Aprendizaje y exploración
Descubrir lo que un modelo de 670B sabe hacer, para luego volver a ejecutarlo todo en local sabiendo qué capacidades buscar.

#Los casos en los que gana el alojamiento propio

Cualquier uso recurrente
Asistente de programación para el día a día, chat interno del equipo, RAG sobre documentos de la empresa: la estabilidad de la factura importa.
Cualquier uso con datos sensibles
No hay debate: los datos jurídicos, sanitarios, de RR. HH., de finanzas y de I+D, así como el código propietario, se quedan en local.
Cualquier uso automatizado
Pipelines por lotes, agentes que ejecutan bucles, n8n, scripts ETL: las cuotas de la nube se disparan y los costes se vuelven impredecibles.
Cualquier uso sin conexión o en edge
Raspberry Pi en un taller, portátil durante los desplazamientos, lugar sin una conexión fiable a Internet.
Cualquier necesidad de personalización
Fine-tuning, un Modelfile personalizado, prompts de sistema para el equipo, integración profunda con tus herramientas: la nube no lo permite.
!
La trampa de la dependencia del proveedor
Una vez que un equipo se ha acostumbrado a llamar a un modelo específico en la nube, dejar de usarlo resulta difícil: prompts ajustados, formatos de salida y comportamientos particulares. Invertir desde el principio en el autoalojamiento evita esta dependencia y permite ahorrar cuando suben los precios.

#Para ir más allá

Si concluyes que el autoalojamiento es la opción adecuada para tu caso (lo cual es probable), estas guías te ayudan a empezar con buen pie:

Elegir la GPU adecuada
La guía «Elegir una GPU para la IA local» detalla los compromisos entre VRAM, presupuesto y rendimiento, desde la RTX 3060 de 12 GB hasta el Mac Studio Ultra.
Comprender la cuantización
La guía Elegir tu cuantización (Q4, Q5, Q8, FP16) explica cómo hacer que un modelo de 32B quepa en una GPU de 16 GB sin degradar la calidad.
Confidencialidad operativa
La Checklist de privacidad enumera las comprobaciones concretas para asegurarte de que ningún paquete salga de tu máquina: una prueba basada en hechos.
Preguntas frecuentes sobre Ollama Cloud
¿Es gratuito Ollama Cloud?+
Existe un plan gratuito, pero con límites de uso estrictos (pocos modelos simultáneos, cuotas que se renuevan por sesión y por semana). Para un uso más intensivo, Ollama ofrece planes de pago mediante una suscripción mensual que dan acceso a más modelos simultáneos y a mayores cuotas. Los precios exactos cambian: revisa siempre la página oficial ollama.com/pricing antes de comprometerte, en lugar de confiar en una cifra fija.
¿Cómo usar Ollama sin pasar por la nube?+
Nada cambia: la instalación local clásica de Ollama funciona exactamente como antes, sin cuenta ni suscripción. El cloud es una funcionalidad opcional que se activa únicamente cuando eliges explícitamente un modelo marcado "cloud" y te autenticas. Mientras uses modelos estándar (Llama, Mistral, Qwen, etc.), todo funciona localmente, sin conexión requerida tras descargar el modelo.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.