Una IA offline: usar un LLM sin conexión internet
Un LLM local solo necesita internet para descargarse. Una vez que el modelo está en tu disco, una IA sin conexión funciona íntegramente sin conectarse a internet: en avión, en una zona sin cobertura, haciendo senderismo o en un equipo aislado de la red. Esta guía muestra cómo preparar tu máquina antes de salir, qué modelos compactos llevar y cómo comprobarlo todo para no quedarte bloqueado en el peor momento.
#¿Por qué una IA offline?
Los asistentes de la nube (ChatGPT, Claude, Gemini) se detienen de inmediato cuando se pierde la conexión. Una IA sin conexión, en cambio, funciona íntegramente en tu máquina: el modelo se carga en memoria y calcula tus respuestas localmente, sin consultar nunca un servidor remoto. Es el mismo principio que un LLM local clásico, llevado hasta su conclusión lógica: ninguna dependencia de la red una vez completada la preparación.
Las situaciones en las que esto lo cambia todo son más frecuentes de lo que se cree: un vuelo de larga distancia, un viaje en tren sin 4G, una misión en una zona sin cobertura, una obra o una instalación industrial sin Wi-Fi, o incluso un equipo desconectado deliberadamente de internet por razones de confidencialidad. En todos estos casos, una IA sin conexión bien preparada sigue plenamente operativa.
- Autonomía total
- Sin interrupciones cuando pierdes la conexión a la red: en un avión, un túnel, el campo o un sótano.
- Confidencialidad
- Nada sale de la máquina. Ideal para datos sensibles o un equipo air-gapped.
- Cero costo recurrente
- Sin suscripción, sin facturación por token, sin límite de uso.
- Latencia estable
- La velocidad depende solo de tu hardware, no de un servidor sobrecargado en el otro extremo del mundo.
#Lo que necesita red (y lo que no la necesita)
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Entender la diferencia entre «en línea» y «sin conexión» evita sorpresas desagradables. Solo un paso requiere internet: la descarga. Todo lo demás es local.
- Necesita red (una vez)
- Descargar la aplicación (Ollama, LM Studio), descargar los modelos (archivos GGUF) y obtener las actualizaciones.
- 100 % offline
- Cargar un modelo ya existente, conversar, generar texto o código, resumir un documento local, usar RAG en tus archivos.
#Requisitos antes de salir
Una IA sin conexión cabe en un portátil corriente. Lo que importa es la RAM (o la VRAM si tienes una GPU) y el espacio en disco para almacenar los modelos.
- Espacio libre en disco
- Prever entre 5 y 30 GB según los modelos incluidos. Un modelo de 7B en Q4_K_M pesa aproximadamente 4,5 GB, uno de 14B alrededor de 9 GB.
- RAM / VRAM
- 8 GB para un 3B, 16 GB para usar cómodamente un 7B, 32 GB para optar por un 14B. Referencias de VRAM en Q4: 3B≈2 GB · 7B≈5 GB · 14B≈9 GB.
- GPU (opcional)
- Una GPU acelera mucho el procesamiento, pero no es obligatoria. Un MacBook Apple Silicon (serie M) o un PC con 16 GB de RAM bastan para trabajar únicamente con la CPU.
- Batería
- La inferencia exige recursos de la CPU/GPU: en un portátil desconectado de la corriente, cuenta con una autonomía reducida. Prioriza los modelos compactos cuando estés fuera.
#Descargar todo antes de perder la conexión a la red
Es la etapa decisiva y la única que requiere internet. Hazla tranquilamente en casa o en la oficina, con Wi-Fi, unas horas antes de salir: un modelo de varios GB no se lleva bien con las conexiones inestables. Este es el procedimiento con Ollama, la opción más sencilla para una IA sin conexión.
- 01Instalar Ollama mientras tengas conexión a internetDescarga e instala Ollama desde ollama.com. Es el daemon que ejecutará tus modelos localmente y escuchará en http://localhost:11434. Instálalo antes que nada, ya que la propia aplicación se descarga en línea.
- 02Descargar uno o dos modelos compactosUsa ollama pull para descargar los modelos al disco. Elige tamaños adecuados para tu máquina (ver sección siguiente). Un pull con Wi-Fi estable tarda desde unos minutos hasta un cuarto de hora, según la velocidad de conexión y el tamaño.
- 03Instalar una interfaz gráfica (opcional)Si prefieres una ventana de chat en lugar de un terminal, instala LM Studio (todo en uno, también gestiona la descarga) o Open WebUI. LM Studio es especialmente práctico cuando estás fuera de casa: app + modelos + interfaz en una sola herramienta.
- 04Poner en marcha cada modelo una vezInicia una conversación de prueba con cada modelo descargado mientras aún tengas conexión a la red. Esto confirma que el archivo está completo y se carga correctamente en memoria.
#Los modelos compactos que bastan para usar sobre la marcha
Al trabajar sin conexión en un portátil, prima la eficiencia: un modelo pequeño, rápido y que consuma poca batería es mejor que un gigante que funcione con lentitud y agote la batería. Para la mayoría de los usos durante los desplazamientos —redacción, resúmenes, preguntas generales, ayuda con el código— un modelo de 2B a 9B en Q4_K_M hace muy bien el trabajo.
- Qwen 3.5 2B
- ~1,9 GB. El más ligero: ideal para un viejo portátil o para conservar la batería. Multimodal, 256k de contexto, licencia Apache 2.0. Suficiente para redactar, reformular, responder preguntas simples.
- Qwen 3.5 9B
- ~6,6 GB. Excelente modelo polivalente, bueno en razonamiento, visión y código, con 256k de contexto. El mejor equilibrio para un portátil con 16 GB de RAM: la opción de referencia de 8 GB en 2026.
- Granite 4.2 8B
- ~5,3 GB. Consume pocos recursos y utiliza los tokens de forma eficiente (IBM, Apache 2.0), 128k de contexto, respuestas concisas. Una opción fiable para escribir que cuida la batería.
- Granite 4.2 3B
- ~2,2 GB. Compacto y ágil, muy eficiente, optimizado para máquinas modestas sin perder capacidad.
La cuantización Q4_K_M es el ajuste recomendado por defecto: reduce considerablemente el tamaño del modelo y la memoria necesaria, con una pérdida de calidad mínima e imperceptible en la mayoría de los usos. Si tienes margen en RAM/VRAM y buscas un poco más de precisión, Q5_K_M es una alternativa. Reserva Q8_0 y FP16 para máquinas muy bien equipadas.
#Verificar que todo funcione realmente offline
Nunca te fíes solo de la palabra de alguien: prueba en condiciones reales antes de quedarte sin red. Una prueba de tres minutos evita una decepción a 10 000 metros de altitud.
- 01Apagar la red por completoActiva el modo avión y desactiva el Wi-Fi Y Ethernet. El objetivo es reproducir exactamente la ausencia total de conexión.
- 02Empezar una conversaciónAbre tu terminal o LM Studio y habla con cada modelo descargado. Si el modelo responde, tu IA offline está funcionando.
- 03Comprobar que ningún error de red cause un bloqueoAlgunas interfaces muestran una franja de advertencia al estar sin conexión: mientras la generación funcione, ignórala. Si el chat no se inicia, probablemente el modelo no se haya descargado por completo.
#Equipo aislado y uso air-gapped
Algunas máquinas están intencionalmente desconectadas de internet de forma permanente: estaciones que procesan datos confidenciales, entornos industriales, laboratorios. Se trata del uso «air-gapped» — la máquina objetivo nunca tendrá acceso a la red, incluso para la instalación.
El principio: preparar los archivos en una máquina conectada y luego transferirlos mediante una memoria USB o un disco externo al ordenador aislado. Ollama almacena sus modelos en un directorio que se puede copiar tal cual.
- Instaladores offline
- Descarga el binario de instalación de Ollama o de LM Studio desde una máquina conectada, luego copíalo en el equipo aislado.
- Archivos de modelos
- En Linux/macOS, los modelos Ollama se encuentran en ~/.ollama/models; en Windows, en %USERPROFILE%\.ollama\models. Copia este directorio al equipo destino en el mismo lugar.
- Alternativa GGUF
- Con LM Studio, basta con copiar los archivos .gguf descargados en el directorio de modelos de la app en la máquina aislada.
#Actualizar tus modelos cuando vuelva la conexión de red
Al volver a una zona con cobertura, es el momento de mantener tu instalación al día: descargar las nuevas versiones de los modelos, añadir nuevos modelos que hayas descubierto por el camino y actualizar la aplicación. Nada de esto se puede hacer sin conexión, de ahí la importancia de hacerlo en cuanto vuelva la conexión.
- 01Actualizar los modelos existentesUn ollama pull sur si el modelo ya está presente solo descarga las capas modificadas si existe una nueva versión. Es rápido y mantiene tus modelos actualizados.
- 02Actualizar la aplicaciónVuelve a ejecutar el instalador de Ollama o LM Studio para obtener las correcciones y el soporte para nuevos modelos. Las actualizaciones son frecuentes en este ecosistema.
- 03Hacer limpiezaElimina los modelos que ya no uses para liberar espacio en disco antes de tu próximo viaje.
- 04Volver a probar en modo aviónDespués de cualquier actualización, vuelve a hacer una prueba offline: una nueva versión de la app podría introducir un comportamiento inesperado sin red.
#Solución de problemas
- «Model not found» sin conexión
- El modelo no había (completamente) descargado antes de la interrupción. Vuelve a conectarte, vuelve a iniciar ollama pull jusqu al mensaje de éxito, luego verifica con ollama list.
- La aplicación se niega a arrancar sin conexión de red
- Algunas interfaces intentan realizar una comprobación en línea al iniciarse. Espera unos segundos a que se agote el tiempo de espera o desactiva la comprobación de actualizaciones en los ajustes.
- Respuestas muy lentas cuando estás fuera de casa
- Si usas solo la CPU y el equipo funciona con batería, es normal. Usa un modelo más pequeño (3B) y cierra las aplicaciones que consumen muchos recursos. Conecta el portátil a la corriente si es posible.
- Batería que se agota a ojos vista
- La inferencia exige mucho al procesador. Reduce el tamaño del modelo, limita la longitud de las respuestas y activa el modo de ahorro de energía para las tareas no urgentes.
- Modelo copiado que no se carga (air-gap)
- La copia estaba incompleta: faltaban blobs o manifiestos. Vuelve a copiar toda la carpeta .ollama/models.
- Memoria insuficiente
- El modelo supera tu RAM/VRAM. Elige un tamaño menor o una cuantización más ligera (Q4_K_M en lugar de Q8_0).
#Para ir más allá
Una IA sin conexión se basa en los mismos fundamentos que una instalación local clásica. Estas guías del sitio completan la preparación:
- Instalar Ollama
- Para instalar el motor de inferencia, un paso que debes realizar mientras aún tengas conexión de red.
- Ejecutar un LLM en local sin GPU (solo CPU)
- Indispensable para usarlo en movilidad: modelos y velocidades esperadas cuando utilizas solo la CPU y el equipo funciona con batería.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Para equilibrar tamaño en disco, memoria y calidad según la máquina que lleves.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.