Reemplazar ChatGPT por una IA local: guía de migración (2026)
Sí, para la mayoría de los usos comunes: redacción, resumen, traducción, código, preguntas sobre tus documentos. La migración se reduce a cuatro pasos: instalar Ollama, añadir una interfaz como Open WebUI, elegir un modelo que quepa en tu memoria y luego importar tu historial de ChatGPT. Lo que no encontrarás en local es el nivel de los modelos de vanguardia de mayor tamaño; mantenlos como respaldo para las tareas en las que marcan la diferencia.
Dejar ChatGPT no quiere decir abandonar tus hábitos. La interfaz de chat, el historial, los asistentes preconfigurados, el análisis de archivos, la búsqueda web y las funciones de voz también están disponibles en local. Esta guía presenta el equivalente de cada función, indica qué modelo elegir según la memoria de tu equipo y detalla el procedimiento para recuperar tus conversaciones.
#Lo que ganas, lo que pierdes
En local, tus conversaciones y archivos permanecen en tu máquina: nada pasa por un servicio de terceros y el asistente funciona sin conexión una vez descargado el modelo. No hay suscripción ni límite de mensajes: el coste es el del hardware y la electricidad. También eliges el modelo, sus ajustes y sus instrucciones. A cambio, pierdes el acceso automático a los modelos de vanguardia más grandes, que no caben en un equipo personal, y parte de la integración lista para usar: aplicaciones móviles, voz fluida y agentes conectados a tus cuentas. La comparativa con cifras de rendimiento y costes se encuentra en nuestra guía «IA local vs ChatGPT».
| Función de ChatGPT | Equivalente local | Lo que hay que saber |
|---|---|---|
| Chat con historial | Open WebUI, LM Studio, Jan, Msty | Open WebUI conserva las conversaciones en un volumen Docker |
| Importación de tus conversaciones anteriores | Import Chats de Open WebUI | El formato ChatGPT se detecta automáticamente |
| GPTs personalizados | Modelos personalizados de Open WebUI | Instrucciones, herramientas y conocimientos en un mismo paquete |
| Memoria | Memoria de Open WebUI | Hechos guardados de una conversación a otra |
| Archivos adjuntos, análisis de documentos | Base de conocimientos (RAG) | El contexto del modelo sigue siendo limitado: ver más abajo |
| Búsqueda web | Búsqueda web de Open WebUI, SearXNG | Fuentes citadas; depende del motor configurado |
| Voz | Reconocimiento y síntesis vocal de Open WebUI | Latencia superior a la de un servicio en la nube |
| Imágenes | ComfyUI o Stable Diffusion | Modelo y GPU distintos del modelo de texto |
| Modelo de punta | No hay equivalente completo | Mantén una API o suscripción de respaldo |
#Elegir el modelo según la memoria disponible
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
La regla es elegir el modelo más grande que quepa cómodamente en Q4 en tu VRAM o en tu memoria unificada, con el contexto incluido. El catálogo QuelLLM indica, para cada modelo, la memoria que ocupan únicamente los pesos en Q4: de ahí proceden las cifras que aparecen a continuación. Añade la caché KV y un margen del 20 %; la guía sobre la ventana de contexto explica el cálculo.
| Memoria disponible | Modelo posible | Peso en Q4 | Para qué sirve |
|---|---|---|---|
| 8 GB | Qwen 3.5 9B | alrededor de 6 GB | Redacción, resumen, preguntas habituales |
| 12 GB | Gemma 4 12B | alrededor de 7 GB | Asistente general con margen de contexto |
| 16 GB | Mistral Small 3.2 24B o gpt-oss 20B | 14 a 13 GB | Razonamiento y contexto más largo |
| 24 GB | Qwen 3.8 27B | aproximadamente 16 GB | Uso diario exigente, código |
| 32 GB | Qwen 3.6 35B-A3B (MoE) | alrededor de 21 GB | Velocidad alta para el tamaño, contextos largos |
| 64 GB y más | Llama 3.3 70B o gpt-oss 120B | 40 a 70 GB | Calidad similar a la de los modelos habituales en la nube |
#Volver a tener una interfaz de chat
- Open WebUI
- La interfaz web más cercana a ChatGPT: historial, prompts de sistema, archivos adjuntos, búsqueda web, memoria y modelos personalizados. Se conecta a Ollama o a cualquier API compatible con OpenAI.
- LM Studio
- Aplicación de escritorio que descarga los modelos y ofrece un chat: la vía más rápida para comenzar sin terminal.
- Jan
- Aplicación de escritorio sencilla, orientada a la privacidad, con chat y gestión de modelos.
- Msty
- Interfaz cuidada para Mac, Windows y Linux, con varios modelos lado a lado.
Para una primera instalación, basta con LM Studio o Jan. Elige Open WebUI si varias personas deben usarlo, si quieres memoria, modelos personalizados o importar tu historial.
#Importar tu historial de ChatGPT
Open WebUI sabe leer la exportación de ChatGPT sin conversión previa: la documentación especifica que el formato ChatGPT es detectado y convertido automáticamente. Tus conversaciones se añaden a las existentes, y cada importación recibe un nuevo identificador: volver a importar el mismo archivo crea duplicados. Por tanto, haz la importación una sola vez, después de haber revisado el archivo.
- 01Solicitar la exportación a ChatGPTEn ChatGPT, abre Configuración, Controles de datos (Data controls), luego Exportar datos (Export data) y Solicitar exportación. Recibirás por correo electrónico un enlace de descarga; el texto exacto de las opciones depende del idioma de la interfaz.
- 02Descomprimir el archivoDescomprime el archivo recibido y busca conversations.json, que contiene el historial.
- 03Hacer una copia de seguridad de Open WebUIAntes de importar, exporta tus conversaciones Open WebUI existentes desde Ajustes, Control de datos, Exportar conversaciones, para poder volver atrás.
- 04ImportarEn Open WebUI: nombre de usuario en la esquina inferior izquierda, Ajustes, Control de datos, Importar conversaciones, luego elige conversations.json. El nombre varía según el idioma.
- 05ComprobarAbre algunas conversaciones antiguas: los mensajes deben aparecer en orden. El modelo mostrado en una conversación importada no refleja necesariamente el modelo original.
#Instalar la pila: Ollama, Open WebUI, un modelo
El siguiente procedimiento presupone que Docker está instalado para Open WebUI. Sin Docker, LM Studio o Jan sustituyen todo el conjunto con una sola aplicación.
- 01Instalar OllamaSigue la guía de instalación de tu sistema. Ollama escucha por defecto en http://localhost:11434.
- 02Descargar un modeloElige según la tabla anterior, por ejemplo ollama pull seguido del nombre del modelo. Verifica su tamaño antes de descargarlo.
- 03Lanzar Open WebUILa documentación oficial ofrece un comando Docker que monta un volumen para conservar tus datos y le permite acceder a Ollama en la máquina anfitriona.
- 04Ajustar el contextoCon menos de 24 GiB de VRAM, Ollama utiliza un contexto de unos 4.000 tokens, lo que trunca los documentos largos. Amplíalo según la memoria disponible.
La opción de volumen conserva tus conversaciones durante las actualizaciones, y la clave secreta debe establecerse una sola vez: sin clave estable, cada recreación del contenedor desconecta a los usuarios, indica la documentación. Reemplaza your-secret-key por un valor generado, por ejemplo con openssl rand -hex 32. La interfaz luego responde en el puerto 3000 de tu máquina.
#Recuperar tus usos uno a uno
- Hablar, redactar, traducir
- Disponible en cuanto se carga un modelo. La calidad depende del tamaño del modelo: uno de 9B basta para un correo electrónico; uno de 27B o más, para un texto largo y lleno de matices.
- Analizar tus documentos
- Las bases de conocimiento de Open WebUI, AnythingLLM o PrivateGPT recuperan los pasajes útiles en lugar de enviar todo al modelo. Es el método adecuado cuando tus documentos superan la ventana.
- Coder
- Extensiones como Cline o Continue se conectan a Ollama. Ollama recomienda al menos 64.000 tokens de contexto para las herramientas de programación.
- Volver a disponer de tus GPTs
- Recrea cada GPT como un modelo personalizado: instrucciones de sistema, herramientas y conocimientos agrupados. Copia tus instrucciones desde ChatGPT.
- Buscar en internet
- Activa la búsqueda web de Open WebUI o conecta SearXNG para que el modelo cite fuentes.
#Cuándo mantener ChatGPT o una API en la nube como respaldo
Tres situaciones justifican no prescindir por completo de la nube: un razonamiento muy largo sobre un problema difícil, una tarea que requiera un contexto de varios cientos de miles de tokens o un uso móvil con voz continua. Un enfoque híbrido funciona bien: la IA local para todo lo confidencial o repetitivo y la nube para los casos excepcionales, sin pegar nunca allí datos sensibles. Open WebUI permite conectar un proveedor externo junto con Ollama y comparar dos modelos en paralelo, lo que ayuda a valorar si la IA local basta para tu caso.
#Migrar sin riesgo: primero, una prueba en paralelo
No canceles nada el primer día. Lo más seguro es usar las dos herramientas en paralelo durante una o dos semanas, haciéndoles la misma pregunta siempre que el resultado importe. Anota los casos en los que el asistente local decepciona: indican si necesitas un modelo más grande, una ventana más amplia, un mejor prompt o, sinceramente, un uso que convenga mantener en la nube.
- 01Días 1 y 2: instalar y probarInstala la pila, carga el modelo adecuado para tu memoria y repite cinco conversaciones típicas de tu historial de ChatGPT.
- 02Días 3 a 7: complementar ChatGPTUtiliza la IA local para todas las tareas habituales; recurre a ChatGPT solo cuando la respuesta local no sea suficiente y anota por qué.
- 03Semana 2: importar y recrearImporta tu historial una vez, recrea tus GPTs más utilizados como modelos personalizados y activa la búsqueda web si la necesitas.
- 04Fin del periodo: decidirCuenta los casos en los que hayas tenido que volver a la nube. Si ocurre pocas veces, se puede cancelar la suscripción; de lo contrario, mantenla o pasa a una API facturada por uso.
#Las decepciones típicas tras la migración
- El contexto recorta tus documentos
- Ollama empieza con unos 4.000 tokens en una tarjeta de menos de 24 GiB: un PDF largo pegado en el chat se trunca sin una advertencia clara. Aumenta la ventana dentro de los límites de tu memoria.
- Un modelo demasiado pequeño o demasiado comprimido
- Un 3B o un 7B en 2 bits dará la impresión de que la IA local es mediocre. Prueba con un modelo más grande antes de sacar conclusiones y evita las cuantizaciones de menos de 4 bits.
- Un modelo de razonamiento lento
- Algunos modelos piensan mucho antes de responder: la respuesta llega después de varias decenas de segundos. Elige un modelo sin razonamiento para conversaciones cotidianas.
- Prompts escritos para ChatGPT
- Un modelo local sigue peor las instrucciones vagas. Especifica el rol, el formato y el idioma de respuesta en el prompt del sistema.
#Lo que aún sale de tu máquina
Local no significa hermético. La búsqueda web de Open WebUI envía tus consultas al motor de búsqueda configurado; un modelo cuya etiqueta de Ollama termine en cloud se ejecuta en los servidores del proveedor, como kimi-k3:cloud en la biblioteca de Ollama; y conectar un proveedor externo junto a Ollama, lo que permite Open WebUI, envía tus mensajes a ese proveedor. Para una verdadera privacidad, desactiva estas opciones o resérvalas para un perfil distinto, y revisa la lista de modelos instalados antes de procesar documentos sensibles.
¿Es realmente posible reemplazar a ChatGPT por una IA local?+
¿Cómo recuperar mis conversaciones de ChatGPT?+
¿Qué interfaz se parece más a ChatGPT?+
¿Qué modelo elegir con 16 GB de memoria?+
¿Y mis GPTs personalizados?+
¿Es realmente gratuito?+
#Para ir más allá
- Instalar Ollama en 5 minutos
- Open WebUI con Ollama: guía completa
- IA local vs. ChatGPT: comparativa
- Comprender la ventana de contexto
- RAG local con Ollama sin programar
- SearXNG: búsqueda web para un modelo local
- Fuente: Open WebUI, importación y exportación de conversaciones
- Fuente: Open WebUI, funcionalidades
- Fuente: Open WebUI, inicio rápido
- Fuente: Ollama, longitud de contexto
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.