GPT4All: primeros pasos
GPT4All es una aplicación de escritorio gratuita (licencia MIT, publicada por Nomic) que ejecuta un modelo de lenguaje en tu ordenador, sin necesidad de GPU ni de cuenta. La instalas, descargas un modelo GGUF y empiezas a conversar. Su última versión, la 3.10.0, data de febrero de 2025: funciona, pero su catálogo es antiguo y LocalDocs sigue siendo limitado. Es un buen punto de partida en un ordenador modesto; en otros casos, compárala con Jan o LM Studio.
GPT4All (a menudo escrito como «GPT for All») es una de las aplicaciones de chat local más antiguas para el público general. Esta guía explica qué hace hoy, cómo instalarla y cargar un primer modelo, qué valor real tienen LocalDocs y el servidor local, y en qué casos es mejor elegir otra opción.
#Qué es GPT4All y su estado en 2026
GPT4All está desarrollado por Nomic AI. El repositorio oficial lo describe como una herramienta que ejecuta modelos de lenguaje de forma privada en computadoras de escritorio y portátiles, sin llamadas a API ni necesidad de una GPU. El repositorio cuenta con aproximadamente 77 000 estrellas y su licencia es MIT. La aplicación se basa en llama.cpp y puede cargar modelos en formato GGUF.
El estado del proyecto es lo primero que debes saber. La última versión publicada es la 3.10.0, del 25 de febrero de 2025, es decir, más de un año y medio antes de este artículo. El sitio histórico gpt4all.io redirige ahora hacia una página de Nomic centrada en su plataforma para empresas. La aplicación sigue siendo usable y no hay indicios de que deje de funcionar, pero no debes esperar nuevas funciones ni un motor de inferencia actualizado.
#1. Instalación
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Actualizaciones de por vida
Los instaladores se encuentran en la página del repositorio oficial nomic-ai/gpt4all (Windows, Windows ARM, macOS, Ubuntu). Descárgalos únicamente desde esta fuente: la página que se abre en la dirección histórica gpt4all.io ya no es la del software. Los requisitos indicados por el repositorio: para Windows y Linux, un procesador Intel Core i3 de segunda generación, AMD Bulldozer o mejor; la compilación para Linux es x86-64 únicamente; para macOS, Monterey 12.6 o más reciente, con mejores resultados en los chips Apple Silicon de la serie M.
| Sistema | Instalador | Requisitos previos indicados en el repositorio |
|---|---|---|
| Windows | Instalador de Windows (y versión ARM) | Intel Core i3 de la generación 2, AMD Bulldozer o mejor; ARM: Snapdragon, SQ1, SQ2 |
| macOS | Instalador para macOS | Monterey 12.6 o posterior; se recomienda Apple Silicon |
| Linux | Instalador para Ubuntu | Solo procesadores x86-64, no ARM |
#2. Primer modelo
Al iniciar la aplicación por primera vez, esta propone un modelo por defecto. La documentación recomienda comenzar con Llama 3, que se descarga desde el botón de añadir modelo. Especifica que GPT4All se conecta a modelos de Hugging Face con el motor llama.cpp y que la mayoría tienen la extensión .gguf.
- 01Abrir ModelsEn el menú de la izquierda, haz clic en Models y luego en + Add Model para acceder a la página Explore Models.
- 02Buscar un modeloBusca entre los modelos disponibles en línea, o ordena los resultados por popularidad, descargas o fecha mediante el icono de engranaje.
- 03DescargarHaz clic en Download. El archivo se guarda en tu disco; no es necesario registrarte.
- 04Cargar y chatearVe a Chats, haz clic en Load Default Model (Llama 3 o el modelo que acabas de descargar) y plantea tu primera pregunta.
La tabla siguiente recoge los ejemplos de la documentación oficial, con la memoria RAM indicada por el editor. La columna «Licencia» es importante: GPT4All enumera modelos con condiciones muy diferentes, entre ellos uno bajo una licencia no comercial.
| Modelo | Archivo | RAM requerida | Tamaño | Licencia |
|---|---|---|---|---|
| Llama 3 Instruct | 4,66 GB | 8 GB | 8 mil millones, q4_0 | Meta Llama 3 License |
| Nous Hermes 2 Mistral DPO | 4,11 GB | 8 GB | 7 mil millones, q4_0 | Apache 2.0 |
| Phi-3 Mini Instruct | 2,18 GB | 4 GB | 4 mil millones, q4_0 | MIT |
| Mini Orca (Small) | 1,98 GB | 4 GB | 3 mil millones, q4_0 | CC-BY-NC-SA-4.0 (uso no comercial) |
¿Dónde se almacenan los modelos? La carpeta de descarga se configura en los ajustes y, por defecto, se encuentra en AppData\Local\nomic.ai\GPT4All en Windows, en Library/Application Support/nomic.ai/GPT4All en macOS y en .local/share/nomic.ai/GPT4All en Linux. Un modelo de 4 a 5 GB ocupa el mismo espacio en el disco: si tu disco de sistema es pequeño, redirige esta carpeta a un disco secundario antes de descargar varios modelos.
#GPT4All en francés
La aplicación ofrece ajustes de idioma y configuración regional para la interfaz. En cuanto a las respuestas, todo depende del modelo: Llama 3 y los modelos derivados de Mistral comprenden y escriben en francés, con una calidad variable. No te fíes de una clasificación en inglés: plantea tres preguntas de tu ámbito en francés y evalúa la respuesta. Si utilizas principalmente el francés, los modelos Mistral y Qwen del catálogo QuelLLM son mejores candidatos, siempre que se puedan cargar en el motor cuya versión está fijada.
#Mucha RAM con un procesador: qué cambia
Una máquina con 256 GB de memoria RAM sin tarjeta gráfica puede cargar modelos muy grandes, pero la velocidad de generación depende del ancho de banda de la memoria, no de su capacidad. Orden de magnitud teórico: la cantidad de tokens por segundo está limitada por el ancho de banda en GB/s dividido por el tamaño de los pesos del modelo en GB. Como ejemplo aritmético, 80 GB/s divididos por 40 GB de pesos dan como máximo 2 tokens por segundo. No es una medición, solo un límite superior.
El único ajuste que puede ayudar es el número de hilos del procesador. En los ajustes avanzados, GPT4All lo ha fijado por defecto en 4; la documentación indica que más hilos pueden acelerar las respuestas. Auméntalo progresivamente, dejando núcleos libres para el sistema. Si tienes una tarjeta gráfica, puedes seleccionar Auto, Metal, CPU o GPU como dispositivo.
#3. La conversación y los ajustes que importan
La interfaz es la de una aplicación de mensajería: conversación en el centro, mensaje en la parte inferior y ajustes del modelo en la configuración. Tres valores por defecto merecen atención. La longitud del contexto es de 2.048 tokens, muy corta para un documento largo. La temperatura es de 0,7. Y el número de capas cargadas en la memoria de vídeo está fijado en 32; debes ajustarlo según tu tarjeta.
#4. LocalDocs: el RAG integrado, con sus limitaciones
LocalDocs te permite conversar con tus archivos sin escribir una línea de código. Creas una colección indicando una carpeta; la aplicación divide tus archivos en fragmentos y los indexa con los modelos de embeddings de Nomic, ejecutados en tu máquina. En un chat, activas la colección y el modelo recibe en sus instrucciones los fragmentos semánticamente cercanos a tu pregunta; las fuentes se muestran debajo de la respuesta.
- 01Crear la colecciónAbre LocalDocs, da un nombre a la colección y elige el directorio, luego haz clic en Create Collection.
- 02Esperar la indexaciónSe muestra el progreso; un indicador verde Ready señala que el proceso ha terminado. Ya puedes consultar los archivos que estén listos.
- 03Activarlo en un chatAbre LocalDocs con el botón en la esquina superior derecha del chat, luego marca la colección.
- 04Verificar las fuentesHaz clic en Sources debajo de la respuesta para ver qué archivos se utilizaron.
#Lo que no hace LocalDocs
Tres límites documentados explican las decepciones. En primer lugar, los tipos de archivos indexados por defecto son .txt, .pdf, .md y .rst: un archivo de Word debe convertirse antes. En segundo lugar, cada fragmento tiene 512 caracteres por defecto y la aplicación solo inyecta como máximo tres por solicitud: el modelo solo ve aproximadamente 1.500 caracteres de tus documentos en cada pregunta. Por último, este enfoque funciona bien para una pregunta específica («¿qué dice la cláusula 4?») y mal para una síntesis de todo un conjunto de documentos.
Los ajustes avanzados permiten aumentar el tamaño y la cantidad de fragmentos, con esta salvedad indicada en la documentación: esto puede mejorar la fiabilidad de las respuestas, pero ralentiza la generación y consume contexto, ya limitado a 2.048 tokens por defecto. Si necesitas conversar con una verdadera base documental, una herramienta como AnythingLLM o Open WebUI es más adecuada.
#5. Servidor local compatible con OpenAI
GPT4All incluye un servidor de API compatible con OpenAI, desactivado por defecto. Para activarlo: Configuración, Aplicación, sección Avanzada, luego marca la casilla «Enable Local API Server». Escucha en el puerto 4891, solo en localhost (127.0.0.1), y solo acepta HTTP, no HTTPS. La dirección base es http://localhost:4891/v1.
Los puntos de acceso disponibles son /v1/models, /v1/models/nom-du-modèle, /v1/completions y /v1/chat/completions. El nombre del modelo en la solicitud debe coincidir con el que aparece en la aplicación. Un consejo documentado: LocalDocs se puede activar para el chat del servidor desde la interfaz, no a través de la API. Las referencias utilizadas se incluyen en la respuesta, en choices[0].references.
#Confidencialidad: tres ajustes que debes conocer
Por defecto, todo queda en tu máquina. Tres opciones cambian eso, y hay que saber dónde están. La opción Datalake, que comparte de forma anónima tus interacciones con la comunidad GPT4All, está desactivada por defecto. La opción «Use Nomic Embed API», que crea colecciones LocalDocs fuera del dispositivo mediante la API de Nomic, está desactivada por defecto y requiere una clave. Por último, añadir un «Model API» (una clave de un proveedor remoto) envía tus prompts a ese proveedor, lo que especifica claramente la documentación.
#Ventajas, limitaciones y alternativas
| Tu situación | ¿Sirve GPT4All? | Alternativa a considerar |
|---|---|---|
| Máquina modesta, primer intento, sin línea de comandos | Sí, es su caso de uso | Jan si quieres un proyecto más activo |
| Hablar con algunos archivos de texto o PDF | Sí para preguntas específicas | AnythingLLM para una verdadera base documental |
| Modelos muy recientes (2025 y después) | No garantizado, motor cuyo desarrollo está congelado | LM Studio o Ollama, actualizado regularmente |
| Servidor compartido para un equipo | No: solo localhost, HTTP | Ollama y Open WebUI |
- Puntos fuertes
- Proceso rápido «descargar y luego chatear», sin cuenta, LocalDocs sin código, servidor compatible con OpenAI, funciona sin GPU.
- Puntos débiles
- Motor sin cambios desde febrero de 2025, contexto predeterminado de 2.048 tokens, LocalDocs limitado a tres extractos de 512 caracteres, catálogo cada vez más desactualizado.
- Ollama vs LM Studio vs Jan vs GPT4All
- Jan: la alternativa de código abierto a ChatGPT
- Primeros pasos con LM Studio
- AnythingLLM: RAG listo para producción en local
- Open WebUI con Ollama: guía completa
- Fuente: repositorio GPT4All
- Fuente: documentación GPT4All, modelos
- Fuente: documentación GPT4All, ajustes
¿Es gratuito GPT4All y funciona fuera de línea?+
¿Aún se mantiene GPT4All en 2026?+
¿Qué modelos usar con GPT4All?+
¿Funciona GPT4All en francés?+
¿Una máquina con 256 GB de RAM cambia algo?+
¿Cómo hacer consultas a mis documentos con GPT4All?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.