Principiante 11 minOtras herramientas

GPT4All: primeros pasos

Respuesta directa

GPT4All es una aplicación de escritorio gratuita (licencia MIT, publicada por Nomic) que ejecuta un modelo de lenguaje en tu ordenador, sin necesidad de GPU ni de cuenta. La instalas, descargas un modelo GGUF y empiezas a conversar. Su última versión, la 3.10.0, data de febrero de 2025: funciona, pero su catálogo es antiguo y LocalDocs sigue siendo limitado. Es un buen punto de partida en un ordenador modesto; en otros casos, compárala con Jan o LM Studio.

GPT4All (a menudo escrito como «GPT for All») es una de las aplicaciones de chat local más antiguas para el público general. Esta guía explica qué hace hoy, cómo instalarla y cargar un primer modelo, qué valor real tienen LocalDocs y el servidor local, y en qué casos es mejor elegir otra opción.

Por Mohamed Meguedmi·Actualización 2026-09-30·Probado en Windows, macOS y Linux

#Qué es GPT4All y su estado en 2026

GPT4All está desarrollado por Nomic AI. El repositorio oficial lo describe como una herramienta que ejecuta modelos de lenguaje de forma privada en computadoras de escritorio y portátiles, sin llamadas a API ni necesidad de una GPU. El repositorio cuenta con aproximadamente 77 000 estrellas y su licencia es MIT. La aplicación se basa en llama.cpp y puede cargar modelos en formato GGUF.

El estado del proyecto es lo primero que debes saber. La última versión publicada es la 3.10.0, del 25 de febrero de 2025, es decir, más de un año y medio antes de este artículo. El sitio histórico gpt4all.io redirige ahora hacia una página de Nomic centrada en su plataforma para empresas. La aplicación sigue siendo usable y no hay indicios de que deje de funcionar, pero no debes esperar nuevas funciones ni un motor de inferencia actualizado.

!
Consecuencia práctica: no se garantiza la compatibilidad con los modelos recientes
GPT4All se basa en un motor llama.cpp fijado en su última versión. Los modelos publicados desde febrero de 2025 pueden usar arquitecturas que este motor no conoce. La búsqueda de Hugging Face de la aplicación te mostrará modelos recientes sin garantizar que se carguen: prueba siempre un modelo antes de contar con él y mantente en familias probadas (Llama 3, Mistral, Phi-3) si quieres evitar sorpresas.

#1. Instalación

El kit IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Actualizaciones de por vida

Los instaladores se encuentran en la página del repositorio oficial nomic-ai/gpt4all (Windows, Windows ARM, macOS, Ubuntu). Descárgalos únicamente desde esta fuente: la página que se abre en la dirección histórica gpt4all.io ya no es la del software. Los requisitos indicados por el repositorio: para Windows y Linux, un procesador Intel Core i3 de segunda generación, AMD Bulldozer o mejor; la compilación para Linux es x86-64 únicamente; para macOS, Monterey 12.6 o más reciente, con mejores resultados en los chips Apple Silicon de la serie M.

Requisitos de instalación según el sistema
SistemaInstaladorRequisitos previos indicados en el repositorio
WindowsInstalador de Windows (y versión ARM)Intel Core i3 de la generación 2, AMD Bulldozer o mejor; ARM: Snapdragon, SQ1, SQ2
macOSInstalador para macOSMonterey 12.6 o posterior; se recomienda Apple Silicon
LinuxInstalador para UbuntuSolo procesadores x86-64, no ARM

#2. Primer modelo

Al iniciar la aplicación por primera vez, esta propone un modelo por defecto. La documentación recomienda comenzar con Llama 3, que se descarga desde el botón de añadir modelo. Especifica que GPT4All se conecta a modelos de Hugging Face con el motor llama.cpp y que la mayoría tienen la extensión .gguf.

  1. 01
    Abrir Models
    En el menú de la izquierda, haz clic en Models y luego en + Add Model para acceder a la página Explore Models.
  2. 02
    Buscar un modelo
    Busca entre los modelos disponibles en línea, o ordena los resultados por popularidad, descargas o fecha mediante el icono de engranaje.
  3. 03
    Descargar
    Haz clic en Download. El archivo se guarda en tu disco; no es necesario registrarte.
  4. 04
    Cargar y chatear
    Ve a Chats, haz clic en Load Default Model (Llama 3 o el modelo que acabas de descargar) y plantea tu primera pregunta.

La tabla siguiente recoge los ejemplos de la documentación oficial, con la memoria RAM indicada por el editor. La columna «Licencia» es importante: GPT4All enumera modelos con condiciones muy diferentes, entre ellos uno bajo una licencia no comercial.

Modelos de ejemplo de la documentación GPT4All
ModeloArchivoRAM requeridaTamañoLicencia
Llama 3 Instruct4,66 GB8 GB8 mil millones, q4_0Meta Llama 3 License
Nous Hermes 2 Mistral DPO4,11 GB8 GB7 mil millones, q4_0Apache 2.0
Phi-3 Mini Instruct2,18 GB4 GB4 mil millones, q4_0MIT
Mini Orca (Small)1,98 GB4 GB3 mil millones, q4_0CC-BY-NC-SA-4.0 (uso no comercial)

¿Dónde se almacenan los modelos? La carpeta de descarga se configura en los ajustes y, por defecto, se encuentra en AppData\Local\nomic.ai\GPT4All en Windows, en Library/Application Support/nomic.ai/GPT4All en macOS y en .local/share/nomic.ai/GPT4All en Linux. Un modelo de 4 a 5 GB ocupa el mismo espacio en el disco: si tu disco de sistema es pequeño, redirige esta carpeta a un disco secundario antes de descargar varios modelos.

#GPT4All en francés

La aplicación ofrece ajustes de idioma y configuración regional para la interfaz. En cuanto a las respuestas, todo depende del modelo: Llama 3 y los modelos derivados de Mistral comprenden y escriben en francés, con una calidad variable. No te fíes de una clasificación en inglés: plantea tres preguntas de tu ámbito en francés y evalúa la respuesta. Si utilizas principalmente el francés, los modelos Mistral y Qwen del catálogo QuelLLM son mejores candidatos, siempre que se puedan cargar en el motor cuya versión está fijada.

#Mucha RAM con un procesador: qué cambia

Una máquina con 256 GB de memoria RAM sin tarjeta gráfica puede cargar modelos muy grandes, pero la velocidad de generación depende del ancho de banda de la memoria, no de su capacidad. Orden de magnitud teórico: la cantidad de tokens por segundo está limitada por el ancho de banda en GB/s dividido por el tamaño de los pesos del modelo en GB. Como ejemplo aritmético, 80 GB/s divididos por 40 GB de pesos dan como máximo 2 tokens por segundo. No es una medición, solo un límite superior.

El único ajuste que puede ayudar es el número de hilos del procesador. En los ajustes avanzados, GPT4All lo ha fijado por defecto en 4; la documentación indica que más hilos pueden acelerar las respuestas. Auméntalo progresivamente, dejando núcleos libres para el sistema. Si tienes una tarjeta gráfica, puedes seleccionar Auto, Metal, CPU o GPU como dispositivo.

#3. La conversación y los ajustes que importan

La interfaz es la de una aplicación de mensajería: conversación en el centro, mensaje en la parte inferior y ajustes del modelo en la configuración. Tres valores por defecto merecen atención. La longitud del contexto es de 2.048 tokens, muy corta para un documento largo. La temperatura es de 0,7. Y el número de capas cargadas en la memoria de vídeo está fijado en 32; debes ajustarlo según tu tarjeta.

→
Aumenta la longitud del contexto antes de pegar un texto largo
Con 2 048 tokens, una página de texto basta para saturar la ventana. Aumenta el valor en los ajustes del modelo, vigilando la memoria: un contexto más largo consume más RAM y ralentiza la generación.

#4. LocalDocs: el RAG integrado, con sus limitaciones

LocalDocs te permite conversar con tus archivos sin escribir una línea de código. Creas una colección indicando una carpeta; la aplicación divide tus archivos en fragmentos y los indexa con los modelos de embeddings de Nomic, ejecutados en tu máquina. En un chat, activas la colección y el modelo recibe en sus instrucciones los fragmentos semánticamente cercanos a tu pregunta; las fuentes se muestran debajo de la respuesta.

  1. 01
    Crear la colección
    Abre LocalDocs, da un nombre a la colección y elige el directorio, luego haz clic en Create Collection.
  2. 02
    Esperar la indexación
    Se muestra el progreso; un indicador verde Ready señala que el proceso ha terminado. Ya puedes consultar los archivos que estén listos.
  3. 03
    Activarlo en un chat
    Abre LocalDocs con el botón en la esquina superior derecha del chat, luego marca la colección.
  4. 04
    Verificar las fuentes
    Haz clic en Sources debajo de la respuesta para ver qué archivos se utilizaron.

#Lo que no hace LocalDocs

Tres límites documentados explican las decepciones. En primer lugar, los tipos de archivos indexados por defecto son .txt, .pdf, .md y .rst: un archivo de Word debe convertirse antes. En segundo lugar, cada fragmento tiene 512 caracteres por defecto y la aplicación solo inyecta como máximo tres por solicitud: el modelo solo ve aproximadamente 1.500 caracteres de tus documentos en cada pregunta. Por último, este enfoque funciona bien para una pregunta específica («¿qué dice la cláusula 4?») y mal para una síntesis de todo un conjunto de documentos.

Los ajustes avanzados permiten aumentar el tamaño y la cantidad de fragmentos, con esta salvedad indicada en la documentación: esto puede mejorar la fiabilidad de las respuestas, pero ralentiza la generación y consume contexto, ya limitado a 2.048 tokens por defecto. Si necesitas conversar con una verdadera base documental, una herramienta como AnythingLLM o Open WebUI es más adecuada.

#5. Servidor local compatible con OpenAI

GPT4All incluye un servidor de API compatible con OpenAI, desactivado por defecto. Para activarlo: Configuración, Aplicación, sección Avanzada, luego marca la casilla «Enable Local API Server». Escucha en el puerto 4891, solo en localhost (127.0.0.1), y solo acepta HTTP, no HTTPS. La dirección base es http://localhost:4891/v1.

Ejemplo de llamada tomado de la documentación oficial
curl -X POST http://localhost:4891/v1/chat/completions -d '{
  "model": "Phi-3 Mini Instruct",
  "messages": [{"role":"user","content":"Who is Lionel Messi?"}],
  "max_tokens": 50,
  "temperature": 0.28
}'

Los puntos de acceso disponibles son /v1/models, /v1/models/nom-du-modèle, /v1/completions y /v1/chat/completions. El nombre del modelo en la solicitud debe coincidir con el que aparece en la aplicación. Un consejo documentado: LocalDocs se puede activar para el chat del servidor desde la interfaz, no a través de la API. Las referencias utilizadas se incluyen en la respuesta, en choices[0].references.

#Confidencialidad: tres ajustes que debes conocer

Por defecto, todo queda en tu máquina. Tres opciones cambian eso, y hay que saber dónde están. La opción Datalake, que comparte de forma anónima tus interacciones con la comunidad GPT4All, está desactivada por defecto. La opción «Use Nomic Embed API», que crea colecciones LocalDocs fuera del dispositivo mediante la API de Nomic, está desactivada por defecto y requiere una clave. Por último, añadir un «Model API» (una clave de un proveedor remoto) envía tus prompts a ese proveedor, lo que especifica claramente la documentación.

#Ventajas, limitaciones y alternativas

GPT4All o una alternativa según tu situación
Tu situación¿Sirve GPT4All?Alternativa a considerar
Máquina modesta, primer intento, sin línea de comandosSí, es su caso de usoJan si quieres un proyecto más activo
Hablar con algunos archivos de texto o PDFSí para preguntas específicasAnythingLLM para una verdadera base documental
Modelos muy recientes (2025 y después)No garantizado, motor cuyo desarrollo está congeladoLM Studio o Ollama, actualizado regularmente
Servidor compartido para un equipoNo: solo localhost, HTTPOllama y Open WebUI
Puntos fuertes
Proceso rápido «descargar y luego chatear», sin cuenta, LocalDocs sin código, servidor compatible con OpenAI, funciona sin GPU.
Puntos débiles
Motor sin cambios desde febrero de 2025, contexto predeterminado de 2.048 tokens, LocalDocs limitado a tres extractos de 512 caracteres, catálogo cada vez más desactualizado.
Preguntas frecuentes
¿Es gratuito GPT4All y funciona fuera de línea?+
Sí: el código está bajo licencia MIT y la aplicación no requiere ni cuenta ni suscripción. Una vez descargado un modelo, funciona sin conexión. Ten cuidado solo con las opciones que envían datos: Datalake, la API de embeddings de Nomic y las conexiones a proveedores de modelos remotos, todas desactivadas por defecto o de uso voluntario.
¿Aún se mantiene GPT4All en 2026?+
La última versión publicada, la 3.10.0, data de febrero de 2025, y el sitio histórico redirige a una plataforma empresarial de Nomic. La aplicación funciona, pero sin nuevas funciones anunciadas. Para un uso duradero con modelos recientes, prefiere una aplicación actualizada regularmente como LM Studio o Jan.
¿Qué modelos usar con GPT4All?+
Empieza por aquellos que menciona la documentación: Llama 3 Instruct (4,66 GB, 8 GB de RAM), Nous Hermes 2 Mistral DPO o Phi-3 Mini para una máquina pequeña. No se garantiza la compatibilidad de los modelos GGUF recientes, ya que el motor ya no se actualiza. Revisa la licencia: algunos modelos listados están reservados para uso no comercial.
¿Funciona GPT4All en francés?+
La interfaz ofrece un ajuste de idioma, y los modelos Llama 3 o derivados de Mistral escriben en francés con una calidad variable. Prueba tres preguntas de tu área antes de elegir un modelo. Si el francés es prioritario, compáralos con los modelos Mistral y Qwen de un catálogo actualizado.
¿Una máquina con 256 GB de RAM cambia algo?+
Permite cargar modelos muy grandes, pero al ejecutarlos en el procesador la velocidad depende del ancho de banda de la memoria, no de su capacidad. El techo teórico es ese ancho de banda dividido por el tamaño del modelo. Aumenta el número de hilos en los ajustes avanzados, configurado en 4 por defecto, y prueba con un modelo de tamaño medio.
¿Cómo hacer consultas a mis documentos con GPT4All?+
Crea una colección LocalDocs apuntando a una carpeta de archivos .txt, .pdf, .md o .rst, espera a que aparezca el indicador Ready y luego actívala en un chat. El modelo recibe como máximo tres extractos de 512 caracteres por pregunta: es adecuado para preguntas precisas, no para sintetizar una carpeta completa de documentos.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.