Mejor IA local gratuita: top 2026, incluso sin GPU
Sí: Ollama, LM Studio, Jan y GPT4All se descargan sin pagar, y Qwen 3.5, Gemma 4, Granite 4.2 o gpt-oss están publicados bajo licencia Apache 2.0. La elección adecuada depende de la memoria: un archivo de 2 a 4 GB es adecuado para una máquina de 8 GB, 6 a 8 GB requieren 16 GB, y por encima de 14 GB se necesitan 24 GB de VRAM o 32 GB de memoria.
Una IA local gratuita se reduce a dos descargas: un software (Ollama, LM Studio, Jan) y un modelo de lenguaje con pesos abiertos. El verdadero criterio de elección no es el nombre del modelo, sino el tamaño de su archivo en comparación con tu memoria. Esta página muestra los tamaños reales publicados por Ollama, un cálculo de velocidad para máquinas sin tarjeta gráfica y los casos en los que una IA llamada «local» envía de todos modos tus datos a otro lugar.
¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →
#Empezar gratis según tu equipo
No existe una única IA local gratuita que sea la mejor: la elección adecuada es el modelo más grande cuyo archivo quepa en tu memoria con margen, ejecutado desde Ollama o LM Studio. En una máquina de 8 GB sin tarjeta gráfica, busca un archivo de 2 a 4 GB, como Granite 4.2 3B (2,2 GB) o Qwen 3.5 4B (3,4 GB). Con 16 GB, Qwen 3.5 9B (6,6 GB), Granite 4.2 8B (5,3 GB) o Gemma 4 12B (7,6 GB) son puntos de partida razonables. A partir de 24 GB de VRAM o 32 GB de memoria, gpt-oss 20B (14 GB) y los modelos de 27 mil millones de parámetros (18 GB) se vuelven accesibles. Estos tamaños corresponden a los archivos anunciados por Ollama, no a los miles de millones de parámetros que indica el nombre: lo que debe caber es el archivo, junto con el contexto y el margen para el sistema. Son puntos de partida, no garantías de calidad ni de velocidad: prueba el modelo en tus propias tareas.
| Memoria de la máquina | Modelos para probar (etiqueta Ollama) | Tamaño del archivo | Contexto anunciado |
|---|---|---|---|
| 8 GB, sin GPU | granite4.2:3b ; qwen3.5:4b | 2,2 GB; 3,4 GB | 128 k; 256 k tokens |
| 16 GB | granite4.2:8b ; qwen3.5:9b ; gemma4:12b | 5,3 GB; 6,6 GB; 7,6 GB | 128 k ; 256 k ; 256 k tokens |
| 24 GB de VRAM o 32 GB de memoria | gpt-oss:20b ; qwen3.6:27b ; qwen3.8:27b ; gemma4:26b | 14 GB; 18 GB; 18 GB; 19 GB | 128 k ; 256 k ; 256 k ; 256 k tokens |
| 32 GB o más, para programar | qwen3-coder:30b | 19 GB | 256 k tokens |
El contexto anunciado es un máximo, no lo que se asignará. Ollama arranca con 4 k tokens cuando la tarjeta gráfica tiene menos de 24 GiB de VRAM, y recomienda al menos 64 000 tokens para búsquedas web, agentes y código. Cada aumento consume memoria adicional a la que ocupa el archivo.
- Estimar la compatibilidad de mi máquina
- Fuente: tamaños de archivos Qwen 3.5, biblioteca Ollama
- Fuente: contexto predeterminado según la VRAM, documentación Ollama
#¿Qué es una IA local?
Sabes qué IA gratuita funciona en tu equipo. El kit de IA local te lleva hasta un asistente que te sirve todos los días: instalación guiada en una hora (cap. 1), el modelo adecuado para tu máquina exacta (cap. 3) y lo que realmente funciona sin tarjeta gráfica (cap. 12).
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Una IA local es un modelo de lenguaje (un LLM, como Qwen, Gemma o Granite) cuyos archivos están en tu disco y que se ejecuta mediante un software instalado en tu máquina. El cálculo se realiza en tu procesador o en tu tarjeta gráfica, no en los servidores de un proveedor de software. LM Studio lo indica en su documentación: lo que introduces al conversar con un modelo no sale del dispositivo.
Los modelos en cuestión se denominan de pesos abiertos: sus parámetros se pueden descargar. Esto no es sinónimo de código abierto, que depende de la licencia. Google lo recuerda en el caso de Gemma: Gemma 4, publicado el 2 de abril de 2026, es el primero de la familia bajo la licencia Apache 2.0, aprobada por la OSI; las generaciones anteriores no estaban bajo esta licencia. Antes de reutilizar un modelo en un producto, lee su licencia.
Lo contrario es un servicio en línea como ChatGPT, Gemini o Claude: tus mensajes se envían a los servidores del proveedor. Entre ambos existen casos híbridos, detallados más abajo.
#¿Por qué pasar a la IA local?
- Confidencialidad
- Tus documentos y tus prompts permanecen en la máquina mientras no actives un modelo alojado ni búsqueda web. Es útil para trabajos sensibles, jurídicos o médicos.
- Sin conexión
- El modelo descargado responde sin conexión, en un tren o en una red aislada.
- Sin límite de mensajes
- Ningún plan limita tus intercambios. La única limitación es la velocidad de tu hardware.
- Control
- Tú eliges el modelo, su cuantización y el contexto, y lo sustituyes cuando sale uno mejor.
La contrapartida es real: un modelo local debe caber en tu memoria, por lo que es más pequeño que los de los servicios en línea.
#IA local gratuita: ¿realmente sin pagar?
Sí, para los programas y modelos mencionados aquí: no necesitas ninguna suscripción para conversar con un modelo instalado en tu máquina. Tres matices evitan sorpresas desagradables: las licencias de los programas varían (LM Studio es gratuito, pero no de código abierto), el costo se traslada al disco y al hardware, y algunos proveedores también venden servicios en línea.
- El disco
- En Windows, Ollama requiere al menos 4 GB para su instalación y, además, espacio para los modelos, que, según la documentación de Ollama, pueden ocupar desde varias decenas hasta varios cientos de GB.
- El hardware
- Un archivo de 14 GB no tiene sentido con 8 GB de memoria: prueba con un modelo pequeño antes de comprar.
- Las ofertas alojadas
- El plan gratuito de Ollama incluye la ejecución local, pero también modelos alojados que se facturan según el consumo, con planes de pago de nivel superior. Eso no es IA local.
#Las mejores herramientas gratuitas
| Herramienta | Licencia | Interfaz | Sistemas compatibles |
|---|---|---|---|
| Ollama | MIT | Terminal, API local y aplicación de escritorio | Windows 10 22H2 o más reciente; macOS 14 o más reciente (Apple Silicon, o Intel solo con CPU); Linux |
| LM Studio | Propietario, gratuito | Interfaz gráfica completa | macOS 14+ únicamente en Apple Silicon; Windows x64 y ARM; Linux |
| Jan | Apache 2.0 | Aplicación de escritorio | Windows, macOS, Linux |
| GPT4All | MIT | Aplicación de escritorio | Windows, macOS 12.6+, Linux x86-64 |
- Ollama
- La elección de los desarrolladores: un modelo se inicia con un solo comando, con una API local en el puerto 11434.
- LM Studio
- Catálogo de modelos, descarga con un clic y ventana de conversación: la forma más sencilla de empezar. Gratis tanto en casa como en el trabajo desde el 8 de julio de 2025, pero es software propietario: sus condiciones otorgan una licencia de uso, no acceso a código abierto.
- Jan
- Descarga modelos desde Hugging Face y abre un servidor local. Su repositorio especifica que también puede conectarse a OpenAI, Anthropic u otros: tú decides mantener el uso en local.
- GPT4All
- Su repositorio anuncia «no API calls or GPUs required». Su documentación está orientada a modelos de entre 3 y 13 mil millones de parámetros e indica 8 GB de RAM para Llama 3 8B. No se ha publicado ninguna versión desde la 3.10.0 de febrero de 2025: comprueba que sea compatible con el modelo que quieres usar.
- Empezar con LM Studio, paso a paso
- Instalar Ollama en Windows, macOS o Linux
- Fuente: requisitos oficiales de LM Studio
#Sin tarjeta gráfica: qué rendimiento ofrece el procesador
Sí, un modelo puede ejecutarse únicamente en el procesador y en la memoria RAM. Ollama lo confirma en su FAQ: la columna Processor de ollama ps muestra «100% CPU» cuando el modelo está cargado completamente en la memoria del sistema. La verdadera pregunta es, por tanto, la velocidad, no la viabilidad.
#Por qué el procesador es lento: un cálculo
Cada token generado obliga a la máquina a volver a leer la mayor parte del modelo desde la memoria: la velocidad está limitada por la rapidez de acceso a los datos más que por la potencia de cálculo. Se obtiene un límite teórico dividiendo el ancho de banda de la memoria (GB/s) por el tamaño del archivo (GB). La tabla utiliza un valor de ejemplo de 50 GB/s: es un cálculo ilustrativo, no una medición.
| Modelo | Tamaño del archivo | Límite teórico |
|---|---|---|
| granite4.2:3b | 2,2 GB | aproximadamente 23 tokens por segundo |
| granite4.2:8b | 5,3 GB | aproximadamente 9 tokens por segundo |
| qwen3.5:9b | 6,6 GB | aproximadamente 8 tokens por segundo |
El real se queda por debajo. El blog TensorFoundry informa que, en un Mac M2 Max a 400 GB/s, el límite calculado es de aproximadamente 87 tokens por segundo para un 8B en 4 bits, y 64,9 medidos, es decir, el 75 %. Consecuencia práctica: sin GPU, el tamaño del archivo es el principal factor de velocidad, ya que el límite depende directamente de él. Los modelos de expertos (MoE) cambian las reglas, ya que solo activan una parte de sus parámetros por token: Qwen3-Coder 30B-A3B activa 3,3 mil millones sobre 30. Pruébalo si la memoria es suficiente para el archivo completo.
#Según tu sistema
- Windows
- Ollama exige Windows 10 22H2 o más reciente. LM Studio requiere un procesador AVX2 y recomienda 16 GB de RAM y 4 GB de VRAM.
- Mac Apple Silicon
- Procesador y GPU comparten memoria unificada. LM Studio recomienda 16 GB o más; con 8 GB, sugiere modelos más pequeños y contextos moderados.
- Mac Intel
- LM Studio no lo soporta. Ollama funciona en x86 pero solo en CPU: prevé modelos pequeños.
- Linux
- Ollama y LM Studio están disponibles; este último se distribuye en AppImage y requiere Ubuntu 20.04 o una versión más reciente.
#Los mejores modelos gratuitos de 2026
Esta selección parte de lo que publica Ollama y de lo que los editores documentan, no de un test interno.
- Qwen 3.5 (Alibaba)
- Familia multimodal (texto e imagen) de 0,8 a 122 mil millones de parámetros, contexto de 256 k tokens, licencia Apache 2.0. Alibaba anuncia 201 idiomas y dialectos. Las versiones 4B (3,4 GB) y 9B (6,6 GB) están dirigidas a máquinas pequeñas.
- Qwen 3.6 y 3.8 (Alibaba)
- Qwen 3.6 existe en 27B (18 GB) y 35B (23 GB), Qwen 3.8 en 27B (18 GB): dos familias orientadas al código y a los agentes. El modo de reflexión de Qwen3.8 está activo por defecto y se desactiva por solicitud: añade tokens antes de la respuesta.
- Granite 4.2 (IBM)
- Versiones 3B (2,2 GB), 8B (5,3 GB) y 30B, contexto de 128 k tokens, licencia Apache 2.0. El francés forma parte de los doce idiomas soportados: es un indicador, no una medida de calidad. Un modo de reflexión integrado se desactiva con el comando /set nothink en Ollama.
- Gemma 4 (Google)
- Tamaños E2B, E4B, 12B, 26B (con expertos, 3,8 mil millones de parámetros activos) y 31B, bajo Apache 2.0 desde abril de 2026. La «E» significa «effective»: gemma4:e2b cuenta con 2,3 mil millones de parámetros efectivos, pero 5,1 con los embeddings, y su archivo pesa 7,2 GB en Ollama. Un nombre con 2B no garantiza un archivo pequeño.
- gpt-oss 20B (OpenAI)
- Modelo con pesos abiertos bajo licencia Apache 2.0, cuantizado en MXFP4 por OpenAI: Ollama indica que funciona con 16 GB de memoria (archivo de 14 GB). Contexto de 128 k tokens.
- Qwen3-Coder 30B-A3B (Alibaba)
- Especialista en código: 30 mil millones de parámetros en total, 3,3 activos, contexto de 256 k tokens, archivo de 19 GB.
#Leer un benchmark sin equivocarse
Las fichas de los modelos publican puntuaciones, pero son las del proveedor, obtenidas con su propio protocolo. La de Gemma 4 indica un 69,4 % en MMLU Pro para la versión E4B frente a un 85,2 % para la 31B: el tamaño importa, y una puntuación no dice nada sobre tu tarea. Otra trampa terminológica: «LLM gratuito» también designa ofertas en línea con límites de uso, en las que tus datos se envían al proveedor.
#Elegir según el uso: chat, código, agentes
- Hablar, resumir, redactar en francés
- Granite 4.2 8B, Qwen 3.5 9B o Gemma 4 12B con 16 GB. Compáralos con tres de tus textos: ninguna ficha sustituye esta prueba.
- Coder
- Alibaba presenta Qwen3-Coder 30B-A3B como su modelo de código más orientado a agentes. La limitación es la memoria: las herramientas de código requieren un contexto largo, que se suma al archivo de 19 GB y deja poco margen con 24 GB.
- Agentes y herramientas
- Ollama sabe lanzar agentes con un modelo local, por ejemplo Claude Code con un modelo Qwen. Esto ejecuta la herramienta Claude Code, no un modelo Claude: el modelo que responde sigue siendo el que has descargado.
- Sin restricciones
- Los modelos originales están entrenados para rechazar ciertas solicitudes. Algunas variantes comunitarias llamadas abliterated eliminan esta capacidad: una entrada de Hugging Face explica que el rechazo se apoya en una dirección específica de las activaciones, que se puede neutralizar. La calidad varía según la variante, y la ley se aplica a los usos que hagas de estos modelos.
#Instalar una IA gratuita, paso a paso
- 01Verificar la memoria libreCierra el navegador y las aplicaciones pesadas: la memoria disponible, no la capacidad total, determina qué modelo puedes usar.
- 02Instalar el softwareOllama si te sientes cómodo con un comando, LM Studio para una interfaz gráfica. Elige la versión de tu sistema: Windows, macOS o Linux.
- 03Descargar un modelo del tamaño adecuadoConsulta la tabla de la primera sección: 8 GB de memoria, un archivo de 2 a 4 GB; 16 GB, un archivo de 5 a 8 GB. Con 8 GB, un archivo de 6,6 GB no deja margen.
- 04Iniciar y luego comprobarConversa y luego ejecuta ollama ps en un segundo terminal para ver si el modelo se ejecuta en la GPU, en la CPU o en ambas.
#Lo que puede salir de la máquina a pesar del término «local»
«Local» describe dónde se ejecuta el modelo, no lo que hace el resto del software. Cuatro situaciones hacen que los datos salgan o queden expuestos.
- Los modelos alojados en Ollama
- La aplicación permite usar modelos ejecutados en la nube de Ollama, que procesa entonces tus prompts y respuestas; Ollama no ve nada de lo que ejecutes localmente. Para deshabilitarlo: variable OLLAMA_NO_CLOUD=1 o opción disable_ollama_cloud.
- Conectores de Jan
- Jan puede conectarse con OpenAI, Anthropic, Mistral o Groq. Con un modelo descargado, la ejecución se mantiene local; con un conector, el diálogo se envía al proveedor elegido.
- Descarga de los modelos
- LM Studio envía solicitudes de red para buscar modelos, descargarlos y verificar actualizaciones. La conversación, tus documentos y el servidor local permanecen en el dispositivo.
- Exposición en red
- Ollama escucha por defecto en 127.0.0.1: solo tu ordenador puede acceder a él. La variable OLLAMA_HOST cambia la dirección; permite el acceso desde la red solo si sabes quién puede conectarse.
¿Cuál es la mejor IA local gratuita para empezar?+
¿Se puede tener una IA local gratuita sin GPU?+
¿LM Studio y Ollama son realmente gratuitos?+
¿Mi IA local envía datos a Internet?+
¿Se puede ejecutar Claude o ChatGPT localmente?+
¿Existe una IA local sin restricciones?+
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.