Principiante 14 minGratis

Mejor IA local gratuita: top 2026, incluso sin GPU

Respuesta directa

Sí: Ollama, LM Studio, Jan y GPT4All se descargan sin pagar, y Qwen 3.5, Gemma 4, Granite 4.2 o gpt-oss están publicados bajo licencia Apache 2.0. La elección adecuada depende de la memoria: un archivo de 2 a 4 GB es adecuado para una máquina de 8 GB, 6 a 8 GB requieren 16 GB, y por encima de 14 GB se necesitan 24 GB de VRAM o 32 GB de memoria.

Una IA local gratuita se reduce a dos descargas: un software (Ollama, LM Studio, Jan) y un modelo de lenguaje con pesos abiertos. El verdadero criterio de elección no es el nombre del modelo, sino el tamaño de su archivo en comparación con tu memoria. Esta página muestra los tamaños reales publicados por Ollama, un cálculo de velocidad para máquinas sin tarjeta gráfica y los casos en los que una IA llamada «local» envía de todos modos tus datos a otro lugar.

¿Estás eligiendo un equipo? Nuestras opciones por presupuesto →

Por Mohamed Meguedmi·Actualización 2026-09-29·Probado en Windows, macOS y Linux

#Empezar gratis según tu equipo

No existe una única IA local gratuita que sea la mejor: la elección adecuada es el modelo más grande cuyo archivo quepa en tu memoria con margen, ejecutado desde Ollama o LM Studio. En una máquina de 8 GB sin tarjeta gráfica, busca un archivo de 2 a 4 GB, como Granite 4.2 3B (2,2 GB) o Qwen 3.5 4B (3,4 GB). Con 16 GB, Qwen 3.5 9B (6,6 GB), Granite 4.2 8B (5,3 GB) o Gemma 4 12B (7,6 GB) son puntos de partida razonables. A partir de 24 GB de VRAM o 32 GB de memoria, gpt-oss 20B (14 GB) y los modelos de 27 mil millones de parámetros (18 GB) se vuelven accesibles. Estos tamaños corresponden a los archivos anunciados por Ollama, no a los miles de millones de parámetros que indica el nombre: lo que debe caber es el archivo, junto con el contexto y el margen para el sistema. Son puntos de partida, no garantías de calidad ni de velocidad: prueba el modelo en tus propias tareas.

Modelos para probar según la memoria (tamaños de archivo publicados por Ollama, última consulta el 29 de septiembre de 2026)
Memoria de la máquinaModelos para probar (etiqueta Ollama)Tamaño del archivoContexto anunciado
8 GB, sin GPUgranite4.2:3b ; qwen3.5:4b2,2 GB; 3,4 GB128 k; 256 k tokens
16 GBgranite4.2:8b ; qwen3.5:9b ; gemma4:12b5,3 GB; 6,6 GB; 7,6 GB128 k ; 256 k ; 256 k tokens
24 GB de VRAM o 32 GB de memoriagpt-oss:20b ; qwen3.6:27b ; qwen3.8:27b ; gemma4:26b14 GB; 18 GB; 18 GB; 19 GB128 k ; 256 k ; 256 k ; 256 k tokens
32 GB o más, para programarqwen3-coder:30b19 GB256 k tokens

El contexto anunciado es un máximo, no lo que se asignará. Ollama arranca con 4 k tokens cuando la tarjeta gráfica tiene menos de 24 GiB de VRAM, y recomienda al menos 64 000 tokens para búsquedas web, agentes y código. Cada aumento consume memoria adicional a la que ocupa el archivo.

#¿Qué es una IA local?

El kit de IA Local

Sabes qué IA gratuita funciona en tu equipo. El kit de IA local te lleva hasta un asistente que te sirve todos los días: instalación guiada en una hora (cap. 1), el modelo adecuado para tu máquina exacta (cap. 3) y lo que realmente funciona sin tarjeta gráfica (cap. 12).

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Una IA local es un modelo de lenguaje (un LLM, como Qwen, Gemma o Granite) cuyos archivos están en tu disco y que se ejecuta mediante un software instalado en tu máquina. El cálculo se realiza en tu procesador o en tu tarjeta gráfica, no en los servidores de un proveedor de software. LM Studio lo indica en su documentación: lo que introduces al conversar con un modelo no sale del dispositivo.

Los modelos en cuestión se denominan de pesos abiertos: sus parámetros se pueden descargar. Esto no es sinónimo de código abierto, que depende de la licencia. Google lo recuerda en el caso de Gemma: Gemma 4, publicado el 2 de abril de 2026, es el primero de la familia bajo la licencia Apache 2.0, aprobada por la OSI; las generaciones anteriores no estaban bajo esta licencia. Antes de reutilizar un modelo en un producto, lee su licencia.

i
En dos palabras
IA local = un modelo descargado en tu equipo + un software que lo ejecuta. Una vez que el modelo está en el disco, la conversación no requiere conexión.

Lo contrario es un servicio en línea como ChatGPT, Gemini o Claude: tus mensajes se envían a los servidores del proveedor. Entre ambos existen casos híbridos, detallados más abajo.

#¿Por qué pasar a la IA local?

Confidencialidad
Tus documentos y tus prompts permanecen en la máquina mientras no actives un modelo alojado ni búsqueda web. Es útil para trabajos sensibles, jurídicos o médicos.
Sin conexión
El modelo descargado responde sin conexión, en un tren o en una red aislada.
Sin límite de mensajes
Ningún plan limita tus intercambios. La única limitación es la velocidad de tu hardware.
Control
Tú eliges el modelo, su cuantización y el contexto, y lo sustituyes cuando sale uno mejor.

La contrapartida es real: un modelo local debe caber en tu memoria, por lo que es más pequeño que los de los servicios en línea.

#IA local gratuita: ¿realmente sin pagar?

Sí, para los programas y modelos mencionados aquí: no necesitas ninguna suscripción para conversar con un modelo instalado en tu máquina. Tres matices evitan sorpresas desagradables: las licencias de los programas varían (LM Studio es gratuito, pero no de código abierto), el costo se traslada al disco y al hardware, y algunos proveedores también venden servicios en línea.

El disco
En Windows, Ollama requiere al menos 4 GB para su instalación y, además, espacio para los modelos, que, según la documentación de Ollama, pueden ocupar desde varias decenas hasta varios cientos de GB.
El hardware
Un archivo de 14 GB no tiene sentido con 8 GB de memoria: prueba con un modelo pequeño antes de comprar.
Las ofertas alojadas
El plan gratuito de Ollama incluye la ejecución local, pero también modelos alojados que se facturan según el consumo, con planes de pago de nivel superior. Eso no es IA local.
i
Qué significa «gratuito» aquí
Software sin suscripción, modelos sin costes de licencia, ningún límite de mensajes. El disco, la electricidad y la memoria siguen a tu cargo.

#Las mejores herramientas gratuitas

Cuatro herramientas gratuitas comparadas (fuentes: repositorios y documentación oficiales)
HerramientaLicenciaInterfazSistemas compatibles
OllamaMITTerminal, API local y aplicación de escritorioWindows 10 22H2 o más reciente; macOS 14 o más reciente (Apple Silicon, o Intel solo con CPU); Linux
LM StudioPropietario, gratuitoInterfaz gráfica completamacOS 14+ únicamente en Apple Silicon; Windows x64 y ARM; Linux
JanApache 2.0Aplicación de escritorioWindows, macOS, Linux
GPT4AllMITAplicación de escritorioWindows, macOS 12.6+, Linux x86-64
Ollama
La elección de los desarrolladores: un modelo se inicia con un solo comando, con una API local en el puerto 11434.
LM Studio
Catálogo de modelos, descarga con un clic y ventana de conversación: la forma más sencilla de empezar. Gratis tanto en casa como en el trabajo desde el 8 de julio de 2025, pero es software propietario: sus condiciones otorgan una licencia de uso, no acceso a código abierto.
Jan
Descarga modelos desde Hugging Face y abre un servidor local. Su repositorio especifica que también puede conectarse a OpenAI, Anthropic u otros: tú decides mantener el uso en local.
GPT4All
Su repositorio anuncia «no API calls or GPUs required». Su documentación está orientada a modelos de entre 3 y 13 mil millones de parámetros e indica 8 GB de RAM para Llama 3 8B. No se ha publicado ninguna versión desde la 3.10.0 de febrero de 2025: comprueba que sea compatible con el modelo que quieres usar.

#Sin tarjeta gráfica: qué rendimiento ofrece el procesador

Sí, un modelo puede ejecutarse únicamente en el procesador y en la memoria RAM. Ollama lo confirma en su FAQ: la columna Processor de ollama ps muestra «100% CPU» cuando el modelo está cargado completamente en la memoria del sistema. La verdadera pregunta es, por tanto, la velocidad, no la viabilidad.

#Por qué el procesador es lento: un cálculo

Cada token generado obliga a la máquina a volver a leer la mayor parte del modelo desde la memoria: la velocidad está limitada por la rapidez de acceso a los datos más que por la potencia de cálculo. Se obtiene un límite teórico dividiendo el ancho de banda de la memoria (GB/s) por el tamaño del archivo (GB). La tabla utiliza un valor de ejemplo de 50 GB/s: es un cálculo ilustrativo, no una medición.

Límite teórico de generación para una memoria de 50 GB/s (ejemplo de cálculo, no una medida)
ModeloTamaño del archivoLímite teórico
granite4.2:3b2,2 GBaproximadamente 23 tokens por segundo
granite4.2:8b5,3 GBaproximadamente 9 tokens por segundo
qwen3.5:9b6,6 GBaproximadamente 8 tokens por segundo

El real se queda por debajo. El blog TensorFoundry informa que, en un Mac M2 Max a 400 GB/s, el límite calculado es de aproximadamente 87 tokens por segundo para un 8B en 4 bits, y 64,9 medidos, es decir, el 75 %. Consecuencia práctica: sin GPU, el tamaño del archivo es el principal factor de velocidad, ya que el límite depende directamente de él. Los modelos de expertos (MoE) cambian las reglas, ya que solo activan una parte de sus parámetros por token: Qwen3-Coder 30B-A3B activa 3,3 mil millones sobre 30. Pruébalo si la memoria es suficiente para el archivo completo.

#Según tu sistema

Windows
Ollama exige Windows 10 22H2 o más reciente. LM Studio requiere un procesador AVX2 y recomienda 16 GB de RAM y 4 GB de VRAM.
Mac Apple Silicon
Procesador y GPU comparten memoria unificada. LM Studio recomienda 16 GB o más; con 8 GB, sugiere modelos más pequeños y contextos moderados.
Mac Intel
LM Studio no lo soporta. Ollama funciona en x86 pero solo en CPU: prevé modelos pequeños.
Linux
Ollama y LM Studio están disponibles; este último se distribuye en AppImage y requiere Ubuntu 20.04 o una versión más reciente.

#Los mejores modelos gratuitos de 2026

Esta selección parte de lo que publica Ollama y de lo que los editores documentan, no de un test interno.

Qwen 3.5 (Alibaba)
Familia multimodal (texto e imagen) de 0,8 a 122 mil millones de parámetros, contexto de 256 k tokens, licencia Apache 2.0. Alibaba anuncia 201 idiomas y dialectos. Las versiones 4B (3,4 GB) y 9B (6,6 GB) están dirigidas a máquinas pequeñas.
Qwen 3.6 y 3.8 (Alibaba)
Qwen 3.6 existe en 27B (18 GB) y 35B (23 GB), Qwen 3.8 en 27B (18 GB): dos familias orientadas al código y a los agentes. El modo de reflexión de Qwen3.8 está activo por defecto y se desactiva por solicitud: añade tokens antes de la respuesta.
Granite 4.2 (IBM)
Versiones 3B (2,2 GB), 8B (5,3 GB) y 30B, contexto de 128 k tokens, licencia Apache 2.0. El francés forma parte de los doce idiomas soportados: es un indicador, no una medida de calidad. Un modo de reflexión integrado se desactiva con el comando /set nothink en Ollama.
Gemma 4 (Google)
Tamaños E2B, E4B, 12B, 26B (con expertos, 3,8 mil millones de parámetros activos) y 31B, bajo Apache 2.0 desde abril de 2026. La «E» significa «effective»: gemma4:e2b cuenta con 2,3 mil millones de parámetros efectivos, pero 5,1 con los embeddings, y su archivo pesa 7,2 GB en Ollama. Un nombre con 2B no garantiza un archivo pequeño.
gpt-oss 20B (OpenAI)
Modelo con pesos abiertos bajo licencia Apache 2.0, cuantizado en MXFP4 por OpenAI: Ollama indica que funciona con 16 GB de memoria (archivo de 14 GB). Contexto de 128 k tokens.
Qwen3-Coder 30B-A3B (Alibaba)
Especialista en código: 30 mil millones de parámetros en total, 3,3 activos, contexto de 256 k tokens, archivo de 19 GB.

#Leer un benchmark sin equivocarse

Las fichas de los modelos publican puntuaciones, pero son las del proveedor, obtenidas con su propio protocolo. La de Gemma 4 indica un 69,4 % en MMLU Pro para la versión E4B frente a un 85,2 % para la 31B: el tamaño importa, y una puntuación no dice nada sobre tu tarea. Otra trampa terminológica: «LLM gratuito» también designa ofertas en línea con límites de uso, en las que tus datos se envían al proveedor.

#Elegir según el uso: chat, código, agentes

Hablar, resumir, redactar en francés
Granite 4.2 8B, Qwen 3.5 9B o Gemma 4 12B con 16 GB. Compáralos con tres de tus textos: ninguna ficha sustituye esta prueba.
Coder
Alibaba presenta Qwen3-Coder 30B-A3B como su modelo de código más orientado a agentes. La limitación es la memoria: las herramientas de código requieren un contexto largo, que se suma al archivo de 19 GB y deja poco margen con 24 GB.
Agentes y herramientas
Ollama sabe lanzar agentes con un modelo local, por ejemplo Claude Code con un modelo Qwen. Esto ejecuta la herramienta Claude Code, no un modelo Claude: el modelo que responde sigue siendo el que has descargado.
Sin restricciones
Los modelos originales están entrenados para rechazar ciertas solicitudes. Algunas variantes comunitarias llamadas abliterated eliminan esta capacidad: una entrada de Hugging Face explica que el rechazo se apoya en una dirección específica de las activaciones, que se puede neutralizar. La calidad varía según la variante, y la ley se aplica a los usos que hagas de estos modelos.

#Instalar una IA gratuita, paso a paso

  1. 01
    Verificar la memoria libre
    Cierra el navegador y las aplicaciones pesadas: la memoria disponible, no la capacidad total, determina qué modelo puedes usar.
  2. 02
    Instalar el software
    Ollama si te sientes cómodo con un comando, LM Studio para una interfaz gráfica. Elige la versión de tu sistema: Windows, macOS o Linux.
  3. 03
    Descargar un modelo del tamaño adecuado
    Consulta la tabla de la primera sección: 8 GB de memoria, un archivo de 2 a 4 GB; 16 GB, un archivo de 5 a 8 GB. Con 8 GB, un archivo de 6,6 GB no deja margen.
  4. 04
    Iniciar y luego comprobar
    Conversa y luego ejecuta ollama ps en un segundo terminal para ver si el modelo se ejecuta en la GPU, en la CPU o en ambas.
Ejemplos: un modelo ligero, luego un modelo de 16 GB
# Machine de 8 Go
ollama run qwen3.5:4b

# Machine de 16 Go
ollama run qwen3.5:9b

# Vérifier le placement CPU ou GPU et le contexte alloué
ollama ps
Agentes y código: aumentar el contexto (consume más memoria)
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#Lo que puede salir de la máquina a pesar del término «local»

«Local» describe dónde se ejecuta el modelo, no lo que hace el resto del software. Cuatro situaciones hacen que los datos salgan o queden expuestos.

Los modelos alojados en Ollama
La aplicación permite usar modelos ejecutados en la nube de Ollama, que procesa entonces tus prompts y respuestas; Ollama no ve nada de lo que ejecutes localmente. Para deshabilitarlo: variable OLLAMA_NO_CLOUD=1 o opción disable_ollama_cloud.
Conectores de Jan
Jan puede conectarse con OpenAI, Anthropic, Mistral o Groq. Con un modelo descargado, la ejecución se mantiene local; con un conector, el diálogo se envía al proveedor elegido.
Descarga de los modelos
LM Studio envía solicitudes de red para buscar modelos, descargarlos y verificar actualizaciones. La conversación, tus documentos y el servidor local permanecen en el dispositivo.
Exposición en red
Ollama escucha por defecto en 127.0.0.1: solo tu ordenador puede acceder a él. La variable OLLAMA_HOST cambia la dirección; permite el acceso desde la red solo si sabes quién puede conectarse.
!
Detectar un modelo alojado
En Ollama, una etiqueta que termine en cloud, como gemma4:31b-cloud, no se ejecuta en tu equipo. Si la confidencialidad es el motivo por el que trabajas localmente, desactiva estas funciones en la configuración.
Preguntas frecuentes
¿Cuál es la mejor IA local gratuita para empezar?+
Ollama o LM Studio con un modelo cuyo archivo cabe con holgura en tu memoria: Qwen 3.5 4B (3,4 GB) con 8 GB, Qwen 3.5 9B (6,6 GB) o Granite 4.2 8B (5,3 GB) con 16 GB. Compara dos modelos con tus propios textos.
¿Se puede tener una IA local gratuita sin GPU?+
Sí. Un modelo se ejecuta en el procesador y la RAM, y Ollama muestra entonces 100 % CPU. El límite es la velocidad, que depende del ancho de banda de la memoria dividido por el tamaño del archivo. Usa un modelo de 2 a 4 GB y mantén un contexto corto.
¿LM Studio y Ollama son realmente gratuitos?+
Para un uso local, sí. LM Studio es gratuito tanto en casa como en el trabajo desde el 8 de julio de 2025, pero no es de código abierto. Ollama está bajo licencia MIT; sus modelos alojados se facturan según el consumo, con planes de pago, y quedan fuera del uso local gratuito.
¿Mi IA local envía datos a Internet?+
No cuando la conversación se mantiene con un modelo cargado en tu máquina: LM Studio indica que lo que introduces no sale del dispositivo. En cambio, sí se envían datos al usar un modelo alojado, un conector en línea o una etiqueta cloud. Desactiva estas opciones si quieres un uso estrictamente local.
¿Se puede ejecutar Claude o ChatGPT localmente?+
La herramienta Claude Code puede ejecutarse con un modelo local, por ejemplo Qwen, a través de Ollama, pero el modelo que responde es el que has descargado. OpenAI publica gpt-oss, con pesos abiertos bajo licencia Apache 2.0: esta es la vía más cercana a ChatGPT en local.
¿Existe una IA local sin restricciones?+
Variantes comunitarias llamadas abliterated eliminan la capacidad de rechazo de un modelo y se encuentran en Hugging Face. Su calidad varía de una variante a otra, y lo que hagas con ellas sigue sujeto a la ley. La guía dedicada detalla qué cambian y las precauciones que debes tomar.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.