Principiante 10 minMóvil

Modelos LLM en local en Android: PocketPal, MLC Chat (2026)

Un LLM local en Android es un asistente que responde sin conexión, sin nube, directamente en el procesador de tu teléfono. Los modelos cuantizados de entre 1 y 4 mil millones de parámetros caben hoy en la RAM de un smartphone de gama media y responden a una velocidad que permite utilizarlos. Esta guía cubre tres enfoques —PocketPal y MLC Chat para empezar sin línea de comandos, llama.cpp a través de Termux para ir más allá— con las limitaciones reales de velocidad, calentamiento y autonomía.

Por Léa B.·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué ejecutar un LLM local en Android?

Ejecutar un LLM local en Android responde a tres necesidades concretas: la confidencialidad total (tus prompts nunca salen del dispositivo), el funcionamiento sin conexión (en avión, en zonas sin cobertura o con roaming costoso) y el uso gratuito (sin suscripción ni facturación por token). La contrapartida es el tamaño: un teléfono ejecuta modelos mucho más pequeños que un PC y, por tanto, menos capaces. Pero para resumir, reformular, traducir o mantener una conversación sencilla, un modelo de 3B es más que suficiente.

Confidencialidad
El modelo se ejecuta en el SoC del teléfono. No se envía ningún dato a Internet, lo cual se puede verificar desactivando el Wi-Fi y los datos móviles.
Sin conexión
Una vez descargado el modelo, todo funciona en modo avión. Útil para desplazamientos o en zonas sin red.
Uso gratuito
Sin cuenta, sin límite de uso, sin costo por token. Solo pagas por la batería consumida.
Límite que debes conocer
En la práctica, un smartphone tiene un límite de alrededor de 4B de parámetros. Para razonamientos complejos o tareas de código, un LLM local en PC sigue siendo muy superior.
i
Local en teléfono ≠ local en PC
No compares un 3B en un móvil con GPT-4. Compáralo con lo que un asistente sin conexión puede hacer: reformular un mensaje, resumir un texto pegado, responder a una pregunta de cultura general. En este contexto, es impresionante. Más allá de eso, muestra rápidamente sus limitaciones.

#Qué tipo de teléfono se necesita

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

El factor determinante es la RAM, exactamente como en ordenadores, donde la VRAM limita el tamaño del modelo. Un modelo cuantizado Q4 de 3B ocupa aproximadamente 2 GB, más la memoria del sistema y de la aplicación. En la práctica, se necesita margen porque Android cierra agresivamente las aplicaciones que consumen demasiado.

RAM 6 GB
El mínimo viable. Modelos de 1B a 3B en Q4. Cierra las demás aplicaciones antes de iniciar una inferencia.
RAM 8 GB
Cómodo para modelos de 3B, posible con modelos de 4B. El punto óptimo de la gama media reciente.
RAM de 12 GB o más
Teléfonos de gama alta recientes. Permite ejecutar modelos de 4B sin problemas, e incluso de 7B con una cuantización agresiva, aunque lentamente.
Almacenamiento
Reserva entre 2 y 5 GB libres por modelo descargado. Los archivos GGUF son voluminosos.
SoC
Un Snapdragon de la serie 8 o un equivalente reciente acelera notablemente. Los chips de gama baja funcionan, pero siguen siendo lentos.
→
Comprueba tu RAM real
La RAM anunciada no está totalmente disponible: el sistema reserva una parte. En un teléfono de 8 GB, cuenta con 5 a 6 GB realmente asignables a una aplicación. Ese es el margen útil para cargar un modelo.

#PocketPal: un LLM local en 5 minutos

PocketPal AI es la aplicación más sencilla para empezar. Es un proyecto de código abierto disponible en Play Store que incluye llama.cpp y un catálogo de modelos descargables directamente desde Hugging Face, sin necesidad de usar la línea de comandos.

  1. 01
    Instalar la aplicación
    Busca «PocketPal AI» en Google Play Store e instálala. La app es gratuita y de código abierto (código disponible en GitHub).
  2. 02
    Abrir el catálogo de modelos
    En la pestaña Models, recorre la lista de modelos recomendados. PocketPal indica el tamaño del archivo y señala aquellos adaptados a tu RAM.
  3. 03
    Descargar un modelo de 1 a 4B
    Elige un modelo pequeño para comenzar, por ejemplo un Qwen 3.5 2B (~1,9 GB) o un Granite 4.2 3B (~2,2 GB) en cuantización Q4. La descarga se realiza a través de la red, una sola vez.
  4. 04
    Cargar y chatear
    Pulsa Load junto al modelo descargado, espera a que se cargue en memoria y luego abre el chat. La primera respuesta comienza después de unos segundos de calentamiento.

PocketPal también permite ajustar los parámetros de inferencia (temperatura, tamaño de contexto, número de hilos de CPU) e importar tus propios archivos GGUF si deseas un modelo que no esté en el catálogo. Para una primera experiencia con LLM local en Android, este es el camino más directo.

→
Desconecta la red para hacer la prueba
Una vez cargado el modelo, activa el modo avión y comienza una conversación. Funciona: es la prueba concreta de que la inferencia es 100 % local, sin ninguna llamada de red.

#MLC Chat y aceleración GPU

MLC Chat es la aplicación de demostración del proyecto MLC LLM, que compila los modelos para aprovechar la GPU móvil a través de la API Vulkan/OpenCL en lugar de ejecutarlo todo en la CPU. En un SoC reciente, esto puede mejorar la velocidad y reducir un poco el consumo en comparación con una ejecución exclusivamente en la CPU.

  1. 01
    Descargar el APK
    MLC Chat no está siempre disponible en la Play Store. Descarga el APK oficial desde el sitio del proyecto MLC LLM (llm.mlc.ai) y permite la instalación desde una fuente externa.
  2. 02
    Descargar un modelo compilado
    La aplicación ofrece modelos ya convertidos al formato MLC (Gemma, Qwen, Granite en tamaños pequeños). Elige uno adecuado para tu RAM.
  3. 03
    Iniciar el chat
    Selecciona el modelo, espera su inicialización, luego comienza a conversar. MLC muestra la velocidad en tokens por segundo en la parte inferior de la pantalla.
i
GPU móvil: el beneficio no está garantizado
La aceleración GPU depende fuertemente del SoC y de los controladores. En algunos teléfonos MLC es más rápido que llama.cpp en CPU, en otros es al revés por el calentamiento y el throttling. Prueba ambos en tu dispositivo antes de concluir.

#llama.cpp a través de Termux para ir más lejos

Para un control total — elegir con precisión el modelo, la cuantización, exponer un servidor local — el camino avanzado pasa por Termux, un emulador de terminal Android que da acceso a un entorno Linux sin root. Allí se compila llama.cpp y se inicia la inferencia desde la línea de comandos, como en un PC Linux.

!
Instala Termux desde F-Droid, no desde Play Store
La versión de Play Store está obsoleta y abandonada. Instala Termux desde F-Droid o GitHub para tener los paquetes actualizados. Es la fuente de errores más común entre los principiantes.
  1. 01
    Instalar y preparar Termux
    Instala Termux desde F-Droid, ábrelo y luego actualiza los paquetes básicos.
  2. 02
    Instalar las herramientas de compilación
    Descarga el compilador, git y cmake necesarios para compilar llama.cpp.
  3. 03
    Compilar llama.cpp
    Clona el repositorio oficial y compílalo. En un móvil, la compilación para CPU (ARM NEON) es la más fiable.
  4. 04
    Descargar un modelo GGUF
    Descarga un archivo .gguf de pequeño tamaño (1-3B en Q4) desde Hugging Face con curl o wget.
  5. 05
    Ejecutar la inferencia
    Usa llama-cli para conversar, o llama-server para exponer una API compatible con OpenAI en localhost accesible desde un navegador.
Termux — preparación
# Mettre à jour les paquets
pkg update && pkg upgrade -y

# Outils de compilation
pkg install -y git cmake clang wget
Termux — compilar llama.cpp
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release -j$(nproc)
Termux — descargar un modelo y conversar
# Exemple : un petit modèle Q4 depuis Hugging Face
wget -O qwen3.5-2b-q4.gguf "<URL_DU_FICHIER_GGUF>"

# Discuter en ligne de commande
./build/bin/llama-cli -m qwen3.5-2b-q4.gguf -p "Résume ce texte : ..." -n 256
Termux — servidor local compatible con OpenAI
# Expose une API sur http://localhost:8080
./build/bin/llama-server -m qwen3.5-2b-q4.gguf --port 8080

El modo servidor es interesante: expone un endpoint compatible con OpenAI en localhost, que puedes consultar desde el navegador del teléfono u otra aplicación. Es la misma lógica que el servidor de Ollama en PC (que escucha por defecto en el puerto 11434), trasladada a tu bolsillo.

#¿Qué modelos de 1 a 4B realmente funcionan?

Todo se juega en el rango de 1 a 4 mil millones de parámetros, con cuantización Q4_K_M (el mejor equilibrio entre calidad y tamaño, como en PC). Por encima de 4B, un teléfono funciona con lentitud o no tiene suficiente RAM. Estas son las familias que dan los mejores resultados en francés.

Qwen 3.5 2B
El modelo pequeño predeterminado de 2026 (~1,9 GB en Q4). Excelente en múltiples idiomas y en francés, contexto ampliado, licencia Apache 2.0. El mejor punto de partida si buscas velocidad en un teléfono de 6 GB.
Qwen 3.5 4B
Mejora en calidad (~3,4 GB en Q4) sin salir de la gama móvil. Coherente y capaz en Q4 si tu teléfono tiene 8 GB+. Apache 2.0.
Granite 4.2 3B
El pequeño modelo de IBM (~2,2 GB en Q4), muy económico en memoria y eficiente en tokens. Un generalista offline sólido cuando la RAM es escasa. Apache 2.0.
Gemma 4 E2B
La versión compacta de Google (~4,3 GB), multimodal y de nuevo bajo licencia Apache 2.0 desde abril de 2026. Reservada para teléfonos de 8 GB o más.
→
Uso de memoria en Q4
Como referencia: un modelo de 1B cabe en ~1 GB, uno de 3B en ~2 GB y uno de 4B en ~3 GB en Q4. Añade la memoria del sistema y de la aplicación: por eso, en un teléfono de 8 GB conviene apuntar a modelos de 3-4B y no mayores.

#Velocidad, calentamiento y batería: lo que hay que saber

La inferencia de LLM exige que la CPU (o la GPU) trabaje al máximo, lo que tiene tres consecuencias muy concretas en un teléfono: la velocidad sigue siendo modesta, el dispositivo se calienta y la batería se descarga rápidamente durante la generación. Nada de esto impide usarlo, pero hay que tener presentes las magnitudes aproximadas.

Velocidad
Calcula aproximadamente entre 5 y 15 tokens/segundo para un 3B Q4 en un SoC de gama media-alta. Se puede leer en tiempo real, pero queda lejos de una GPU de PC. Un 1B es claramente más rápido.
Calentamiento y throttling
Después de una larga generación, el SoC sube de temperatura y se limita (throttling), lo que ralentiza las respuestas siguientes. Deja que respire entre dos solicitudes largas.
Batería
Una sesión de uso sostenido puede hacer que el nivel de batería baje varios puntos porcentuales en pocos minutos. Para un uso puntual no supone un problema; para un uso intensivo, conecta el cargador.
Contexto
Cuanto mayor es la ventana de contexto, más aumentan el consumo de memoria y el tiempo de procesamiento. En dispositivos móviles, mantén un contexto razonable (2k-4k tokens) para mantener la fluidez.
!
No uses la carga rápida
Ejecutar un LLM mientras se recarga el dispositivo con carga rápida combina dos fuentes de calor. A largo plazo, el calentamiento repetido desgasta la batería. Para un uso intensivo, opta por una carga lenta o haz pausas.

#Solución de problemas

La app se cierra al cargar el modelo
Falta de RAM. Cierra todas las demás aplicaciones, elige un modelo más pequeño (1B en lugar de 3B) o una cuantización más ligera.
Respuestas muy lentas
Reduce el tamaño del contexto, disminuye el número de tokens generados o pasa a un modelo más pequeño. Comprueba también que el teléfono no esté reduciendo su rendimiento por el calor.
Termux: comando no encontrado tras la compilación
El build falló silenciosamente. Reinicia la compilación y lee los errores. Asegúrate de que git, cmake y clang estén bien instalados.
Termux abandonado / paquetes obsoletos
Has instalado la versión de Play Store. Desinstálala y vuelve a instalar Termux desde F-Droid o GitHub.
Respuestas incoherentes
Normal para un modelo muy pequeño en una tarea compleja. Simplifica la solicitud, o acepta que un modelo de 1-3B tenga límites de razonamiento.

#Para ir más allá

Una vez que te sientas cómodo con el móvil, probablemente querrás una máquina más potente en casa para las tareas pesadas. Estas guías del sitio complementan esta guía:

Ejecutar un LLM en local sin GPU (solo CPU)
La misma lógica que en el móvil, pero en PC: modelos recomendados según la RAM y trucos para acelerar usando solo la CPU.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Entender por qué Q4_K_M ofrece el equilibrio recomendado, tanto en un teléfono como en un PC.
Instalar Ollama
Para un verdadero servidor LLM en casa al que puedas enviar consultas desde tu teléfono a través de la red local.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.