Modelos LLM en local en Android: PocketPal, MLC Chat (2026)
Un LLM local en Android es un asistente que responde sin conexión, sin nube, directamente en el procesador de tu teléfono. Los modelos cuantizados de entre 1 y 4 mil millones de parámetros caben hoy en la RAM de un smartphone de gama media y responden a una velocidad que permite utilizarlos. Esta guía cubre tres enfoques —PocketPal y MLC Chat para empezar sin línea de comandos, llama.cpp a través de Termux para ir más allá— con las limitaciones reales de velocidad, calentamiento y autonomía.
#¿Por qué ejecutar un LLM local en Android?
Ejecutar un LLM local en Android responde a tres necesidades concretas: la confidencialidad total (tus prompts nunca salen del dispositivo), el funcionamiento sin conexión (en avión, en zonas sin cobertura o con roaming costoso) y el uso gratuito (sin suscripción ni facturación por token). La contrapartida es el tamaño: un teléfono ejecuta modelos mucho más pequeños que un PC y, por tanto, menos capaces. Pero para resumir, reformular, traducir o mantener una conversación sencilla, un modelo de 3B es más que suficiente.
- Confidencialidad
- El modelo se ejecuta en el SoC del teléfono. No se envía ningún dato a Internet, lo cual se puede verificar desactivando el Wi-Fi y los datos móviles.
- Sin conexión
- Una vez descargado el modelo, todo funciona en modo avión. Útil para desplazamientos o en zonas sin red.
- Uso gratuito
- Sin cuenta, sin límite de uso, sin costo por token. Solo pagas por la batería consumida.
- Límite que debes conocer
- En la práctica, un smartphone tiene un límite de alrededor de 4B de parámetros. Para razonamientos complejos o tareas de código, un LLM local en PC sigue siendo muy superior.
#Qué tipo de teléfono se necesita
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
El factor determinante es la RAM, exactamente como en ordenadores, donde la VRAM limita el tamaño del modelo. Un modelo cuantizado Q4 de 3B ocupa aproximadamente 2 GB, más la memoria del sistema y de la aplicación. En la práctica, se necesita margen porque Android cierra agresivamente las aplicaciones que consumen demasiado.
- RAM 6 GB
- El mínimo viable. Modelos de 1B a 3B en Q4. Cierra las demás aplicaciones antes de iniciar una inferencia.
- RAM 8 GB
- Cómodo para modelos de 3B, posible con modelos de 4B. El punto óptimo de la gama media reciente.
- RAM de 12 GB o más
- Teléfonos de gama alta recientes. Permite ejecutar modelos de 4B sin problemas, e incluso de 7B con una cuantización agresiva, aunque lentamente.
- Almacenamiento
- Reserva entre 2 y 5 GB libres por modelo descargado. Los archivos GGUF son voluminosos.
- SoC
- Un Snapdragon de la serie 8 o un equivalente reciente acelera notablemente. Los chips de gama baja funcionan, pero siguen siendo lentos.
#PocketPal: un LLM local en 5 minutos
PocketPal AI es la aplicación más sencilla para empezar. Es un proyecto de código abierto disponible en Play Store que incluye llama.cpp y un catálogo de modelos descargables directamente desde Hugging Face, sin necesidad de usar la línea de comandos.
- 01Instalar la aplicaciónBusca «PocketPal AI» en Google Play Store e instálala. La app es gratuita y de código abierto (código disponible en GitHub).
- 02Abrir el catálogo de modelosEn la pestaña Models, recorre la lista de modelos recomendados. PocketPal indica el tamaño del archivo y señala aquellos adaptados a tu RAM.
- 03Descargar un modelo de 1 a 4BElige un modelo pequeño para comenzar, por ejemplo un Qwen 3.5 2B (~1,9 GB) o un Granite 4.2 3B (~2,2 GB) en cuantización Q4. La descarga se realiza a través de la red, una sola vez.
- 04Cargar y chatearPulsa Load junto al modelo descargado, espera a que se cargue en memoria y luego abre el chat. La primera respuesta comienza después de unos segundos de calentamiento.
PocketPal también permite ajustar los parámetros de inferencia (temperatura, tamaño de contexto, número de hilos de CPU) e importar tus propios archivos GGUF si deseas un modelo que no esté en el catálogo. Para una primera experiencia con LLM local en Android, este es el camino más directo.
#MLC Chat y aceleración GPU
MLC Chat es la aplicación de demostración del proyecto MLC LLM, que compila los modelos para aprovechar la GPU móvil a través de la API Vulkan/OpenCL en lugar de ejecutarlo todo en la CPU. En un SoC reciente, esto puede mejorar la velocidad y reducir un poco el consumo en comparación con una ejecución exclusivamente en la CPU.
- 01Descargar el APKMLC Chat no está siempre disponible en la Play Store. Descarga el APK oficial desde el sitio del proyecto MLC LLM (llm.mlc.ai) y permite la instalación desde una fuente externa.
- 02Descargar un modelo compiladoLa aplicación ofrece modelos ya convertidos al formato MLC (Gemma, Qwen, Granite en tamaños pequeños). Elige uno adecuado para tu RAM.
- 03Iniciar el chatSelecciona el modelo, espera su inicialización, luego comienza a conversar. MLC muestra la velocidad en tokens por segundo en la parte inferior de la pantalla.
#llama.cpp a través de Termux para ir más lejos
Para un control total — elegir con precisión el modelo, la cuantización, exponer un servidor local — el camino avanzado pasa por Termux, un emulador de terminal Android que da acceso a un entorno Linux sin root. Allí se compila llama.cpp y se inicia la inferencia desde la línea de comandos, como en un PC Linux.
- 01Instalar y preparar TermuxInstala Termux desde F-Droid, ábrelo y luego actualiza los paquetes básicos.
- 02Instalar las herramientas de compilaciónDescarga el compilador, git y cmake necesarios para compilar llama.cpp.
- 03Compilar llama.cppClona el repositorio oficial y compílalo. En un móvil, la compilación para CPU (ARM NEON) es la más fiable.
- 04Descargar un modelo GGUFDescarga un archivo .gguf de pequeño tamaño (1-3B en Q4) desde Hugging Face con curl o wget.
- 05Ejecutar la inferenciaUsa llama-cli para conversar, o llama-server para exponer una API compatible con OpenAI en localhost accesible desde un navegador.
El modo servidor es interesante: expone un endpoint compatible con OpenAI en localhost, que puedes consultar desde el navegador del teléfono u otra aplicación. Es la misma lógica que el servidor de Ollama en PC (que escucha por defecto en el puerto 11434), trasladada a tu bolsillo.
#¿Qué modelos de 1 a 4B realmente funcionan?
Todo se juega en el rango de 1 a 4 mil millones de parámetros, con cuantización Q4_K_M (el mejor equilibrio entre calidad y tamaño, como en PC). Por encima de 4B, un teléfono funciona con lentitud o no tiene suficiente RAM. Estas son las familias que dan los mejores resultados en francés.
- Qwen 3.5 2B
- El modelo pequeño predeterminado de 2026 (~1,9 GB en Q4). Excelente en múltiples idiomas y en francés, contexto ampliado, licencia Apache 2.0. El mejor punto de partida si buscas velocidad en un teléfono de 6 GB.
- Qwen 3.5 4B
- Mejora en calidad (~3,4 GB en Q4) sin salir de la gama móvil. Coherente y capaz en Q4 si tu teléfono tiene 8 GB+. Apache 2.0.
- Granite 4.2 3B
- El pequeño modelo de IBM (~2,2 GB en Q4), muy económico en memoria y eficiente en tokens. Un generalista offline sólido cuando la RAM es escasa. Apache 2.0.
- Gemma 4 E2B
- La versión compacta de Google (~4,3 GB), multimodal y de nuevo bajo licencia Apache 2.0 desde abril de 2026. Reservada para teléfonos de 8 GB o más.
#Velocidad, calentamiento y batería: lo que hay que saber
La inferencia de LLM exige que la CPU (o la GPU) trabaje al máximo, lo que tiene tres consecuencias muy concretas en un teléfono: la velocidad sigue siendo modesta, el dispositivo se calienta y la batería se descarga rápidamente durante la generación. Nada de esto impide usarlo, pero hay que tener presentes las magnitudes aproximadas.
- Velocidad
- Calcula aproximadamente entre 5 y 15 tokens/segundo para un 3B Q4 en un SoC de gama media-alta. Se puede leer en tiempo real, pero queda lejos de una GPU de PC. Un 1B es claramente más rápido.
- Calentamiento y throttling
- Después de una larga generación, el SoC sube de temperatura y se limita (throttling), lo que ralentiza las respuestas siguientes. Deja que respire entre dos solicitudes largas.
- Batería
- Una sesión de uso sostenido puede hacer que el nivel de batería baje varios puntos porcentuales en pocos minutos. Para un uso puntual no supone un problema; para un uso intensivo, conecta el cargador.
- Contexto
- Cuanto mayor es la ventana de contexto, más aumentan el consumo de memoria y el tiempo de procesamiento. En dispositivos móviles, mantén un contexto razonable (2k-4k tokens) para mantener la fluidez.
#Solución de problemas
- La app se cierra al cargar el modelo
- Falta de RAM. Cierra todas las demás aplicaciones, elige un modelo más pequeño (1B en lugar de 3B) o una cuantización más ligera.
- Respuestas muy lentas
- Reduce el tamaño del contexto, disminuye el número de tokens generados o pasa a un modelo más pequeño. Comprueba también que el teléfono no esté reduciendo su rendimiento por el calor.
- Termux: comando no encontrado tras la compilación
- El build falló silenciosamente. Reinicia la compilación y lee los errores. Asegúrate de que git, cmake y clang estén bien instalados.
- Termux abandonado / paquetes obsoletos
- Has instalado la versión de Play Store. Desinstálala y vuelve a instalar Termux desde F-Droid o GitHub.
- Respuestas incoherentes
- Normal para un modelo muy pequeño en una tarea compleja. Simplifica la solicitud, o acepta que un modelo de 1-3B tenga límites de razonamiento.
#Para ir más allá
Una vez que te sientas cómodo con el móvil, probablemente querrás una máquina más potente en casa para las tareas pesadas. Estas guías del sitio complementan esta guía:
- Ejecutar un LLM en local sin GPU (solo CPU)
- La misma lógica que en el móvil, pero en PC: modelos recomendados según la RAM y trucos para acelerar usando solo la CPU.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Entender por qué Q4_K_M ofrece el equilibrio recomendado, tanto en un teléfono como en un PC.
- Instalar Ollama
- Para un verdadero servidor LLM en casa al que puedas enviar consultas desde tu teléfono a través de la red local.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.