Modelos LLM en local en iPhone y iPad: aplicaciones y modelos que funcionan vraiment
Ejecutar un LLM local en un iPhone es posible y funciona de verdad: los chips Apple Silicon (series A y M) y el framework MLX permiten ejecutar modelos de entre 1 y 8 mil millones de parámetros sin conexión, directamente en el dispositivo. Esta guía distingue las apps que cumplen sus promesas, explica qué diferencia supone realmente la RAM según tu iPhone o iPad y ofrece referencias reales de rendimiento, sin marketing.
#¿Por qué ejecutar un LLM local en iPhone?
Un LLM local en iOS realiza todos los cálculos en tu dispositivo: ningún servidor, ninguna suscripción y ningún dato que salga del teléfono. Es lo contrario de una app como ChatGPT, que envía cada mensaje a la nube. Las razones para querer esto son concretas: privacidad total (notas médicas, borradores, código), funcionamiento en avión o sin red y cero costo recurrente una vez descargado el modelo.
La contrapartida es real: un iPhone no tiene ni la memoria ni la potencia de un PC equipado con una RTX 4070. No se puede ejecutar un modelo de 70B en el bolsillo. Pero un 3B correctamente cuantizado basta de sobra para resumir un texto, reformular un correo, responder a preguntas sencillas o traducir: todo sin conexión y accesible al instante.
#Apple Silicon, MLX y Neural Engine
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
Los iPhone y iPad modernos comparten la arquitectura Apple Silicon con los Mac: un chip de sistema (serie A en iPhone, serie M en iPad Pro) y, sobre todo, una memoria unificada compartida entre CPU, GPU y Neural Engine. Es esta memoria RAM común la que hace posible la inferencia de LLM en dispositivos móviles: el modelo se carga una sola vez y todos los núcleos pueden acceder a él sin copiarlo.
MLX es el framework de aprendizaje automático de Apple, diseñado para esta memoria unificada. Las aplicaciones serias de iOS lo utilizan (o utilizan llama.cpp compilado con Metal) para aprovechar la GPU del chip. Ahí se realiza la mayor parte del cálculo de inferencia: en la GPU mediante Metal, no solo en la CPU.
- Memoria unificada
- CPU, GPU y ANE comparten la misma RAM. Es el factor limitante número 1 para el tamaño del modelo que puedes cargar.
- GPU Metal
- Ejecuta la inferencia a través de MLX o llama.cpp. Esto determina tus tokens por segundo.
- Neural Engine (ANE)
- Potente pero especializada. Poco utilizada hasta la fecha para la generación de texto LLM.
#Requisitos y RAM por dispositivo
En iOS, la RAM es la única cifra que realmente importa, y Apple no la destaca. Sin embargo, es la que determina si un modelo se carga o provoca un fallo de la aplicación. Estos son los valores de referencia para los dispositivos recientes.
- iPhone 15 / 15 Plus
- 6 GB de RAM. Cómodo para modelos de 1B–3B en Q4. Un 3B funciona; un 7B está al límite y deja poco margen para el sistema.
- iPhone 15 Pro / 16 / 16 Pro
- 8 GB. El punto óptimo para móviles: ejecución fluida de modelos de 3B y viable de modelos de 7B–8B en Q4 con un contexto moderado.
- iPhone 17 Pro
- 12 GB (gama Pro reciente). Margen real para ejecutar cómodamente un modelo de 7B–8B y usar contextos más largos.
- iPad Pro M4
- 16 GB o más según la configuración. La mejor opción para iOS: 8B fluido, y modelos más grandes se vuelven viables.
Las necesidades aproximadas de memoria de un modelo cuantizado en Q4 son las mismas que en un ordenador de escritorio: un 3B ocupa aproximadamente 2 GB, un 7B unos 5 GB y un 8B un poco más. Añade la memoria del contexto (caché KV), que crece con la longitud de la conversación. Por eso, un contexto largo puede hacer que falle una aplicación que arrancaba bien.
#Las apps iOS que funcionan
La App Store está llena de apps de «IA» que no son más que interfaces de acceso a la nube. Para ejecutar el modelo realmente en local, necesitas una app que lo descargue en el dispositivo y lo ejecute con MLX o llama.cpp. Estas son las opciones fiables.
- PocketPal AI
- Gratuita y de código abierto. Descarga modelos GGUF desde Hugging Face y los ejecuta mediante llama.cpp. Interfaz de chat sencilla, ajustes de contexto y temperatura. El punto de partida recomendado.
- LLM Farm
- De código abierto, muy configurable. Admite numerosos formatos y permite ajustar la inferencia con precisión. Más técnica, ideal para probar distintos modelos.
- Enclave / aplicaciones basadas en MLX
- Aplicaciones basadas en MLX, el framework de Apple. Buen rendimiento en chips Apple Silicon recientes, a menudo orientadas a la privacidad.
- Private LLM
- App de pago, ofrece modelos cuantizados optimizados y una experiencia lista para usar. No hay que configurar nada, todo viene empaquetado.
#Instalar y ejecutar un modelo: paso a paso
El ejemplo a continuación utiliza PocketPal AI, gratuita y representativa del flujo general. La lógica es la misma en las otras aplicaciones.
- 01Instalar la appDescarga PocketPal AI desde la App Store. No necesitas una cuenta y no hay conexión a ningún servidor.
- 02Elegir un modeloAbre la biblioteca de modelos integrada. La app ofrece modelos adaptados al móvil (Qwen 3.5 2B, Granite 4.2 3B, Gemma 4 E2B, Qwen 3.5 4B). Empieza con un modelo pequeño: un 2B o 3B en Q4.
- 03DescargarInicia la descarga (de unos cientos de MB a ~2 GB según el tamaño). Hazlo por Wi-Fi. El archivo permanece almacenado localmente en el dispositivo.
- 04Cargar el modeloSelecciona el modelo descargado para cargarlo en memoria. Si la aplicación se cierra aquí, es por falta de RAM: elige uno más pequeño o cierra las otras aplicaciones.
- 05Conversar sin conexiónAbre un chat y plantea una pregunta. Activa el modo avión para comprobarlo: todo sigue funcionando, lo que demuestra que nada sale del dispositivo.
Para los curiosos que quieren la opción más rudimentaria, también es posible compilar llama.cpp por su cuenta, pero iOS no permite ejecutar código arbitrario fuera de una app firmada: en la práctica, usar una app dedicada es la única vía realista para la gran mayoría de los usuarios.
#¿Qué modelos elegir según la RAM?
El modelo adecuado depende en primer lugar de tu dispositivo. Aquí tienes recomendaciones concretas, desde el más básico hasta el más potente, todos en cuantización Q4.
- iPhone 15 / 15 Plus (6 GB)
- Qwen 3.5 2B (1,9 GB) o Granite 4.2 3B (2,2 GB) para fluidez; Qwen 3.5 4B (3,4 GB) para mayor calidad. Mantén contextos cortos.
- iPhone 16 / 16 Pro (8 GB)
- Un modelo de 3B–4B para un uso diario fluido. Un modelo de 8B–9B (Granite 4.2 8B con 5,3 GB, Qwen 3.5 9B con 6,6 GB, 256k ctx y visión) funciona en Q4 con un contexto moderado: más lento, pero claramente más capaz.
- iPhone 17 Pro (12 GB)
- Modelos de 8B–9B con margen, contextos más largos y Qwen 3.5 9B en Q8 (11 GB) para la máxima calidad de este rango.
- iPad Pro M4 (16 GB+)
- Qwen 3.5 9B funciona con fluidez en el uso real; se pueden probar modelos de hasta ~12B (Gemma 4 12B, multimodal, 7,6 GB), con una velocidad que sigue siendo aceptable gracias a la GPU M4.
En francés, Gemma 4 y los modelos Qwen 3.5 rinden bien para su tamaño. Para resúmenes, reformulaciones y respuestas cortas, un modelo de 3B basta. Para tareas de razonamiento o programación más exigentes, las limitaciones del móvil se hacen notar enseguida: es el momento de pasar a un equipo en casa.
#Confidencialidad total: nada sale del dispositivo
Es el argumento más contundente a favor de la IA local en el móvil. Una vez descargado el modelo, no se necesita ninguna solicitud de red para conversar. Tus prompts, tus documentos y tus borradores se quedan en el iPhone. Sin telemetría de las conversaciones, sin entrenamiento con tus datos y sin riesgo de filtraciones desde un servidor.
- Comprueba en modo avión
- La prueba más sencilla: desconecta todas las conexiones de red y comprueba que el chat siga funcionando. Si funciona sin conexión, no se transmite nada.
- Cuidado con las aplicaciones híbridas
- Algunas aplicaciones de «IA» cambian silenciosamente a la nube cuando el modelo local falla. Prefiere aplicaciones 100 % locales y de código abierto para despejar las dudas.
- Datos sensibles
- Notas de salud, documentos profesionales bajo NDA, información personal: la ejecución en local es la única forma de tener la certeza de que estos datos nunca salen de tu dispositivo.
#Solución de problemas y consejos
- La app se cierra al cargar el modelo
- Falta de RAM. Cierra todas las otras aplicaciones, elige un modelo más pequeño (3B en lugar de 7B) o una cuantización más ligera (Q4 en lugar de Q5/Q8).
- Respuestas muy lentas
- Reduce la longitud del contexto y el número de tokens generados. Revisa también la temperatura: un iPhone caliente reduce su rendimiento por motivos térmicos y ralentiza la inferencia.
- El iPhone se calienta y la batería se agota rápidamente
- La inferencia exige el máximo a la GPU. Es normal en sesiones largas. Haz pausas, evita generar continuamente y mantén el dispositivo conectado a la corriente durante el uso intensivo.
- El modelo no responde a lo que se le pregunta
- Es normal con un modelo muy pequeño en una tarea compleja. Simplifica la solicitud o pasa al siguiente tamaño de modelo si tu RAM lo permite.
- Descarga bloqueada
- Los archivos GGUF son voluminosos. Mantén la conexión Wi-Fi y evita poner la app en segundo plano durante la descarga.
#Para ir más allá
El móvil es perfecto para usarlo en cualquier lugar y con privacidad, pero para tareas pesadas querrás un equipo potente. Estas guías del sitio complementan esta guía:
- Ejecutar un LLM localmente en Android
- El equivalente en Android: PocketPal, MLC Chat y llama.cpp a través de Termux, con las mismas restricciones de RAM.
- Instalar Ollama en macOS (Apple Silicon)
- Para pasar del teléfono al Mac: la memoria unificada de los M1/M2/M3/M4 permite ir mucho más allá, hasta modelos de 32B y superiores.
- Elegir tu cuantización (Q4, Q5, Q8, FP16)
- Entender por qué Q4_K_M ofrece el equilibrio recomendado tanto en móviles como en PC, y cuándo pasar a Q5/Q8.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.