Principiante 10 minMóvil

Modelos LLM en local en iPhone y iPad: aplicaciones y modelos que funcionan vraiment

Ejecutar un LLM local en un iPhone es posible y funciona de verdad: los chips Apple Silicon (series A y M) y el framework MLX permiten ejecutar modelos de entre 1 y 8 mil millones de parámetros sin conexión, directamente en el dispositivo. Esta guía distingue las apps que cumplen sus promesas, explica qué diferencia supone realmente la RAM según tu iPhone o iPad y ofrece referencias reales de rendimiento, sin marketing.

Por Clara M.·Actualización 2026-08-27·Probado en macOS 14+

#¿Por qué ejecutar un LLM local en iPhone?

Un LLM local en iOS realiza todos los cálculos en tu dispositivo: ningún servidor, ninguna suscripción y ningún dato que salga del teléfono. Es lo contrario de una app como ChatGPT, que envía cada mensaje a la nube. Las razones para querer esto son concretas: privacidad total (notas médicas, borradores, código), funcionamiento en avión o sin red y cero costo recurrente una vez descargado el modelo.

La contrapartida es real: un iPhone no tiene ni la memoria ni la potencia de un PC equipado con una RTX 4070. No se puede ejecutar un modelo de 70B en el bolsillo. Pero un 3B correctamente cuantizado basta de sobra para resumir un texto, reformular un correo, responder a preguntas sencillas o traducir: todo sin conexión y accesible al instante.

i
Lo realista en móvil
Busca modelos de 1B a 8B con cuantización Q4. Por debajo de 1B, la calidad se desploma; por encima de 8B, solo los iPad Pro y los iPhone recientes de gama alta pueden ejecutarlos, y aun así lentamente.

#Apple Silicon, MLX y Neural Engine

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j

Los iPhone y iPad modernos comparten la arquitectura Apple Silicon con los Mac: un chip de sistema (serie A en iPhone, serie M en iPad Pro) y, sobre todo, una memoria unificada compartida entre CPU, GPU y Neural Engine. Es esta memoria RAM común la que hace posible la inferencia de LLM en dispositivos móviles: el modelo se carga una sola vez y todos los núcleos pueden acceder a él sin copiarlo.

MLX es el framework de aprendizaje automático de Apple, diseñado para esta memoria unificada. Las aplicaciones serias de iOS lo utilizan (o utilizan llama.cpp compilado con Metal) para aprovechar la GPU del chip. Ahí se realiza la mayor parte del cálculo de inferencia: en la GPU mediante Metal, no solo en la CPU.

!
Lo que la Neural Engine no hace (aún)
A menudo se cree que la Neural Engine (ANE) acelera los LLM. En la práctica, la generación de texto token por token se realiza hoy principalmente en la GPU mediante Metal, a través de MLX o llama.cpp. La ANE destaca en modelos con grafo fijo (visión, Face ID), pero menos en la generación autoregresiva. No cuentes con ella para mejorar tu velocidad en tokens/segundo.
Memoria unificada
CPU, GPU y ANE comparten la misma RAM. Es el factor limitante número 1 para el tamaño del modelo que puedes cargar.
GPU Metal
Ejecuta la inferencia a través de MLX o llama.cpp. Esto determina tus tokens por segundo.
Neural Engine (ANE)
Potente pero especializada. Poco utilizada hasta la fecha para la generación de texto LLM.

#Requisitos y RAM por dispositivo

En iOS, la RAM es la única cifra que realmente importa, y Apple no la destaca. Sin embargo, es la que determina si un modelo se carga o provoca un fallo de la aplicación. Estos son los valores de referencia para los dispositivos recientes.

iPhone 15 / 15 Plus
6 GB de RAM. Cómodo para modelos de 1B–3B en Q4. Un 3B funciona; un 7B está al límite y deja poco margen para el sistema.
iPhone 15 Pro / 16 / 16 Pro
8 GB. El punto óptimo para móviles: ejecución fluida de modelos de 3B y viable de modelos de 7B–8B en Q4 con un contexto moderado.
iPhone 17 Pro
12 GB (gama Pro reciente). Margen real para ejecutar cómodamente un modelo de 7B–8B y usar contextos más largos.
iPad Pro M4
16 GB o más según la configuración. La mejor opción para iOS: 8B fluido, y modelos más grandes se vuelven viables.
→
Regla práctica para la memoria
iOS no permite que una app monopolice toda la RAM. Calcula que una app de terceros dispone aproximadamente de entre la mitad y dos tercios de la RAM física. En un iPhone con 8 GB, prevé un margen de memoria realista para el modelo de unos 4–5 GB: un 7B en Q4 cabe justo, mientras que un 3B cabe con mucha holgura.

Las necesidades aproximadas de memoria de un modelo cuantizado en Q4 son las mismas que en un ordenador de escritorio: un 3B ocupa aproximadamente 2 GB, un 7B unos 5 GB y un 8B un poco más. Añade la memoria del contexto (caché KV), que crece con la longitud de la conversación. Por eso, un contexto largo puede hacer que falle una aplicación que arrancaba bien.

#Las apps iOS que funcionan

La App Store está llena de apps de «IA» que no son más que interfaces de acceso a la nube. Para ejecutar el modelo realmente en local, necesitas una app que lo descargue en el dispositivo y lo ejecute con MLX o llama.cpp. Estas son las opciones fiables.

PocketPal AI
Gratuita y de código abierto. Descarga modelos GGUF desde Hugging Face y los ejecuta mediante llama.cpp. Interfaz de chat sencilla, ajustes de contexto y temperatura. El punto de partida recomendado.
LLM Farm
De código abierto, muy configurable. Admite numerosos formatos y permite ajustar la inferencia con precisión. Más técnica, ideal para probar distintos modelos.
Enclave / aplicaciones basadas en MLX
Aplicaciones basadas en MLX, el framework de Apple. Buen rendimiento en chips Apple Silicon recientes, a menudo orientadas a la privacidad.
Private LLM
App de pago, ofrece modelos cuantizados optimizados y una experiencia lista para usar. No hay que configurar nada, todo viene empaquetado.
i
GGUF, el formato de archivo de los modelos
La mayoría de estas aplicaciones cargan archivos GGUF — el formato de llama.cpp. Elige la cuantización al descargar: Q4_K_M es el mejor equilibrio entre tamaño y calidad, exactamente como en ordenador. Evita el FP16 en dispositivos móviles, demasiado pesado.

#Instalar y ejecutar un modelo: paso a paso

El ejemplo a continuación utiliza PocketPal AI, gratuita y representativa del flujo general. La lógica es la misma en las otras aplicaciones.

  1. 01
    Instalar la app
    Descarga PocketPal AI desde la App Store. No necesitas una cuenta y no hay conexión a ningún servidor.
  2. 02
    Elegir un modelo
    Abre la biblioteca de modelos integrada. La app ofrece modelos adaptados al móvil (Qwen 3.5 2B, Granite 4.2 3B, Gemma 4 E2B, Qwen 3.5 4B). Empieza con un modelo pequeño: un 2B o 3B en Q4.
  3. 03
    Descargar
    Inicia la descarga (de unos cientos de MB a ~2 GB según el tamaño). Hazlo por Wi-Fi. El archivo permanece almacenado localmente en el dispositivo.
  4. 04
    Cargar el modelo
    Selecciona el modelo descargado para cargarlo en memoria. Si la aplicación se cierra aquí, es por falta de RAM: elige uno más pequeño o cierra las otras aplicaciones.
  5. 05
    Conversar sin conexión
    Abre un chat y plantea una pregunta. Activa el modo avión para comprobarlo: todo sigue funcionando, lo que demuestra que nada sale del dispositivo.

Para los curiosos que quieren la opción más rudimentaria, también es posible compilar llama.cpp por su cuenta, pero iOS no permite ejecutar código arbitrario fuera de una app firmada: en la práctica, usar una app dedicada es la única vía realista para la gran mayoría de los usuarios.

#¿Qué modelos elegir según la RAM?

El modelo adecuado depende en primer lugar de tu dispositivo. Aquí tienes recomendaciones concretas, desde el más básico hasta el más potente, todos en cuantización Q4.

iPhone 15 / 15 Plus (6 GB)
Qwen 3.5 2B (1,9 GB) o Granite 4.2 3B (2,2 GB) para fluidez; Qwen 3.5 4B (3,4 GB) para mayor calidad. Mantén contextos cortos.
iPhone 16 / 16 Pro (8 GB)
Un modelo de 3B–4B para un uso diario fluido. Un modelo de 8B–9B (Granite 4.2 8B con 5,3 GB, Qwen 3.5 9B con 6,6 GB, 256k ctx y visión) funciona en Q4 con un contexto moderado: más lento, pero claramente más capaz.
iPhone 17 Pro (12 GB)
Modelos de 8B–9B con margen, contextos más largos y Qwen 3.5 9B en Q8 (11 GB) para la máxima calidad de este rango.
iPad Pro M4 (16 GB+)
Qwen 3.5 9B funciona con fluidez en el uso real; se pueden probar modelos de hasta ~12B (Gemma 4 12B, multimodal, 7,6 GB), con una velocidad que sigue siendo aceptable gracias a la GPU M4.
→
Pequeño y reciente supera a grande y antiguo
Un modelo reciente de 3B (Granite 4.2 3B, Qwen 3.5 2B/4B, Gemma 4 E2B) suele responder mejor que uno de 7B más antiguo, consumiendo la mitad de RAM. En dispositivos móviles, prioriza la generación del modelo sobre su tamaño bruto.

En francés, Gemma 4 y los modelos Qwen 3.5 rinden bien para su tamaño. Para resúmenes, reformulaciones y respuestas cortas, un modelo de 3B basta. Para tareas de razonamiento o programación más exigentes, las limitaciones del móvil se hacen notar enseguida: es el momento de pasar a un equipo en casa.

#Confidencialidad total: nada sale del dispositivo

Es el argumento más contundente a favor de la IA local en el móvil. Una vez descargado el modelo, no se necesita ninguna solicitud de red para conversar. Tus prompts, tus documentos y tus borradores se quedan en el iPhone. Sin telemetría de las conversaciones, sin entrenamiento con tus datos y sin riesgo de filtraciones desde un servidor.

Comprueba en modo avión
La prueba más sencilla: desconecta todas las conexiones de red y comprueba que el chat siga funcionando. Si funciona sin conexión, no se transmite nada.
Cuidado con las aplicaciones híbridas
Algunas aplicaciones de «IA» cambian silenciosamente a la nube cuando el modelo local falla. Prefiere aplicaciones 100 % locales y de código abierto para despejar las dudas.
Datos sensibles
Notas de salud, documentos profesionales bajo NDA, información personal: la ejecución en local es la única forma de tener la certeza de que estos datos nunca salen de tu dispositivo.
i
Local no quiere decir infalible
El modelo no filtra tus datos, pero puede equivocarse (alucinaciones). Para decisiones importantes, mantén una actitud crítica: la confidencialidad no es lo mismo que la fiabilidad.

#Solución de problemas y consejos

La app se cierra al cargar el modelo
Falta de RAM. Cierra todas las otras aplicaciones, elige un modelo más pequeño (3B en lugar de 7B) o una cuantización más ligera (Q4 en lugar de Q5/Q8).
Respuestas muy lentas
Reduce la longitud del contexto y el número de tokens generados. Revisa también la temperatura: un iPhone caliente reduce su rendimiento por motivos térmicos y ralentiza la inferencia.
El iPhone se calienta y la batería se agota rápidamente
La inferencia exige el máximo a la GPU. Es normal en sesiones largas. Haz pausas, evita generar continuamente y mantén el dispositivo conectado a la corriente durante el uso intensivo.
El modelo no responde a lo que se le pregunta
Es normal con un modelo muy pequeño en una tarea compleja. Simplifica la solicitud o pasa al siguiente tamaño de modelo si tu RAM lo permite.
Descarga bloqueada
Los archivos GGUF son voluminosos. Mantén la conexión Wi-Fi y evita poner la app en segundo plano durante la descarga.

#Para ir más allá

El móvil es perfecto para usarlo en cualquier lugar y con privacidad, pero para tareas pesadas querrás un equipo potente. Estas guías del sitio complementan esta guía:

Ejecutar un LLM localmente en Android
El equivalente en Android: PocketPal, MLC Chat y llama.cpp a través de Termux, con las mismas restricciones de RAM.
Instalar Ollama en macOS (Apple Silicon)
Para pasar del teléfono al Mac: la memoria unificada de los M1/M2/M3/M4 permite ir mucho más allá, hasta modelos de 32B y superiores.
Elegir tu cuantización (Q4, Q5, Q8, FP16)
Entender por qué Q4_K_M ofrece el equilibrio recomendado tanto en móviles como en PC, y cuándo pasar a Q5/Q8.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.