Intermedio 15 minEdge

LLM en Raspberry Pi 5: IA local integrada

Ejecutar un LLM en Raspberry Pi sonaba a broma hace dos años. Con la Pi 5 de 8 GB, su SoC BCM2712 de cuatro núcleos Cortex-A76 a 2,4 GHz y la oleada de pequeños modelos de 2–4B lanzados en 2026, se ha convertido en una posibilidad real. Esta guía explica cómo instalar Ollama en Raspberry Pi, mide los tokens por segundo con Qwen 3.5 2B, Granite 4.2 3B y Qwen 3.5 4B, y muestra los casos en los que un LLM embebido tiene sentido.

Por Mohamed Meguedmi·Actualización 2026-08-27·Probado en Windows, macOS y Linux

#¿Por qué un LLM en Raspberry Pi?

Un Raspberry Pi 5 no va a reemplazar tu RTX 4090. El objetivo no es la velocidad bruta, sino los sistemas embebidos: una placa de 80 € que consume 5-12 W, cabe en una caja del tamaño de una tarjeta de crédito y funciona las 24 horas del día sin ruido. Para casos de uso de computación en el borde —asistente de voz local, estación meteorológica inteligente, quiosco sin conexión, robot móvil— es suficiente e incomparablemente más barato que un mini-PC.

La otra ventaja: la privacidad absoluta. Ningún dato abandona la red local. Puedes montar un asistente familiar en la habitación de un niño sin nube, sin telemetría y sin suscripción.

i
En dos palabras
Pi 5 + Ollama + un modelo de 2-4B cuantizado en Q4 = un asistente local que responde a una velocidad de 2 a 4 tokens/segundo. Lento, pero autónomo, silencioso y con un coste de hardware marginal.

#Requisitos de hardware

El kit de IA Local

Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.

  • Espacio en línea de por vida
  • PDF + archivos
  • Reembolsado 30 j
Raspberry Pi 5 (8 GB obligatorios)
La versión de 4 GB puede ejecutar Qwen 3.5 2B, pero se queda corta con modelos más grandes. La de 8 GB es el mínimo para trabajar con comodidad. La de 16 GB (lanzada a finales de 2024) abre la puerta a Qwen 3.5 4B sin swap.
Tarjeta microSD A2 o SSD NVMe
Una SD A1 ralentiza enormemente la carga inicial del modelo. Lo ideal es un SSD NVMe a través del HAT M.2 oficial: ancho de banda de más de 500 MB/s y carga de Qwen 3.5 4B en 4 s frente a 30 s con una SD.
Fuente de alimentación oficial de 27 W
La Pi 5 consume 9-12 W durante la inferencia. La fuente de alimentación oficial USB-C de 5 V/5 A es obligatoria para evitar el throttling. Una fuente de alimentación genérica de 15 W suministra una tensión insuficiente a la placa.
Enfriamiento activo
Indispensable. El SoC reduce su frecuencia a partir de 80 °C. Basta con el ventilador oficial (5 €) o una caja Argon ONE V3. Sin disipador, pierdes un 30-40 % de velocidad de generación después de 2 minutos de inferencia.
Pi OS de 64 bits (Bookworm)
Raspberry Pi OS de 64 bits basado en Debian 12. Ollama no es compatible con sistemas de 32 bits. Compruébalo con uname -m → debe devolver aarch64.
!
Sin GPU utilizable
El VideoCore VII de la Pi 5 no tiene soporte oficial para la inferencia LLM (sin backend Vulkan estable, sin drivers ML maduros). Todo se ejecuta en los 4 núcleos CPU ARM. Es la principal limitación.

#1. Instalar Ollama en Pi 5

Ollama soporta oficialmente linux/arm64 desde 2024. El script de instalación universal funciona directamente en Pi OS, sin necesidad de compilación manual.

Instalación de Ollama (1 línea)
curl -fsSL https://ollama.com/install.sh | sh

El script descarga el binario ARM64 (~150 MB), instala un servicio systemd y arranca el daemon en el puerto 11434. Calcula entre 1 y 2 minutos.

Verificar que el servicio esté funcionando
systemctl status ollama
ollama --version
→
Acceso desde la red local
Por defecto, Ollama escucha en 127.0.0.1:11434. Para usarlo desde otro dispositivo de la red local (teléfono, portátil), edita /etc/systemd/system/ollama.service y añade Environment="OLLAMA_HOST=0.0.0.0:11434". Luego sudo systemctl daemon-reload && sudo systemctl restart ollama.

#2. Modelos recomendados para Raspberry Pi

En un Pi 5 de 8 GB, tienes aproximadamente 6,5 GB de RAM realmente utilizable (el sistema y su caché ocupan el resto). Cualquier LLM que supere los 4–5 GB con cuantización Q4 es inutilizable: usará la microSD como memoria de intercambio y caerá a 0,1 tok/s.

Tres modelos dan los mejores resultados en Pi 5 en agosto de 2026:

Qwen 3.5 2B (Alibaba, Apache 2.0)
El mejor en relación rendimiento/RAM. 1,9 GB en Q4_K_M, multimodal, 256k de contexto, excelente en chats cortos y en francés. Ideal para un asistente sencillo o para el control por voz.
Granite 4.2 3B (IBM, Apache 2.0)
Muy ligero en consumo de recursos y eficiente en el uso de tokens. 2,2 GB en Q4_K_M. Un nivel más de calidad en razonamiento, diseñado para funcionar las 24 horas del día sin saturar la RAM. Sólido en múltiples idiomas.
Qwen 3.5 4B (Alibaba, Apache 2.0)
El nuevo «modelo pequeño por defecto» y el más capaz de los tres. 3,4 GB en Q4_K_M. Cabe en la RAM de una Pi 5 de 8 GB, pero deja poco margen: no uses una interfaz gráfica pesada en paralelo.
Descargar los tres modelos
ollama pull qwen3.5:2b
ollama pull granite4.2:3b
ollama pull qwen3.5:4b
i
¿Por qué no gpt-oss 20B o Mistral Small 24B?
Estos modelos ocupan ~14 GB en Q4 y no caben en los 6,5 GB realmente utilizables de una Pi 5 de 8 GB. Incluso una Pi de 16 GB tendría que recurrir a la memoria de intercambio para ejecutarlos a 0,3-0,5 tok/s, lo que resulta inutilizable. Mantente por debajo de 4B en una Pi; esos modelos necesitan un Mac o una GPU.

#3. Benchmarks de tokens/s (órdenes de magnitud)

Órdenes de magnitud registrados en una Raspberry Pi 5 de 8 GB, con refrigeración activa oficial, SSD NVMe mediante HAT M.2, Pi OS Bookworm de 64 bits, una versión reciente de Ollama, cuantización Q4_K_M y un prompt para generar 200 tokens. Las cifras varían según la versión de Ollama y las condiciones térmicas: considéralas como órdenes de magnitud, no como valores absolutos.

Qwen 3.5 2B Q4_K_M
≈ 4,4 tokens/s en generación · 6,6 tok/s en evaluación del prompt · 1,9 GB de RAM · 9,6 W
Granite 4.2 3B Q4_K_M
≈ 3,4 tokens/s de generación · 5,1 tok/s de evaluación del prompt · 2,2 GB de RAM · 10,2 W
Qwen 3.5 4B Q4_K_M
≈ 2,3 tokens/s de generación · 3,6 tok/s de evaluación del prompt · 3,4 GB de RAM · 11,2 W
Gemma 4 E2B (referencia multimodal)
≈ 3.9 tokens/seg · 4.3 GB de RAM · 10.4 W. MoE rápido, pero con mayor consumo de RAM.
Granite 4.2 3B Q3_K_S (variante de bajo consumo de recursos)
≈ 3,6 tokens/s · 1,7 GB de RAM · 9,9 W. El más ligero del grupo, ideal si la RAM es limitada (Pi de 4 GB).
→
Leer estos números
A 5 tok/s, una respuesta de 80 palabras tarda entre 20 y 25 segundos. Es más lento que un asistente en la nube, pero más que suficiente para casos no interactivos (notificaciones, resúmenes en lote, control por voz asíncrono).
Reproducir estos benchmarks en tu propio entorno
ollama run qwen3.5:2b --verbose "Explique en 100 mots ce qu'est un Raspberry Pi."

La opción --verbose muestra al final de la generación: eval rate (tok/s), prompt eval rate, total duration. Es la medida oficial para comparar.

#4. Casos de uso offline relevantes

A 2-5 tok/s, la inferencia en Pi no está pensada para el chat en tiempo real. Los casos en los que destaca son aquellos en los que la latencia no es crítica, o en los que la confidencialidad y la autonomía importan más que la velocidad.

Asistente de voz local
Pi 5 + micrófono USB + Whisper.cpp tiny + Qwen 3.5 2B + Piper TTS. Pregunta → transcripción → respuesta → voz sintetizada, todo en 8-12 s sin nube. Domótica offline, kiosco infantil, robot educativo.
Resumen de correos o noticias en lote
Cron job que cada hora descarga los RSS, los resume con Qwen 3.5 4B, y los envía a Telegram/Matrix. El tiempo de inferencia no se nota cuando es asíncrono.
Clasificación de logs o tickets
Pi en el borde de red que etiqueta los logs entrantes ('error crítico', 'spam', 'normal') antes de enviarlos a un servidor central. Ahorra ancho de banda WAN.
Demo integrada / portátil
Presentación al cliente, taller escolar, conferencia: Pi 5 en el bolsillo, batería USB-C, demo de IA local 100 % autónoma.
Salvaguarda para otros LLM
Pequeño modelo local que filtra o reformula un prompt antes de enviarlo a un LLM en la nube. Útil para anonimizar datos sensibles en el entorno edge.
!
Casos en los que la Pi no es suficiente
RAG sobre >50 documentos, generación de código extenso, agentes con llamadas complejas a herramientas, razonamiento paso a paso (modelos de cadena de pensamiento como Qwen 3.8 27B): en estos casos, opta por un Mac mini M4 o un mini-PC GMKtec/Beelink. La relación rendimiento/€ es mucho mejor en esos equipos.

#5. Optimizaciones específicas para Pi

#Reducir la ventana de contexto

Por defecto, Ollama utiliza num_ctx=2048. En Pi, eso ya es mucho: cada token de contexto consume RAM y ralentiza la evaluación previa. Para un asistente de chat con conversaciones breves, baja el valor a 1024.

En tiempo de ejecución durante la sesión
/set parameter num_ctx 1024

#Limitar los hilos

Ollama utiliza por defecto todos los núcleos. En Pi 5 (4 núcleos), esto es óptimo en términos de velocidad, pero satura el SoC, lo que provoca una reducción de rendimiento por temperatura al cabo de 1-2 minutos. En un uso prolongado, limitar a 3 núcleos mantiene una tasa de generación estable durante más tiempo.

Limitar los hilos mediante env
OLLAMA_NUM_PARALLEL=1 OLLAMA_NUM_THREAD=3 ollama serve

#Preferir el NVMe a la microSD

La carga inicial de un modelo desde SD lee secuencialmente varios GB. SD A1 → 30-40 s para Phi-3.5 Mini. NVMe → 3-5 s. Una vez en RAM, la inferencia es idéntica.

#Bajar un nivel si falta RAM

En un Pi 5 de 8 GB con la interfaz gráfica activa, Qwen 3.5 4B en Q4_K_M puede empezar a usar memoria de intercambio. Dos opciones: pasar a Granite 4.2 3B (2,2 GB) o Qwen 3.5 2B (1,9 GB), que liberan entre 1 y 1,5 GB de RAM sin que la calidad caiga drásticamente.

Modelo más ligero
ollama pull granite4.2:3b
→
Modo headless recomendado
Si configuras la Pi como servidor dedicado de inferencia, desactiva el escritorio LXDE: sudo raspi-config → Boot Options → Console. Recuperas 300-500 MB de RAM, espacio suficiente para pasar del modelo 2B al 4B cómodamente.

#Solución de problemas

ollama: command not found después de la instalación
El script systemd ha fallado (a menudo: Pi OS demasiado antiguo). Revisa sudo systemctl status ollama. Si aparece el error 'exec format error', estás en 32 bits — reinstala Pi OS de 64 bits.
El modelo se carga, pero solo genera 0,3 tok/s
Estás usando swap. Verifica free -h: si la columna 'available' está por debajo de 500 MB durante la inferencia, tu modelo es demasiado grande. Pasa a Granite 4.2 3B o Qwen 3.5 2B, o cambia a Q3.
Reducción del rendimiento por temperatura después de 1 minuto
El SoC ha superado los 80 °C. Comprueba vcgencmd measure_temp durante la inferencia. Solución: ventilador oficial o Argon ONE V3. Sin disipación activa, la Pi 5 no se puede utilizar de forma continua para inferencia.
Memoria insuficiente a mitad de la generación
El OOM killer de Linux ha terminado el proceso de Ollama. Reduce num_ctx a 1024, cierra el navegador o pasa a un modelo más pequeño. En una Pi con 4 GB, quédate con Qwen 3.5 2B, el más ligero del catálogo de 2026.
El servicio Ollama no inicia al arrancar
sudo systemctl enable ollama pour activer l'autostart. Vérifiez ensuite avec systemctl is-enabled ollama.

#Para ir más allá

Una vez que Ollama esté funcionando en tu Pi 5, hay tres vías naturales para profundizar:

Comprender la cuantización para ir más lejos
La guía para elegir la cuantización compara Q3, Q4, Q5 y Q8 en detalle. Es fundamental en una Pi, donde cada 100 MB de RAM cuentan.
Integrar en una app de Python
La guía para integrar Ollama en Python a través de la API REST muestra cómo controlar tu Pi 5 desde un script Flask/FastAPI — base de cualquier asistente edge.
Automatizar flujos de trabajo sin conexión
La guía para automatizar con n8n y Ollama se aplica directamente en Pi (n8n funciona nativamente en ARM64). Ideal para un hub domótico de IA autónomo.
¿Esta guía te ha ayudado?

¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.