LLM en Raspberry Pi 5: IA local integrada
Ejecutar un LLM en Raspberry Pi sonaba a broma hace dos años. Con la Pi 5 de 8 GB, su SoC BCM2712 de cuatro núcleos Cortex-A76 a 2,4 GHz y la oleada de pequeños modelos de 2–4B lanzados en 2026, se ha convertido en una posibilidad real. Esta guía explica cómo instalar Ollama en Raspberry Pi, mide los tokens por segundo con Qwen 3.5 2B, Granite 4.2 3B y Qwen 3.5 4B, y muestra los casos en los que un LLM embebido tiene sentido.
#¿Por qué un LLM en Raspberry Pi?
Un Raspberry Pi 5 no va a reemplazar tu RTX 4090. El objetivo no es la velocidad bruta, sino los sistemas embebidos: una placa de 80 € que consume 5-12 W, cabe en una caja del tamaño de una tarjeta de crédito y funciona las 24 horas del día sin ruido. Para casos de uso de computación en el borde —asistente de voz local, estación meteorológica inteligente, quiosco sin conexión, robot móvil— es suficiente e incomparablemente más barato que un mini-PC.
La otra ventaja: la privacidad absoluta. Ningún dato abandona la red local. Puedes montar un asistente familiar en la habitación de un niño sin nube, sin telemetría y sin suscripción.
#Requisitos de hardware
Tu ChatGPT privado y gratuito en tu máquina en 1 hora — LM Studio, Ollama, Open WebUI, tus documentos, sin nube.
- Espacio en línea de por vida
- PDF + archivos
- Reembolsado 30 j
- Raspberry Pi 5 (8 GB obligatorios)
- La versión de 4 GB puede ejecutar Qwen 3.5 2B, pero se queda corta con modelos más grandes. La de 8 GB es el mínimo para trabajar con comodidad. La de 16 GB (lanzada a finales de 2024) abre la puerta a Qwen 3.5 4B sin swap.
- Tarjeta microSD A2 o SSD NVMe
- Una SD A1 ralentiza enormemente la carga inicial del modelo. Lo ideal es un SSD NVMe a través del HAT M.2 oficial: ancho de banda de más de 500 MB/s y carga de Qwen 3.5 4B en 4 s frente a 30 s con una SD.
- Fuente de alimentación oficial de 27 W
- La Pi 5 consume 9-12 W durante la inferencia. La fuente de alimentación oficial USB-C de 5 V/5 A es obligatoria para evitar el throttling. Una fuente de alimentación genérica de 15 W suministra una tensión insuficiente a la placa.
- Enfriamiento activo
- Indispensable. El SoC reduce su frecuencia a partir de 80 °C. Basta con el ventilador oficial (5 €) o una caja Argon ONE V3. Sin disipador, pierdes un 30-40 % de velocidad de generación después de 2 minutos de inferencia.
- Pi OS de 64 bits (Bookworm)
- Raspberry Pi OS de 64 bits basado en Debian 12. Ollama no es compatible con sistemas de 32 bits. Compruébalo con uname -m → debe devolver aarch64.
#1. Instalar Ollama en Pi 5
Ollama soporta oficialmente linux/arm64 desde 2024. El script de instalación universal funciona directamente en Pi OS, sin necesidad de compilación manual.
El script descarga el binario ARM64 (~150 MB), instala un servicio systemd y arranca el daemon en el puerto 11434. Calcula entre 1 y 2 minutos.
#2. Modelos recomendados para Raspberry Pi
En un Pi 5 de 8 GB, tienes aproximadamente 6,5 GB de RAM realmente utilizable (el sistema y su caché ocupan el resto). Cualquier LLM que supere los 4–5 GB con cuantización Q4 es inutilizable: usará la microSD como memoria de intercambio y caerá a 0,1 tok/s.
Tres modelos dan los mejores resultados en Pi 5 en agosto de 2026:
- Qwen 3.5 2B (Alibaba, Apache 2.0)
- El mejor en relación rendimiento/RAM. 1,9 GB en Q4_K_M, multimodal, 256k de contexto, excelente en chats cortos y en francés. Ideal para un asistente sencillo o para el control por voz.
- Granite 4.2 3B (IBM, Apache 2.0)
- Muy ligero en consumo de recursos y eficiente en el uso de tokens. 2,2 GB en Q4_K_M. Un nivel más de calidad en razonamiento, diseñado para funcionar las 24 horas del día sin saturar la RAM. Sólido en múltiples idiomas.
- Qwen 3.5 4B (Alibaba, Apache 2.0)
- El nuevo «modelo pequeño por defecto» y el más capaz de los tres. 3,4 GB en Q4_K_M. Cabe en la RAM de una Pi 5 de 8 GB, pero deja poco margen: no uses una interfaz gráfica pesada en paralelo.
#3. Benchmarks de tokens/s (órdenes de magnitud)
Órdenes de magnitud registrados en una Raspberry Pi 5 de 8 GB, con refrigeración activa oficial, SSD NVMe mediante HAT M.2, Pi OS Bookworm de 64 bits, una versión reciente de Ollama, cuantización Q4_K_M y un prompt para generar 200 tokens. Las cifras varían según la versión de Ollama y las condiciones térmicas: considéralas como órdenes de magnitud, no como valores absolutos.
- Qwen 3.5 2B Q4_K_M
- ≈ 4,4 tokens/s en generación · 6,6 tok/s en evaluación del prompt · 1,9 GB de RAM · 9,6 W
- Granite 4.2 3B Q4_K_M
- ≈ 3,4 tokens/s de generación · 5,1 tok/s de evaluación del prompt · 2,2 GB de RAM · 10,2 W
- Qwen 3.5 4B Q4_K_M
- ≈ 2,3 tokens/s de generación · 3,6 tok/s de evaluación del prompt · 3,4 GB de RAM · 11,2 W
- Gemma 4 E2B (referencia multimodal)
- ≈ 3.9 tokens/seg · 4.3 GB de RAM · 10.4 W. MoE rápido, pero con mayor consumo de RAM.
- Granite 4.2 3B Q3_K_S (variante de bajo consumo de recursos)
- ≈ 3,6 tokens/s · 1,7 GB de RAM · 9,9 W. El más ligero del grupo, ideal si la RAM es limitada (Pi de 4 GB).
La opción --verbose muestra al final de la generación: eval rate (tok/s), prompt eval rate, total duration. Es la medida oficial para comparar.
#4. Casos de uso offline relevantes
A 2-5 tok/s, la inferencia en Pi no está pensada para el chat en tiempo real. Los casos en los que destaca son aquellos en los que la latencia no es crítica, o en los que la confidencialidad y la autonomía importan más que la velocidad.
- Asistente de voz local
- Pi 5 + micrófono USB + Whisper.cpp tiny + Qwen 3.5 2B + Piper TTS. Pregunta → transcripción → respuesta → voz sintetizada, todo en 8-12 s sin nube. Domótica offline, kiosco infantil, robot educativo.
- Resumen de correos o noticias en lote
- Cron job que cada hora descarga los RSS, los resume con Qwen 3.5 4B, y los envía a Telegram/Matrix. El tiempo de inferencia no se nota cuando es asíncrono.
- Clasificación de logs o tickets
- Pi en el borde de red que etiqueta los logs entrantes ('error crítico', 'spam', 'normal') antes de enviarlos a un servidor central. Ahorra ancho de banda WAN.
- Demo integrada / portátil
- Presentación al cliente, taller escolar, conferencia: Pi 5 en el bolsillo, batería USB-C, demo de IA local 100 % autónoma.
- Salvaguarda para otros LLM
- Pequeño modelo local que filtra o reformula un prompt antes de enviarlo a un LLM en la nube. Útil para anonimizar datos sensibles en el entorno edge.
#5. Optimizaciones específicas para Pi
#Reducir la ventana de contexto
Por defecto, Ollama utiliza num_ctx=2048. En Pi, eso ya es mucho: cada token de contexto consume RAM y ralentiza la evaluación previa. Para un asistente de chat con conversaciones breves, baja el valor a 1024.
#Limitar los hilos
Ollama utiliza por defecto todos los núcleos. En Pi 5 (4 núcleos), esto es óptimo en términos de velocidad, pero satura el SoC, lo que provoca una reducción de rendimiento por temperatura al cabo de 1-2 minutos. En un uso prolongado, limitar a 3 núcleos mantiene una tasa de generación estable durante más tiempo.
#Preferir el NVMe a la microSD
La carga inicial de un modelo desde SD lee secuencialmente varios GB. SD A1 → 30-40 s para Phi-3.5 Mini. NVMe → 3-5 s. Una vez en RAM, la inferencia es idéntica.
#Bajar un nivel si falta RAM
En un Pi 5 de 8 GB con la interfaz gráfica activa, Qwen 3.5 4B en Q4_K_M puede empezar a usar memoria de intercambio. Dos opciones: pasar a Granite 4.2 3B (2,2 GB) o Qwen 3.5 2B (1,9 GB), que liberan entre 1 y 1,5 GB de RAM sin que la calidad caiga drásticamente.
#Solución de problemas
- ollama: command not found después de la instalación
- El script systemd ha fallado (a menudo: Pi OS demasiado antiguo). Revisa sudo systemctl status ollama. Si aparece el error 'exec format error', estás en 32 bits — reinstala Pi OS de 64 bits.
- El modelo se carga, pero solo genera 0,3 tok/s
- Estás usando swap. Verifica free -h: si la columna 'available' está por debajo de 500 MB durante la inferencia, tu modelo es demasiado grande. Pasa a Granite 4.2 3B o Qwen 3.5 2B, o cambia a Q3.
- Reducción del rendimiento por temperatura después de 1 minuto
- El SoC ha superado los 80 °C. Comprueba vcgencmd measure_temp durante la inferencia. Solución: ventilador oficial o Argon ONE V3. Sin disipación activa, la Pi 5 no se puede utilizar de forma continua para inferencia.
- Memoria insuficiente a mitad de la generación
- El OOM killer de Linux ha terminado el proceso de Ollama. Reduce num_ctx a 1024, cierra el navegador o pasa a un modelo más pequeño. En una Pi con 4 GB, quédate con Qwen 3.5 2B, el más ligero del catálogo de 2026.
- El servicio Ollama no inicia al arrancar
- sudo systemctl enable ollama pour activer l'autostart. Vérifiez ensuite avec systemctl is-enabled ollama.
#Para ir más allá
Una vez que Ollama esté funcionando en tu Pi 5, hay tres vías naturales para profundizar:
- Comprender la cuantización para ir más lejos
- La guía para elegir la cuantización compara Q3, Q4, Q5 y Q8 en detalle. Es fundamental en una Pi, donde cada 100 MB de RAM cuentan.
- Integrar en una app de Python
- La guía para integrar Ollama en Python a través de la API REST muestra cómo controlar tu Pi 5 desde un script Flask/FastAPI — base de cualquier asistente edge.
- Automatizar flujos de trabajo sin conexión
- La guía para automatizar con n8n y Ollama se aplica directamente en Pi (n8n funciona nativamente en ARM64). Ideal para un hub domótico de IA autónomo.
¿Un comentario, un error, una precisión? Avísanos, eso mejora la guía para todos.