Sí, una Raspberry Pi 5 puede ejecutar modelos de lenguaje, pero con expectativas ajustadas: espera entre 2 y 5 palabras por segundo con modelos de 3B. No sirve para chatear con comodidad, sí para automatizaciones donde la velocidad no importa y el consumo de 5 vatios sí.
Este artículo explica qué se puede hacer de forma realista, cómo montarlo y en qué casos tiene sentido frente a usar el ordenador de siempre. Es un caso particular de lo que cubre la guía de IA local.
Expectativas realistas
Empecemos por lo honesto, porque hay mucho contenido que exagera lo que consigue una Pi. Una Raspberry Pi 5 no tiene GPU aprovechable para IA ni NPU: todo se ejecuta en la CPU, y la memoria es notablemente más lenta que en un ordenador de escritorio.
| Modelo | RAM necesaria | Velocidad aprox. | Viable |
|---|---|---|---|
| Qwen2 0.5B | 1 GB | 10-15 tokens/s | Si, fluido |
| Gemma 2 2B | 2,5 GB | 4-7 tokens/s | Si, con paciencia |
| Phi-3 Mini 3.8B | 3 GB | 2-4 tokens/s | Limite practico |
| Llama 3.1 8B | 5,5 GB | Menos de 1 token/s | No recomendable |
Para situar esas cifras: la lectura humana cómoda ronda los 10 tokens por segundo. A 3 tokens por segundo verás aparecer las palabras de una en una, con pausas. Es perfectamente válido para un proceso automatizado, incomodo para conversar.
Necesitas el modelo de 8 GB de RAM. Con 4 GB solo entran modelos por debajo de 2B, y con 2 GB no merece la pena intentarlo.
Instalación paso a paso
Ollama funciona en ARM de 64 bits, así que el proceso es el mismo que en cualquier Linux. Asegúrate de usar Raspberry Pi OS de 64 bits: con la versión de 32 bits no funcionará.
curl -fsSL https://ollama.com/install.sh | sh
Comprueba primero que estás en 64 bits:
uname -m
Debe devolver aarch64. Si devuelve armv7l, estás en 32 bits y necesitas reinstalar el sistema.
Después, descarga un modelo pequeño para la primera prueba:
ollama run gemma2:2b
El detalle que más influye: usa SSD
Arrancar desde un SSD por USB 3.0 en lugar de una microSD es la mejora más rentable. Los modelos pesan varios gigabytes y hay que leerlos completos al cargarlos: con microSD la carga inicial puede tardar minutos. También evita que la tarjeta se degrade por escrituras.
Qué modelos elegir
En una Pi la regla cambia respecto a un ordenador normal: aquí el modelo más pequeño que resuelva tu tarea es el correcto. No busques calidad máxima, busca que termine en un tiempo razonable.
- Qwen2 0.5B: sorprendentemente capaz para clasificar texto o extraer datos. El único que resulta ágil de verdad.
- Gemma 2 2B: el equilibrio recomendado. Redacta con corrección y aguanta instrucciones sencillas.
- Phi-3 Mini: el más competente que entra, pero ya en el límite de la paciencia.
Usa siempre cuantización Q4. En un equipo tan limitado, la diferencia de calidad frente a Q5 no compensa el coste en velocidad y memoria. Lo explico en detalle en el artículo sobre cuantización.
Para qué tiene sentido de verdad
La pregunta correcta no es si una Pi puede ejecutar un LLM, sino cuándo tiene sentido usarla en lugar de tu ordenador. La respuesta está en tres características suyas: consume unos 5 vatios, cabe en cualquier sitio y puede estar encendida todo el año.
- Domótica con lenguaje natural. Interpretar órdenes habladas y traducirlas a comandos, sin depender de servicios en la nube.
- Clasificar texto entrante. Etiquetar correos, mensajes o incidencias según su contenido, de forma continua.
- Resúmenes programados. Procesar por la noche lo acumulado durante el día: la lentitud es irrelevante si nadie espera.
- Entornos sin internet. Instalaciones aisladas donde la nube simplemente no es una opción.
- Aprender. Un laboratorio barato para entender cómo funciona todo esto sin tocar tu equipo principal.
El patrón común: tareas asíncronas donde nadie espera la respuesta en pantalla. Para eso, 3 tokens por segundo funcionando sin parar valen más que 40 tokens por segundo en un portatil que se apaga.
Cómo sacarle más partido
- Refrigeración activa. Sin ventilador, la Pi 5 reduce su frecuencia al calentarse y pierde rendimiento justo cuando más lo necesitas. Un disipador con ventilador es casi obligatorio.
- Reduce la ventana de contexto. Menos contexto significa menos memoria y más velocidad. Si tus prompts son cortos, no necesitas el máximo.
- Mantén el modelo cargado. Cargarlo desde disco es lo más lento del proceso. Si vas a hacer varias consultas, evita que se descargue de memoria entre una y otra.
- Fuente de alimentación oficial. Con un cargador insuficiente la Pi limita su rendimiento de forma silenciosa y cuesta diagnosticarlo.
- Prompts breves y directos. Cada palabra del prompt también hay que procesarla. En hardware limitado, la concisión se nota.
Preguntas frecuentes
¿Sirve una Raspberry Pi 4?
Funciona, pero aproximadamente a la mitad de velocidad que la Pi 5. Con la versión de 8 GB puedes ejecutar modelos de 2B de forma testimonial. Para uso práctico, la Pi 5 es el mínimo razonable.
¿Ayudan los aceleradores USB?
Los aceleradores tipo Coral están diseñados para visión por computador, no para modelos de lenguaje: no tienen memoria suficiente ni soporte para este tipo de arquitectura. No mejoran la generación de texto.
¿Puedo servir el modelo a otros dispositivos de casa?
Sí, y es uno de los montajes más interesantes: la Pi actúa como servidor de IA de la red local y cualquier dispositivo le consulta por su API. Eso sí, todas las peticiones compiten por la misma CPU limitada.
¿Cuánta electricidad gasta?
Entre 5 y 8 vatios bajo carga. Encendida todo el año supone un gasto muy bajo, y esa es precisamente su gran ventaja frente a dejar un PC encendido.
En resumen
Una Raspberry Pi 5 de 8 GB con SSD ejecuta modelos de hasta 3B a una velocidad modesta pero utilizable para automatizaciones.
No la compres esperando un ChatGPT doméstico. Cómprala si quieres un servidor de IA que consuma 5 vatios, funcione sin internet y pueda estar encendido siempre. Para ese papel concreto, es difícil de superar.
