Instalar Ollama y tener un modelo de IA funcionando en tu ordenador lleva menos de diez minutos: descargas el instalador de su web, ejecutas un comando y ya estás conversando con un modelo que corre íntegramente en tu máquina. No hace falta saber programar ni configurar nada.
Esta guía cubre la instalación en Windows, macOS y Linux, los comandos que vas a usar de verdad y los errores habituales de las primeras veces. Para el contexto general, consulta la guía de IA local.
Instalación según tu sistema
Descarga el instalador desde la página oficial de Ollama. Evita descargarlo de otras fuentes.
macOS y Windows
Se instala como cualquier aplicación: descargas, abres y sigues el asistente. Al terminar, Ollama queda funcionando como servicio en segundo plano y verás su icono en la barra de menú o en la bandeja del sistema.
En Windows necesitas Windows 10 o superior. En macOS, cualquier Mac con Apple Silicon funciona de maravilla; los Intel también, aunque bastante más despacio.
Linux
Un solo comando se encarga de todo, incluida la detección de GPU:
curl -fsSL https://ollama.com/install.sh | sh
Conviene revisar el contenido del script antes de ejecutarlo, como con cualquier instalación de este tipo. Tras instalarlo, verifica que responde:
ollama --version
Tu primer modelo
Un solo comando descarga el modelo y abre el chat. Si tienes 16 GB de RAM o más:
ollama run llama3.1:8b
Si tienes 8 GB, empieza por un modelo más ligero:
ollama run phi3:mini
La primera vez descarga entre 2 y 5 GB según el modelo. Cuando termine aparecerá un prompt donde puedes escribir directamente. Para salir, teclea /bye.
A partir de la segunda vez el arranque es casi inmediato, porque el modelo ya está en tu disco. Si no sabes cuál elegir, la tabla de modelos por memoria lo resuelve en un vistazo.
Comandos que vas a usar
| Comando | Para que sirve |
|---|---|
ollama list | Ver los modelos que tienes descargados |
ollama run modelo | Chatear con un modelo |
ollama pull modelo | Descargar sin abrir el chat |
ollama rm modelo | Borrar un modelo y liberar espacio |
ollama ps | Ver que modelos estan cargados en memoria |
ollama serve | Arrancar el servidor manualmente |
Un aviso práctico: los modelos ocupan bastante y es fácil acumular varios sin darse cuenta. Revisa ollama list de vez en cuando y borra los que no uses.
Añadir una interfaz gráfica
Chatear en la terminal funciona, pero se queda corto: no guarda conversaciones cómodamente ni permite adjuntar archivos. La solución habitual es añadir una interfaz web por encima de Ollama.
Open WebUI es la más extendida. Detecta tu Ollama automáticamente y ofrece una experiencia muy parecida a la de ChatGPT, con historial, múltiples conversaciones y posibilidad de subir documentos.
Si prefieres no montar nada adicional, LM Studio ya incluye su propia interfaz. Comparo ambos enfoques en ese artículo.
Problemas habituales
Va muy lento
Casi siempre significa que el modelo no cabe en memoria y el sistema está recurriendo al disco. Prueba un modelo más pequeño o cierra aplicaciones. Comprueba con ollama ps cuánta memoria está usando.
No usa mi tarjeta gráfica
En Linux y Windows suele faltar el controlador correcto o la versión necesaria del kit de desarrollo. Ollama informa al arrancar de qué acelerador ha detectado: si dice que usa CPU teniendo GPU, ahí está el problema. En Mac con Apple Silicon la GPU se usa siempre sin configurar nada.
El puerto 11434 está ocupado
Significa que Ollama ya está corriendo, probablemente como servicio. No necesitas ejecutar ollama serve a mano: comprueba que responde consultando su API.
Se me llena el disco
Normal tras probar varios modelos. Cada uno ocupa entre 2 y 40 GB. Usa ollama list para verlos y ollama rm para eliminar los que no necesites.
Preguntas frecuentes
¿Consume recursos cuando no lo uso?
Muy pocos. El servicio queda a la escucha sin gastar CPU. Los modelos se descargan de memoria tras unos minutos de inactividad, liberando la RAM automáticamente.
¿Dónde se guardan los modelos?
En una carpeta oculta del perfil de usuario. Se puede cambiar mediante una variable de entorno, algo útil si quieres guardarlos en un disco externo por espacio.
¿Puedo usarlo sin conexión?
Sí, una vez descargado el modelo. Solo necesitas internet para la descarga inicial; después funciona completamente aislado.
¿Envía datos a algún servidor?
Las conversaciones no salen de tu equipo. Ollama contacta con sus servidores únicamente para descargar modelos y comprobar actualizaciones, nunca para procesar tus prompts.
¿Cómo lo conecto a otras aplicaciones?
Ollama expone una API local compatible con el estándar de OpenAI en http://localhost:11434/v1. Cualquier herramienta preparada para ChatGPT puede apuntar ahí. Un ejemplo práctico: conectarlo a WordPress.
Siguientes pasos
Con Ollama instalado y un modelo descargado ya tienes IA privada funcionando. A partir de aquí hay tres caminos interesantes.
Añadir Open WebUI para una experiencia más cómoda, montar un RAG local para consultar tus propios documentos, o entender la cuantización para elegir mejor tus próximas descargas.
