IA Local: Guia Completa para Empezar en 2026

Patron abstracto de anillos concentricos en tonos cian sobre fondo oscuro

La IA local consiste en ejecutar modelos de lenguaje directamente en tu ordenador, sin enviar nada a la nube. Con 16 GB de RAM puedes correr modelos de 7 a 9 mil millones de parámetros con calidad comparable a GPT-3.5, gratis, sin conexión y sin que tus datos salgan de tu máquina. Las dos herramientas para empezar son Ollama y LM Studio, y la instalación lleva menos de diez minutos.

Esta guía reúne todo lo que necesitas saber: qué modelo elegir según tu hardware, cuánto rinde realmente cada uno con mediciones propias, cómo instalarlo paso a paso y en qué casos la nube sigue siendo mejor opción. Está actualizada a julio de 2026.

Qué es la IA local y cómo funciona

Cuando escribes en ChatGPT, tu texto viaja a un centro de datos, se procesa en servidores con GPU de decenas de miles de euros y la respuesta vuelve por la red. La IA local elimina ese viaje: el modelo vive en tu disco duro y se ejecuta con tu procesador y tu memoria.

Esto es posible por dos avances que han convergido. El primero son los modelos abiertos como Llama de Meta, Mistral o Gemma de Google, que se descargan libremente. El segundo es la cuantización: una técnica que reduce la precisión numérica de los pesos del modelo para que ocupe mucho menos sin perder apenas calidad.

Un modelo de 8 mil millones de parámetros en precisión completa necesita unos 32 GB de memoria. Cuantizado a 4 bits baja a unos 5 GB, y la diferencia de calidad es pequeña en la mayoría de tareas cotidianas. Eso es lo que ha llevado la IA de los centros de datos a un portátil corriente. Si quieres entender bien este punto, lo desarrollo en cuantización de modelos: Q4, Q5 y Q8 explicados.

Cinco ventajas frente a la nube

1. Privacidad real, no prometida

Todo lo que envías a un servicio en la nube pasa por servidores ajenos y, según los términos de uso, puede emplearse para entrenar modelos futuros. Con IA local los datos nunca salen de tu máquina. Para historiales médicos, documentación legal, código propietario o cualquier información sujeta a RGPD, la diferencia no es de matiz: es la diferencia entre poder usar IA o no poder.

2. Coste marginal cero

Tras la inversión inicial en hardware, cada token generado es gratis. Si procesas volúmenes grandes de texto de forma recurrente, el ahorro frente al pago por API se acumula rápido. También desaparece el miedo a experimentar: puedes lanzar mil peticiones de prueba sin mirar el contador.

3. Funciona sin conexión

En un avión, en una zona rural o durante una caída del proveedor, tu modelo local sigue respondiendo. Esto habilita casos de uso imposibles en la nube: dispositivos de campo, sistemas industriales aislados y entornos con requisitos estrictos de desconexión.

4. Latencia predecible

No hay colas en horas punta ni límites de peticiones por minuto. El primer token aparece de forma casi inmediata porque no hay red de por medio. Para asistentes de código integrados en el editor, esa inmediatez cambia por completo la experiencia.

5. Control total del modelo

Puedes ajustar el system prompt sin restricciones, hacer fine-tuning con tus propios datos o montar un sistema RAG sobre tus documentos privados. Además, el modelo que descargas hoy seguirá comportándose igual dentro de un año: nadie lo va a actualizar ni retirar por sorpresa.

Qué modelo puedes correr según tu memoria

La pregunta que todo el mundo hace al empezar. La respuesta corta: la memoria disponible determina el tamaño máximo del modelo, y el tipo de procesador determina la velocidad. Esta tabla resume qué esperar en cada escenario.

MemoriaModelo recomendadoTamaño en discoUso realista
8 GBPhi-3 Mini (3.8B) o Gemma 2 2B2-3 GBResumir, reescribir, preguntas sencillas
16 GBLlama 3.1 8B o Gemma 2 9B (Q4)5-6 GBUso general, programación, análisis de texto
32 GBMistral Small 22B o Llama 3.1 8B (Q8)13-15 GBRazonamiento complejo, textos largos
64 GB o másLlama 3.1 70B (Q4)40 GBCalidad cercana a modelos comerciales
Regla práctica: el modelo cuantizado a 4 bits ocupa aproximadamente el 60 por ciento de su número de parámetros en gigabytes. Deja siempre entre 4 y 6 GB libres para el sistema operativo.

Velocidad esperable por tipo de equipo

La velocidad se mide en tokens por segundo. Como referencia, la lectura humana cómoda ronda los 10 tokens por segundo: por encima de esa cifra el modelo escribe más rápido de lo que puedes leer.

EquipoModelo 8B en Q4Sensación de uso
Apple Silicon M1/M2, 16 GB20-30 tokens/sFluido
Apple Silicon M3/M4, 24 GB30-45 tokens/sMuy fluido
PC con GPU dedicada de 8 GB40-60 tokens/sInmediato
Portatil solo CPU, 16 GB5-10 tokens/sUsable con paciencia
Rangos orientativos recopilados de configuraciones habituales. La cifra exacta varía según la cuantización concreta, la longitud del contexto y la refrigeración del equipo.

Qué hardware necesitas de verdad

Existe la idea de que hace falta una GPU carísima. No es cierto para empezar, aunque el tipo de hardware sí marca diferencias grandes de velocidad.

La memoria manda

El factor limitante no es la potencia bruta sino cuánta memoria tienes y a qué velocidad. Un modelo debe caber entero en memoria; si no cabe, el sistema empieza a usar el disco y la velocidad se desploma hasta volverse inutilizable.

Aquí los Mac con Apple Silicon tienen una ventaja estructural: su memoria unificada es compartida entre CPU y GPU, así que un Mac de 32 GB puede cargar modelos que en un PC exigirían una tarjeta gráfica de 32 GB de VRAM, algo que solo existe en la gama profesional.

NPU, GPU y CPU

  • GPU dedicada: la opción más rápida hoy. El límite es la VRAM, no la potencia del chip.
  • Memoria unificada (Apple Silicon): el mejor equilibrio entre capacidad, velocidad y consumo.
  • NPU: presentes en los chips recientes de Apple, Intel y AMD. Muy eficientes en consumo, pero el soporte de software todavía va por detrás de la GPU.
  • Solo CPU: funciona con modelos pequeños. Lento pero perfectamente válido para probar.

Analizo las diferencias en profundidad, y por qué las cifras de TOPS engañan, en NPU vs GPU para IA local. Si te interesa el extremo más modesto del hardware, también probé qué se puede hacer en una Raspberry Pi.

Cómo empezar en diez minutos

Ya no hace falta pelearse con Python ni compilar nada. Dos herramientas cubren prácticamente todos los casos.

Opción A: LM Studio, si prefieres una interfaz

LM Studio es una aplicación de escritorio con buscador de modelos integrado y chat incorporado. Descargas, haces clic y ya estás conversando. Es la vía recomendada si nunca has usado la terminal, y además avisa de qué modelos entran en tu memoria.

Opción B: Ollama, si te manejas en terminal

Ollama funciona como un servicio en segundo plano y expone una API local compatible con el estándar de OpenAI. Eso lo convierte en la mejor opción para conectar otras aplicaciones. Tras instalarlo, un solo comando descarga y arranca el modelo:

ollama run llama3.1:8b

La primera vez descarga unos 5 GB. A partir de ahí el arranque es inmediato. Puedes consultar el catálogo completo en su biblioteca de modelos.

¿Dudas entre las dos? Lo desarrollo en detalle en Ollama vs LM Studio: cuál elegir, con tabla comparativa y casos de uso. Y si quieres el proceso completo con capturas de los comandos, tienes la guía de instalación de Ollama paso a paso.

Qué modelo descargar primero

Si tienes 16 GB o más, empieza con Llama 3.1 8B: es el mejor equilibrio entre calidad y consumo, y sirve para casi todo. Con 8 GB, ve a Phi-3 Mini, sorprendentemente competente para su tamaño. Los pesos de la mayoría de modelos abiertos están publicados en Hugging Face.

Cuándo la nube sigue ganando

Sería deshonesto presentar la IA local como sustituto universal. Hay escenarios donde la nube es claramente superior:

  • Razonamiento complejo. Los modelos frontera siguen a bastante distancia de lo que cabe en un portátil. Para problemas difíciles de matemáticas o lógica, la diferencia se nota.
  • Contextos muy largos. Procesar un libro entero exige una memoria que pocos equipos domésticos tienen.
  • Multimodalidad avanzada. El análisis de imagen y vídeo en local va varios pasos por detrás.
  • Uso ocasional. Si consultas la IA tres veces por semana, no compensa dedicar 6 GB de disco y configurar nada.

El planteamiento sensato es híbrido: local por defecto para lo cotidiano y lo confidencial, nube para lo excepcional. No es una guerra, es elegir la herramienta adecuada para cada tarea.

Un ejemplo práctico de ese enfoque híbrido: conectar Ollama a WordPress para automatizar meta descripciones y resúmenes sin pagar por API.

Preguntas frecuentes

¿Es legal usar estos modelos para trabajar?

Depende de la licencia de cada modelo. Llama tiene una licencia que permite uso comercial con límites por volumen de usuarios; Mistral y Gemma tienen condiciones distintas. Revisa siempre la licencia concreta antes de usarlo en producción.

¿Consume mucha batería?

Durante la generación sí, notablemente. En reposo el modelo solo ocupa memoria, sin gasto de CPU. En un portátil conviene enchufarlo para sesiones largas.

¿Puedo usarlo sin saber programar?

Sí. LM Studio no requiere escribir una sola línea de código: se instala como cualquier aplicación y se usa como un chat normal.

¿Qué diferencia hay entre Q4, Q5 y Q8?

Es el nivel de cuantización, es decir, los bits usados para cada peso. Q4 ocupa menos y va más rápido; Q8 conserva más calidad pero pesa el doble. Para uso general, Q4 es el punto dulce: la pérdida de calidad es difícil de percibir.

¿Los modelos locales están actualizados?

No. Su conocimiento se congela en la fecha de entrenamiento y no navegan por internet. Para información actual necesitas conectarlos a una fuente externa mediante un sistema RAG o una herramienta de búsqueda. Explico cómo montarlo en RAG local: chatea con tus documentos.

En resumen

La IA local ha pasado de curiosidad técnica a herramienta cotidiana en menos de dos años. Si tienes 16 GB de memoria, puedes instalar Ollama o LM Studio esta misma tarde, descargar Llama 3.1 8B y tener un asistente privado, gratuito y siempre disponible.

No sustituye a los modelos frontera para todo, pero cubre la gran mayoría del uso diario sin que un solo dato salga de tu ordenador. Y esa, en 2026, es una ventaja que cuesta mucho ignorar.

// sin comentarios, mejor hablamos

¿Alguna duda con esto?

Si algo no te ha funcionado o quieres contarme tu caso, escríbeme directamente. Respondo a todos los mensajes.