NPU vs GPU para IA Local: Que Importa de Verdad

Patron abstracto de lineas diagonales tipo circuito en cian sobre fondo oscuro

Para ejecutar modelos de lenguaje en 2026, la GPU sigue ganando por velocidad y la memoria unificada de Apple gana por capacidad. La NPU es la más eficiente en consumo, pero su soporte de software para LLM aún va por detrás. Si compras hoy pensando en IA local, prioriza cantidad de memoria antes que potencia bruta.

Los fabricantes llevan dos años anunciando NPU en cada procesador nuevo con cifras de TOPS que suenan impresionantes. Conviene saber qué significan de verdad y cuánto importan para ejecutar modelos en casa. Este artículo complementa la guía de IA local.

Qué hace cada uno

CPU: el generalista

Pocos núcleos muy potentes y flexibles. Puede ejecutar modelos, pero lo hace de forma ineficiente: las operaciones de IA son miles de multiplicaciones simultáneas, y la CPU está diseñada para resolver tareas complejas en secuencia, no muchas simples a la vez.

GPU: la fuerza bruta paralela

Miles de núcleos simples trabajando en paralelo. Nació para calcular píxeles, pero resulta que renderizar gráficos y ejecutar redes neuronales requieren la misma operación matemática de base. De ahí que la GPU sea hoy el estándar para IA.

Su límite real no es la potencia sino la VRAM: si el modelo no cabe en la memoria de la tarjeta, no hay velocidad que lo salve.

NPU: la eficiencia

Un circuito dedicado exclusivamente a operaciones de redes neuronales. Hace menos cosas que una GPU, pero las que hace las hace gastando una fracción de la energía. Está pensada para tareas continuas en segundo plano: desenfocar el fondo en videollamadas, transcribir voz, filtrar fotos.

Memoria unificada: el caso de Apple

Los chips M de Apple comparten una sola memoria entre CPU, GPU y NPU. Eso elimina la copia de datos entre memorias separadas y, sobre todo, significa que toda la RAM está disponible para el modelo. Un Mac de 64 GB puede cargar modelos que en PC exigirían una tarjeta gráfica profesional de coste muy superior.

Comparativa para ejecutar LLM

AspectoGPU dedicadaMemoria unificadaNPUSolo CPU
VelocidadMuy altaAltaMediaBaja
Memoria util8-24 GB16-192 GBComparte RAMToda la RAM
ConsumoAltoBajoMuy bajoMedio
Soporte para LLMExcelenteExcelenteLimitadoBueno
Modelo maximo viable13B-30BHasta 70B+Modelos pequenos7B-13B lento
El soporte de software es tan determinante como el hardware: una NPU potente sin herramientas que la usen no aporta nada al ejecutar un LLM.

La letra pequeña de los TOPS

Los fabricantes miden sus NPU en TOPS, billones de operaciones por segundo. Es una cifra llamativa y bastante engañosa por dos razones.

La primera: generar texto no está limitado por cálculo sino por memoria. Para producir cada palabra, el sistema debe leer los pesos del modelo desde la memoria. El cuello de botella es la velocidad a la que puede leerlos, no la capacidad de calcular. Una NPU con muchos TOPS pero acceso lento a memoria no rinde más.

La segunda: el software manda. Ollama y LM Studio están muy optimizados para GPU y para Apple Silicon. El soporte de NPU en Windows depende de que cada aplicación lo implemente, y a día de hoy la mayoría de herramientas de IA local no lo aprovechan. Tienes el hardware, pero nada lo usa.

Esto cambiará, y probablemente rápido. Pero si compras hoy pensando en ejecutar modelos, la NPU no debería ser el factor decisivo.

Qué comprar según tu objetivo

Una única regla por encima de todo: prioriza cantidad de memoria sobre potencia. Un modelo que no cabe no se ejecuta, por muy rápido que sea el chip.

  • Presupuesto ajustado: cualquier equipo con 16 GB de RAM. Modelos de 8B funcionan bien, aunque sea solo con CPU.
  • Portabilidad y autonomía: Mac con Apple Silicon y 24 GB o más. La mejor relación entre capacidad, velocidad y batería.
  • Máxima velocidad: PC con GPU dedicada de 16 GB de VRAM o más. Imbatible en rapidez, a costa de consumo y ruido.
  • Modelos muy grandes: Mac con 64 GB o más de memoria unificada. Es la vía más accesible para mover un 70B.

Antes de decidir, comprueba en la tabla de memoria y modelos qué puedes ejecutar en cada configuración, y ten en cuenta que la cuantización cambia bastante la ecuación: reduce el tamaño necesario unas cuatro veces.

Preguntas frecuentes

¿Merece la pena comprar un equipo con NPU?

Como criterio principal para LLM, hoy no. Como extra que ganará utilidad con el tiempo y ya sirve para funciones del sistema, sí. No pagues un sobreprecio solo por la NPU si tu objetivo es ejecutar modelos de lenguaje.

¿Puedo usar GPU y CPU a la vez?

Sí. Se llama descarga parcial de capas: metes en la GPU las que caben y el resto las procesa la CPU. Funciona, pero cada capa fuera de la GPU cuesta velocidad. Ollama y LM Studio lo gestionan de forma automática.

¿Mejor una GPU antigua con mucha VRAM o una nueva con poca?

Para LLM, casi siempre la de más VRAM. Poder cargar el modelo entero importa más que la arquitectura del chip. Es el motivo de que tarjetas de generaciones anteriores con 24 GB sigan siendo muy apreciadas.

¿Cuánta memoria dejo libre para el sistema?

Entre 4 y 6 GB. Si el modelo ocupa toda la memoria, el sistema empieza a usar el disco como memoria virtual y el rendimiento se hunde.

En resumen

Ignora las cifras de TOPS de los anuncios y fíjate en cuánta memoria tiene el equipo y a qué velocidad accede a ella. Ese es el dato que determina qué modelos puedes ejecutar.

GPU si buscas velocidad, Apple Silicon si buscas capacidad y autonomía, y NPU como una promesa que aún está madurando en el terreno de los modelos de lenguaje.

// sin comentarios, mejor hablamos

¿Alguna duda con esto?

Si algo no te ha funcionado o quieres contarme tu caso, escríbeme directamente. Respondo a todos los mensajes.