Ejecutar un LLM en local ya no es un capricho de laboratorio. Con Llama 3, Mistral, DeepSeek Coder o Phi-3 corriendo desde tu propio portátil, ganas privacidad, latencia baja y cero factura de API. Pero también entras en un terreno donde el marketing —sobre todo el de la palabra "IA" pegada a cualquier NPU— confunde más que aclara. Vamos a lo que importa: cuánta memoria necesitas, qué papel juega cada chip y qué portátiles a la venta en España cumplen sin que pagues de más.
Qué significa "ejecutar un LLM en local" en 2026
Un modelo cuantizado a 4 bits (formato GGUF o similar, que es lo que usa la mayoría de la gente con llama.cpp, LM Studio u Ollama) ocupa aproximadamente medio byte por parámetro. De ahí sale la regla que interesa memorizar:
- 7B parámetros → ~4-5 GB. Cabe en 8 GB de VRAM o RAM unificada con margen.
- 13B → ~8 GB. Necesitas 12-16 GB libres para trabajar cómodo.
- 30-34B → ~18-22 GB. Aquí ya hablamos de 24-32 GB.
- 70B → ~40 GB en Q4. Sin 64 GB de memoria unificada o dos GPUs, ni te acerques.
Sin cuantizar (FP16), multiplica por cuatro. Nadie con un portátil corre un 70B en FP16, así que la referencia útil es Q4/Q5.
NPU, GPU dedicada y memoria unificada: qué hace cada una
La NPU que llevan los Copilot+ PC (Intel Core Ultra, AMD Ryzen AI, Snapdragon X) está pensada para tareas ligeras y sostenidas: transcripción, efectos de cámara, pequeños modelos de <3B. Para inferencia de un 13B a velocidad decente, la NPU actual no te sirve. Punto. Es un acelerador para el sistema operativo, no un sustituto de GPU.
La GPU dedicada (NVIDIA RTX 40 Mobile) manda cuando quieres velocidad bruta y tienes el modelo cargado en VRAM. El problema es el techo: una RTX 4070 Mobile trae 8 GB, una 4080 Mobile 12 GB, una 4090 Mobile 16 GB. Ese número es tu límite duro para lo que carga en GPU.
La memoria unificada de Apple Silicon rompe esa lógica. Un M4 Pro con 48 GB puede dedicar prácticamente toda esa memoria al modelo, porque CPU y GPU comparten el mismo pool. Es más lenta en tokens/s que una RTX 4090 con el modelo dentro, pero te permite cargar modelos que a la NVIDIA no le entran. Para un 70B Q4, hoy por hoy, Apple es la vía razonable en formato portátil.
Cinco portátiles que tienen sentido según el modelo que vas a correr
1. Apple MacBook Pro M4 Pro 14" (48 GB) — el todoterreno de LLMs medianos
Para quien quiere correr 13B y 30B sin dramas, es la opción menos problemática. 48 GB de memoria unificada dan margen para un DeepSeek Coder 33B en Q4 con contexto amplio, y macOS con Ollama funciona sin tocar drivers. No es el más rápido en tokens/s puros —una RTX 4090 Mobile le gana con un 13B cargado en VRAM—, pero llega donde la NVIDIA no llega. Autonomía real de 12-14 horas en tareas normales, algo impensable en cualquier portátil con GPU dedicada.
| Especificación | Detalle |
|---|---|
| Pantalla | 14,2″ Liquid Retina XDR 3024×1964 |
| Chip | Apple M4 Pro (12 CPU / 16 GPU) |
| Memoria unificada | 48 GB |
| SSD | 512 GB / 1 TB |
| Autonomía real | 12-14 h uso normal, 2-3 h en inferencia sostenida |
| Peso | 1,55 kg |
| SO | macOS Sequoia |
| Precio desde | 2.729 € |
2. ASUS ROG Zephyrus G14 (2024) con RTX 4070 — el equilibrio para 7B/13B rápidos
Si tu caso son modelos hasta 13B y quieres velocidad de generación alta, una RTX 4070 Mobile de 8 GB con 32 GB de RAM DDR5 hace el trabajo. Un Mistral 7B Q4 vuela; un 13B Q4 te obligará a hacer offload parcial a CPU, con la penalización que eso implica. Pantalla OLED 3K, 1,5 kg, chasis serio. Como referencia de rendimiento en LLMs locales, canales como Alex Ziskind han publicado comparativas de tokens/s entre RTX 40 Mobile y Apple Silicon que confirman esta división de terreno.
| Especificación | Detalle |
|---|---|
| Pantalla | 14″ OLED 2880×1800 120 Hz |
| Procesador | AMD Ryzen 9 8945HS |
| RAM | 32 GB DDR5-5600 |
| GPU | NVIDIA RTX 4070 Mobile 8 GB VRAM |
| SSD | 1 TB PCIe 4.0 |
| Autonomía real | 7-9 h ofimática, ~1,5 h en carga GPU |
| Peso | 1,5 kg |
| SO | Windows 11 |
| Precio desde | 1.999 € |
3. Lenovo ThinkPad P16 Gen 2 con RTX 4090 Mobile — cuando quieres VRAM y no te importa el peso
16 GB de VRAM te dejan cargar un 13B Q4 entero en GPU, o un 30B con offload. Es la vía "workstation portátil" clásica: 2,95 kg, ventilación agresiva, teclado ThinkPad. No lo compras si vas a moverlo mucho. Sí lo compras si el portátil sustituye a una torre.
| Especificación | Detalle |
|---|---|
| Pantalla | 16″ IPS 2560×1600 |
| Procesador | Intel Core i9-13980HX / Xeon |
| RAM | 64 GB DDR5 ECC (ampliable a 192 GB) |
| GPU | NVIDIA RTX 4090 Mobile 16 GB VRAM |
| SSD | 1 TB PCIe 4.0 |
| Autonomía real | 4-6 h ofimática |
| Peso | 2,95 kg |
| SO | Windows 11 Pro / Ubuntu certificado |
| Precio desde | 3.499 € |
4. Apple MacBook Pro M4 Max 16" (64 GB) — la única vía sensata para 70B en portátil
Aquí es donde la memoria unificada gana sin discusión. 64 GB te permiten cargar un Llama 3.1 70B Q4 con contexto útil, algo que ningún portátil x86 comercial hace hoy. Velocidad de ~6-8 tokens/s en 70B según pruebas publicadas por varios canales técnicos: usable para código y análisis, no para chat interactivo fluido. Es un gasto serio y solo se justifica si de verdad vas a trabajar con modelos de esa escala.
| Especificación | Detalle |
|---|---|
| Pantalla | 16,2″ Liquid Retina XDR 3456×2234 |
| Chip | Apple M4 Max (16 CPU / 40 GPU) |
| Memoria unificada | 64 GB (ampliable a 128 GB) |
| SSD | 1 TB |
| Autonomía real | 10-13 h uso normal |
| Peso | 2,14 kg |
| SO | macOS Sequoia |
| Precio desde | 4.279 € |
5. Framework Laptop 16 con Radeon RX 7700S — la apuesta reparable
Módulos intercambiables, RAM soldada no, Linux de primera. La GPU AMD tiene menos soporte que NVIDIA para inferencia (ROCm sigue siendo irregular), pero con llama.cpp compilado con Vulkan funciona razonablemente bien para 7B/13B. Elección de nicho para quien prioriza reparabilidad y control sobre rendimiento máximo.
| Especificación | Detalle |
|---|---|
| Pantalla | 16″ 2560×1600 165 Hz |
| Procesador | AMD Ryzen 7 7840HS |
| RAM | 32 GB DDR5 (ampliable a 96 GB) |
| GPU | AMD Radeon RX 7700S 8 GB VRAM |
| SSD | 1 TB (ampliable, doble ranura) |
| Autonomía real | 6-8 h ofimática |
| Peso | 2,1 kg |
| SO | Windows 11 / Linux |
| Precio desde | 2.199 € |
Y los Copilot+ PC con NPU, ¿qué?
Modelos como el HP OmniBook Ultra 14 (Ryzen AI 9 HX 375, 55 TOPS de NPU), el Acer Swift 16 AI o el MSI Prestige 16 AI Evo venden la NPU como argumento estrella. En la práctica, para ejecutar Llama o Mistral en local, esos TOPS no se aprovechan hoy en llama.cpp ni Ollama de forma seria. Sirven para funciones de Windows (Recall, subtítulos en vivo, efectos de Studio) y para modelos muy pequeños (Phi-3-mini, algún 3B). Si tu caso real es correr un 13B, un portátil con RTX 4060/4070 te dará mucho más por el mismo dinero. Que quede claro: la NPU no es humo, pero hoy no sustituye a una GPU para LLMs de tamaño medio.
Alternativas de segunda mano que sí compensan
Un MacBook Pro M2 Max de 2023 con 64 GB en el mercado de reacondicionado ronda los 2.400-2.800 €, y ejecuta los mismos modelos que el M4 Max con un 20-30% menos de velocidad. Para 70B Q4 sigue siendo funcional. Igualmente, un Lenovo Legion o ASUS ROG con RTX 3080 Ti Mobile de 16 GB de 2022-2023 se encuentra desde 1.200 € y da más VRAM que muchas RTX 40 Mobile nuevas. Si el objetivo es cacharrear y aprender, ahorro sustancial sin perder capacidad.
Comparativa y puntuación
Puntuación pensada específicamente para el caso "programar con LLMs en local", no como valoración global del portátil. Si buscas contexto más amplio, ya cubrimos el terreno general en nuestra guía sobre portátiles para trabajar con IA en local sin pasarte de presupuesto.
| Modelo | Memoria útil para LLM | Modelo máximo cómodo | Autonomía | Precio | Nota /10 |
|---|---|---|---|---|---|
| Apple MacBook Pro M4 Pro 14″ 48 GB | 48 GB unificada | 30B Q4 | 12-14 h | 2.729 € | 9,0 |
| ASUS ROG Zephyrus G14 (RTX 4070) | 8 GB VRAM + 32 GB RAM | 13B Q4 con offload | 7-9 h | 1.999 € | 7,8 |
| Lenovo ThinkPad P16 (RTX 4090 Mobile) | 16 GB VRAM + 64 GB RAM | 30B Q4 con offload | 4-6 h | 3.499 € | 8,2 |
| Apple MacBook Pro M4 Max 16″ 64 GB | 64 GB unificada | 70B Q4 | 10-13 h | 4.279 € | 9,3 |
| Framework Laptop 16 (RX 7700S) | 8 GB VRAM + 32 GB RAM | 13B Q4 (Vulkan) | 6-8 h | 2.199 € | 6,8 |
Qué elegir según tu perfil
- Trabajas sobre todo con 7B/13B y quieres velocidad: ASUS ROG Zephyrus G14 con RTX 4070. Barato relativo, rápido en su rango.
- Necesitas 30B como techo y valoras autonomía: MacBook Pro M4 Pro con 48 GB. La opción menos frustrante.
- Vas en serio con 70B o modelos multimodales grandes: MacBook Pro M4 Max con 64 GB. Caro, pero no hay alternativa portátil real.
- Sustituyes torre por portátil y no te mueves: ThinkPad P16 con RTX 4090 Mobile. VRAM y RAM ampliables.
- Prima ideología (reparabilidad, Linux) sobre rendimiento: Framework Laptop 16.
Si además vas a apoyarte en asistentes en la nube para tareas donde el modelo local se queda corto, tiene sentido combinar. Sobre eso escribimos

1 comentario
Pingback: Qué portátil comprar para trabajar con IA generativa en la nube sin gastar en GPU – Compra Tecnología Inteligente