¿Cuánta VRAM necesitas para ejecutar LLMs localmente?
La principal pregunta al ejecutar un LLM local es simple: ¿cabe en tu GPU? La respuesta depende del tamaño del modelo, la cuantización y la longitud del contexto. Esta guía te ofrece un punto de partida práctico para elegir la cantidad adecuada de VRAM.
Cómo afecta la cuantización a la VRAM
La cuantización reduce la precisión utilizada para almacenar los pesos del modelo. Una cuantización de menor número de bits hace que el modelo sea más pequeño y use menos VRAM, con una cierta pérdida de calidad.
| Cuantización | Bits por peso | Uso típico |
|---|---|---|
| Q8_0 | 8 | Muy alta calidad |
| Q6_K | ~6.6 | Muy buena calidad |
| Q5_K_M | ~5.5 | Buena calidad y tamaño |
| Q4_K_M | ~4.5 | Buena proporción entre tamaño y calidad |
| Q3_K_M | ~3.5 | Menos VRAM, mayor pérdida de calidad |
Q4_K_M es una opción común cuando la VRAM es limitada. Si tienes más VRAM disponible, Q5 o Q6 te permiten ejecutar el mismo modelo con menos cuantización.
VRAM aproximada según el tamaño del modelo
Estas son estimaciones aproximadas para los pesos del modelo. La cantidad real de VRAM requerida es mayor, ya que el runtime, la caché KV y el contexto también utilizan memoria.
| Tamaño del modelo | Q8_0 | Q6_K | Q4_K_M | Q3_K_M |
|---|---|---|---|---|
| 4B | ~5 GB | ~4 GB | ~3 GB | ~2.5 GB |
| 8B | ~9 GB | ~7 GB | ~5.5 GB | ~4.5 GB |
| 12B | ~13 GB | ~10 GB | ~8 GB | ~6.5 GB |
| 14B | ~16 GB | ~12 GB | ~9 GB | ~7.5 GB |
| 27B | ~30 GB | ~22 GB | ~17 GB | ~13 GB |
| 32B | ~36 GB | ~27 GB | ~20 GB | ~16 GB |
| 70B | ~80 GB | ~60 GB | ~42 GB | ~34 GB |
Estas son estimaciones, no límites estrictos. Diferentes arquitecturas de modelos y formatos de cuantización pueden cambiar el tamaño real.
Qué pueden ejecutar distintas cantidades de VRAM
| VRAM | Rango práctico | Ejemplos actuales |
|---|---|---|
| 8 GB | Modelos pequeños de aproximadamente 4B a 9B | Gemma 4 E4B, Qwen3.5 9B |
| 12 GB | Modelos pequeños a medianos de aproximadamente 9B a 14B | Gemma 4 12B, Qwen3.5 9B |
| 16 GB | 12B a 27B con cuantización más baja | Gemma 4 26B-A4B, Qwen3.6 27B en Q4 |
| 24 GB | 27B a 35B en Q4 a Q6 | Qwen3.8 27B, Gemma 4 31B |
| 32 GB | 27B a 35B con cuantización más alta | Qwen3.8 27B, Gemma 4 31B |
| 48 GB | Modelos densos grandes con cuantización más baja | Modelos de clase 70B en Q3 a Q4 |
| 80 GB | Modelos densos grandes con cuantización más alta | Modelos de clase 70B en Q4 a Q6 |
Estos rangos son para modelos cuyos pesos pueden caber en la GPU. Los grandes modelos MoE son diferentes: solo algunos de sus parámetros están activos para cada token, pero el modelo aún debe almacenar su conjunto completo de pesos. Por lo tanto, un modelo con 100B o más parámetros totales no cabe en un presupuesto de VRAM de 100B simplemente porque tiene menos parámetros activos.
Modelos MoE
Los modelos Mixture-of-Experts (MoE) contienen múltiples grupos de parámetros llamados expertos. Solo algunos expertos se utilizan para cada token, lo que puede hacer que la inferencia sea más eficiente que un modelo denso con el mismo recuento total de parámetros.
Sin embargo, los expertos inactivos siguen siendo parte del modelo. Por lo tanto, los grandes modelos MoE pueden requerir mucha más memoria de lo que sugiere su recuento de parámetros activos. Los modelos muy grandes pueden necesitar múltiples GPUs o la descarga de memoria a la RAM del sistema.
La longitud del contexto también utiliza VRAM
Los pesos del modelo son solo parte del requisito de memoria. La caché KV crece a medida que el contexto se alarga, por lo que ejecutar el mismo modelo con un contexto de 64K puede requerir considerablemente más VRAM que ejecutarlo con 4K.
- Un contexto más largo requiere más VRAM.
- La precisión de la caché KV afecta el uso de memoria.
- El tamaño del lote (batch size) y los usuarios concurrentes también aumentan el uso de memoria.
- Deja algo de VRAM disponible para el runtime en lugar de llenar completamente la GPU con pesos del modelo.
Consejos prácticos
- Verifica el tamaño real del modelo cuantizado que deseas ejecutar.
- No uses el tamaño del archivo del modelo como el requisito exacto de VRAM. Deja espacio para la caché KV y el runtime.
- Si un modelo no cabe por completo en la VRAM, parte de él puede descargarse a la RAM del sistema, pero la inferencia generalmente será más lenta.
- Para cargas de trabajo de contexto largo o agénticas, presupuesta más VRAM de lo que requieren solo los pesos del modelo.
- Múltiples GPUs pueden dividir un modelo cuando una sola GPU no tiene suficiente VRAM.
Ejecútalo en DaDesktop
No necesitas comprar una GPU para ejecutar un LLM local. DaDesktop te proporciona un escritorio en la nube con la VRAM que necesitas, para que puedas ejecutar el modelo directamente sin poseer el hardware.
Elige el nivel de VRAM que se adapte a tu modelo, cárgalo y empieza a usarlo. Sin configuración, sin compra de hardware, sin problemas de controladores. Consulta las GPUs disponibles para ver las opciones.