
¿Cuánta VRAM necesitas para usar un modelo de IA en local?
Los pesos ocupan parámetros × bits por peso ÷ 8: unos 5 GB un modelo de 8.000 millones en Q4_K_M y unos 20 GB uno de 32.000 millones. Suma la caché KV, que crece con el contexto (1 GiB por cada 8.192 tokens en Llama 3.1 8B), y 1 GB de margen. Con 8 GB usas modelos de 8.000 millones con poco contexto; con 16 GB, la mayoría de modelos medianos; los de 70.000 millones no caben en ninguna tarjeta de consumo.
Datos comprobados el




