Calculadora · IA en local
¿Cuánta VRAM necesitas para usar un modelo de IA en local?
Respuesta corta
Los pesos ocupan parámetros × bits por peso ÷ 8: unos 5 GB un modelo de 8.000 millones en Q4_K_M y unos 20 GB uno de 32.000 millones. Suma la caché KV, que crece con el contexto (1 GiB por cada 8.192 tokens en Llama 3.1 8B), y 1 GB de margen. Con 8 GB usas modelos de 8.000 millones con poco contexto; con 16 GB, la mayoría de modelos medianos; los de 70.000 millones no caben en ninguna tarjeta de consumo.

Los precios, límites y funciones cambian a menudo. Fechamos cada dato y enlazamos su fuente: compruébalo en la web del proveedor antes de pagar o de construir nada. Cómo nos financiamos.
Para usar un modelo de IA en tu propio ordenador, la pregunta que decide todo es cuánta memoria de vídeo (VRAM) necesita. La respuesta tiene tres partes: los pesos del modelo, la caché KV, que guarda la conversación, y un margen para el propio programa. Los pesos dependen del tamaño del modelo y de cuánto se comprime (la cuantización). La caché depende de la arquitectura y de cuánto texto le das. Esa segunda parte es la que casi nadie explica, y por eso un modelo que «cabe» puede fallar al pegarle un documento largo.
La calculadora usa la misma fórmula que comprobamos con 13 archivos de modelos reales (cómo lo comprobamos).
Memoria estimada
7,3 GB
- Pesos
- 5,0 GB
- Caché KV
- 1,2 GB
- Margen
- 1,1 GB
- Menor tamaño de memoria habitual en el que cabe8 GB
- Tarjetas NVIDIA GeForce con VRAM suficiente
Techo teórico en una RTX 5090: unos 358 tokens por segundo (ancho de banda ÷ tamaño de los pesos). La velocidad real es menor.
- Pesos = parámetros × bits por peso ÷ 8, con los bits por peso que midió llama.cpp para cada cuantización.
- Caché KV = 2 × capas que guardan todo el contexto × cabezas KV × dimensión por cabeza × bytes por valor × tokens. Las capas de ventana deslizante se detienen en su ventana.
- El margen de 1 GiB es un supuesto nuestro para búferes de cálculo y el controlador. Cambia según el motor y la configuración.
- Valores en GB (10⁹ bytes), la unidad que usan los fabricantes de tarjetas. Nada de lo que escribes sale de tu navegador.
Qué tarjeta te basta según el modelo
Con 8.192 tokens de contexto (una conversación larga o unas cuantas páginas de texto), estas son las cifras de los modelos abiertos más descargados:
| Modelo | Parámetros | Q4_K_M | Q8_0 | Cabe en (Q4_K_M) |
|---|---|---|---|---|
| Qwen3 4B | 4 B | 4,7 | 6,6 | 8 GB |
| Qwen3 8B | 8,2 B | 7,3 | 11,0 | 8 GB |
| Llama 3.1 8B | 8 B | 7,1 | 10,7 | 8 GB |
| Gemma 3 12B | 12,2 B | 9,4 | 14,9 | 12 GB |
| Qwen3 14B | 14,8 B | 11,5 | 18,1 | 12 GB |
| gpt-oss 20B | 20,9 B, (MoE, 3,6 B activos) | 15,1 MXFP4 (publicado) | 16 GB | |
| Mistral Small 3.2 24B | 24 B | 17,1 | 27,9 | 24 GB |
| Qwen3-Coder 30B-A3B | 30,5 B, (MoE, 3,3 B activos) | 20,6 | 34,3 | 24 GB |
| Qwen3 32B | 32,8 B | 23,3 | 38,0 | 24 GB |
| Qwen3.6 35B-A3B | 36 B, (MoE, 3 B activos) | 23,2 | 39,4 | 24 GB |
| Llama 3.3 70B | 70,6 B | 46,9 | 78,7 | 48 GB |
| gpt-oss 120B | 116,8 B, (MoE, 5,1 B activos) | 66,7 MXFP4 (publicado) | 96 GB | |
En la práctica:
- 8 GB (RTX 5060, RTX 4060): modelos de 4.000 a 8.000 millones de parámetros en Q4_K_M y con poco contexto. Qwen3 8B se queda en unos 7,3 GB con 8.192 tokens: entra, pero justo.
- 12 GB (RTX 5070, RTX 4070): modelos de hasta unos 14.000 millones en Q4_K_M con poco contexto. Qwen3 14B necesita unos 11,5 GB.
- 16 GB (RTX 5080, RTX 5070 Ti, RTX 5060 Ti de 16 GB): la mayoría de modelos medianos. gpt-oss-20b, de OpenAI, ronda los 15 GB; la propia OpenAI dice que funciona «within 16GB of memory».
- 24 y 32 GB (RTX 4090, RTX 5090): modelos de 24.000 a 35.000 millones en Q4_K_M, como Qwen3 32B (unos 23 GB con 8.192 tokens).
- 70.000 millones o más: no caben en ninguna tarjeta de consumo. Llama 3.3 70B necesita unos 43 GB solo para los pesos en Q4_K_M.
Cuánta VRAM tiene cada tarjeta NVIDIA
La memoria y el ancho de banda salen de la tabla comparativa de NVIDIA:
| Tarjeta | VRAM | Ancho de banda |
|---|---|---|
| GeForce RTX 5090 | 32 GB | 1792 GB/s |
| GeForce RTX 5080 | 16 GB | 960 GB/s |
| GeForce RTX 5070 Ti | 16 GB | 896 GB/s |
| GeForce RTX 5070 | 12 GB | 672 GB/s |
| GeForce RTX 5060 Ti | 16 / 8 GB | 448 GB/s |
| GeForce RTX 5060 | 8 GB | 448 GB/s |
| GeForce RTX 5050 | 8 GB | 320 GB/s |
| GeForce RTX 4090 | 24 GB | no figura |
| GeForce RTX 4080 SUPER | 16 GB | no figura |
| GeForce RTX 4080 | 16 GB | no figura |
| GeForce RTX 4070 Ti SUPER | 16 GB | no figura |
| GeForce RTX 4070 Ti | 12 GB | no figura |
| GeForce RTX 4070 SUPER | 12 GB | no figura |
| GeForce RTX 4070 | 12 GB | no figura |
| GeForce RTX 4060 Ti | 16 / 8 GB | no figura |
| GeForce RTX 4060 | 8 GB | no figura |
La VRAM decide qué cabe; el ancho de banda decide la velocidad. Para escribir cada palabra (token) nueva, la tarjeta lee una vez todos los pesos activos, así que hay un techo de ancho de banda ÷ tamaño de los pesos. Con Qwen3 8B en Q4_K_M (5,0 GB), ese techo es de unos 358 tokens por segundo en una RTX 5090 (1.792 GB/s) y de unos 89 en una RTX 5060 (448 GB/s). La velocidad real es menor, porque también se lee la caché, pero la proporción entre tarjetas se mantiene. No hemos medido velocidades reales: son límites teóricos, no pruebas.
La fórmula, en tres líneas
- Pesos (bytes) = parámetros × bits por peso ÷ 8. Un modelo de 8.000 millones de parámetros en Q4_K_M (4,89 bits por peso, según la medición de llama.cpp) ocupa unos 5 GB.
- Caché KV (bytes) = 2 × capas × cabezas KV × dimensión por cabeza × bytes por valor × tokens de contexto. El 2 corresponde a las claves y los valores. Con la precisión por defecto (16 bits), cada valor ocupa 2 bytes.
- Margen: sumamos 1 GiB para búferes de cálculo y el controlador de la tarjeta. Es un supuesto nuestro, no una medición: cambia según el programa, el tamaño de lote y la GPU.
Los datos de arquitectura salen del config.json de cada modelo en Hugging Face (num_hidden_layers, num_key_value_heads, head_dim). La calculadora los trae para 12 modelos; para cualquier otro, elige «Otro modelo» y cópialos.
Cuantización: qué significan Q4_K_M y Q8_0
Cuantizar es guardar cada peso con menos bits. llama.cpp publica los bits por peso medidos en Llama 3.1 8B: Q4_K_M usa 4,89 (4,58 GiB), Q5_K_M 5,70, Q6_K 6,56, Q8_0 8,50 (7,95 GiB) y F16 16 (14,96 GiB). Son algo más de 4, 5 u 8 porque cada bloque guarda también factores de escala.
Según llama.cpp, cuantizar «may introduce some accuracy loss», y esa pérdida la mide con la perplejidad. Cuánto importa depende del modelo y de la tarea. Si un modelo va justo, prueba el formato siguiente antes de comprar más memoria.
El contexto también ocupa memoria
La caché crece en línea recta con el contexto. En Llama 3.1 8B, a 16 bits, ocupa exactamente 1 GiB con 8.192 tokens, 4 GiB con 32.768 y 16 GiB con sus 131.072 tokens máximos: tres veces y media lo que ocupan sus pesos en Q4_K_M.
Ollama elige el contexto por ti según la VRAM: 4K con menos de 24 GiB, 32K entre 24 y 48 GiB y 256K a partir de 48 GiB (así lo escribe su documentación). Para agentes, búsquedas web y herramientas de programación recomienda al menos 64.000 tokens. Si lo subes, comprueba con ollama ps que la columna PROCESSOR sigue diciendo «100% GPU».
Dos ajustes reducen la caché:
- Caché cuantizada: la variable
OLLAMA_KV_CACHE_TYPEadmitef16(por defecto),q8_0(más o menos la mitad de memoria, que según Ollama normalmente no se nota en la calidad) yq4_0(un cuarto, con una pérdida que puede notarse más con contextos largos). - Menos contexto: si tus preguntas son cortas, 4.096 u 8.192 tokens bastan, y la memoria que ahorras puede ir a una cuantización mejor.
Por qué algunos modelos nuevos necesitan mucha menos memoria
Muchos modelos recientes no guardan todo el contexto en todas las capas. Algunas capas solo miran los últimos cientos o miles de tokens (ventana deslizante) y otras usan atención lineal, cuya memoria no crece con el contexto. Las calculadoras que tratan todas las capas igual se equivocan mucho con ellos:
| Modelo | Capas con todo el contexto | Caché a 128.000 tokens, bien contada | Si todas guardaran todo |
|---|---|---|---|
| gpt-oss-20b | 12 de 24 (el resto, ventana de 128 tokens) | 3,2 GB | 6,4 GB |
| Gemma 3 12B | 8 de 48 (el resto, ventana de 1.024) | 8,9 GB | 51,5 GB |
| Qwen3.6 35B-A3B (a 262.144) | 10 de 40 (el resto, atención lineal) | 5,4 GB | 21,5 GB |
El ahorro depende del programa: llama.cpp guarda una caché reducida para las capas de ventana deslizante por defecto (su opción --swa-full, que la desactiva, viene apagada).
Modelos de mezcla de expertos
Qwen3-Coder 30B-A3B o gpt-oss-20b son modelos de mezcla de expertos: en cada token solo trabajan unos pocos. Según sus fichas, Qwen3-Coder activa 3.300 de sus 30.500 millones de parámetros y gpt-oss-20b, 3.600 de 21.000 millones. Todos los expertos tienen que estar cargados, así que la memoria depende del tamaño total; la velocidad, del activo. Por eso van mucho más rápidos de lo que su tamaño sugiere.
En un Mac
En los Mac con chip Apple, la tarjeta gráfica usa la misma memoria unificada que el resto del sistema: lo que cuenta es la memoria total del Mac menos lo que usan macOS y tus aplicaciones. LM Studio recomienda al menos 16 GB y dice que en los Mac de 8 GB hay que quedarse con modelos pequeños y contextos modestos.
Si el modelo no cabe
- Usa una cuantización menor (Q4_K_M en lugar de Q6_K) o un modelo más pequeño de la misma familia.
- Reduce el contexto o cuantiza la caché.
- Reparte el modelo entre la GPU y la CPU. Ollama lo hace solo cuando no cabe en la VRAM, y
ollama psmuestra el reparto. Funciona, pero cada capa que va en la CPU hace más lenta la respuesta. - Añade otra tarjeta. Ollama reparte el modelo entre varias GPU cuando no cabe en una, según su documentación.
Para instalarlo todo paso a paso, mira cómo instalar Ollama y usar IA en local.
Cómo lo comprobamos
Comparamos la fórmula de los pesos con el tamaño real de 13 archivos GGUF que publica unsloth en Hugging Face, de Qwen3 4B a Llama 3.3 70B, en Q4_K_M y Q8_0. Todas las estimaciones quedan a menos de un 3 % del archivo real: Qwen3-8B en Q4_K_M pesa 5,03 GB y la fórmula da 5,01 (-0,3 %); Qwen3-32B pesa 19,76 GB y la fórmula da 20,04 (+1,4 %); Llama 3.3 70B pesa 42,52 GB y la fórmula da 43,16 (+1,5 %). Gemma 3 y Mistral Small salen algo por encima (+2,1 % y +2,5 %) porque su recuento de parámetros incluye un codificador de imágenes que va en otro archivo.
La caché KV es aritmética exacta sobre la arquitectura publicada; las pruebas automáticas de esta página la comparan con valores conocidos (Llama 3.1 8B: 16 GiB con 131.072 tokens). Lo que no hemos medido es el margen de ejecución, que fijamos en 1 GiB, ni la velocidad real.
Qué hemos comprobado
- Q4_K_M usa 4,8944 bits por peso y Llama 3.1 8B en Q4_K_M ocupa 4,58 GiB; Q8_0 usa 8,5008 bits por peso. (ggml-org / llama.cpp, )
- Qwen3-8B tiene 36 capas, 8 cabezas KV y dimensión por cabeza 128 (config.json). (Qwen (Hugging Face), )
- Qwen3-32B tiene 64 capas, 8 cabezas KV y dimensión por cabeza 128 (config.json). (Qwen (Hugging Face), )
- Llama 3.1 8B tiene 32 capas, 8 cabezas KV y dimensión por cabeza 128 (config.json). (unsloth (Hugging Face), )
- gpt-oss-20b tiene 21.000 millones de parámetros (3.600 millones activos), alterna capas de ventana deslizante de 128 tokens y de atención completa, y funciona con 16 GB de memoria con pesos MXFP4. (OpenAI (Hugging Face), )
- Gemma 3 12B usa una ventana deslizante de 1.024 tokens con una capa global de cada seis. (unsloth (Hugging Face), )
- Qwen3.6-35B-A3B tiene 35.000 millones de parámetros (3.000 millones activos) y 10 capas de atención completa de 40. (Qwen (Hugging Face), )
- Qwen3-Coder-30B-A3B tiene 30.500 millones de parámetros (3.300 millones activos). (Qwen (Hugging Face), )
- Tamaños reales de 13 archivos GGUF usados para validar la fórmula. (unsloth (Hugging Face), )
- Ollama usa por defecto 4K de contexto con menos de 24 GiB de VRAM, 32K entre 24 y 48 GiB y 256K a partir de 48, y recomienda al menos 64.000 tokens para agentes, búsqueda web y programación. (Ollama, )
- OLLAMA_KV_CACHE_TYPE admite f16 (por defecto), q8_0 (la mitad, aprox.) y q4_0 (un cuarto, aprox.). (Ollama, )
- La opción --swa-full de llama.cpp (caché completa en capas de ventana deslizante) viene desactivada por defecto. (ggml-org / llama.cpp, )
- Memoria de las GeForce: RTX 5090 32 GB (1.792 GB/s), RTX 5080 16 GB, RTX 5070 Ti 16 GB, RTX 5070 12 GB, RTX 5060 Ti 16 u 8 GB, RTX 5060 8 GB (448 GB/s), RTX 4090 24 GB. (NVIDIA, )
- LM Studio recomienda 16 GB o más de memoria en Mac y modelos pequeños con contextos modestos en los de 8 GB. (LM Studio, )
Qué puede cambiar
- Los modelos de la calculadora cambian: añadimos uno cuando se publican su config.json y sus archivos.
- Los programas mejoran el uso de memoria (caché cuantizada, ventanas deslizantes): el consumo real puede ser menor.
- La gama de tarjetas cambia; la tabla sigue la comparativa de NVIDIA.
Preguntas frecuentes
¿Una tarjeta de 8 GB sirve para usar IA en local?
Sí, con modelos de hasta unos 8.000 millones de parámetros en Q4_K_M y poco contexto. Qwen3 8B necesita unos 5 GB de pesos, 1,2 GB de caché con 8.192 tokens y nuestro margen de 1 GB: unos 7,3 GB en total.
¿Cuánta VRAM tienen la RTX 5060, 5070, 5080 y 5090?
Según NVIDIA: RTX 5060, 8 GB; RTX 5060 Ti, 8 o 16 GB; RTX 5070, 12 GB; RTX 5070 Ti y RTX 5080, 16 GB; RTX 5090, 32 GB.
¿Puedo usar un modelo de 70.000 millones de parámetros con 24 o 32 GB?
No entero en la tarjeta. Llama 3.3 70B necesita unos 43 GB solo para los pesos en Q4_K_M. Ollama puede dejar parte en la RAM del sistema, pero cada capa que va en la CPU hace más lenta la respuesta.
¿Más contexto necesita más VRAM?
Sí. La caché KV crece en línea recta con el contexto: en Llama 3.1 8B ocupa 1 GiB con 8.192 tokens y 16 GiB con 131.072. Los modelos con ventana deslizante o atención lineal crecen mucho menos.
Fuentes
- llama.cpp: quantize (bits per weight and sizes by quantization type), ggml-org / llama.cpp. Consultado el 1 de octubre de 2026.
- Qwen3-8B model card and config.json, Qwen (Hugging Face). Consultado el 1 de octubre de 2026.
- Qwen3-32B model card and config.json, Qwen (Hugging Face). Consultado el 1 de octubre de 2026.
- Llama 3.1 8B Instruct config.json (unsloth mirror of Meta's weights), unsloth (Hugging Face). Consultado el 1 de octubre de 2026.
- gpt-oss-20b model card and config.json, OpenAI (Hugging Face). Consultado el 1 de octubre de 2026.
- Gemma 3 12B config.json (unsloth mirror of Google's weights), unsloth (Hugging Face). Consultado el 1 de octubre de 2026.
- Qwen3.6-35B-A3B model card and config.json, Qwen (Hugging Face). Consultado el 1 de octubre de 2026.
- Qwen3-Coder-30B-A3B-Instruct model card, Qwen (Hugging Face). Consultado el 1 de octubre de 2026.
- GGUF files and sizes for Qwen3, Llama 3.1/3.3, Gemma 3, Mistral Small 3.2 and gpt-oss, unsloth (Hugging Face). Consultado el 1 de octubre de 2026.
- Ollama: context length defaults and settings, Ollama. Consultado el 1 de octubre de 2026.
- Ollama FAQ: Flash Attention, K/V cache quantization, multiple GPUs, Ollama. Consultado el 1 de octubre de 2026.
- llama.cpp server: command-line options (--swa-full, --flash-attn, cache types), ggml-org / llama.cpp. Consultado el 1 de octubre de 2026.
- Compare GeForce graphics cards (memory configuration and bandwidth), NVIDIA. Consultado el 1 de octubre de 2026.
- LM Studio: system requirements, LM Studio. Consultado el 1 de octubre de 2026.
¿Has visto un error o un dato desactualizado? Avísanos y lo corregimos.
Historial de cambios
- : Primera versión, con una calculadora de 12 modelos abiertos comprobada con 13 archivos GGUF reales.
Próxima revisión: .