Tamaño del modelo y consumo de memoria: ¿Cuánto espacio ocupa un modelo de IA?
Qué cubre este artículo
- Qué significa la cifra en miles de millones en modelos de IA y cómo se relacionan los parámetros con la memoria
- Cómo calcular por ti mismo el consumo de memoria de un modelo, con y sin cuantización
- Una tabla de referencia de 1B a 70B con números concretos para FP16, Q8 y Q4
- Qué más consume memoria además del modelo, desde el KV-Cache hasta el sistema operativo
- Cómo encontrar el tamaño real de un modelo en Hugging Face y en Ollama
Introducción: Tamaño del modelo y consumo de memoria explicados
Cuando exploras IA local, rápidamente te encuentras con designaciones como 7B, 13B o 70B. Estos números representan la cantidad de parámetros de un modelo, es decir, los valores que el modelo aprendió durante el entrenamiento. Son el factor más importante para determinar cuánta memoria necesita el modelo en tu computadora.
Muchos principiantes se sorprenden cuando descargan un modelo de 7B y el archivo ocupa solo 4 GB en lugar de 7 GB. O descargan un modelo de 13B sin cuantización y descubren que consume 26 GB de memoria, aunque esperaban 13 GB. La razón es que parámetros y almacenamiento no son lo mismo. Un parámetro es un número, y cuánta memoria ocupa depende de su precisión.
Este artículo te explica cómo se relacionan parámetros, pesos y consumo de memoria. Aprenderás a calcular el consumo de memoria por ti mismo, qué tiene que ver la cuantización con esto y qué factores adicionales debes considerar. Al final, podrás estimar para cualquier modelo si funcionará en tu hardware antes de descargarlo.
¿Por qué necesito este conocimiento?
Imagina que instalaste Ollama y quieres probar un modelo. Lees en algún lugar sobre un excelente modelo de 7B y lo descargas. El archivo tiene 4,4 GB. Te preguntas por qué no son 7 GB. Luego intentas un modelo de 13B y de repente necesita 26 GB de memoria, aunque el número sea solo 13. ¿Qué está pasando aquí?
El problema es que la cifra en miles de millones indica la cantidad de parámetros, no el tamaño del archivo en gigabytes. Cuánta memoria ocupa un parámetro depende del formato. En el formato estándar FP16, es decir, números de punto flotante de 16 bits, cada parámetro ocupa 2 bytes. Un modelo de 7B necesita aproximadamente 14 GB en FP16. Con cuantización de 4 bits se reduce a unos 4 GB, y ese es exactamente el archivo que descargaste.
Si no conoces esta relación, podrías comprar el hardware incorrecto. Crees que un modelo de 13B necesita 13 GB de VRAM, compras una tarjeta gráfica con 16 GB, y luego no es suficiente porque el modelo sin cuantizar necesita 26 GB. O descargas un modelo que ni siquiera inicia porque no hay suficiente memoria. Con el conocimiento de este artículo tomas las decisiones correctas.
Tamaño del modelo y consumo de memoria en pocas palabras
Un modelo de IA consta de parámetros, también llamados pesos. Son números que el modelo aprendió durante el entrenamiento. Determinan cómo reacciona el modelo ante las entradas. Cuantos más parámetros tiene un modelo, más puede aprender y más complejas son las relaciones que puede captar. Más parámetros significan más consumo de memoria.
Una analogía sencilla: imagina el modelo como un cerebro. Los parámetros son las neuronas. Un cerebro con más neuronas puede resolver tareas más complejas, pero también necesita más espacio. Un modelo de 1B es un cerebro pequeño, uno de 70B es uno grande. Cuánto espacio ocupa cada neurona, es decir, cada parámetro, depende de la precisión con que se almacena el número. En formato de 16 bits, cada parámetro ocupa 2 bytes; en formato de 4 bits, solo medio byte.
La fórmula básica es: cantidad de parámetros multiplicada por bytes por parámetro da el consumo de memoria. Un modelo de 7B con precisión de 16 bits necesita 7 mil millones multiplicado por 2 bytes, aproximadamente 14 GB. Con cuantización de 4 bits necesita 7 mil millones multiplicado por 0,5 bytes, aproximadamente 3,5 GB. Más detalles en la sección de cálculo.
Para quién está pensado este conocimiento
Este artículo va dirigido a principiantes que quieren probar IA local y se preguntan cuán grandes son realmente los modelos. Si nunca has oído hablar de parámetros o no entiendes por qué un modelo de 7B a veces ocupa 4 GB y a veces 14 GB, estás en el lugar correcto. No necesitas conocimientos previos. Repasamos paso a paso qué son los parámetros, cómo se almacenan y cómo calculas el consumo de memoria.
Incluso si ya has ejecutado los primeros modelos con Ollama y te preguntas por qué algunos modelos funcionan en tu hardware y otros no, este artículo te ayuda. Los fundamentos aquí son la base para temas más avanzados como cuantización, requisitos de RAM y VRAM y asesoramiento de compra.
Términos importantes sobre tamaño del modelo
| Término | Significado |
|---|---|
| Parámetro | Número que el modelo aprendió durante el entrenamiento, también llamado peso |
| Pesos | Sinónimo de parámetro, determina con qué intensidad se ponderan las entradas |
| Miles de millones | Unidad para la cantidad de parámetros, abreviado como B para Billion en inglés |
| B | Abreviatura de Billion, es decir, miles de millones, por ejemplo 7B para 7 mil millones de parámetros |
| FP16 | Número de punto flotante de 16 bits, formato estándar, 2 bytes por parámetro |
| INT8 | Entero de 8 bits, 1 byte por parámetro, pérdida de calidad ligera |
| INT4 | Entero de 4 bits, 0,5 bytes por parámetro, pérdida de calidad mayor |
| Cuantización | Reducción de la precisión de los parámetros para ahorrar memoria |
| GGUF | Formato de archivo para modelos cuantizados, utilizado por Ollama y llama.cpp |
| KV-Cache | Búfer para el contexto, crece con la longitud del contexto |
¿Qué significa la cifra en miles de millones?
La cifra en miles de millones de un modelo de IA indica la cantidad de parámetros. B viene de la palabra inglesa Billion, que en español significa mil millones. Un modelo de 7B tiene 7 mil millones de parámetros, uno de 70B tiene 70 mil millones. A veces también ves la notación 7B o 7B-parámetros, ambas significan lo mismo.
Cada parámetro es un número, típicamente un número decimal entre menos 1 y más 1. Estos números se ajustan durante el entrenamiento para que el modelo produzca salidas significativas. Cuando usas un modelo, estos números se multiplican y suman millones de veces en cada solicitud. Este es el trabajo computacional real que la GPU o CPU realiza.
La cifra en miles de millones por sí sola no dice nada sobre el tamaño del archivo. Un modelo de 7B puede ocupar 14 GB si se almacena en formato de 16 bits, u 4 GB si está cuantizado a 4 bits. La cifra solo indica cuántos parámetros tiene. Cuánta memoria ocupa cada parámetro depende del formato. Esta es la clave para entender tamaño del modelo y consumo de memoria.
Calcular el consumo de memoria
La fórmula básica para el consumo de memoria es sencilla:
Consumo de memoria = Cantidad de parámetros × Bytes por parámetro
Cuántos bytes ocupa un parámetro depende del formato:
- FP16 (16 bits): 2 bytes por parámetro
- INT8 (8 bits): 1 byte por parámetro
- INT4 (4 bits): 0,5 bytes por parámetro
Aquí hay ejemplos concretos para diferentes tamaños de modelos y formatos. Los valores están redondeados y se refieren solo a los pesos del modelo, sin KV-Cache ni overhead.
| Parámetros | FP16 (2 bytes) | Q8 (1 byte) | Q4 (0,5 bytes) |
|---|---|---|---|
| 1B | 2 GB | 1 GB | 0,5 GB |
| 3B | 6 GB | 3 GB | 1,5 GB |
| 7B | 14 GB | 7 GB | 3,5 GB |
| 13B | 26 GB | 13 GB | 6,5 GB |
| 30B | 60 GB | 30 GB | 15 GB |
| 70B | 140 GB | 70 GB | 35 GB |
Ves de inmediato por qué la cuantización es tan importante. Un modelo de 70B necesita 140 GB de memoria en formato FP16, lo que no funciona en ningún hardware de consumo. Con cuantización de 4 bits se reduce a 35 GB, lo que es posible en una Mac con 64 GB de memoria unificada o en una configuración multi-GPU. Más sobre cuantización en el artículo dedicado a cuantización.
La fórmula proporciona el consumo de memoria para los pesos del modelo puro. En la práctica necesitas un poco más, porque el KV-Cache, el sistema operativo y el framework en sí también consumen memoria. Más sobre esto en la siguiente sección.
Tabla: Tamaños de modelos de un vistazo
Aquí tienes una descripción general con valores realistas, incluyendo VRAM recomendada y ejemplos de modelos. Los valores recomendados incluyen buffer para KV-Cache y overhead, de modo que el modelo no solo se cargue, sino que también funcione con una longitud de contexto decente.
| Tamaño del modelo | FP16 | Q8 | Q4 | VRAM recomendada (Q4) | Modelos de ejemplo |
|---|---|---|---|---|---|
| 1B | 2 GB | 1 GB | 0,5 GB | 2 GB | TinyLlama, Qwen2.5-1.5B |
| 3B | 6 GB | 3 GB | 1,5 GB | 4 GB | Llama 3.2-3B, Phi-3-mini |
| 7B | 14 GB | 7 GB | 3,5 GB | 8 GB | Llama 3.1-8B, Mistral-7B |
| 13B | 26 GB | 13 GB | 6,5 GB | 12 GB | Llama 2-13B, Qwen2.5-14B |
| 30B | 60 GB | 30 GB | 15 GB | 24 GB | Mixtral 8x7B, Qwen2.5-32B |
| 70B | 140 GB | 70 GB | 35 GB | 48 GB | Llama 3.1-70B, Qwen2.5-72B |
Los valores de VRAM recomendados aplican para modelos cuantizados a 4 bits. Si quieres cargar un modelo sin cuantizar, es decir en formato FP16, necesitarás mucho más almacenamiento. La tabla ilustra por qué la mayoría de usuarios utilizan modelos cuantizados. Sin cuantización, un modelo de 13B ni siquiera entra en una RTX 4090 con 24 GB de VRAM.
Encontrarás más información sobre los requisitos exactos de RAM y VRAM en el artículo sobre requisitos de RAM y VRAM. Si quieres entender las diferencias generales entre RAM y VRAM, consulta el artículo RAM vs. VRAM.
¿Qué más se suma al modelo?
Los pesos del modelo son el mayor consumidor de almacenamiento, pero no el único. Cuando ejecutas un modelo, intervienen varios factores adicionales.
KV-Cache: El KV-Cache almacena resultados intermedios durante la inferencia, para que el modelo no recalcule todo de cero con cada palabra nueva. Crece junto con la longitud del contexto, es decir, la cantidad de tokens que el modelo está procesando actualmente. Un texto de entrada largo requiere más KV-Cache que uno corto. Con una longitud de contexto de 8192 tokens, el KV-Cache puede ocupar varios gigabytes según el modelo. Más información en el artículo sobre longitud del contexto.
Overhead del sistema operativo: Tu sistema operativo necesita memoria por sí mismo. Windows, Linux o macOS ocupan típicamente 2 a 4 GB de RAM, además de todos los demás programas en ejecución. Si tienes 16 GB de RAM y un modelo necesita 10 GB, solo quedan 6 GB para todo lo demás.
Overhead del framework: Herramientas como Ollama o el llama.cpp subyacente requieren cierta memoria para la ejecución y la gestión del modelo. Generalmente son cientos de megabytes, pero pueden ser más en configuraciones especiales.
Como regla general, planifica aproximadamente 20 a 30 por ciento más almacenamiento del que indica el tamaño puro del modelo. Si un modelo de 7B en formato Q4 requiere 3,5 GB, planifica con alrededor de 5 GB para que el contexto, el overhead y el sistema operativo tengan suficiente espacio.
Tamaño de descarga vs. requisitos de almacenamiento
Un punto frecuente de confusión es la diferencia entre el tamaño del archivo al descargar y los requisitos de almacenamiento durante la operación. Cuando descargas un modelo como archivo GGUF, el archivo ya está cuantizado y comprimido. El tamaño de descarga corresponde aproximadamente a los requisitos de almacenamiento de los pesos cuantizados.
Si descargas un modelo en formato FP16, el archivo es aproximadamente tan grande como los requisitos de almacenamiento en FP16. Un modelo de 7B en formato FP16 tiene aproximadamente 14 GB de tamaño. Si lo cargas luego cuantizado a 4 bits, requiere solo 3,5 GB durante la operación. El archivo en el disco duro sigue siendo 14 GB porque has guardado los pesos sin cuantizar.
A la inversa: si descargas un modelo cuantizado a 4 bits como archivo GGUF, el archivo tiene aproximadamente 3,5 GB de tamaño. En la memoria, el modelo requiere entonces alrededor de 3,5 GB, más KV-Cache y overhead. El archivo GGUF no es un archivo comprimido que se desempaqueta en la memoria, sino que los pesos ya están en formato cuantizado.
Lo más importante: el tamaño de descarga del archivo GGUF es un buen indicador de los requisitos de almacenamiento de los pesos del modelo. Lo que se suma además es el KV-Cache y el overhead, que se ocupan adicionalmente durante la operación.
¿Cómo encuentro el tamaño de un modelo?
Hay varias formas de averiguar el tamaño de un modelo antes de descargarlo.
Hugging Face: En Hugging Face puedes ver para cada modelo el número de parámetros en la descripción. Los tamaños de archivo de los archivos individuales los encuentras en la sección Files. Ten cuidado con qué archivo descargas. Un archivo FP16 es significativamente más grande que un archivo GGUF cuantizado. Los nombres de archivo a menudo contienen indicios como FP16, Q8_0 o Q4_K_M que te dicen qué formato es.
Ollama: Cuando cargas un modelo con Ollama, el comando ollama list te muestra todos los modelos instalados con su tamaño. El tamaño corresponde al archivo GGUF, es decir, a los pesos cuantizados. Si buscas un modelo que se ajuste a tu hardware, el artículo sobre buscar modelos te ayuda.
Tarjetas de modelo: La mayoría de tarjetas de modelo en Hugging Face dan el número de parámetros y las cuantizaciones disponibles. A veces también encuentras directamente una tabla con los tamaños de archivo de las diferentes variantes.
La regla más importante: siempre fíjate en el formato. Un modelo de 7B puede tener 14 GB o 3,5 GB de tamaño, dependiendo de si es FP16 o Q4. El número B solo no es suficiente para determinar los requisitos de almacenamiento.
Tropiezos típicos con tamaño de modelo y requisitos de almacenamiento
- Confundir número B con tamaño de archivo: 7B significa 7 mil millones de parámetros, no 7 GB. En formato FP16, un modelo de 7B requiere 14 GB; en formato Q4, 3,5 GB.
- Ignorar el formato: Quien no presta atención al formato se sorprende de por qué un modelo de 7B a veces tiene 4 GB y otras 14 GB. El formato determina los requisitos de almacenamiento.
- Olvidar el KV-Cache: Los pesos del modelo no lo son todo. Con contextos largos, el KV-Cache puede ocupar varios gigabytes e inutilizar el modelo si la memoria es escasa.
- Subestimar el overhead del sistema operativo: Si tienes 8 GB de VRAM y un modelo requiere 7 GB, apenas queda espacio para el resto. Siempre planifica un buffer.
- Cargar modelos sin cuantizar: Quien carga un modelo de 13B sin cuantización necesita 26 GB de VRAM. Con Q4 son solo 6,5 GB. Para la mayoría de aplicaciones, Q4 es completamente suficiente.
- Equiparar VRAM recomendada con tamaño del modelo: La VRAM recomendada incluye buffer para KV-Cache y overhead. Siempre es mayor que el tamaño puro del modelo.
- Estimar mal modelos mixtos: Modelos como Mixtral 8x7B son modelos Mixture-of-Experts. El número total de parámetros es alto, pero en cada solicitud solo una parte está activa. Los requisitos de almacenamiento dependen de todos los parámetros, no solo de los activos.
Hardware, costos y seguridad en relación al tamaño del modelo
Hardware: El tamaño del modelo determina qué hardware necesitas. Para modelos de 1B a 3B, una computadora simple con 8 GB de RAM es suficiente. Para modelos de 7B se recomienda una tarjeta gráfica con 8 GB de VRAM. Para modelos de 13B necesitas 12 GB de VRAM; para 30B, 24 GB de VRAM. Los modelos de 70B requieren múltiples tarjetas gráficas, Apple Silicon con al menos 64 GB de Unified Memory, o una APU como AMD Ryzen AI Max con RAM suficiente. La guía de compra te ayuda en la selección.
Costos: Los modelos más grandes necesitan hardware más caro. Una tarjeta gráfica con 8 GB de VRAM cuesta alrededor de 300 euros; una con 24 GB de VRAM cuesta aproximadamente 2000 euros. Apple Silicon con 64 GB de Unified Memory es un Mac Studio o Mac Book Pro que rápidamente cuesta varios miles de euros. La cuantización te ayuda a manejarte con hardware más económico, porque reduce drásticamente los requisitos de almacenamiento.
Seguridad: Con modelos operados localmente, tus datos permanecen en tu computadora. Ninguna solicitud va a un servidor; ningún dato abandona tu sistema. El tamaño del modelo no juega un papel aquí, lo importante es que el modelo funcione localmente y no invoque APIs externas. Más información en ¿Qué es la IA local?.
Enlaces y recursos adicionales sobre tamaño de modelo y requisitos de memoria
- Fundamentos de hardware de IA para profundizar en los conceptos básicos del hardware para IA local
- RAM vs. VRAM si quieres entender cómo se relacionan RAM y VRAM
- Cuantización para detalles sobre cómo reducir el tamaño del modelo
- Requisitos de RAM y VRAM con números precisos sobre tamaños de modelo
- Longitud de contexto si quieres saber cómo crece la memoria caché KV
- ¿Qué es IA local? para los fundamentos de la IA local
- Ollama la herramienta más popular para ejecutar modelos localmente
- Encontrar modelo consejos para seleccionar el modelo adecuado
- Guía de compra si estás planeando adquirir hardware nuevo
FAQ: Tamaño de modelo y requisitos de memoria - Preguntas frecuentes
¿Qué significa 7B en un modelo de IA?
7B representa 7 mil millones de parámetros, es decir, los valores que el modelo aprendió durante el entrenamiento. El número B indica cuántos parámetros tiene el modelo, pero no cuánta memoria necesita. Esto depende del formato. En formato FP16, un modelo 7B requiere 14 GB, mientras que en Q4 ocupa 3,5 GB.
¿Cómo calculo el requisito de memoria de un modelo?
La fórmula es: cantidad de parámetros por bytes por parámetro. En FP16 son 2 bytes por parámetro, en Q8 es 1 byte, en Q4 es 0,5 bytes. Un modelo 7B necesita en FP16 entonces 7 mil millones por 2 bytes, aproximadamente 14 GB. Suma a esto la caché KV y el overhead.
¿Por qué mi modelo 7B solo ocupa 4 GB?
Porque está cuantizado. Los 4 GB corresponden a un modelo cuantizado a 4 bits, donde cada parámetro ocupa solo 0,5 bytes. El número B indica la cantidad de parámetros, no el tamaño del archivo. Sin cuantización, el modelo ocuparía aproximadamente 14 GB.
¿Cuál es la diferencia entre FP16 y Q4?
FP16 es el formato estándar con precisión de 16 bits, es decir, 2 bytes por parámetro. Q4 es un formato cuantizado a 4 bits con 0,5 bytes por parámetro. Q4 usa una cuarta parte de la memoria de FP16, con una ligera pérdida de calidad que es apenas perceptible para la mayoría de aplicaciones.
¿Necesito el VRAM recomendado o es suficiente con el tamaño del modelo?
El VRAM recomendado siempre es mayor que el tamaño puro del modelo porque incluye buffer para la caché KV, el framework y el sistema operativo. Si solo tienes VRAM equivalente al tamaño del modelo, este puede cargarse, pero podría fallar con contextos más largos. Siempre planifica un 20 a 30 por ciento adicional.
¿Qué es la caché KV y por qué requiere memoria?
La caché KV almacena resultados intermedios durante la inferencia, permitiendo que el modelo no recalcule todo desde cero con cada palabra nueva. Crece con la longitud del contexto. Con una longitud de contexto de 8192 tokens, la caché KV puede ocupar varios gigabytes según el modelo. Más detalles en el artículo sobre longitud de contexto.
¿Cuánto VRAM necesito para un modelo 13B?
Un modelo 13B requiere aproximadamente 6,5 GB en formato Q4 para los pesos. Con buffer para caché KV y overhead, se recomienda 12 GB de VRAM. En formato FP16 necesita 26 GB, viable solo con hardware de gama alta o Apple Silicon con suficiente Unified Memory.
¿Puedo ejecutar un modelo 70B en una GPU consumer?
No en una sola GPU consumer. Una RTX 4090 tiene 24 GB de VRAM, mientras que un modelo 70B requiere aproximadamente 35 GB en formato Q4 más buffer. Necesitarías dos tarjetas gráficas, Apple Silicon con al menos 64 GB de Unified Memory o una APU como el AMD Ryzen AI Max con RAM suficiente.
¿Qué significa GGUF?
GGUF es un formato de archivo para modelos cuantizados utilizado por Ollama y llama.cpp. Un archivo GGUF contiene los pesos del modelo en formato cuantizado, frecuentemente a 4 bits u 8 bits. El tamaño del archivo GGUF es un buen indicador del requisito de memoria para los pesos del modelo.
¿Es siempre mejor un modelo más grande?
No necesariamente. Un modelo más grande puede resolver tareas más complejas, pero requiere más memoria y es más lento. Para muchas tareas, un modelo 7B u 8B es completamente suficiente. Si solo puedes ejecutar un modelo más pequeño fluidamente en tu hardware, a menudo es mejor opción que un modelo grande que funciona de manera extremadamente lenta.
¿Cómo encuentro el tamaño de un modelo en Hugging Face?
En Hugging Face ves el número de parámetros en la descripción del modelo. Los tamaños de archivo están en la sección Files. Presta atención a los nombres de archivo, que frecuentemente indican el formato, por ejemplo FP16, Q8_0 o Q4_K_M. El tamaño del archivo corresponde al requisito de memoria para los pesos del modelo en ese formato.
¿Qué significa Q4_K_M?
Q4_K_M es un método de cuantización específico en formato GGUF. Q4 representa 4 bits, K una técnica particular de cuantización y M Medium, es decir, un equilibrio entre calidad y tamaño. Es la opción más común para lograr un balance adecuado entre requisito de memoria y calidad del modelo.
¿Por qué mi modelo necesita más memoria de la que ocupa el archivo?
Porque durante la ejecución se suman la caché KV y el overhead del framework. El archivo solo contiene los pesos del modelo. Cuando ejecutas el modelo, la caché KV ocupa memoria adicional que crece con la longitud del contexto. Planifica aproximadamente 20 a 30 por ciento más memoria de la que ocupa el archivo.
Fuentes y lecturas adicionales
- Documentación de Hugging Face sobre formatos de modelo y cuantización
- Especificación de llama.cpp y GGUF
- Documentación de Ollama sobre gestión de modelos
- Experiencias de la comunidad de IA local
- Cuantización para detalles sobre cómo reducir el tamaño del modelo


