Calculadora de RAM para IA local
Qué cubre este artículo
- Cuánta RAM necesita un sistema de IA local.
- Qué componentes determinan el consumo total de memoria.
- Cómo planificar el sistema operativo, contenedores, modelos y RAG.
- Cómo trabajar de forma efectiva con RAM limitada.
Introducción: calcular RAM para IA local
Muchos principiantes sobrestiman la importancia de la tarjeta gráfica e infraestiman la RAM. Pero la memoria es igual de importante. Determina si puedes cargar modelos, ejecutar RAG y mantener varios servicios activos simultáneamente.
Si solo usas ocasionalmente un modelo pequeño, 16 GB de RAM son suficientes. Si ejecutas permanentemente varios contenedores, bases de datos vectoriales y un modelo grande, necesitarás 32 GB, 64 GB o más. La calculadora te ayuda a encontrar el equilibrio adecuado.
¿Por qué necesito una calculadora de RAM?
Sin planificación, es fácil que el sistema recurra a Swap. Entonces todo se ralentiza y los modelos responden con latencia alta. Una calculadora de RAM te muestra antes de comprar o configurar cuánta memoria realmente necesitas.
Además, el cálculo ayuda a evaluar correctamente sistemas antiguos. Quizás una máquina existente con modelos más pequeños siga siendo viable.
Consumo de RAM explicado brevemente
La RAM total se compone de varias partes:
- Overhead del sistema operativo: Linux, Windows o macOS reservan entre 2 y 6 GB.
- Ollama o runtime del modelo: El modelo de lenguaje ocupa VRAM o RAM según la configuración.
- Base de datos vectorial: Chroma, Qdrant o PostgreSQL con búsqueda vectorial requieren memoria.
- Otros servicios: interfaz web, proxy inverso, bases de datos, monitoreo.
- Reserva: Al menos 10 a 20 por ciento de buffer para picos.
Para una operación estable, la RAM total no debe estar constantemente ocupada por encima del 80 por ciento.
Para quién es la calculadora de RAM
- Para cualquiera que planee un servidor de IA en casa.
- Para usuarios que quieran saber si su máquina existente es suficiente.
- Para administradores que ejecuten varios servicios contenedorizados simultáneamente.
- Para principiantes que quieran entender el dimensionamiento del hardware.
Conceptos clave en el cálculo de RAM
- Swap: Descarga en el disco duro cuando la RAM está llena. Ralentiza el sistema.
- RAM-Disk: Una parte de la RAM se utiliza como unidad virtual.
- Shared Memory: Memoria compartida por varios procesos.
- Almacenamiento de base de datos vectorial: RAM adicional para embeddings e índices.
- Overhead: Consumo de memoria no visible directamente de frameworks y bibliotecas.
Ejemplos prácticos de cálculo de RAM
Chatbot mínimo
- Linux: 2 GB
- Ollama con modelo 3B Q4: 1,5 GB
- Open WebUI: 500 MB
- Reserva: 2 GB
RAM recomendada: 8 GB
Sistema RAG para libros
- Linux: 2 GB
- Ollama con modelo 8B Q4: 5 GB
- Chroma o Qdrant: 4 GB
- Open WebUI: 500 MB
- Reserva: 4 GB
RAM recomendada: 32 GB
Servidor multi-servicio
- Linux: 3 GB
- Ollama con modelo 13B Q4: 9 GB
- Base de datos vectorial, n8n, proxy inverso: 6 GB
- Otros contenedores: 4 GB
- Reserva: 6 GB
RAM recomendada: 64 GB
Trampas típicas en la planificación de RAM
- Solo considerar el modelo: Los contenedores, la base de datos y la interfaz también requieren RAM.
- No planificar reserva: Con carga máxima el sistema se bloquea o se ralentiza extremadamente.
- Ver Swap como solución: Swap es un freno de emergencia, no un sustituto de RAM.
- Iniciar demasiados servicios: Cada contenedor consume memoria, especialmente las aplicaciones Java o Python.
- Olvidar GPU offloading: Si el modelo se puede descargar en VRAM, eso ahorra RAM del sistema.
Enlaces informativos sobre la calculadora de RAM
FAQ: Calculadora de RAM para IA local
¿Son 16 GB de RAM suficientes para IA local? Para modelos pequeños y un bot simple, 16 GB son suficientes. Para RAG o varios servicios se queda corto rápidamente.
¿Qué pasa si no hay suficiente RAM? El sistema descarga a Swap o interrumpe operaciones. Los modelos responden extremadamente lentamente o no se pueden cargar.
¿Necesito DDR5 para IA local? DDR5 es útil pero no obligatorio. La cantidad y estabilidad son más importantes que la tecnología más nueva.
¿Ayuda GPU offloading a ahorrar RAM? Sí. Si el modelo se ejecuta en la GPU, se requiere menos RAM del sistema. El VRAM es entonces crucial.
¿Debo comprar más RAM o más VRAM? Para ejecución pura del modelo, VRAM es más importante. Para RAG, contenedores y muchos servicios paralelos, RAM es igualmente crítico.
Fuentes y lecturas adicionales
- Documentación de Ollama: https://ollama.com/
- Documentación de Qdrant: https://qdrant.tech/documentation/
- Documentación de Chroma: https://docs.trychroma.com/
Resumen: Calculadora de RAM para IA local
El consumo de RAM se compone del sistema operativo, modelo, base de datos vectorial, otros servicios y una reserva. Un chatbot simple requiere 8 a 16 GB, un sistema RAG con varios servicios más bien 32 a 64 GB. Quien calcula anticipadamente el consumo evita compras costosas de hardware inadecuado y comportamiento lento por Swap.


