PC para RAG: Hardware para bases de datos de conocimiento
Qué cubre este artículo sobre hardware RAG
- Qué componentes de hardware realmente importan para RAG local, desde GPU hasta SSD
- Cuánta VRAM necesitas cuando el LLM y el modelo de embedding se ejecutan simultáneamente
- Por qué las bases de datos vectoriales como Chroma y Qdrant consumen mucha RAM
- Qué configuraciones se adaptan a RAG, desde PCs presupuestarios hasta workstations
- Qué trampa evitar al construir un sistema RAG
Introducción: PC para RAG explicado de forma clara
RAG local combina un modelo de lenguaje con tu propia base de datos de conocimiento. En lugar de entrenar el modelo para todo, buscas en tus documentos en tiempo de ejecución y proporcionas los pasajes relevantes como contexto al LLM. Funciona localmente, sin la nube, sin costos de API.
El problema: RAG impone requisitos de hardware diferentes a la mera inferencia LLM. Ejecutas simultáneamente un LLM, un modelo de embedding y una base de datos vectorial. Los tres compiten por VRAM, RAM y ancho de banda de memoria. Un PC que ejecuta fluidamente un modelo de 7B puede fallar con RAG cuando añades la base de datos vectorial y el modelo de embedding.
Este artículo explica qué PC tiene sentido para RAG y qué configuraciones funcionan para diferentes presupuestos. Encontrarás más recomendaciones en la sección Asesoramiento de compra.
¿Por qué necesito hardware especial para RAG?
Un setup LLM normal carga un modelo en VRAM y genera texto. RAG hace más: cuando haces una pregunta, el sistema primero busca en tu base de datos vectorial pasajes de texto coincidentes. Para ello, un modelo de embedding convierte tu pregunta en un vector. La base de datos vectorial compara este vector con todos los vectores almacenados y devuelve los mejores resultados. Solo entonces el prompt completo se envía al LLM.
Concretamente, tres cosas se ejecutan simultáneamente o secuencialmente:
- Modelo de embedding: Convierte la consulta en vectores, requiere VRAM o RAM
- Base de datos vectorial: Mantiene todos los embeddings en memoria, requiere RAM
- LLM: Genera la respuesta desde el contexto, requiere VRAM
Si ejecutas un LLM de 7B con 6 GB de VRAM y un modelo de embedding como nomic-embed-text requiere otros 1 o 2 GB, ya tienes 8 GB ocupados. Además está el KV-cache, que con documentos largos llega rápidamente a varios GB. Quien no lo planifica obtiene problemas de rendimiento.
Encontrarás los fundamentos en el artículo Dimensionar hardware correctamente.
PC para RAG explicado brevemente
Para RAG necesitas tres cosas simultáneamente: VRAM para LLM y modelo de embedding, RAM para la base de datos vectorial y una SSD rápida. Como regla general: al menos 12 GB de VRAM para un LLM de 7B más modelo de embedding, 32 GB de RAM para bases de datos vectoriales pequeñas y una SSD NVMe. Quién busca en colecciones más grandes debe prever 64 GB de RAM o más.
¿Para quién es este artículo?
Este artículo está dirigido a principiantes e intermedios que planean construir o actualizar un PC para RAG local. Si sabes qué hace una base de datos vectorial y qué es VRAM, eso es suficiente. Quién recién empieza encontrará en el artículo Conceptos básicos RAG una descripción más amplia.
Términos importantes alrededor del hardware RAG
| Término | Significado |
|---|---|
| VRAM | Memoria de video de la GPU. Espacio para LLM y modelo de embedding. |
| RAM | Memoria de acceso aleatorio del sistema. Mantiene la base de datos vectorial en memoria. |
| Modelo de embedding | Convierte texto en vectores. Requiere VRAM o RAM según la configuración. |
| Base de datos vectorial | Almacena embeddings y permite búsqueda por similitud. Ejemplos: Chroma, Qdrant. |
| SSD | Disco para modelos y documentos. NVMe es significativamente más rápido que SATA. |
| NVMe | Interfaz SSD rápida. Importante para tiempos de carga cortos al iniciar. |
| KV-Cache | Almacena valores de atención calculados durante la inferencia. Crece con el contexto. |
| Chunking | División de documentos en secciones antes del embedding. |
| Retrieval | Proceso de búsqueda en la base de datos vectorial de pasajes de texto coincidentes. |
| Reranking | Segunda evaluación de los resultados de búsqueda para mejor relevancia. Requiere poder computacional adicional. |
Requisitos de hardware para RAG
RAG significa que tres componentes necesitan recursos simultáneamente. La siguiente tabla muestra los requisitos típicos para un setup RAG local con un LLM de 7B.
| Componente | Requisito VRAM | Requisito RAM | Nota |
|---|---|---|---|
| LLM de 7B (Q4) | 5 a 6 GB | 16 GB | Modelo principal para generación de respuestas |
| Modelo de embedding | 1 a 2 GB | 4 GB | p.ej. nomic-embed-text, all-MiniLM |
| KV-Cache (contexto 8k) | 1 a 3 GB | - | Crece con la longitud del contexto |
| Base de datos vectorial | - | 4 a 32 GB | Depende del número de vectores |
| Sistema operativo + otros | - | 8 GB | Navegador, IDE, otros programas |
En total llegas a unos 8 a 11 GB de VRAM y 32 a 64 GB de RAM para un setup RAG de 7B útil. Quién usa un LLM de 13B necesita correspondientemente más VRAM. Encontrarás detalles en los artículos Modelos de embedding y Bases de datos vectoriales.
GPU para RAG
La GPU en un sistema RAG debe cargar dos modelos: el LLM y el modelo de embedding. Ambos necesitan VRAM. Si ambos juntos no caben en la VRAM, hay dos estrategias.
Estrategia 1: Ambos modelos simultáneamente en VRAM. Esta es la variante más rápida. En cada consulta se incrusta y se busca inmediatamente, sin tiempo de carga. Necesitas suficiente VRAM para ambos más KV-cache. Un LLM de 7B en Q4 (6 GB) más nomic-embed-text (1 GB) más KV-cache (2 GB) requiere aproximadamente 9 GB de VRAM. Una RTX 3060 con 12 GB lo logra.
Estrategia 2: Cargar modelos secuencialmente. Si la VRAM no es suficiente, descargas el LLM, cargas el modelo de embedding, incrustas la consulta y cargas el LLM nuevamente. Esto cuesta varios segundos de tiempo de carga cada vez. Para uso interactivo es incómodo, para procesamiento por lotes es aceptable.
Con Ollama puedes gestionar ambos modelos. Ollama mantiene los modelos en memoria si hay suficiente espacio y los descarga automáticamente si hay escasez. La configuración OLLAMA_KEEP_ALIVE controla cuánto tiempo permanecen cargados los modelos.
GPUs recomendadas para RAG:
- RTX 3060 12 GB: Punto de entrada para RAG de 7B. Ambos modelos caben simultáneamente en VRAM.
- RTX 4070 12 GB: Más rápida, misma VRAM. Buena para 7B con contextos más largos.
- RTX 3090 24 GB: Mucha VRAM para LLM de 13B más modelo de embedding más KV-cache grande.
- RTX 4090 24 GB: Velocidad máxima para setups RAG de 13B.
RAM y base de datos vectorial
Bases de datos vectoriales como Chroma y Qdrant mantienen sus embeddings en RAM para permitir búsqueda de similitud rápida. Cuantos más documentos tengas, más RAM necesitas.
Un embedding con 768 dimensiones requiere aproximadamente 3 KB de almacenamiento. Con 100.000 documentos con 10 chunks cada uno, eso son 1 millón de vectores, aproximadamente 3 GB de RAM solo para los vectores. Además vienen metadatos y estructura de índice, lo que duplica el requisito aproximadamente.
| Documentos | Chunks | Vectores | Requisito RAM (aprox.) |
|---|---|---|---|
| 1.000 | 10.000 | 10.000 | 0,1 GB |
| 10.000 | 100.000 | 100.000 | 0,8 GB |
| 100.000 | 1.000.000 | 1.000.000 | 8 GB |
| 500.000 | 5.000.000 | 5.000.000 | 40 GB |
Quién busca en colecciones grandes de documentos necesita significativamente más RAM. 32 GB son suficientes para colecciones pequeñas a medianas. Con varios cientos de miles de documentos deberías prever 64 GB o más.
SSD: Por qué NVMe es importante
RAG carga modelos y documentos con regularidad. Al iniciar, Ollama carga el LLM y el modelo de embedding. Una SSD NVMe con 3.500 MB/s o más carga un modelo de 5 GB en menos de dos segundos. Una SSD SATA con 550 MB/s necesita aproximadamente nueve segundos para lo mismo.
La base de datos vectorial también se beneficia de NVMe. Al iniciar, Chroma o Qdrant cargan el índice desde el disco hacia la RAM. En colecciones grandes, esto puede ser varios gigabytes. NVMe reduce significativamente el tiempo de inicio.
Además, almacenas los documentos originales en la SSD. Con colecciones grandes, fácilmente llegas a varios cientos de gigabytes. Una SSD NVMe de 2 TB te proporciona espacio suficiente para modelos, base de datos vectorial y documentos.
Hardware recomendada en Amazon
Hardware für RAG im Amazon Shop
Bei Amazon ansehenAffiliate-Link: Bei einem Kauf erhalten wir möglicherweise eine Provision.
Propuestas de configuración para PCs con RAG
Configuración 1: Presupuesto, aproximadamente 700 a 900 EUR
- CPU: AMD Ryzen 5 5600 o Intel Core i5-12400F
- RAM: 32 GB DDR4
- GPU: RTX 3060 12 GB
- Almacenamiento: 1 TB SSD NVMe
- Fuente de alimentación: 550 W, 80+ Bronze
Esta configuración ejecuta un LLM de 7B más un modelo de embedding simultáneamente. 32 GB de RAM son suficientes para bases de datos vectoriales con aproximadamente 100.000 vectores. Ideal para comenzar.
Configuración 2: Rango medio, aproximadamente 1.400 a 2.000 EUR
- CPU: AMD Ryzen 5 7600 o Intel Core i5-13600K
- RAM: 64 GB DDR5
- GPU: RTX 4070 12 GB o RTX 3090 24 GB usada
- Almacenamiento: 2 TB SSD NVMe
- Fuente de alimentación: 750 W, 80+ Gold
Con 24 GB de VRAM (RTX 3090) funcionan un LLM de 13B más un modelo de embedding más un caché KV grande. 64 GB de RAM te dan espacio para bases de datos vectoriales con cientos de miles de vectores.
Configuración 3: High-End, aproximadamente 3.500 a 5.500 EUR
- CPU: AMD Ryzen 9 7950X o Intel Core i9-14900K
- RAM: 128 GB DDR5
- GPU: 2x RTX 4090 24 GB o 2x RTX 3090 24 GB
- Almacenamiento: 4 TB SSD NVMe
- Fuente de alimentación: 1.200 W, 80+ Platinum
48 GB de VRAM permiten LLMs grandes de hasta 70B en Q4, más un modelo de embedding y un modelo de reranking simultáneamente. 128 GB de RAM garantizan que incluso bases de datos vectoriales con millones de entradas funcionen correctamente.
Consejos de rendimiento para RAG
- Mantén los modelos en memoria: Deja el LLM y el modelo de embedding en VRAM si hay espacio disponible. Esto ahorra tiempo de carga en cada consulta.
- Elige la cuantización adecuada: Q4_K_M es un buen estándar para el LLM. Para el modelo de embedding a menudo basta con Q8 o FP16, ya que estos modelos son pequeños. Más información en Cuantización.
- Limita la longitud del contexto: El caché KV crece con el contexto. En RAG proporcionas varios fragmentos como contexto. Reduce la cantidad o tamaño de los fragmentos si el VRAM se agota.
- Utiliza caché: Si planteas las mismas preguntas varias veces, almacena en caché los embeddings y resultados de búsqueda. Esto ahorra tiempo de embedding y consultas a la base de datos.
- Embedding por lotes: Cuando añades muchos documentos, realiza el embedding en lotes en lugar de uno por uno. Esto optimiza el uso de la GPU.
- Usa reranking con moderación: Un modelo de reranking mejora los resultados de búsqueda, pero requiere VRAM adicional y poder de cálculo. Úsalo solo cuando la calidad de la recuperación sea insuficiente.
Obstáculos típicos en hardware para RAG
- VRAM insuficiente: Quien planifica solo el LLM y olvida el modelo de embedding no tiene suficiente VRAM. Siempre planifica ambos modelos más caché KV.
- Base de datos vectorial en VRAM: Chroma y Qdrant se ejecutan en RAM, no en VRAM. La GPU es para el LLM y el modelo de embedding.
- RAM subestimada: Las bases de datos vectoriales grandes requieren mucha RAM. Quien tiene 16 GB y busca en 500.000 documentos llega al límite. El sistema comienza a hacer intercambio.
- Modelo de embedding demasiado grande: Modelos de embedding grandes como
bge-largerequieren más VRAM que modelos pequeños comoall-MiniLM. Elige el modelo según tu hardware. - Se ignora la longitud de contexto del LLM: RAG añade varios fragmentos al prompt. Con 10 fragmentos de 500 tokens cada uno, tienes 5.000 tokens de contexto. El caché KV consume VRAM proporcionalmente.
- SSD lenta como cuello de botella: Al cargar modelos y al iniciar la base de datos vectorial, una SSD SATA marca la diferencia perceptible. NVMe es prácticamente obligatoria para RAG.
- Fuente de alimentación insuficiente: Dos RTX 3090 consumen más de 700 W bajo carga solo en la GPU. Una fuente débil causa fallos.
- Carcasa demasiado pequeña: Las GPUs grandes no caben en todas las carcasas. Con configuraciones dual-GPU, mide antes.
Hardware, costes y seguridad en RAG
RAG local significa que tus documentos y consultas nunca abandonan tu equipo. Documentos confidenciales, wikis internos y notas personales permanecen en tu disco duro.
En cuanto a costes, el hardware es una inversión única, sin costes de API después. Para quien busca regularmente en una base de conocimiento con varios miles de documentos, una configuración de 1.500 EUR se amortiza rápidamente. Debes considerar el consumo de energía: una RTX 4090 consume hasta 450 W bajo carga.
En términos de seguridad: descarga LLMs y modelos de embedding solo de repositorios confiables como la biblioteca oficial de Ollama o Hugging Face de cargadores verificados.
Enlaces informativos y referencias sobre hardware para RAG
- RAG local - Conceptos básicos e instalación
- Fundamentos de RAG - Cómo funciona RAG
- Modelos de embedding - Vectores a partir de texto
- Bases de datos vectoriales - Almacenamiento y búsqueda
- Asesoramiento de compra - Recomendaciones de hardware adicionales
- Dimensionar hardware correctamente - Planificación de recursos
- Ollama - Gestión de modelos local
- Cuantización - Hacer modelos más pequeños
FAQ: PC para RAG - Preguntas frecuentes
¿Qué GPU necesito para RAG local?
Para un LLM de 7B más un modelo de embedding, una RTX 3060 con 12 GB de VRAM es suficiente. Para modelos de 13B, se recomienda 24 GB de VRAM, como una RTX 3090.
¿Puedo usar RAG sin GPU?
Sí, RAG también funciona en CPU. El LLM y el modelo de embedding se ejecutan entonces en RAM. Sin embargo, la velocidad es significativamente menor. Para uso interactivo, se recomienda una GPU.
¿Cuánta RAM necesito para RAG?
Mínimo 32 GB para configuraciones RAG pequeñas. Para bases de datos vectoriales con cientos de miles de vectores, deberías planificar 64 GB o más. Las necesidades crecen con el número de documentos.
¿Es suficiente una RTX 3060 para RAG?
Sí, la RTX 3060 con 12 GB de VRAM es un buen comienzo. Ejecuta un LLM de 7B y un modelo de embedding pequeño simultáneamente. Para modelos de 13B, el VRAM se ajusta.
¿Puedo usar LLM y modelo de embedding simultáneamente en la GPU?
Sí, si hay suficiente VRAM disponible. Ollama mantiene ambos modelos en memoria si hay espacio. Con VRAM limitado, Ollama descarga modelos automáticamente.
¿Cuál es la mejor base de datos vectorial para RAG local?
Chroma es fácil de configurar y buena para principiantes. Qdrant es más performante y escala mejor con colecciones grandes. Ambas se ejecutan localmente y mantienen sus datos en RAM.
¿Cuánto espacio de almacenamiento necesito para RAG?
Los modelos requieren de 3 a 40 GB por modelo. La base de datos vectorial necesita aproximadamente 3 KB por vector más índice. Los documentos originales requieren entre 1 y 10 MB según el formato. Una SSD NVMe de 2 TB es suficiente para la mayoría de configuraciones.
¿Necesito una SSD NVMe para RAG?
Recomendado, sí. RAG carga modelos regularmente y al iniciar carga la base de datos vectorial. NVMe con 3.500 MB/s reduce significativamente los tiempos de carga en comparación con SSDs SATA de 550 MB/s.
¿Qué es el intercambio de modelos en RAG?
El intercambio de modelos significa descargar el LLM para cargar el modelo de embedding, y viceversa. Esto sucede automáticamente cuando el VRAM es insuficiente. La desventaja es el tiempo de carga en cada cambio.
¿Cómo afecta la longitud de contexto al consumo de VRAM en RAG?
En RAG, añades varios fragmentos de texto encontrados al prompt. Cada token adicional en el contexto amplía el caché KV, que reside en VRAM. Con 10 fragmentos de 500 tokens cada uno, tienes 5.000 tokens de contexto, que pueden consumir varios GB de VRAM adicionales.
¿Vale la pena el reranking para RAG local?
El reranking mejora el orden de los resultados de búsqueda y puede aumentar la calidad de las respuestas. Sin embargo, requiere VRAM adicional para otro modelo y cuesta tiempo de cálculo. Para colecciones de documentos pequeñas a menudo no es necesario, pero para colecciones grandes con muchos resultados puede ayudar.
Fuentes y lecturas recomendadas
- Biblioteca de modelos Ollama
- Documentación de Ollama
- Chroma Base de datos vectorial
- Qdrant Base de datos vectorial
- Especificaciones GPU de NVIDIA
- Modelos de embeddings en Hugging Face
- Hardware para RAG en Amazon Shop


