PC para agentes de IA: hardware para sistemas autónomos
Qué cubre este artículo sobre hardware para agentes de IA
- Qué requisitos de hardware surgen de agentes paralelos y tool-calling
- Cuánta VRAM necesitas para sistemas de un agente y múltiples agentes
- Por qué los agentes requieren más RAM y reservas de CPU que aplicaciones de chat puro
- Qué GPUs funcionan bien con LangGraph, CrewAI y AutoGen
- Propuestas de builds concretos para PCs de agentes en diferentes rangos de precio
Introducción: hardware para agentes de IA explicado de forma accesible
Ejecutar un LLM individual en tu máquina local es hoy sencillo. Inicias Ollama, descargas un modelo cuantizado y estás listo. Los agentes de IA, sin embargo, plantean requisitos distintos para tu hardware. Invocan herramientas, buscan en la web, ejecutan código y se comunican entre sí. En lugar de una única inferencia por consulta, se generan docenas de llamadas, algunas en paralelo, otras en secuencia.
Si te interesa aprender los fundamentos de los agentes, encontrarás más en Conceptos básicos de agentes de IA y en la descripción general de sistemas de agentes. Este artículo se enfoca en el aspecto del hardware: ¿qué PC es adecuado para frameworks de agentes como LangGraph, CrewAI y AutoGen, y qué debes tener en cuenta al comprar?
¿Por qué necesito hardware especializado para agentes?
Un escenario simple de chat carga un modelo en VRAM y espera consultas. La inferencia es el único paso computacional. Un agente, en cambio, trabaja en bucles: planifica, invoca herramientas, evalúa resultados y planifica nuevamente. Cada uno de estos pasos puede desencadenar una o más inferencias.
Un ejemplo concreto: ejecutas un sistema multi-agente con tres agentes. El agente A es un planificador, el agente B realiza búsquedas web, el agente C escribe y ejecuta código. Si mantienes los tres agentes activos simultáneamente, se ejecutan tres inferencias separadas. Bien tienes suficiente VRAM para mantener tres modelos en memoria en paralelo, o tu sistema debe descargar modelos de VRAM y recargarlos. Esto se llama model swapping y consume tiempo valioso.
En sistemas multi-agente, además, los agentes se comunican entre sí. Cada mensaje genera contexto que se mantiene en el KV-cache. Con cada tool-call, el contexto crece y el requisito de memoria aumenta.
Hardware para agentes de IA brevemente explicado
Para agentes de IA necesitas más VRAM y RAM que para chat puro. Un setup de un agente con un modelo de 8B requiere entre 12 y 16 GB de VRAM. Sistemas multi-agente con tres o más agentes necesitan 24 GB de VRAM o más si quieres mantener modelos en paralelo. Además, deberías planificar 32 GB de RAM para ejecución de herramientas, automatización de navegador y code execution, preferiblemente 64 GB.
¿Para quién está destinado este artículo?
Este artículo está dirigido a desarrolladores y entusiastas de tecnología que quieren trabajar localmente con frameworks de agentes. Probablemente ya tengas experiencia con Ollama o LM Studio y ahora quieras dar el siguiente paso. Planeas implementar LangGraph, CrewAI o AutoGen localmente y buscas una recomendación de hardware fundamentada. Si acabas de empezar, primero consulta la guía general de compra.
Términos importantes relacionados con hardware de agentes
| Término | Significado |
|---|---|
| VRAM | Memoria de la tarjeta gráfica donde residen modelos y KV-cache. Fundamental para inferencia paralela. |
| RAM | Memoria de acceso aleatorio del sistema. Importante para ejecución de herramientas, automatización de navegador y ejecución de código. |
| Multi-Model | Múltiples modelos simultáneamente en VRAM, por ejemplo un LLM más un modelo de embedding. |
| Model Swapping | Los modelos se descargan de VRAM y se recargan según sea necesario. Consume tiempo. |
| Parallel Inference | Múltiples inferencias ejecutándose simultáneamente en la misma GPU. Aumenta el requisito de VRAM. |
OLLAMA_NUM_PARALLEL | Variable de entorno en Ollama que controla cuántas solicitudes se procesan en paralelo. |
| KV-Cache | Almacena valores de atención ya calculados. Crece con el contexto y consume VRAM. |
| Tool-Calling | El agente invoca herramientas externas, por ejemplo búsqueda web, consultas de API o ejecución de código. |
| Embedding | Conversión de texto en representaciones vectoriales para bases de datos vectoriales. Requiere su propio modelo. |
| Vektordatenbank | Almacena embeddings para generación aumentada por recuperación, por ejemplo Chroma o Qdrant. |
¿Qué hacen diferente los agentes de IA?
Un setup de LLM normal responde una pregunta y termina. Un agente trabaja en iteraciones. Planifica un paso, lo ejecuta, evalúa el resultado y decide qué sucede después. Esto significa:
- Muchas llamadas de API: Cada paso del agente genera al menos una inferencia. Con tareas complejas, fácilmente acumulas 20 a 50 llamadas.
- Ejecución de herramientas: Los agentes invocan herramientas que consumen CPU y RAM. Automatización de navegador con Playwright requiere RAM, ejecución de código requiere un sandbox.
- Contexto creciente: Cada tool-call expande el contexto. El KV-cache crece y consume más VRAM.
- Agentes paralelos: En sistemas multi-agente, múltiples agentes se ejecutan simultáneamente. Esto multiplica el requisito de VRAM.
La latencia por paso es crítica. Si un agente requiere cinco pasos y cada paso tarda 3 segundos, estás en 15 segundos. Con agentes paralelos puedes reducir la duración total, pero necesitas el hardware para ello.
Requisitos de hardware para agentes
| Escenario | VRAM | RAM | Modelos típicos |
|---|---|---|---|
| Un agente, modelo de 8B | 12 a 16 GB | 32 GB | Llama 3.1 8B, Qwen 2.5 7B |
| Un agente + Embedding | 16 a 24 GB | 32 GB | LLM de 8B más nomic-embed-text |
| 3 agentes, modelos de 8B | 24 a 48 GB | 64 GB | Tres modelos de 8B en paralelo |
| 5+ agentes, mixtos | 48 GB o más | 64 a 128 GB | Múltiples modelos, embedding, visión |
Los valores aplican para modelos cuantizados, típicamente 4-bit o 5-bit. Encontrarás más sobre cuantización en el artículo correspondiente. Si no cuantizas, necesitarás significativamente más VRAM.
Modelos paralelos vs. model swapping
Hay dos estrategias para trabajar con múltiples modelos en un sistema de agentes:
Modelos paralelos: Cargas todos los modelos simultáneamente en VRAM. Es rápido porque no requiere cargar y descargar. La desventaja: necesitas suficiente VRAM para todos los modelos más sus KV-caches. Tres modelos de 8B en 4-bit requieren aproximadamente 3 x 5 GB para los pesos, más KV-cache por modelo. Eso suma rápidamente entre 20 a 30 GB.
Model swapping: Cargas solo el modelo que está activo actualmente. Cuando el agente B es su turno, el modelo del agente A se descarga y se carga el modelo B. Ahorra VRAM pero consume tiempo. Cada intercambio tarda varios segundos, dependiendo del tamaño del modelo y el ancho de banda de memoria. Con agentes que tienen muchas iteraciones, se acumula.
La recomendación: si tienes suficiente VRAM, prefiere modelos paralelos. La ventaja de velocidad es perceptible en cargas de trabajo de agentes. Para más información sobre dimensionamiento de memoria, consulta el artículo Dimensionar hardware correctamente.
Recomendaciones de GPU para Agentes
Con agentes necesitas VRAM para tres cosas simultáneamente:
- El modelo principal: El LLM que gestiona la lógica del agente.
- El modelo de embedding: Para bases de datos vectoriales y recuperación. Pequeño, pero siempre cargado.
- Opcionalmente un modelo de visión: Si tu agente necesita procesar imágenes.
| GPU | VRAM | Idoneidad |
|---|---|---|
| RTX 3060 12 GB | 12 GB | Un único agente con modelo de 8B, justo |
| RTX 4060 Ti 16 GB | 16 GB | Un agente único más embedding |
| RTX 3090 | 24 GB | 2 o 3 agentes en paralelo, opción sólida |
| RTX 4090 | 24 GB | 3 agentes, inferencia más rápida |
| 2x RTX 3090 | 48 GB | 5+ agentes, configuración multi-modelo |
| RTX 5090 | 32 GB | 3 o 4 agentes, lo más avanzado actualmente |
Una RTX 3090 de segunda mano con 24 GB de VRAM sigue siendo la mejor relación calidad-precio para configuraciones de agentes. Si compras nuevo y tienes presupuesto, la RTX 5090 con 32 GB es una opción muy sólida.
RAM y CPU para Agentes
Los agentes no solo exigen potencia de GPU. La ejecución de herramientas ocurre en la CPU y RAM:
- Automatización de navegador: Playwright o Selenium lanzan procesos de navegador. Cada uno consume entre 200 y 500 MB de RAM.
- Ejecución de código: Cuando un agente ejecuta código, lo hace en un proceso separado. Los entornos sandbox requieren RAM adicional.
- Bases de datos vectoriales: Chroma, Qdrant o FAISS mantienen embeddings en RAM.
- Overhead del framework: LangGraph, CrewAI y AutoGen consumen recursos de CPU para la orquestación.
Recomendación: mínimo 32 GB de RAM, mejor 64 GB. En sistemas multi-agente con automatización de navegador y ejecución de código, 64 GB tiene sentido. La CPU debe tener al menos 8 núcleos, idealmente 12 o más, para que la ejecución de herramientas y el framework funcionen en paralelo con la inferencia de GPU.
Hardware Recomendada en Amazon
Hardware para Agentes de IA en Amazon
Bei Amazon ansehenAffiliate-Link: Bei einem Kauf erhalten wir möglicherweise eine Provision.
Propuestas de Configuración para PCs de Agentes
Configuración 1: Entrada Single-Agent (aprox. 800 a 1.200 EUR)
- GPU: RTX 4060 Ti 16 GB
- CPU: AMD Ryzen 5 7600 o Intel Core i5-13400
- RAM: 32 GB DDR5
- SSD: 1 TB NVMe
- Fuente de alimentación: 650 W
Suficiente para un agente con modelo de 8B más modelo de embedding. Ideal para experimentar con LangGraph y CrewAI con agentes individuales.
Configuración 2: Estación de Trabajo Multi-Agente (aprox. 2.000 a 3.000 EUR)
- GPU: RTX 3090 24 GB (de segunda mano) o RTX 4090 24 GB (nueva)
- CPU: AMD Ryzen 9 7900X o Intel Core i7-13700K
- RAM: 64 GB DDR5
- SSD: 2 TB NVMe
- Fuente de alimentación: 850 W a 1.000 W
VRAM suficiente para 2 o 3 agentes en paralelo. 64 GB de RAM para automatización de navegador y ejecución de código. Esta configuración cubre la mayoría de escenarios con agentes.
Configuración 3: Servidor Multi-Agente (aprox. 4.000 a 6.000 EUR)
- GPU: 2x RTX 3090 24 GB (48 GB totales) o RTX 5090 32 GB
- CPU: AMD Ryzen 9 7950X o Intel Core i9-13900K
- RAM: 128 GB DDR5
- SSD: 4 TB NVMe
- Fuente de alimentación: 1.200 W
Para 5 o más agentes en paralelo, configuraciones multi-modelo y pipelines de agentes de larga duración. 128 GB de RAM aseguran que bases de datos vectoriales, navegadores y entornos sandbox funcionen simultáneamente.
Trampas Típicas en Hardware para Agentes
- VRAM subestimado: Los agentes no solo necesitan espacio para el modelo, sino también para el cache KV que crece. En conversaciones largas, el cache KV puede ocupar varios GB.
- Modelo de embedding olvidado: Junto al LLM corre un modelo de embedding para la base de datos vectorial. Requiere VRAM adicional, frecuentemente 1 o 2 GB.
OLLAMA_NUM_PARALLELconfigurado incorrectamente: Por defecto, Ollama procesa una solicitud a la vez. Para agentes en paralelo debes aumentar este valor, lo que a su vez requiere más VRAM.- RAM para tool execution ignorado: La automatización de navegador y ejecución de código se ejecutan en CPU y RAM. Sin suficiente memoria, obtendrás errores OOM.
- Model swapping en lugar de modelos paralelos: Con muchos pasos de agentes, cargar y descargar constantemente cuesta mucho tiempo. Es mejor planificar VRAM suficiente.
- Ancho de banda de memoria descuidado: En model swapping, el ancho de banda de memoria es decisivo. Las SSDs NVMe son obligatorias, las SSDs SATA son demasiado lentas.
- Fuente de alimentación insuficiente: Dos GPUs necesitan bastante energía. Una fuente de 850 W sirve para una RTX 4090, con dos tarjetas necesitas 1.000 W o más.
- Refrigeración no considerada: Las cargas de trabajo de agentes a menudo se ejecutan durante horas. El hardware debe mantenerse estable continuamente bajo carga.
Hardware, Costes y Seguridad en Hardware para Agentes
Los PCs para agentes son más caros que máquinas solo para chat, porque requieren más VRAM y RAM. Los costes oscilan entre 800 EUR para un inicio single-agent y 6.000 EUR para un servidor multi-agente. Hardware de segunda mano, especialmente RTX 3090, puede reducir significativamente los costes.
En cuanto a seguridad, asegúrate de que la ejecución de código ocurra en un sandbox. Los agentes que ejecutan código pueden poner en riesgo tu sistema si no están aislados. Contenedores Docker o máquinas virtuales separadas son apropiados aquí. Más información sobre seguridad en Fundamentos de Agentes de IA.
Enlaces adicionales e información sobre Hardware para Agentes
- Fundamentos de Agentes de IA - Introducción al mundo de los agentes
- Sistemas de Agentes - Cómo funcionan los sistemas de agentes
- Sistemas Multi-Agente - Múltiples agentes en conjunto
- Frameworks - LangGraph, CrewAI, AutoGen y más
- Asesoramiento de Compra - Asesoramiento general sobre compra de hardware
- Dimensionar Hardware Correctamente - Planificar memoria y rendimiento adecuadamente
- Ollama - Ejecutar modelos locales
- Cuantización - Reducir el tamaño de modelos
FAQ: PC para Agentes de IA - Preguntas Típicas
¿Cuánto VRAM necesito para un agente único?
Para un single-agent con un modelo de 8B en cuantización de 4 bits, 12 a 16 GB de VRAM son suficientes. Si además cargas un modelo de embedding, planifica 16 a 24 GB.
¿Es suficiente una RTX 3060 con 12 GB para agentes?
Para un agente único con un modelo pequeño sí. Para sistemas multi-agente o modelos en paralelo se queda corta. Tendrías que trabajar con model swapping, lo que aumenta la latencia.
¿Qué significa OLLAMA_NUM_PARALLEL y por qué es importante?
Es una variable de entorno en Ollama que controla cuántas solicitudes se procesan simultáneamente. Para agentes en paralelo debes aumentar el valor, por ejemplo a 3 o 4. Pero esto requiere más VRAM por solicitud paralela.
¿Necesito una base de datos vectorial para agentes?
No es obligatorio, pero muchas configuraciones de agentes utilizan Retrieval-Augmented Generation. Para esto necesitas una base de datos vectorial como Chroma o Qdrant más un modelo de embedding. Ambos requieren RAM y VRAM adicionales.
¿Vale la pena una RTX 3090 de segunda mano para agentes?
Sí. La RTX 3090 ofrece 24 GB de VRAM y de segunda mano es significativamente más barata que una RTX 4090 nueva. Para configuraciones multi-agente es actualmente la mejor opción en relación calidad-precio.
¿Cuánto RAM necesito para automatización de navegador en agentes?
Cada proceso de navegador necesita 200 a 500 MB de RAM. Si tu agente abre múltiples pestañas o sesiones de navegador en paralelo, deberías planificar al menos 64 GB de RAM.
¿Puedo ejecutar agentes en un Mac con Apple Silicon?
Sí, con limitaciones. Apple Silicon utiliza Unified Memory, lo que proporciona mucho espacio para modelos. Sin embargo, no todos los frameworks de agentes están óptimamente optimizados para macOS. La automatización de navegador y ejecución de código funcionan, pero las herramientas específicas de CUDA no se ejecutan nativamente.
¿Qué es mejor: un modelo grande o varios pequeños para multi-agente?
Depende del caso de uso. Un modelo grande (por ejemplo, 70B) como agente central es a menudo más preciso. Múltiples modelos pequeños (por ejemplo, 8B) para agentes especializados son más rápidos y requieren menos VRAM por agente. Muchas configuraciones multi-agente utilizan varios modelos pequeños.
¿Necesito un procesador especial para agentes?
No es obligatorio, pero los agentes se benefician de más núcleos de CPU. La ejecución de herramientas, overhead del framework y bases de datos vectoriales se ejecutan en la CPU. Un procesador con 12 o más núcleos es recomendable.
¿Cuán importante es la velocidad del SSD en agentes?
Muy importante, especialmente si practicas model swapping. Los SSDs NVMe cargan modelos mucho más rápido que los SSDs SATA. Con modelos en paralelo que permanecen en VRAM, la velocidad del SSD es menos crítica.
¿Puedo ejecutar agentes en múltiples GPUs?
Sí. Ollama y otros motores de inferencia soportan configuraciones multi-GPU. Dos RTX 3090 con 24 GB cada una te dan 48 GB totales, suficiente para varios modelos en paralelo.
¿Cuánta energía consume un PC de agentes bajo carga?
Una configuración single-agent con una RTX 4060 Ti consume aproximadamente 300 a 400 vatios bajo carga. Una estación de trabajo multi-agente con dos RTX 3090 puede consumir 700 a 900 vatios. Presta atención a una fuente de alimentación adecuadamente dimensionada.
Fuentes y referencias
- Documentación de Ollama
- Documentación de LangGraph
- Documentación de CrewAI
- Documentación de AutoGen
- Especificaciones de GPU NVIDIA
- Fundamentos de agentes de IA en BotServ.de
- Dimensionar hardware correctamente en BotServ.de


