Skip to content
BotServBotServ
Agentes IAPC IAGuía de compraMulti-AgentLangGraphCrewAIVRAMAmazon

PC para Agentes IA: Hardware para Sistemas Autónomos

¿Qué PC para agentes IA? Hardware para LangGraph, CrewAI, AutoGen y sistemas multi-agente. VRAM, RAM y modelos paralelos.

S

schutzgeist

12 min read
PC para Agentes IA: Hardware para Sistemas Autónomos

PC para agentes de IA: hardware para sistemas autónomos

Qué cubre este artículo sobre hardware para agentes de IA

  • Qué requisitos de hardware surgen de agentes paralelos y tool-calling
  • Cuánta VRAM necesitas para sistemas de un agente y múltiples agentes
  • Por qué los agentes requieren más RAM y reservas de CPU que aplicaciones de chat puro
  • Qué GPUs funcionan bien con LangGraph, CrewAI y AutoGen
  • Propuestas de builds concretos para PCs de agentes en diferentes rangos de precio

Introducción: hardware para agentes de IA explicado de forma accesible

Ejecutar un LLM individual en tu máquina local es hoy sencillo. Inicias Ollama, descargas un modelo cuantizado y estás listo. Los agentes de IA, sin embargo, plantean requisitos distintos para tu hardware. Invocan herramientas, buscan en la web, ejecutan código y se comunican entre sí. En lugar de una única inferencia por consulta, se generan docenas de llamadas, algunas en paralelo, otras en secuencia.

Si te interesa aprender los fundamentos de los agentes, encontrarás más en Conceptos básicos de agentes de IA y en la descripción general de sistemas de agentes. Este artículo se enfoca en el aspecto del hardware: ¿qué PC es adecuado para frameworks de agentes como LangGraph, CrewAI y AutoGen, y qué debes tener en cuenta al comprar?

¿Por qué necesito hardware especializado para agentes?

Un escenario simple de chat carga un modelo en VRAM y espera consultas. La inferencia es el único paso computacional. Un agente, en cambio, trabaja en bucles: planifica, invoca herramientas, evalúa resultados y planifica nuevamente. Cada uno de estos pasos puede desencadenar una o más inferencias.

Un ejemplo concreto: ejecutas un sistema multi-agente con tres agentes. El agente A es un planificador, el agente B realiza búsquedas web, el agente C escribe y ejecuta código. Si mantienes los tres agentes activos simultáneamente, se ejecutan tres inferencias separadas. Bien tienes suficiente VRAM para mantener tres modelos en memoria en paralelo, o tu sistema debe descargar modelos de VRAM y recargarlos. Esto se llama model swapping y consume tiempo valioso.

En sistemas multi-agente, además, los agentes se comunican entre sí. Cada mensaje genera contexto que se mantiene en el KV-cache. Con cada tool-call, el contexto crece y el requisito de memoria aumenta.

Hardware para agentes de IA brevemente explicado

Para agentes de IA necesitas más VRAM y RAM que para chat puro. Un setup de un agente con un modelo de 8B requiere entre 12 y 16 GB de VRAM. Sistemas multi-agente con tres o más agentes necesitan 24 GB de VRAM o más si quieres mantener modelos en paralelo. Además, deberías planificar 32 GB de RAM para ejecución de herramientas, automatización de navegador y code execution, preferiblemente 64 GB.

¿Para quién está destinado este artículo?

Este artículo está dirigido a desarrolladores y entusiastas de tecnología que quieren trabajar localmente con frameworks de agentes. Probablemente ya tengas experiencia con Ollama o LM Studio y ahora quieras dar el siguiente paso. Planeas implementar LangGraph, CrewAI o AutoGen localmente y buscas una recomendación de hardware fundamentada. Si acabas de empezar, primero consulta la guía general de compra.

Términos importantes relacionados con hardware de agentes

TérminoSignificado
VRAMMemoria de la tarjeta gráfica donde residen modelos y KV-cache. Fundamental para inferencia paralela.
RAMMemoria de acceso aleatorio del sistema. Importante para ejecución de herramientas, automatización de navegador y ejecución de código.
Multi-ModelMúltiples modelos simultáneamente en VRAM, por ejemplo un LLM más un modelo de embedding.
Model SwappingLos modelos se descargan de VRAM y se recargan según sea necesario. Consume tiempo.
Parallel InferenceMúltiples inferencias ejecutándose simultáneamente en la misma GPU. Aumenta el requisito de VRAM.
OLLAMA_NUM_PARALLELVariable de entorno en Ollama que controla cuántas solicitudes se procesan en paralelo.
KV-CacheAlmacena valores de atención ya calculados. Crece con el contexto y consume VRAM.
Tool-CallingEl agente invoca herramientas externas, por ejemplo búsqueda web, consultas de API o ejecución de código.
EmbeddingConversión de texto en representaciones vectoriales para bases de datos vectoriales. Requiere su propio modelo.
VektordatenbankAlmacena embeddings para generación aumentada por recuperación, por ejemplo Chroma o Qdrant.

¿Qué hacen diferente los agentes de IA?

Un setup de LLM normal responde una pregunta y termina. Un agente trabaja en iteraciones. Planifica un paso, lo ejecuta, evalúa el resultado y decide qué sucede después. Esto significa:

  • Muchas llamadas de API: Cada paso del agente genera al menos una inferencia. Con tareas complejas, fácilmente acumulas 20 a 50 llamadas.
  • Ejecución de herramientas: Los agentes invocan herramientas que consumen CPU y RAM. Automatización de navegador con Playwright requiere RAM, ejecución de código requiere un sandbox.
  • Contexto creciente: Cada tool-call expande el contexto. El KV-cache crece y consume más VRAM.
  • Agentes paralelos: En sistemas multi-agente, múltiples agentes se ejecutan simultáneamente. Esto multiplica el requisito de VRAM.

La latencia por paso es crítica. Si un agente requiere cinco pasos y cada paso tarda 3 segundos, estás en 15 segundos. Con agentes paralelos puedes reducir la duración total, pero necesitas el hardware para ello.

Requisitos de hardware para agentes

EscenarioVRAMRAMModelos típicos
Un agente, modelo de 8B12 a 16 GB32 GBLlama 3.1 8B, Qwen 2.5 7B
Un agente + Embedding16 a 24 GB32 GBLLM de 8B más nomic-embed-text
3 agentes, modelos de 8B24 a 48 GB64 GBTres modelos de 8B en paralelo
5+ agentes, mixtos48 GB o más64 a 128 GBMúltiples modelos, embedding, visión

Los valores aplican para modelos cuantizados, típicamente 4-bit o 5-bit. Encontrarás más sobre cuantización en el artículo correspondiente. Si no cuantizas, necesitarás significativamente más VRAM.

Modelos paralelos vs. model swapping

Hay dos estrategias para trabajar con múltiples modelos en un sistema de agentes:

Modelos paralelos: Cargas todos los modelos simultáneamente en VRAM. Es rápido porque no requiere cargar y descargar. La desventaja: necesitas suficiente VRAM para todos los modelos más sus KV-caches. Tres modelos de 8B en 4-bit requieren aproximadamente 3 x 5 GB para los pesos, más KV-cache por modelo. Eso suma rápidamente entre 20 a 30 GB.

Model swapping: Cargas solo el modelo que está activo actualmente. Cuando el agente B es su turno, el modelo del agente A se descarga y se carga el modelo B. Ahorra VRAM pero consume tiempo. Cada intercambio tarda varios segundos, dependiendo del tamaño del modelo y el ancho de banda de memoria. Con agentes que tienen muchas iteraciones, se acumula.

La recomendación: si tienes suficiente VRAM, prefiere modelos paralelos. La ventaja de velocidad es perceptible en cargas de trabajo de agentes. Para más información sobre dimensionamiento de memoria, consulta el artículo Dimensionar hardware correctamente.

Recomendaciones de GPU para Agentes

Con agentes necesitas VRAM para tres cosas simultáneamente:

  1. El modelo principal: El LLM que gestiona la lógica del agente.
  2. El modelo de embedding: Para bases de datos vectoriales y recuperación. Pequeño, pero siempre cargado.
  3. Opcionalmente un modelo de visión: Si tu agente necesita procesar imágenes.
GPUVRAMIdoneidad
RTX 3060 12 GB12 GBUn único agente con modelo de 8B, justo
RTX 4060 Ti 16 GB16 GBUn agente único más embedding
RTX 309024 GB2 o 3 agentes en paralelo, opción sólida
RTX 409024 GB3 agentes, inferencia más rápida
2x RTX 309048 GB5+ agentes, configuración multi-modelo
RTX 509032 GB3 o 4 agentes, lo más avanzado actualmente

Una RTX 3090 de segunda mano con 24 GB de VRAM sigue siendo la mejor relación calidad-precio para configuraciones de agentes. Si compras nuevo y tienes presupuesto, la RTX 5090 con 32 GB es una opción muy sólida.

RAM y CPU para Agentes

Los agentes no solo exigen potencia de GPU. La ejecución de herramientas ocurre en la CPU y RAM:

  • Automatización de navegador: Playwright o Selenium lanzan procesos de navegador. Cada uno consume entre 200 y 500 MB de RAM.
  • Ejecución de código: Cuando un agente ejecuta código, lo hace en un proceso separado. Los entornos sandbox requieren RAM adicional.
  • Bases de datos vectoriales: Chroma, Qdrant o FAISS mantienen embeddings en RAM.
  • Overhead del framework: LangGraph, CrewAI y AutoGen consumen recursos de CPU para la orquestación.

Recomendación: mínimo 32 GB de RAM, mejor 64 GB. En sistemas multi-agente con automatización de navegador y ejecución de código, 64 GB tiene sentido. La CPU debe tener al menos 8 núcleos, idealmente 12 o más, para que la ejecución de herramientas y el framework funcionen en paralelo con la inferencia de GPU.

Hardware Recomendada en Amazon

Hardware para Agentes de IA en Amazon

Bei Amazon ansehen

Affiliate-Link: Bei einem Kauf erhalten wir möglicherweise eine Provision.

Propuestas de Configuración para PCs de Agentes

Configuración 1: Entrada Single-Agent (aprox. 800 a 1.200 EUR)

  • GPU: RTX 4060 Ti 16 GB
  • CPU: AMD Ryzen 5 7600 o Intel Core i5-13400
  • RAM: 32 GB DDR5
  • SSD: 1 TB NVMe
  • Fuente de alimentación: 650 W

Suficiente para un agente con modelo de 8B más modelo de embedding. Ideal para experimentar con LangGraph y CrewAI con agentes individuales.

Configuración 2: Estación de Trabajo Multi-Agente (aprox. 2.000 a 3.000 EUR)

  • GPU: RTX 3090 24 GB (de segunda mano) o RTX 4090 24 GB (nueva)
  • CPU: AMD Ryzen 9 7900X o Intel Core i7-13700K
  • RAM: 64 GB DDR5
  • SSD: 2 TB NVMe
  • Fuente de alimentación: 850 W a 1.000 W

VRAM suficiente para 2 o 3 agentes en paralelo. 64 GB de RAM para automatización de navegador y ejecución de código. Esta configuración cubre la mayoría de escenarios con agentes.

Configuración 3: Servidor Multi-Agente (aprox. 4.000 a 6.000 EUR)

  • GPU: 2x RTX 3090 24 GB (48 GB totales) o RTX 5090 32 GB
  • CPU: AMD Ryzen 9 7950X o Intel Core i9-13900K
  • RAM: 128 GB DDR5
  • SSD: 4 TB NVMe
  • Fuente de alimentación: 1.200 W

Para 5 o más agentes en paralelo, configuraciones multi-modelo y pipelines de agentes de larga duración. 128 GB de RAM aseguran que bases de datos vectoriales, navegadores y entornos sandbox funcionen simultáneamente.

Trampas Típicas en Hardware para Agentes

  • VRAM subestimado: Los agentes no solo necesitan espacio para el modelo, sino también para el cache KV que crece. En conversaciones largas, el cache KV puede ocupar varios GB.
  • Modelo de embedding olvidado: Junto al LLM corre un modelo de embedding para la base de datos vectorial. Requiere VRAM adicional, frecuentemente 1 o 2 GB.
  • OLLAMA_NUM_PARALLEL configurado incorrectamente: Por defecto, Ollama procesa una solicitud a la vez. Para agentes en paralelo debes aumentar este valor, lo que a su vez requiere más VRAM.
  • RAM para tool execution ignorado: La automatización de navegador y ejecución de código se ejecutan en CPU y RAM. Sin suficiente memoria, obtendrás errores OOM.
  • Model swapping en lugar de modelos paralelos: Con muchos pasos de agentes, cargar y descargar constantemente cuesta mucho tiempo. Es mejor planificar VRAM suficiente.
  • Ancho de banda de memoria descuidado: En model swapping, el ancho de banda de memoria es decisivo. Las SSDs NVMe son obligatorias, las SSDs SATA son demasiado lentas.
  • Fuente de alimentación insuficiente: Dos GPUs necesitan bastante energía. Una fuente de 850 W sirve para una RTX 4090, con dos tarjetas necesitas 1.000 W o más.
  • Refrigeración no considerada: Las cargas de trabajo de agentes a menudo se ejecutan durante horas. El hardware debe mantenerse estable continuamente bajo carga.

Hardware, Costes y Seguridad en Hardware para Agentes

Los PCs para agentes son más caros que máquinas solo para chat, porque requieren más VRAM y RAM. Los costes oscilan entre 800 EUR para un inicio single-agent y 6.000 EUR para un servidor multi-agente. Hardware de segunda mano, especialmente RTX 3090, puede reducir significativamente los costes.

En cuanto a seguridad, asegúrate de que la ejecución de código ocurra en un sandbox. Los agentes que ejecutan código pueden poner en riesgo tu sistema si no están aislados. Contenedores Docker o máquinas virtuales separadas son apropiados aquí. Más información sobre seguridad en Fundamentos de Agentes de IA.

Enlaces adicionales e información sobre Hardware para Agentes

FAQ: PC para Agentes de IA - Preguntas Típicas

¿Cuánto VRAM necesito para un agente único?

Para un single-agent con un modelo de 8B en cuantización de 4 bits, 12 a 16 GB de VRAM son suficientes. Si además cargas un modelo de embedding, planifica 16 a 24 GB.

¿Es suficiente una RTX 3060 con 12 GB para agentes?

Para un agente único con un modelo pequeño sí. Para sistemas multi-agente o modelos en paralelo se queda corta. Tendrías que trabajar con model swapping, lo que aumenta la latencia.

¿Qué significa OLLAMA_NUM_PARALLEL y por qué es importante?

Es una variable de entorno en Ollama que controla cuántas solicitudes se procesan simultáneamente. Para agentes en paralelo debes aumentar el valor, por ejemplo a 3 o 4. Pero esto requiere más VRAM por solicitud paralela.

¿Necesito una base de datos vectorial para agentes?

No es obligatorio, pero muchas configuraciones de agentes utilizan Retrieval-Augmented Generation. Para esto necesitas una base de datos vectorial como Chroma o Qdrant más un modelo de embedding. Ambos requieren RAM y VRAM adicionales.

¿Vale la pena una RTX 3090 de segunda mano para agentes?

Sí. La RTX 3090 ofrece 24 GB de VRAM y de segunda mano es significativamente más barata que una RTX 4090 nueva. Para configuraciones multi-agente es actualmente la mejor opción en relación calidad-precio.

¿Cuánto RAM necesito para automatización de navegador en agentes?

Cada proceso de navegador necesita 200 a 500 MB de RAM. Si tu agente abre múltiples pestañas o sesiones de navegador en paralelo, deberías planificar al menos 64 GB de RAM.

¿Puedo ejecutar agentes en un Mac con Apple Silicon?

Sí, con limitaciones. Apple Silicon utiliza Unified Memory, lo que proporciona mucho espacio para modelos. Sin embargo, no todos los frameworks de agentes están óptimamente optimizados para macOS. La automatización de navegador y ejecución de código funcionan, pero las herramientas específicas de CUDA no se ejecutan nativamente.

¿Qué es mejor: un modelo grande o varios pequeños para multi-agente?

Depende del caso de uso. Un modelo grande (por ejemplo, 70B) como agente central es a menudo más preciso. Múltiples modelos pequeños (por ejemplo, 8B) para agentes especializados son más rápidos y requieren menos VRAM por agente. Muchas configuraciones multi-agente utilizan varios modelos pequeños.

¿Necesito un procesador especial para agentes?

No es obligatorio, pero los agentes se benefician de más núcleos de CPU. La ejecución de herramientas, overhead del framework y bases de datos vectoriales se ejecutan en la CPU. Un procesador con 12 o más núcleos es recomendable.

¿Cuán importante es la velocidad del SSD en agentes?

Muy importante, especialmente si practicas model swapping. Los SSDs NVMe cargan modelos mucho más rápido que los SSDs SATA. Con modelos en paralelo que permanecen en VRAM, la velocidad del SSD es menos crítica.

¿Puedo ejecutar agentes en múltiples GPUs?

Sí. Ollama y otros motores de inferencia soportan configuraciones multi-GPU. Dos RTX 3090 con 24 GB cada una te dan 48 GB totales, suficiente para varios modelos en paralelo.

¿Cuánta energía consume un PC de agentes bajo carga?

Una configuración single-agent con una RTX 4060 Ti consume aproximadamente 300 a 400 vatios bajo carga. Una estación de trabajo multi-agente con dos RTX 3090 puede consumir 700 a 900 vatios. Presta atención a una fuente de alimentación adecuadamente dimensionada.

Fuentes y referencias

Volver al blog
Share:

Entradas relacionadas