Monitoreo de GPU para IA local
Qué cubre este artículo sobre monitoreo de GPU
- Por qué el monitoreo de GPU es importante en IA local.
- Qué métricas debes observar.
- Qué herramientas están disponibles para NVIDIA, AMD e Intel.
- Cómo capturar utilización, VRAM, temperatura y consumo de energía.
- Dashboards, alarmas y errores comunes.
Introducción: Monitoreo de GPU para IA local
Las cargas de trabajo de IA local exigen mucho de la tarjeta gráfica. Los modelos grandes llenan la VRAM, los cálculos calientan la GPU y las respuestas lentas suelen indicar cuellos de botella en recursos. Si configuras monitoreo de GPU, identificas limitaciones temprano, evitas fallos y puedes optimizar o mejorar hardware de forma dirigida.
El monitoreo de GPU no es interesante solo para servidores grandes. Incluso un mini-PC o una estación de trabajo individual se benefician al ver cuánta memoria necesitan los modelos y cómo evolucionan la temperatura y el rendimiento a lo largo del día.
¿Por qué necesito monitoreo de GPU?
Sin monitoreo trabajas sin visibilidad:
- No sabes si el modelo se ejecuta en GPU o CPU.
- Los cuellos de botella de VRAM causan fallos.
- Temperaturas altas pueden dañar el hardware.
- Los flujos de trabajo lentos no se pueden explicar.
- Las configuraciones multiusuario se vuelven impredecibles.
Con monitoreo puedes:
- Dimensionar modelos según tu hardware,
- Elegir niveles de cuantización,
- Ajustar ventiladores y refrigeración,
- Identificar picos de carga,
- Estimar costos y consumo de energía.
Métricas importantes
- Utilización de GPU: Qué porcentaje de la GPU está calculando en este momento.
- Uso de VRAM: Memoria de video ocupada en GB.
- Temperatura de GPU: Generación de calor de la tarjeta.
- Consumo de energía: Uso de corriente en watts.
- Clock: Frecuencias de GPU y memoria.
- VRAM por proceso: Cuánta memoria ocupa cada proceso.
- Time-to-First-Token: Velocidad de la primera respuesta.
- Tokens por segundo: Velocidad de generación.
Herramientas para NVIDIA
nvidia-smi
La herramienta estándar de línea de comandos para GPUs NVIDIA. Muestra utilización, VRAM, temperatura y procesos.
nvidia-smi
nvidia-smi dmon
nvidia-smi pmon
nvtop
Una vista similar a top para GPUs. Más legible que nvidia-smi y también soporta AMD e Intel.
nvtop
Prometheus y Grafana
Para monitoreo a largo plazo y dashboards. NVIDIA Data Center GPU Manager o exportadores de la comunidad proporcionan métricas.
Netdata
Solución de monitoreo basada en agentes simple con métricas de GPU.
Herramientas para AMD
- radeontop: Muestra utilización de GPU AMD.
- amdgpu-pro: Herramientas propietarias y controladores.
- ROCm-SMI: Similar a nvidia-smi para la plataforma ROCm.
- nvtop: Soporta AMD.
Herramientas para Intel
- intel-gpu-top: Utilización de GPUs Intel.
- xpu-smi: Para GPUs Intel Data Center.
- nvtop: Soporta Intel Arc y GPUs integradas.
Capturar métricas en Docker
Cuando Ollama o vLLM se ejecutan en contenedores, debes leer métricas de GPU en el host o dentro del contenedor. NVIDIA Container Toolkit hace que nvidia-smi esté disponible dentro del contenedor. Los exportadores de Prometheus suelen ejecutarse como contenedores separados.
Construir dashboards
Un buen dashboard muestra:
- Utilización actual de GPU y VRAM por tarjeta.
- Carga histórica y temperatura en las últimas 24 horas.
- Procesos con uso de GPU.
- Alarmas si la temperatura es muy alta o la VRAM está llena.
- Comparación entre múltiples GPUs.
Alarmas y umbrales
Límites sensatos:
- Temperatura: Alarma a partir de 80 grados Celsius.
- VRAM: Advertencia al 85 por ciento, crítico al 95 por ciento.
- Utilización de GPU: A largo plazo el 95-100 por ciento está bien, pero mantén la temperatura en mente.
- Procesos: Procesos inesperados con alto consumo de VRAM.
Errores comunes
- Sin monitoreo en contenedor: Los datos de GPU no son visibles dentro del contenedor.
- Solo observaciones breves: Se pierden picos y tendencias.
- Sensores incorrectos: AMD e Intel requieren herramientas diferentes.
- Alarmas demasiado tardías: Umbrales muy altos o mal configurados.
- Sin asignación de procesos: No sabes qué servicio está usando la GPU.
Enlaces e información adicional
- BotServ.de Monitoreo en Self-Hosting
- BotServ.de Calculadora de VRAM
- BotServ.de Hardware de IA local
- nvtop
FAQ: Monitoreo de GPU
¿Cuál es la mejor herramienta para empezar? Para NVIDIA, nvidia-smi está disponible inmediatamente. nvtop es más legible y multiplataforma.
¿Puedo mostrar métricas de GPU en Grafana? Sí, con exportadores de Prometheus para NVIDIA, AMD o Intel.
¿Qué significa alta utilización de GPU con bajo VRAM? El modelo es lo suficientemente pequeño para la GPU, pero la GPU hace cálculos intensivos.
¿Cómo reconozco cuellos de botella de VRAM? Uso de VRAM cerca de la capacidad máxima y generación lenta o interrumpida son señales típicas.
¿Debo priorizar temperatura o utilización? Ambas. Alta utilización con temperatura aceptable es normal. Temperatura alta daña el hardware a largo plazo.
Fuentes y lecturas adicionales
- nvtop: https://github.com/Syllo/nvtop
- nvidia-smi docs: https://developer.nvidia.com/nvidia-management-library-nvml
- Netdata: https://www.netdata.cloud/
Resumen: Monitoreo de GPU para IA local
El monitoreo de GPU ayuda a ejecutar cargas de trabajo de IA local de forma estable y eficiente. Las métricas importantes son utilización de GPU, VRAM, temperatura y frecuencia. Herramientas como nvidia-smi, nvtop, Prometheus y Grafana cubren la mayoría de escenarios. En configuraciones multiusuario y operación continua, el monitoreo a largo plazo y las alarmas son esenciales. Quien mantiene su GPU bajo vigilancia elige mejores modelos, evita cuellos de botella y cuida el hardware.


