Skip to content
BotServBotServ
BenchmarksMMLUHumanEvalGSM8KMT-BenchComparaciónModelos

Benchmarks de IA: Comparar modelos objetivamente

Benchmarks de IA: MMLU, HumanEval, GSM8K, MT-Bench y más. Cómo comparar modelos y qué métricas importan.

S

schutzgeist

13 min read
Benchmarks de IA: Comparar modelos objetivamente

Benchmarks de IA: comparar modelos de forma objetiva

Qué encontrarás en este artículo

  • Qué son los benchmarks de IA y por qué importan para comparar modelos
  • Los benchmarks clave: MMLU, HumanEval, GSM8K, MT-Bench y LMSYS Arena
  • Cómo interpretar y comparar correctamente los resultados de benchmarks
  • Qué benchmarks son relevantes para tu caso de uso
  • Las limitaciones y trampas de los benchmarks

Introducción

Si te interesa la IA local, pronto surge una pregunta central: ¿cuál es el mejor modelo? La respuesta no es sencilla, porque “mejor” depende de lo que quieras hacer. Un modelo que genera buen código puede ser débil con textos en español. Uno que domina matemáticas puede decepcionar en tareas creativas.

Para esto sirven los benchmarks. Un benchmark es una prueba estandarizada que evalúa un modelo en una tarea específica y asigna una puntuación al resultado. En lugar de confiar en impresiones subjetivas, un benchmark mide qué tan bien se desempeña un modelo en una tarea claramente definida. Esto permite comparar diferentes modelos de manera objetiva.

En este artículo conocerás los benchmarks más importantes, entenderás qué miden y cómo usar los resultados para elegir tu modelo. Si todavía no tienes claro cuál te conviene, el artículo Encontrar el modelo adecuado te ayuda con la selección inicial.

¿Por qué necesito benchmarks?

Imagina que lees en internet que un nuevo modelo es “revolucionario”. ¿Cómo verificas si es cierto? Sin benchmarks, tu única opción sería probar el modelo por ti mismo y confiar en tu intuición. El problema es que tus pruebas son subjetivas, cubren pocas tareas y son difíciles de comparar con otros modelos.

Los benchmarks resuelven esto. Presentan a cada modelo las mismas preguntas y evalúan las respuestas según reglas fijas. Así puedes ver que el Modelo A resuelve correctamente el 85 por ciento de los problemas de matemáticas, mientras que el Modelo B solo logra el 60 por ciento. Eso es objetivo, reproducible y comparable.

Para la IA local, los benchmarks son especialmente valiosos porque no puedes descargar y probar cada modelo. Un resultado de benchmark te dice si vale la pena descargar el modelo antes de ocupar gigabytes de pesos en tu disco duro. Eso ahorra tiempo y espacio.

Además, los benchmarks ayudan a decidir entre tamaños de modelo. Si ves que un modelo de 9B obtiene casi el mismo resultado en MMLU que uno de 27B, puedes elegir el más pequeño y ahorrar VRAM.

Cómo funcionan los benchmarks

Un benchmark tiene tres componentes: un conjunto de datos con preguntas o tareas, una metodología de evaluación y una puntuación que resume el resultado. El modelo recibe las preguntas, da respuestas y la metodología verifica cuántas son correctas.

Hay dos tipos principales de benchmarks:

Benchmarks de opción múltiple como MMLU presentan al modelo una pregunta y varias opciones de respuesta. El modelo elige una, y la evaluación verifica si es la correcta. Es simple, objetivo y automatizable.

Benchmarks de respuesta libre como MT-Bench dejan que el modelo responda sin restricciones. La evaluación la hacen evaluadores humanos o un modelo de IA que actúa como árbitro. Es más realista, pero menos objetivo.

La mayoría de los benchmarks importantes combinan ambos enfoques. En las siguientes secciones te mostraré cada uno.

Para quién es este artículo

Este artículo es para ti si:

  • Quieres comparar modelos sin probar cada uno por ti mismo
  • Deseas entender mejor los resultados de benchmarks que ves en artículos y foros
  • Quieres tomar una decisión fundamentada sobre qué modelo descargar
  • Necesitas saber qué benchmarks son relevantes para tu caso de uso
  • Te preguntas por qué un modelo es bueno en un benchmark pero malo en otro

Debes entender básicamente qué es un LLM y cómo funcionan los modelos. Si estás empezando, lee primero ¿Qué es la IA local?.

Términos clave

TérminoSignificado
BenchmarkPrueba estandarizada para comparar capacidades de modelos
ScoreValor numérico que resume el resultado de un benchmark
MMLUMassive Multitask Language Understanding, prueba amplia de conocimiento
HumanEvalBenchmark para tareas de programación en Python
GSM8KGrade School Math, problemas matemáticos de nivel primaria
MT-BenchMulti-Turn Benchmark para calidad conversacional
LMSYS ArenaPlataforma para comparaciones a ciegas entre modelos con humanos
Few-ShotMétodo de prueba donde se muestran ejemplos antes de la tarea
Zero-ShotMétodo de prueba donde el modelo resuelve la tarea sin ejemplos
LeaderboardRanking que ordena modelos por resultados de benchmark

Los benchmarks más importantes en detalle

MMLU: medir conocimiento general

MMLU (Massive Multitask Language Understanding) es el benchmark más conocido para evaluar conocimiento general. Contiene más de 15.000 preguntas de opción múltiple de 57 disciplinas distintas, desde historia y derecho hasta medicina y matemáticas. El modelo debe elegir la respuesta correcta entre cuatro opciones.

MMLU mide cuánto conocimiento tiene un modelo y qué tan bien puede recuperar ese conocimiento en diferentes áreas. Una puntuación del 80 por ciento significa que el modelo respondió correctamente el 80 por ciento de las preguntas. Los modelos líderes actuales alcanzan valores superiores al 85 por ciento.

Para la IA local, MMLU es un buen primer filtro. Si un modelo obtiene una mala puntuación en MMLU, probablemente no sea un buen generalista. Sin embargo, MMLU solo mide conocimiento, no la capacidad de escribir textos fluidos o resolver problemas complejos.

HumanEval: evaluar programación

HumanEval es el benchmark estándar para capacidades de programación. Consta de 164 tareas de programación en Python. El modelo recibe una firma de función y una descripción, y debe escribir el código que resuelve la tarea. La evaluación es automática, ejecutando el código generado contra casos de prueba.

Una puntuación del 70 por ciento significa que el modelo resolvió correctamente el 70 por ciento de las tareas. La puntuación se expresa como “pass@1”, lo que significa que el modelo tiene un intento. También existe “pass@10”, donde el modelo tiene diez intentos y uno debe ser correcto.

Para quienes buscan un modelo para programar, HumanEval es el benchmark más importante. Modelos como DeepSeek-Coder y Qwen obtienen resultados especialmente buenos aquí. Encontrarás más sobre estos en los artículos sobre modelos Llama y modelos Qwen.

GSM8K: entender matemáticas

GSM8K (Grade School Math 8K) evalúa la comprensión matemática básica. El benchmark consta de más de 8.000 problemas matemáticos de nivel primaria. Las tareas requieren múltiples pasos de cálculo y pensamiento lógico, pero no matemáticas avanzadas.

A pesar de su nivel básico, GSM8K es sorprendentemente difícil para muchos modelos. La prueba evalúa si un modelo puede pensar lógicamente paso a paso, no solo si ha memorizado hechos. Modelos con capacidades de razonamiento como DeepSeek-R1 tienen especialmente buenos resultados.

La puntuación indica el porcentaje de tareas que el modelo resolvió correctamente. Los modelos líderes actuales superan el 90 por ciento, mientras que los modelos más pequeños frecuentemente se sitúan entre el 50 y el 70 por ciento.

MT-Bench: Evaluación de la calidad en conversaciones

MT-Bench (Multi-Turn Benchmark) mide el desempeño de un modelo en diálogos realistas. El benchmark consiste en conversaciones predefinidas con múltiples turnos. El modelo debe responder no solo la pregunta inicial, sino también las preguntas de seguimiento, manteniendo el contexto de la conversación.

La evaluación la realiza un modelo de IA potente que actúa como juez y califica las respuestas en una escala de 1 a 10. Este enfoque es menos objetivo que los tests de opción múltiple, pero refleja mejor la experiencia real del usuario.

MT-Bench es especialmente relevante si buscas un modelo para aplicaciones de chat. Un modelo puede sobresalir en MMLU pero fallar en MT-Bench si da respuestas rígidas o inapropiadas.

LMSYS Chatbot Arena: La comparación humana

LMSYS Chatbot Arena es una plataforma donde usuarios reales enfrentan dos modelos en una comparación a ciegas. Los usuarios plantean una pregunta, ven las respuestas de ambos modelos (sin saber cuáles son) y votan por la mejor respuesta. A partir de miles de comparaciones, surge un ranking basado en la preferencia humana real.

La Arena utiliza un sistema de clasificación Elo, similar al del ajedrez. Los modelos que ganan frecuentemente suben en el ranking. El resultado es un leaderboard que refleja la calidad percibida por humanos.

Para la IA local, la Arena es especialmente útil porque mide preguntas reales de usuarios y preferencias auténticas, no solo tareas estandarizadas. Sin embargo, la mayoría de modelos comparados son grandes modelos en la nube, y no todos los modelos locales están representados en la Arena.

Comparativa de benchmarks para modelos locales populares

La siguiente tabla muestra resultados típicos de benchmarks para modelos populares de ejecución local. Los valores están redondeados y pueden variar ligeramente según la cuantización y el método de prueba.

ModeloMMLUHumanEvalGSM8KMT-BenchTamaño
Llama 3 8Bca. 68ca. 62ca. 52ca. 8,08B
Llama 3 70Bca. 80ca. 75ca. 82ca. 8,970B
Qwen 2.5 7Bca. 74ca. 70ca. 75ca. 8,37B
Qwen 2.5 32Bca. 83ca. 82ca. 85ca. 9,032B
Gemma 2 9Bca. 72ca. 60ca. 68ca. 8,39B
Gemma 2 27Bca. 76ca. 65ca. 78ca. 8,727B
Mistral 7Bca. 62ca. 40ca. 52ca. 7,67B
DeepSeek-R1 7B Distillca. 70ca. 72ca. 80ca. 8,27B
DeepSeek-R1 32B Distillca. 79ca. 80ca. 88ca. 8,832B

Esta tabla revela patrones importantes: Los modelos Qwen destacan particularmente en programación y matemática. Los DeepSeek-R1 Distill obtienen resultados sorprendentes en GSM8K considerando su tamaño. Gemma 2 27B es notablemente fuerte en MMLU para su escala. Mistral 7B es un buen polivalente, pero tiene limitaciones en programación y matemática.

Encontrarás más detalles sobre cada familia de modelos en los artículos sobre modelos Llama, modelos Qwen y modelos Mistral.

Cómo interpretar resultados de benchmarks

Los resultados de benchmarks son útiles, pero debes leerlos correctamente. Aquí están los consejos más importantes:

Enfócate en el caso de uso: Si buscas un modelo para programación, ignora MMLU y mira HumanEval. Si necesitas matemática, consulta GSM8K. Ningún benchmark individual te dirá si un modelo es apropiado para tu tarea específica.

Compara tamaños similares: Un modelo de 7B con 70 por ciento en MMLU es impresionante. Uno de 70B con 70 por ciento en MMLU es decepcionante. Siempre compara modelos del mismo rango de tamaño.

Ten en cuenta la cuantización: Los resultados de benchmarks generalmente se obtienen con modelos sin cuantizar (FP16). Un modelo cuantizado en Q4_K_M puede tener un desempeño entre 1 y 3 puntos porcentuales inferior. Planifica con esa variación en mente.

Observa tendencias, no valores aislados: Un modelo con 71,3 por ciento en MMLU no es significativamente mejor que uno con 70,8 por ciento. Diferencias menores a 2 puntos porcentuales frecuentemente son ruido estadístico. Busca diferencias claras, no decimales.

Verifica la fecha: Los modelos de IA evolucionan rápidamente. Un resultado de hace un año puede estar desactualizado. Busca resultados recientes.

Ejecutar benchmarks tú mismo

Si ejecutas un modelo localmente y quieres probarlo, puedes correr benchmarks con herramientas como lm-evaluation-harness. Esta es la herramienta estándar que usan la mayoría de desarrolladores de modelos.

# Instalar lm-evaluation-harness
pip install lm-eval

# Ejecutar MMLU con un modelo local
lm_eval --model hf --model_args pretrained=meta-llama/Llama-3-8B-Instruct --tasks mmlu --batch_size 8

Ejecutar benchmarks consume tiempo y recursos computacionales. Para la mayoría de usuarios, es suficiente comparar resultados publicados en lugar de ejecutar tus propios benchmarks. Si necesitas valores precisos para una cuantización específica, ejecutar los benchmarks localmente es el camino más confiable.

Encontrarás más sobre testing de calidad en sistemas locales en el artículo Pruebas de calidad.

Errores frecuentes

1. Usar un solo benchmark como medida definitiva: Ningún benchmark individual captura todas las capacidades de un modelo. Uno puede brillar en MMLU pero fallar en conversación. Siempre revisa múltiples benchmarks.

2. Equiparar scores de benchmark con desempeño real: Un score alto en MMLU no garantiza que el modelo funcione bien en tu aplicación. Los benchmarks son tests simplificados que aproximan el uso real de forma limitada.

3. No considerar la cuantización: La mayoría de resultados de benchmarks corresponden a modelos sin cuantizar. Un modelo Q4_K_M puede tener un desempeño notablemente inferior. Compara siempre al mismo nivel de cuantización.

4. Ignorar diferencias de tamaño: Un modelo de 70B debe superar a uno de 7B. Lo interesante es comparar cuánto logra cada modelo por parámetro, no el score absoluto.

5. Usar resultados desactualizados: La IA avanza rápidamente. Benchmarks de hace seis meses pueden estar superados. Busca comparaciones y leaderboards actuales.

6. Confiar únicamente en LMSYS Arena: La Arena mide preferencia humana, no capacidad objetiva. Un modelo que responde con elocuencia pero de forma inexacta puede puntuar mejor que uno que responde brevemente pero con precisión.

7. Pasar por alto contaminación de datos: Algunos modelos vieron las preguntas de benchmarks durante el entrenamiento. Esto infla los resultados artificialmente. Desarrolladores confiables advierten cuando se ha excluido contaminación.

Hardware, costos y seguridad

Hardware: Ejecutar benchmarks requiere poder computacional. Un test de MMLU con 15.000 preguntas puede tomar horas en una GPU. Para la mayoría de usuarios, leer resultados publicados es suficiente. Si ejecutas tests, usa una GPU con mínimo 12 GB de VRAM.

Costos: Los resultados de benchmarks están disponibles gratuitamente. Los principales leaderboards como LMSYS Arena y Hugging Face Open LLM Leaderboard son de acceso público. Ejecutar benchmarks localmente cuesta solo tiempo de computación en tu hardware.

Seguridad: Los benchmarks no tienen implicaciones de seguridad directas. Si ejecutas benchmarks localmente, tus datos permanecen en tu máquina. No se envía información a servicios externos.

Enlaces de referencia

FAQ

¿Qué es una buena puntuación en MMLU?

Una puntuación superior al 70 por ciento es buena para modelos de 7B a 13B. Para modelos de 30B en adelante, deberían alcanzar más del 75 por ciento. Los modelos de primer nivel superan el 85 por ciento. Siempre compara modelos de tamaño similar.

¿Son más fiables los benchmarks que las pruebas propias?

Los benchmarks son más objetivos y comparables, mientras que tus propias pruebas reflejan tu uso real. Lo ideal es combinar ambos: utiliza benchmarks para hacer una preselección y prueba los candidatos finales con tus propias tareas.

¿Qué significa pass@1 en HumanEval?

pass@1 significa que el modelo tiene un intento para resolver la tarea. Si el código generado pasa los casos de prueba, cuenta como éxito. pass@10 significa que el modelo tiene diez intentos y uno de ellos debe ser correcto.

¿Cuál es la confiabilidad de LMSYS Chatbot Arena?

Arena se basa en miles de comparaciones humanas y es uno de los métodos más fiables para medir la calidad de los modelos. Sin embargo, no es perfecto: los humanos suelen preferir respuestas más largas o amables, incluso cuando no son más precisas.

¿Afecta la cuantificación a los resultados de los benchmarks?

Sí. Un modelo Q4_K_M puede tener un rendimiento de 1 a 3 puntos porcentuales peor que el original FP16. Con cuantificaciones muy bajas como Q2 o Q3, las diferencias pueden ser significativamente mayores.

¿Qué es la contaminación de benchmarks?

Contaminación significa que el modelo ya ha visto las preguntas del benchmark durante el entrenamiento. Esto produce puntuaciones artificialmente altas porque el modelo conoce las respuestas de memoria, no porque resuelva realmente la tarea. Los desarrolladores confiables verifican esto.

¿Puedo ejecutar benchmarks con modelos de Ollama?

Sí, con herramientas como lm-evaluation-harness puedes ejecutar benchmarks en modelos servidos a través de Ollama. Debes acceder al modelo a través de la API de Ollama. La ejecución toma desde minutos hasta horas, dependiendo del benchmark y el tamaño del modelo.

¿Cuál es el benchmark más importante para programadores?

HumanEval es el benchmark estándar para evaluar habilidades de programación. Prueba si el modelo genera código Python correcto. Para pruebas más exhaustivas, también existen MBPP y LiveCodeBench, que miden tareas similares con diferentes enfoques.

¿Por qué algunos modelos se desempeñan tan diferente en GSM8K?

GSM8K prueba razonamiento lógico y cálculo multietapa. Los modelos con entrenamiento de reasoning, como DeepSeek-R1, tienen un desempeño mucho mejor porque desglosan los problemas en pasos intermedios. Los modelos sin capacidad de reasoning suelen dar respuestas rápidas pero incorrectas.

¿Existen benchmarks en alemán?

Sí, hay benchmarks multilingües como MGSM (matemáticas multilingües) y variantes multilingües de MMLU. Sin embargo, la mayoría de los benchmarks estándar están en inglés. Para aplicaciones centradas en alemán, debes hacer pruebas adicionales por tu cuenta.

¿Debo elegir siempre el modelo con la puntuación más alta?

No necesariamente. Un modelo con una puntuación ligeramente inferior puede ser más adecuado para tu tarea específica, especialmente si es más pequeño y, por lo tanto, más rápido. Los benchmarks son orientativos, no el único criterio.

Fuentes

  • Hugging Face Open LLM Leaderboard
  • LMSYS Chatbot Arena Leaderboard
  • MMLU: Massive Multitask Language Understanding (Paper en arXiv)
  • HumanEval: Evaluating Code Synthesis (Paper en arXiv)
  • GSM8K: Training Verifiers for Math Word Problems (Paper en arXiv)
  • MT-Bench: Multi-Turn Benchmark (Investigación de LMSYS)
  • Documentación de lm-evaluation-harness en GitHub
Volver al blog
Share:

Entradas relacionadas