Modelos Llama: la serie de código abierto de Meta
Qué cubre este artículo
- Qué modelos Llama existen y cómo se diferencian las generaciones 3.1, 3.2 y 3.3
- El tamaño de cada variante y cuánta VRAM necesitas para cada una
- Las fortalezas y debilidades de la serie Llama
- Cómo iniciar modelos Llama localmente con Ollama
- Qué obstáculos puedes encontrar al usarlos
Introducción
Llama es probablemente la serie de modelos de código abierto más conocida del mundo. Desarrollada por Meta, ha moldeado significativamente el mercado de la IA local. Desde la primera generación en 2023, Meta ha publicado continuamente versiones mejoradas que se vuelven cada vez más potentes y accesibles. Si te interesa la IA local, es difícil evitar Llama.
Las generaciones actuales Llama 3.1, Llama 3.2 y Llama 3.3 cubren un amplio espectro: desde modelos diminutos para smartphones hasta modelos gigantescos que compiten con servicios en la nube comerciales. En este artículo obtendrás una visión completa de la serie, sus variantes y cómo implementarlas localmente.
¿Por qué necesito Llama?
Los modelos Llama son interesantes por varias razones. Primero, están disponibles gratuitamente, al menos para la mayoría de los casos de uso. Puedes descargarlos, ejecutarlos localmente e incluso usarlos en proyectos comerciales, siempre que respetes los términos de licencia de Meta. Segundo, cubren un espectro inusualmente amplio de tamaños. De 1 mil millones a 405 mil millones de parámetros, hay algo para cada hardware.
Tercero, el rendimiento de los modelos Llama es de nivel superior. Llama 3.1 70B y Llama 3.3 70B logran resultados en muchos benchmarks que se mantienen al nivel de modelos comerciales como GPT-4. Al mismo tiempo, Llama 3.2 3B es lo suficientemente pequeño para ejecutarse en una laptop. Esto hace que la serie sea una de las opciones más versátiles para IA local.
Cuarto, la comunidad juega un papel importante. Porque Llama es tan popular, existen innumerables versiones cuantizadas, fine-tunes e herramientas de integración. Si tienes un problema, probablemente alguien más ya lo ha tenido y ha publicado una solución.
Llama explicado brevemente
Llama es una serie de Large Language Models desarrollada por Meta y publicada como modelo de pesos abiertos. “Open Weight” significa que los pesos del modelo se pueden descargar libremente, aunque el entrenamiento en sí no es completamente abierto. Los modelos se basan en la arquitectura Transformer y se construyen como modelos solo decodificadores.
Los nombres de los modelos siguen un esquema simple: el número de versión indica la generación, el número después de la letra B representa el número de parámetros en miles de millones. Llama 3.1 8B tiene 8 mil millones de parámetros, Llama 3.1 70B tiene 70 mil millones. Más parámetros suelen significar mejor rendimiento, pero también mayor demanda de hardware.
Los modelos están optimizados como versiones Instruct para diálogo e instrucciones. También existen versiones Base que simplemente continúan el texto, pero para la mayoría de los usuarios las versiones Instruct son relevantes.
A quién va dirigido este artículo
Este artículo está dirigido a:
- Principiantes que quieren entender qué modelos Llama existen y cuál es el adecuado para ellos
- Usuarios domésticos que desean ejecutar un modelo Llama en su propia máquina
- Desarrolladores que quieren integrar Llama en sus propias aplicaciones
- Tomadores de decisiones que evalúan Llama como alternativa a la IA en la nube
- Cualquiera que quiera obtener una visión general de la serie Llama sin tener que abrirse camino a través de papers técnicos
Términos importantes
| Término | Significado |
|---|---|
| Parámetros | Los valores aprendidos del modelo, cantidad expresada en miles de millones (B) |
| Instruct | Versión de un modelo optimizada para instrucciones |
| Base | Versión original sin optimización Instruct |
| Tokenizer | Divide el texto en tokens que el modelo procesa |
| Context Length | Número máximo de tokens que el modelo puede procesar simultáneamente |
| Quantization | Reducción de la precisión de almacenamiento para ahorrar VRAM |
| GGUF | Formato de archivo para modelos cuantizados, usado por Ollama |
| VRAM | Memoria de video de la tarjeta gráfica, fundamental para IA local |
| Fine-Tune | Reentrenamiento de un modelo en datos especializados |
| Multimodal | Modelo que puede procesar múltiples tipos de entrada, por ejemplo texto e imágenes |
Las generaciones Llama en resumen
Meta ha desarrollado la serie Llama en varios pasos. Las generaciones actuales son Llama 3.1, Llama 3.2 y Llama 3.3. Cada generación tiene sus propios énfasis y variantes.
Llama 3.1
Llama 3.1 es la generación base de la serie actual y se publicó en julio de 2024. Incluye tres tamaños:
- Llama 3.1 8B: El modelo más pequeño de la generación. Es rápido, necesita poco VRAM y es excelente para comenzar. Con una longitud de contexto de 128.000 tokens, puede procesar textos muy largos.
- Llama 3.1 70B: El modelo intermedio. Ofrece un rendimiento significativamente mejor que 8B, pero también requiere mucho más hardware. En forma cuantizada, se ejecuta en GPUs consumer de gama alta o Macs con mucha memoria.
- Llama 3.1 405B: El modelo más grande de la serie y uno de los modelos de código abierto más grandes jamás creados. Compite con modelos comerciales de clase superior, pero es poco realista para ejecución local en hardware consumer.
Llama 3.2
Llama 3.2 se publicó en septiembre de 2024 y trae dos innovaciones importantes. Primero, hay modelos muy pequeños para dispositivos edge, segundo se añaden modelos de visión.
- Llama 3.2 1B: Un modelo diminuto con 1 mil millón de parámetros. Se ejecuta en smartphones y tablets y está diseñado para tareas simples.
- Llama 3.2 3B: Un poco más grande y capaz que 1B, pero aún muy compacto. Ideal para laptops sin tarjeta gráfica potente.
- Llama 3.2 11B Vision: Un modelo multimodal que puede procesar texto e imágenes. Tiene 11 mil millones de parámetros y es el modelo de visión más pequeño de la serie.
- Llama 3.2 90B Vision: El modelo de visión grande. Ofrece capacidades sólidas de comprensión de imágenes, pero requiere hardware correspondiente.
Llama 3.3
Llama 3.3 se publicó en diciembre de 2024 y por ahora consta de una única variante:
- Llama 3.3 70B: Un modelo 70B mejorado que logra el rendimiento de Llama 3.1 405B con significativamente menos requisitos de hardware. Es uno de los mejores modelos en su clase de tamaño.
Especificaciones técnicas
| Modelo | Parámetros | Context Length | Tipo | Fecha de lanzamiento |
|---|---|---|---|---|
| Llama 3.1 8B | 8B | 128K | Texto | Julio 2024 |
| Llama 3.1 70B | 70B | 128K | Texto | Julio 2024 |
| Llama 3.1 405B | 405B | 128K | Texto | Julio 2024 |
| Llama 3.2 1B | 1B | 128K | Texto | Septiembre 2024 |
| Llama 3.2 3B | 3B | 128K | Texto | Septiembre 2024 |
| Llama 3.2 11B Vision | 11B | 128K | Multimodal | Septiembre 2024 |
| Llama 3.2 90B Vision | 90B | 128K | Multimodal | Septiembre 2024 |
| Llama 3.3 70B | 70B | 128K | Texto | Diciembre 2024 |
Todos los modelos tienen una longitud de contexto de 128.000 tokens, lo cual es más que suficiente para la mayoría de los casos de uso. Más sobre el significado de la longitud de contexto lo encontrarás en el artículo Longitud de contexto.
Requisitos de VRAM para los modelos Llama
El consumo de VRAM depende del tamaño del modelo y la cuantización. La siguiente tabla muestra valores de referencia para el nivel de cuantización más común, Q4_K_M.
| Modelo | VRAM en Q4_K_M | VRAM en Q8 | VRAM en FP16 |
|---|---|---|---|
| Llama 3.2 1B | aprox. 1 GB | aprox. 1,5 GB | aprox. 2 GB |
| Llama 3.2 3B | aprox. 2,5 GB | aprox. 4 GB | aprox. 6 GB |
| Llama 3.1 8B | aprox. 5 GB | aprox. 9 GB | aprox. 16 GB |
| Llama 3.2 11B Vision | aprox. 7 GB | aprox. 12 GB | aprox. 22 GB |
| Llama 3.1 70B / 3.3 70B | aprox. 40 GB | aprox. 75 GB | aprox. 140 GB |
| Llama 3.2 90B Vision | aprox. 52 GB | aprox. 95 GB | aprox. 180 GB |
| Llama 3.1 405B | aprox. 230 GB | aprox. 430 GB | aprox. 810 GB |
Estos valores son orientativos y varían levemente según la implementación. Además del modelo en sí, necesitarás entre 1 y 2 GB adicionales para el contexto. Encontrarás más detalles en el artículo Requisitos de RAM y VRAM y en Tamaño de modelo y necesidad de almacenamiento.
Rendimiento y prestaciones
El desempeño de los modelos Llama varía considerablemente según su tamaño. Aquí tienes una clasificación general:
Llama 3.2 1B y 3B funcionan bien para tareas sencillas: resúmenes, preguntas simples y procesamiento de texto básico. No están pensados para reasoning complejo o codificación sofisticada, pero corren prácticamente en cualquier dispositivo.
Llama 3.1 8B es un todoterreno sólido. Maneja chat, codificación sencilla, resúmenes de texto y traducciones. Para la mayoría de usuarios domésticos, este es el mejor modelo para empezar. La calidad en español es buena, aunque no alcanza el nivel del inglés.
Llama 3.2 11B Vision añade comprensión de imágenes al modelo de 8B. Puedes pasarle una imagen y hacer preguntas sobre ella. Funciona bien para descripciones y análisis simples, pero tiene limitaciones en reasoning visual complejo.
Llama 3.1 70B y Llama 3.3 70B son significativamente más potentes. Dominan el reasoning complejo, la codificación avanzada y la comunicación multilingüe. Llama 3.3 70B es la mejor opción, ya que alcanza el desempeño de 405B con requisitos menores.
Llama 3.2 90B Vision es el modelo de visión más poderoso de la serie. Puede analizar imágenes complejas, leer diagramas y comprender relaciones visuales.
Llama 3.1 405B es el modelo más capaz de la serie, pero no es práctico para ejecutar localmente en hardware consumer. Generalmente se utiliza a través de API o en infraestructura de servidores.
Casos de uso para modelos Llama
| Caso de uso | Modelo recomendado | Por qué |
|---|---|---|
| Chat en una laptop | Llama 3.2 3B | Pequeño, rápido, funciona en todas partes |
| Multiusos para texto y código | Llama 3.1 8B | Mejor equilibrio entre tamaño y rendimiento |
| Análisis y descripción de imágenes | Llama 3.2 11B Vision | Multimodal, requisitos moderados de hardware |
| Codificación compleja y reasoning | Llama 3.3 70B | Muy potente si tu hardware lo permite |
| Aplicaciones multilingües | Llama 3.1 8B o 70B | Buen multilingüismo gracias al entrenamiento |
| Despliegue en dispositivos móviles | Llama 3.2 1B | Huella mínima |
Si tienes dudas sobre cuál es el modelo adecuado para ti, el artículo Encontrar modelo te ayudará a decidir.
Ejecutar modelos Llama con Ollama
Ollama es la forma más sencilla de lanzar modelos Llama localmente. Solo necesitas un comando en la terminal.
Iniciar Llama 3.1 8B:
ollama run llama3.1
Iniciar Llama 3.2 3B:
ollama run llama3.2:3b
Iniciar Llama 3.2 11B Vision:
ollama run llama3.2-vision
Iniciar Llama 3.3 70B:
ollama run llama3.3
Ollama descarga automáticamente una versión cuantizada adecuada, por defecto Q4_K_M. Si quieres usar un nivel de cuantización diferente, puedes especificarlo:
ollama run llama3.1:8b-q5_K_M
Para eliminar los modelos que ya no necesites, usa el siguiente comando. Más información en el artículo Gestionar modelos:
ollama rm llama3.1
Obstáculos comunes
1. Modelo demasiado grande para tu hardware: Llama 70B requiere alrededor de 40 GB de VRAM incluso cuantizado. Muy pocas GPUs consumer lo tienen. Si quieres ejecutar 70B, necesitarás una RTX 4090 con 24 GB más intercambio de RAM del sistema, o una Mac con 64 GB o más.
2. Confundir Base e Instruct: Los modelos Base continúan texto, pero no siguen instrucciones. Para chat y tareas necesitas la versión Instruct. Ollama usa Instruct por defecto, pero en descargas manuales tienes que asegurarte tú mismo.
3. Context Length agota la VRAM: Una Context Length de 128.000 tokens suena genial, pero usar el contexto al máximo consume VRAM adicional considerable. En modelos de 8B con GPUs de 8 GB, deberías limitar el contexto entre 4.000 y 8.000 tokens.
4. Sobreestimar la calidad en español: Los modelos Llama están entrenados principalmente en inglés. El español funciona bien, pero en textos complejos pueden aparecer formulaciones poco naturales o préstamos del inglés. Para aplicaciones exclusivas en español, Mistral o Qwen podrían ser opciones mejores.
5. Probar Vision-Modelle sin imágenes: Los modelos Llama 3.2 Vision están optimizados para texto e imágenes. Si los usas solo para texto, no son mejores que modelos puros de texto y consumen más VRAM. Usa Vision solo si realmente procesas imágenes.
6. Ignorar las condiciones de licencia: Llama no es completamente libre. La licencia de Meta restringe el uso comercial, especialmente para números muy grandes de usuarios. Lee la licencia antes de utilizar Llama en un producto comercial.
7. Usar generaciones antiguas: Llama 2 y Llama 3 (sin .1) son más antiguos y significativamente más débiles. Cuando ejecutes un modelo Llama, siempre usa la generación actual: 3.1, 3.2 o 3.3.
Hardware, costos y seguridad
Hardware: Las necesidades de hardware varían enormemente. Llama 3.2 1B corre en casi cualquier dispositivo, Llama 3.1 8B necesita una GPU con 8 GB de VRAM o una Mac con 16 GB de RAM, y Llama 70B requiere hardware de gama alta. La buena noticia es que para empezar, una GPU consumer como la RTX 3060 con 12 GB es más que suficiente.
Costos: Los modelos en sí son gratuitos. Los costos están en el hardware. Una RTX 3060 para modelos de 8B cuesta alrededor de 300 euros. Si quieres ejecutar modelos de 70B, necesitarás hardware de cuatro cifras o una Mac Studio con 128 GB de RAM. El hosting en la nube es una alternativa, pero va en contra de la filosofía de la IA local.
Seguridad: Los modelos Llama se ejecutan localmente, tus datos permanecen en tu máquina. Esta es una ventaja importante comparado con IA en la nube. Sin embargo, ten en cuenta que los modelos Llama no tienen filtros de seguridad incorporados. Pueden generar contenido inapropiado si se les pide. Para aplicaciones en producción, deberías implementar medidas de seguridad adicionales.
Enlaces relacionados
- Modelos de IA local - Descripción general de todos los artículos sobre modelos
- Encontrar modelo - Ayuda para elegir modelo
- Ollama - La forma más sencilla para modelos locales
- Gestionar modelos - Administra modelos en Ollama
- Cuantización - Cómo se reducen los modelos de tamaño
- Requisitos de RAM y VRAM - Entender las necesidades de memoria
- Tamaño de modelo y necesidad de almacenamiento - Fundamentos de hardware
- ¿Qué es IA local? - Artículo fundamental
FAQ
¿Qué modelo Llama debería probar primero?
Llama 3.1 8B es la mejor opción para empezar. Funciona en la mayoría de tarjetas gráficas de consumo y ofrece un buen equilibrio entre rendimiento y requisitos de hardware. Inicia con ollama run llama3.1.
¿Puedo ejecutar Llama 70B en mi tarjeta gráfica?
Depende de tu GPU. Cuantizado (Q4_K_M), 70B requiere aproximadamente 40 GB de VRAM. Una sola RTX 4090 con 24 GB no es suficiente. Necesitas dos GPUs, una GPU con descarga a RAM de sistema, o una Mac con 64 GB de RAM o superior.
¿Cuál es la diferencia entre Llama 3.1 y Llama 3.3?
Llama 3.3 70B es una versión mejorada de Llama 3.1 70B. Logra un rendimiento similar al Llama 3.1 405B mucho más grande, pero requiere considerablemente menos hardware. Si puedes usar 70B, siempre elige 3.3 sobre 3.1.
¿Son gratuitos los modelos Llama?
Los pesos del modelo se pueden descargar gratuitamente. La licencia de Meta permite uso comercial con restricciones, particularmente para empresas con más de 700 millones de usuarios mensuales. Para la mayoría de usuarios y pequeñas empresas, el uso es gratuito.
¿Puede Llama entender imágenes?
Sí, los modelos Llama 3.2 Vision (11B y 90B) pueden procesar imágenes. Puedes proporcionarles una imagen y hacer preguntas sobre ella. Los modelos de solo texto como Llama 3.1 8B no pueden procesar imágenes.
¿Qué tal es Llama en español?
Los modelos Llama manejan bien el español, pero se entrenan principalmente en inglés. Para tareas simples o intermedias, la calidad en español es suficiente. Con textos complejos pueden surgir formulaciones poco naturales. Qwen y Mistral suelen estar mejor optimizados para español.
¿Qué significa una longitud de contexto de 128.000 tokens?
El modelo puede procesar hasta 128.000 tokens simultáneamente, lo que equivale a aproximadamente 100.000 palabras. Es suficiente para documentos largos o conversaciones extensas. Ten en cuenta que un contexto completamente utilizado consume VRAM adicional.
¿Puedo ejecutar Llama en una Mac?
Sí. Apple Silicon comparte memoria entre CPU y GPU, lo que permite modelos más grandes. Una Mac con 16 GB de RAM puede ejecutar Llama 3.1 8B sin problemas. Para modelos 70B necesitas al menos 64 GB de RAM, preferiblemente 128 GB.
¿Cuál es la diferencia entre Base e Instruct?
Los modelos Base continúan texto, pero no siguen instrucciones. Los modelos Instruct están optimizados para diálogos y seguimiento de instrucciones. Para chat y la mayoría de tareas necesitas la versión Instruct. Ollama usa Instruct por defecto.
¿Puedo usar Llama en mi proyecto comercial?
Sí, bajo ciertas condiciones. La licencia Llama de Meta permite uso comercial, pero tiene restricciones, especialmente para números de usuarios muy grandes. Revisa los términos de licencia en el sitio web de Meta antes de utilizar Llama comercialmente.
¿Son los modelos Llama mejores que la IA en la nube como ChatGPT?
El modelo más grande, Llama 3.1 405B, puede competir con los mejores modelos comerciales. Los modelos más pequeños son menos potentes, pero ofrecen las ventajas de ejecución local, privacidad de datos y gratuidad. Para la mayoría de casos de uso locales, 8B o 70B son completamente suficientes.
Fuentes
- Meta AI - Descripción general de modelos Llama y documentación
- Biblioteca de modelos Ollama - Modelos Llama
- Hugging Face - Página del modelo Meta Llama
- Informes técnicos de Meta Llama 3.1, 3.2 y 3.3


