Skip to content
BotServBotServ
GemmaGemma 2Gemma 3GoogleOllamaIA localcompacto

Modelos Gemma: IA ligera de Google

Gemma 2, Gemma 3, Gemma 2B/7B/9B/27B. Modelos compactos de Google. Requisitos de hardware y uso local con Ollama.

S

schutzgeist

13 min read
Modelos Gemma: IA ligera de Google

Modelos Gemma: la IA ligera de Google

Qué cubre este artículo

  • Qué es Gemma y cómo ha evolucionado la familia de modelos
  • Qué versiones de Gemma existen y para qué sirven
  • Cuánta VRAM necesitas para los distintos modelos Gemma
  • Cómo iniciar y usar Gemma localmente con Ollama
  • Fortalezas y debilidades de la familia de modelos

Introducción

Gemma es la contribución de Google al mundo de la IA de código abierto. El nombre proviene de “gem” (gema), que representa las letras latinas G-E-M-M-A y recuerda a Gemini, el gran modelo comercial de IA de Google. La diferencia clave: mientras que Gemini es un servicio en la nube, los modelos Gemma son código abierto y pueden ejecutarse localmente en tu equipo.

Los modelos Gemma se destacan por su tamaño compacto. Incluso la versión más pequeña, con 2 mil millones de parámetros, ofrece resultados sorprendentemente buenos para su escala. La versión más grande, con 27 mil millones de parámetros, compite con modelos que tienen significativamente más parámetros. Esto hace que Gemma sea particularmente atractivo para usuarios con hardware limitado que aún buscan calidad.

En este artículo aprenderás qué versiones de Gemma existen, cómo difieren y cómo ejecutarlas localmente con Ollama. Si aún no estás seguro de qué modelo se adapta a ti, consulta primero la descripción general de modelos y el artículo Encontrar el modelo adecuado.

¿Por qué necesito Gemma?

Imagina que tienes un portátil con 16 GB de RAM y aún así quieres ejecutar un modelo de IA decente localmente. Muchos de los modelos conocidos como Llama 3 70B o DeepSeek-R1 son demasiado grandes para este hardware. Aquí es donde entra Gemma: la versión 2B se ejecuta en casi cualquier equipo moderno, y la versión 9B solo requiere alrededor de 6 GB de VRAM en Q4_K_M.

Gemma es especialmente interesante si te importan tres cosas: tamaño compacto, buena calidad por parámetro y una base sólida para experimentar. Google ha entrenado los modelos con la misma investigación y técnicas que se utilizan en Gemini. Esto significa que obtienes la calidad de Google en un paquete que corre en hardware de consumidor.

Si ya conoces modelos Llama o modelos Phi, Gemma complementa tu selección con otra opción compacta. Especialmente la versión 9B es un competidor fuerte frente a Llama 3 8B, y la versión 27B ofrece calidad en un nivel que normalmente solo alcanzan modelos de 30B o 70B.

Modelos Gemma explicados brevemente

La familia de modelos Gemma ha evolucionado a través de varias generaciones. Aquí te presentamos un resumen de las versiones más importantes:

Gemma 1 fue la primera generación, con versiones de 2B y 7B. Se lanzó en febrero de 2024 y demostró que Google podía construir modelos de código abierto compactos. Para aplicaciones actuales, Gemma 1 es menos relevante, ya que sus sucesores son significativamente mejores.

Gemma 2 es la segunda generación, lanzada en junio de 2024. Viene en tres tamaños: 2B, 9B y 27B. Gemma 2 utiliza una arquitectura mejorada con Grouped-Query Attention y atención de ventana deslizante local, lo que aumenta significativamente la calidad para el mismo número de parámetros. La versión 9B logra resultados en benchmarks que compiten con Llama 3 8B. La versión 27B supera modelos que tienen el doble de tamaño.

Gemma 3 es la generación más reciente. Amplía la familia con capacidades multimodales, permitiendo procesar imágenes también, y ofrece un contexto más amplio. Gemma 3 está disponible en varios tamaños y se dirige a usuarios que buscan un modelo compacto versátil con comprensión de imágenes.

Para la ejecución local, Gemma 2 y Gemma 3 son las versiones más relevantes. Gemma 1 apenas se usa, ya que sus sucesores son superiores en todos los aspectos.

¿Para quién es este artículo?

Este artículo va dirigido a ti si:

  • buscas un modelo compacto para hardware limitado
  • quieres experimentar con tecnología de Google sin dependencia de la nube
  • deseas ejecutar un modelo ligero en un portátil o Mac
  • quieres saber si Gemma es una alternativa a Llama o Phi para ti
  • buscas un modelo que funcione bien incluso con 8 GB de VRAM

No necesitas conocimientos previos sobre la investigación de IA de Google. Si sabes qué es un LLM y cómo usar Ollama, puedes empezar inmediatamente.

Términos importantes

TérminoSignificado
GemmaFamilia de modelos de código abierto de Google, derivada de investigación Gemini
GeminiLínea comercial de modelos de IA de Google, solo disponible como servicio en la nube
Grouped-Query AttentionMétodo de atención eficiente que ahorra memoria y poder de cálculo
Sliding-Window AttentionProcedimiento de atención que solo considera una ventana de los tokens recientes
MultimodalCapacidad de un modelo de procesar múltiples tipos de entrada como texto e imágenes
Ventana de contextoNúmero máximo de tokens que el modelo puede procesar simultáneamente
ParámetrosValores aprendibles en el modelo que determinan su tamaño y capacidades
CuantizaciónReducción de la precisión de almacenamiento para disminuir los requisitos de memoria
TokenizadorComponente que divide el texto en tokens que el modelo procesa
Instruction-TunedModelo entrenado para seguir instrucciones

Gemma 2: la segunda generación

Gemma 2 es la versión que la mayoría de usuarios locales utilizan actualmente. Los tres tamaños cubren diferentes requisitos de hardware:

Gemma 2 2B es la versión más pequeña y se ejecuta en casi cualquier hardware. Con solo 2 mil millones de parámetros, requiere aproximadamente 1,5 GB de memoria en Q4_K_M. Es suficiente para tareas de chat simples, resúmenes y procesamiento básico de texto. En un portátil con 8 GB de RAM se ejecuta sin problemas. La calidad es buena para su tamaño, pero se encuentra rápidamente con limitaciones en tareas complejas.

Gemma 2 9B es el punto óptimo de la familia. Con 9 mil millones de parámetros, ofrece calidad comparable al nivel de Llama 3 8B, a menudo superior. En Q4_K_M requiere aproximadamente 6 GB de VRAM, lo que funciona sin problemas en la mayoría de tarjetas gráficas modernas con 8 GB o más. La versión 9B es la mejor opción para usuarios que buscan un modelo versátil sólido que no consuma demasiada memoria.

Gemma 2 27B es el buque insignia de la familia. Con 27 mil millones de parámetros, logra resultados en benchmarks que compiten con modelos de 50 a 70 mil millones de parámetros. En Q4_K_M requiere aproximadamente 16 GB de VRAM. Esto funciona en una RTX 4080 con 16 GB o una Mac con 24 GB de Unified Memory. La versión 27B es ideal para usuarios que desean máxima calidad y disponen del hardware correspondiente.

ModeloParámetrosVRAM (Q4_K_M)VRAM (Q5_K_M)VRAM (Q8_0)Adecuado para
Gemma 2 2B2Baprox. 1,5 GBaprox. 2 GBaprox. 2,5 GBPortátiles, hardware mínimo
Gemma 2 9B9Baprox. 6 GBaprox. 7 GBaprox. 10 GBModelo versátil para GPUs de 8 GB+
Gemma 2 27B27Baprox. 16 GBaprox. 19 GBaprox. 28 GBHigh-end, máxima calidad

Encuentra más información sobre requisitos de memoria en el artículo Requisitos de RAM y VRAM y en Tamaño del modelo y necesidad de almacenamiento.

Gemma 3: Multimodal y flexible

Gemma 3 amplía la familia con varias capacidades importantes. La novedad más destacada es su capacidad multimodal: Gemma 3 puede procesar y describir imágenes, no solo texto. Esto lo hace valioso para aplicaciones como descripción de imágenes, sistemas de preguntas y respuestas visuales o análisis de diagramas.

Además, Gemma 3 ofrece una ventana de contexto significativamente más grande que Gemma 2. Mientras que Gemma 2 está limitado a 8.192 tokens, Gemma 3 puede procesar mucho más contexto. Esto es importante si necesitas analizar documentos extensos o mantener conversaciones largas. Más información sobre este tema en el artículo Kontextlaenge.

Gemma 3 está disponible en varios tamaños, que van desde muy pequeño hasta medio. La arquitectura ha sido optimizada para entregar mejores resultados con el mismo número de parámetros. Para la mayoría de usuarios locales, Gemma 3 es la primera opción cuando buscan un modelo compacto con comprensión de imágenes.

Arquitectura: Qué hace que Gemma sea especial

Gemma 2 y 3 utilizan varias características arquitectónicas que los diferencian de otros modelos:

Grouped-Query Attention (GQA): Esta técnica reduce el consumo de memoria del KV-Cache sin afectar la calidad. En lugar de almacenar valores separados para cada cabeza de atención, múltiples cabezas comparten los mismos valores. Esto hace que Gemma sea particularmente eficiente con contextos más largos.

Local Sliding-Window Attention: Gemma 2 combina atención global y local. La atención local examina solo una ventana de los últimos tokens, lo que ahorra poder de cálculo. La atención global se intercala periódicamente para mantener una visión general de todo el contexto.

Knowledge Distillation: En Gemma 2 se utilizó destilación de conocimiento de modelos más grandes. Esto significa que los modelos Gemma más pequeños aprendieron de las respuestas de modelos más grandes. Esto explica por qué Gemma 2 9B y 27B son tan potentes para su tamaño.

Estas técnicas juntas explican por qué los modelos Gemma a menudo superan su “peso” en benchmarks. Google ha traducido la investigación de Gemini en modelos Open Source compactos.

Ejecutar Gemma localmente con Ollama

La forma más sencilla de ejecutar Gemma localmente es a través de Ollama. Aquí están los comandos principales:

# Ejecutar Gemma 2 2B
ollama run gemma2:2b

# Ejecutar Gemma 2 9B
ollama run gemma2:9b

# Ejecutar Gemma 2 27B
ollama run gemma2:27b

# Ejecutar Gemma 3 4B
ollama run gemma3:4b

# Ejecutar Gemma 3 12B
ollama run gemma3:12b

# Ejecutar Gemma 3 27B
ollama run gemma3:27b

Ollama descarga automáticamente la variante Q4_K_M. Si deseas una cuantización diferente, puedes especificarla, por ejemplo ollama run gemma2:9b-q5_K_M. Más información sobre cuantización en el artículo Quantisierung.

Gemma comparado con otros modelos

¿Cómo se desempeña Gemma frente a la competencia? Aquí hay una orientación general:

  • Gemma 2 9B vs. Llama 3 8B: Ambos tienen un rendimiento similar. Gemma 2 9B es marginalmente mejor en algunos benchmarks, Llama 3 8B en otros. Ambos requieren una cantidad similar de VRAM.
  • Gemma 2 9B vs. Phi-3: Phi-3 es más pequeño y eficiente en recursos, pero Gemma 2 9B ofrece mejor calidad en la mayoría de tareas.
  • Gemma 2 27B vs. Llama 3 70B: Llama 3 70B es más potente en general, pero requiere significativamente más VRAM. Gemma 2 27B es la mejor opción si no dispones de 40 GB de VRAM.
  • Gemma 3 vs. Gemma 2: Gemma 3 es el sucesor y en la mayoría de casos la mejor opción, especialmente si necesitas comprensión de imágenes o contextos más largos.

La elección depende en última instancia de tu hardware y caso de uso. Si tienes 8 GB de VRAM, Gemma 2 9B y Gemma 3 4B o 12B son buenas opciones. Si tienes 16 GB o más, prueba Gemma 2 27B o Gemma 3 27B.

Errores comunes

1. Confundir Gemma con Gemini: Gemini es el modelo en la nube de Google y no está disponible localmente. Gemma es la versión Open Source que puedes ejecutar localmente. Están relacionados, pero no son idénticos.

2. Usar versiones antiguas de Gemma 1: Gemma 1 es significativamente más débil que Gemma 2 y 3. Si usas Gemma, asegúrate de tener la versión actual. En Ollama, Gemma 2 se llama gemma2, no gemma.

3. Subestimar la ventana de contexto de Gemma 2: Gemma 2 tiene una ventana de contexto de 8.192 tokens, que es más pequeña que la de muchos competidores. Con documentos largos esto puede ser limitante. Gemma 3 ofrece una ventana más grande.

4. Iniciar la versión 27B en hardware demasiado pequeño: Gemma 2 27B requiere aproximadamente 16 GB de VRAM en Q4_K_M. En una tarjeta gráfica de 12 GB solo se ejecutará con intercambio con RAM del sistema, lo que la hace lenta. Elige en su lugar la versión 9B.

5. Respuestas en alemán más débiles que en inglés: Los modelos Gemma fueron entrenados principalmente en inglés. El alemán funciona, pero no es tan potente como en modelos como Qwen o Llama 3, que fueron optimizados multilingües.

6. Esperar funciones multimodales en Gemma 2: Solo Gemma 3 puede procesar imágenes. Gemma 2 es un modelo puramente textual. Si necesitas comprensión de imágenes, elige Gemma 3.

7. Elegir cuantización demasiado agresiva: Con la versión 2B, Q3 o Q2 pueden causar pérdidas significativas de calidad, porque el modelo ya es pequeño de por sí. Usa al menos Q4_K_M, preferiblemente Q5_K_M con modelos pequeños.

Hardware, costos y seguridad

Hardware: Los modelos Gemma son especialmente amigables con el hardware. La versión 2B funciona en casi cualquier equipo con 4 GB de RAM o más. La versión 9B requiere una tarjeta gráfica con 8 GB de VRAM o una Mac con 16 GB de Memoria Unificada. La versión 27B requiere una tarjeta gráfica con 16 GB de VRAM o una Mac con 24 GB o más. Una RTX 3060 con 12 GB es ideal para la versión 9B.

Costos: Todos los modelos Gemma son Open Source y gratuitos. Los pesos del modelo están disponibles en Hugging Face y en la biblioteca de Ollama. La licencia Gemma permite uso comercial, pero tiene algunas condiciones que deberías verificar. Para la mayoría de aplicaciones el uso es sin problemas.

Seguridad: Como con todos los modelos locales, tus datos permanecen en tu equipo. Esta es una ventaja sobre el servicio en la nube Gemini de Google, donde los datos se envían a Google. Con Gemma localmente obtienes la calidad de Google sin dependencia de la nube. Sin embargo, verifica si tu software (Ollama, LM Studio) tiene funciones de telemetría.

Enlaces relacionados

Preguntas frecuentes

¿Cuál es la diferencia entre Gemma y Gemini?

Gemini es el modelo de IA comercial en la nube de Google, disponible únicamente a través de API o interfaz web. Gemma es la familia de modelos de código abierto que puedes ejecutar localmente en tu ordenador. Ambos se basan en investigación similar, pero son modelos distintos.

¿Son los modelos Gemma gratuitos?

Sí, todos los modelos Gemma son de uso gratuito. Los pesos de los modelos están disponibles en Hugging Face y en la biblioteca de Ollama. La licencia de Gemma también permite el uso comercial bajo ciertas condiciones.

¿Qué versión de Gemma debo elegir?

Con 8 GB de VRAM, opta por Gemma 2 9B o Gemma 3 12B. Con 16 GB de VRAM o más, elige Gemma 2 27B o Gemma 3 27B. Si solo tienes 4 GB de VRAM, usa Gemma 2 2B o Gemma 3 4B. Para la mayoría de usuarios, Gemma 2 9B es el mejor punto de partida.

¿Puede Gemma procesar imágenes?

Solo Gemma 3 es multimodal y puede procesar imágenes. Gemma 2 es un modelo de texto puro. Si necesitas comprensión de imágenes, elige Gemma 3.

¿Es Gemma 2 9B mejor que Llama 3 8B?

Ambos modelos tienen un rendimiento similar. En algunos benchmarks, Gemma 2 9B es marginalmente mejor; en otros, lo es Llama 3 8B. Ambos requieren aproximadamente la misma cantidad de VRAM. Prueba ambos y compara en tus propias tareas.

¿Cuál es el tamaño de la ventana de contexto de Gemma?

Gemma 2 tiene una ventana de contexto de 8.192 tokens. Gemma 3 ofrece una ventana de contexto considerablemente más grande. Si procesas documentos largos, Gemma 3 es la mejor opción.

¿Puedo ejecutar Gemma en un Mac con Apple Silicon?

Sí, Gemma funciona sin problemas en Apple Silicon. Un Mac con 16 GB de memoria unificada ejecuta Gemma 2 9B sin dificultad. Un Mac con 24 GB o más también puede ejecutar Gemma 2 27B o Gemma 3 27B.

¿Necesito una GPU Nvidia para Gemma?

No. Gemma se ejecuta en CPU, Apple Silicon y GPUs AMD. Ollama soporta todas estas plataformas. Una GPU Nvidia es la más rápida, pero para las versiones más pequeñas es suficiente un procesador estándar de laptop.

¿Puedo usar Gemma comercialmente?

Sí, la licencia de Gemma permite el uso comercial. De todas formas, debes revisar los términos exactos de la licencia, especialmente si integras Gemma en un producto. Para la mayoría de casos de uso, el uso no presenta problemas.

¿Dónde encuentro modelos Gemma cuantizados?

Ollama descarga automáticamente una variante Q4_K_M cuando inicias un modelo Gemma. En Hugging Face encontrarás más cuantizaciones de proveedores como bartowski o TheBloke. Busca “gemma2” más “GGUF” en Hugging Face.

¿Es Gemma 3 siempre mejor que Gemma 2?

En la mayoría de casos sí, especialmente si necesitas comprensión de imágenes o contextos más largos. En tareas de texto puro, las diferencias son menores. Si ya usas Gemma 2 y estás satisfecho, el cambio no es obligatorio.

Referencias

  • Google DeepMind: Publicaciones del modelo Gemma e informes técnicos
  • Hugging Face: Fichas de modelos Gemma y pesos
  • Biblioteca de modelos de Ollama: Modelos Gemma
  • Blog de IA de Google: Anuncios de Gemma 2 y Gemma 3
  • Licencia de Gemma en el sitio web oficial de Gemma
Volver al blog
Share:

Nächster Artikel in IA Local

Weiterlesen
Configurar Chroma

Entradas relacionadas