Encontrar el modelo adecuado
Introducción
Existen cientos de modelos de lenguaje. Para ejecutar localmente, necesitas uno que funcione en tu hardware y realice bien tu tarea. Este artículo te muestra dónde encontrar modelos, qué criterios importan y cómo saber si un modelo te conviene.
Encontrar el modelo adecuado en pocas palabras
Un modelo adecuado es lo suficientemente pequeño para tu hardware y lo suficientemente bueno para tu tarea. Para empezar, modelos como Llama 3, Qwen 2 o Mistral en 7B u 8B son excelentes opciones. La cuantización los hace más pequeños sin perder demasiada calidad. Las fuentes más importantes son la biblioteca Ollama, Hugging Face y las variantes de modelo TheBloke.
Términos y componentes importantes
| Término | Significado |
|---|---|
| Parámetros | Tamaño del modelo, típicamente expresado en miles de millones |
| GGUF | Formato contenedor para modelos cuantizados |
| Cuantización | Reducción de la precisión del modelo para ahorrar memoria |
| Ollama Library | Colección oficial de modelos compatibles con Ollama |
| Hugging Face | Plataforma para modelos de IA, datos y herramientas |
Relevancia práctica
Por qué es importante la selección
Un modelo demasiado grande no funcionará en tu hardware. Un modelo demasiado pequeño podría dar respuestas pobres. Un modelo especializado en código escribe mejor código, uno de texto se desempeña mejor en español. La elección del modelo es, por tanto, el paso más crítico después de la instalación.
Qué influye en la selección
Los factores principales son el tamaño del modelo, la cuantización, los datos de entrenamiento, las capacidades y la licencia. Para empezar, los dos primeros son los más relevantes. Si tienes más hardware disponible, puedes usar modelos más grandes o más altamente cuantizados.
Modelos populares para principiantes
| Modelo | Tamaño | Idoneidad | Característica especial |
|---|---|---|---|
| Llama 3 | 8B, 70B | Texto, código, chat | Rendimiento general sólido |
| Qwen 2 | 7B, 72B | Código, lógica, multilingüe | Codificación muy buena |
| Mistral | 7B, 8x7B | Texto, razonamiento | Eficiente y rápido |
| Phi 3 | 4B, 14B | Inicio, bajo consumo de recursos | Modelos pequeños con buen rendimiento |
| DeepSeek | 7B, 67B | Codificación, razonamiento | Variantes abiertas y potentes |
Dónde encuentro modelos
Las tres fuentes más importantes para modelos locales son:
Ollama Library
La fuente más simple. En ollama.com/library ves qué modelos están disponibles e inicias con ollama run nombredelmodelo.
Hugging Face La plataforma de modelos más grande. Allí encuentras modelos originales, variantes cuantizadas y modelos especializados. Para ejecución local, generalmente buscas archivos en formato GGUF.
TheBloke Una fuente conocida para cuantizaciones GGUF prefabricadas de modelos populares. Especialmente útil cuando Ollama aún no ofrece un modelo por sí mismo.
Ayuda para la decisión
Antes de descargar, hazte tres preguntas:
- ¿Qué quieres hacer? ¿Chatear, escribir código, analizar documentos o entender imágenes?
- ¿Cuánta memoria tienes? Al menos 8 GB de VRAM abren muchas posibilidades con modelos de 7B.
- ¿Qué idioma necesitas? No todos los modelos están igualmente bien entrenados en español.
Si no estás seguro, comienza con Llama 3 8B en Q4_K_M. Es un versátil confiable para texto y código.
Consideraciones de hardware, costos y seguridad
La mayoría de modelos de código abierto son gratuitos. Las licencias varían, especialmente en uso comercial. Presta atención a la declaración de licencia. En términos de seguridad, la gran ventaja de los modelos locales es que tus datos no van al proveedor del modelo. Aun así, con datos sensibles deberías verificar que el modelo permanece local y que no hay telemetría activa.
Más información e temas sobre IA
- Comienza con Ollama Library si quieres empezar rápidamente.
- Para casos especiales, usa Hugging Face y archivos GGUF.
- Q4_K_M es un buen equilibrio entre necesidad de memoria y calidad.
- El tamaño del modelo es la palanca más importante para rendimiento y calidad.
Más sobre cuantización en el artículo Cuantización y sobre RAM y VRAM en Requisitos de RAM y VRAM.
Preguntas frecuentes sobre encontrar el modelo
¿Un modelo más grande siempre es mejor?
No necesariamente. Los modelos más grandes suelen ser mejores, pero son más lentos y consumen más memoria. Para muchas tareas, un modelo de 7B u 8B con buena cuantización es suficiente.
¿Cuál es un buen primer modelo?
Llama 3 8B, Qwen 2 7B o Mistral 7B son versátiles sólidos y funcionan en muchos sistemas consumer.
¿Puedo usar modelos de Hugging Face en Ollama?
Sí, si están en formato GGUF. Ollama puede crear modelfiles propios que hagan referencia a archivos GGUF.
¿Todos los modelos son gratuitos?
La mayoría de modelos de código abierto se pueden usar gratuitamente. Para uso comercial, verifica la licencia correspondiente.
¿Dónde encuentro modelos para idiomas específicos?
Hugging Face y Ollama Library permiten filtrar por idiomas o regiones. Modelos multilingües como Qwen o Llama 3 suelen ser buenas opciones.
Herramientas y lecturas adicionales
Además de Ollama y Hugging Face, las comparativas de modelos, leaderboards y benchmarks ayudan. Un buen punto de partida es la biblioteca Ollama, ya que ofrece modelos ejecutables de inmediato.
Fuentes
- Biblioteca de modelos Ollama
- Catálogo de modelos Hugging Face
- Modelos GGUF de TheBloke


