Modelos Phi: la IA compacta de Microsoft
Qué encontrarás en este artículo
- Qué modelos Phi existen y cómo se diferencian las generaciones 3, 3.5 y 4
- Qué es un Small Language Model y por qué importan los modelos pequeños
- Cuánta VRAM necesitas para cada modelo Phi
- Cómo ejecutar modelos Phi localmente con Ollama
- Las fortalezas y limitaciones de los modelos compactos
Introducción
Phi es la línea de modelos de Microsoft que apuesta por un enfoque diferente: pequeños pero potentes. Mientras otros fabricantes construyen modelos cada vez más grandes, Microsoft toma el camino opuesto con Phi. Estos modelos están deliberadamente optimizados para ser compactos y aun así alcanzan un rendimiento que esperarías de modelos significativamente más grandes. Microsoft los llama “Small Language Models” o SLMs.
Si necesitas ejecutar IA local en hardware limitado, los modelos Phi son especialmente interesantes. Funcionan en laptops sin GPU potente, en dispositivos edge e incluso en smartphones. En este artículo obtendrás una visión completa de la línea, sus características particulares y cómo implementarlos localmente.
¿Por qué necesito Phi?
Los modelos Phi resultan atractivos por varias razones. Primero, son extremadamente compactos. El modelo más pequeño, Phi-3 mini, tiene solo 3,8 mil millones de parámetros y funciona en una GPU con 4 GB de VRAM. Esto convierte a Phi en la opción ideal para usuarios sin acceso a hardware costoso.
Segundo, el rendimiento respecto al tamaño es notable. Microsoft utiliza un enfoque de entrenamiento especial llamado “Textbook Quality”. En lugar de usar enormes cantidades de datos sin procesar de internet, Microsoft entrena con datos de alta calidad cuidadosamente filtrados, estructurados como libros de texto. El resultado son modelos que frecuentemente superan a otros modelos del mismo tamaño entrenados convencionalmente.
Tercero, los modelos Phi son versátiles. Funcionan bien para chat, codificación simple, resúmenes de texto y tareas básicas de razonamiento. Para problemas complejos no son la primera opción, pero para el día a día son completamente suficientes.
Cuarto, el despliegue en edge es fundamental. Los modelos Phi son lo bastante pequeños para ejecutarse en dispositivos móviles, navegadores o dispositivos IoT. Esto abre posibilidades de aplicación que serían imposibles con modelos más grandes.
Phi en breve
Phi es una serie de Small Language Models desarrollada por Microsoft Research. Los modelos se basan en la arquitectura Transformer y están construidos como modelos solo decodificadores. La diferencia clave respecto a otras líneas radica en el entrenamiento: Microsoft utiliza datos filtrados de alta calidad en lugar de datos sin procesar de internet.
Los nombres de los modelos siguen un esquema simple: “Phi” seguido del número de versión y el tamaño. Phi-3 mini tiene 3,8 mil millones de parámetros, Phi-3 small tiene 7,4 mil millones, Phi-3 medium tiene 14 mil millones. Las generaciones Phi-3, Phi-3.5 y Phi-4 se construyen una sobre otra, donde cada generación introduce mejoras.
Los modelos están optimizados como versiones Instruct para diálogos e instrucciones. Se distribuyen bajo la licencia MIT, una de las licencias de código abierto más permisivas, permitiendo uso comercial sin restricciones.
Para quién es este artículo
Este artículo está dirigido a:
- Principiantes que buscan un modelo compacto para hardware limitado
- Usuarios domésticos que quieren ejecutar IA en un laptop sin GPU potente
- Desarrolladores que desean desplegar modelos en dispositivos edge o navegadores
- Usuarios con presupuesto limitado que no quieren invertir en una GPU cara
- Cualquiera que quiera entender qué son los Small Language Models y por qué son importantes
Términos clave
| Término | Significado |
|---|---|
| SLM | Small Language Model, un modelo de lenguaje compacto |
| Parámetros | Los valores aprendidos del modelo, expresados en miles de millones (B) |
| Textbook Quality | Enfoque de entrenamiento con datos de alta calidad y estructura ordenada |
| Instruct | Versión de un modelo optimizada para instrucciones |
| Edge Deployment | Despliegue de modelos en dispositivos finales en lugar de servidores |
| Tokenizer | Divide el texto en tokens que el modelo puede procesar |
| Context Length | Número máximo de tokens que el modelo puede procesar simultáneamente |
| Quantisierung | Reducción de la precisión numérica para ahorrar VRAM |
| GGUF | Formato de archivo para modelos cuantificados, usado por Ollama |
| Fine-Tune | Reentrenamiento de un modelo con datos especializados |
Los modelos Phi en perspectiva
Microsoft ha desarrollado la línea Phi en varias generaciones. Cada una introduce mejoras en rendimiento, eficiencia y capacidades.
Phi-3
Phi-3 es la tercera generación, lanzada en abril de 2024. Incluye tres variantes:
- Phi-3 mini (3,8B): El modelo más pequeño de la generación. Tiene 3,8 mil millones de parámetros y una context length de 128.000 tokens. A pesar de su tamaño compacto, alcanza en muchos benchmarks el nivel de modelos tres veces más grandes. Funciona en una GPU con 4 GB de VRAM en forma cuantificada.
- Phi-3 small (7,4B): Un modelo de tamaño medio con 7,4 mil millones de parámetros. Ofrece rendimiento significativamente mejor que mini y es comparable con modelos de 7B de otros fabricantes. La context length es de 128.000 tokens.
- Phi-3 medium (14B): El modelo más grande de Phi-3 con 14 mil millones de parámetros. Proporciona el mejor rendimiento de la generación, aunque requiere más VRAM.
Phi-3.5
Phi-3.5 es una generación intermedia lanzada en agosto de 2024. Incluye dos modelos:
- Phi-3.5 mini (3,8B): Una versión mejorada de Phi-3 mini con mejor multilingüismo y contexto más largo. Soporta 128.000 tokens de context length y está entrenado en varios idiomas incluyendo alemán, francés y español.
- Phi-3.5 MoE (16x3,8B): Un modelo de Mixture-of-Experts con 16 expertos de 3,8 mil millones de parámetros cada uno. En cada solicitud se activan 2 expertos. El número total de parámetros es aproximadamente 42 mil millones, pero solo 6,6 mil millones están activos por solicitud. Este es el modelo Phi más potente, pero requiere considerablemente más VRAM.
Phi-4
Phi-4 es la generación más reciente, lanzada en diciembre de 2024. Introduce una novedad importante: entrenamiento especializado en matemáticas y razonamiento.
- Phi-4 (14B): Un modelo de 14B con capacidades significativamente mejoradas en matemáticas, programación y razonamiento. Alcanza en estas áreas un rendimiento comparable con modelos que tienen el doble de tamaño. La context length es de 16.000 tokens. Phi-4 se distribuye bajo licencia MIT.
Especificaciones técnicas
| Modelo | Parámetros | Context Length | Arquitectura | Licencia |
|---|---|---|---|---|
| Phi-3 mini | 3,8B | 128K | Dense | MIT |
| Phi-3 small | 7,4B | 128K | Dense | MIT |
| Phi-3 medium | 14B | 128K | Dense | MIT |
| Phi-3.5 mini | 3,8B | 128K | Dense | MIT |
| Phi-3.5 MoE | 42B (6,6B activos) | 128K | MoE (16x3,8B) | MIT |
| Phi-4 | 14B | 16K | Dense | MIT |
Requisitos de VRAM de los modelos Phi
Los requisitos de VRAM constituyen una de las mayores ventajas de los modelos Phi. Al ser compactos, demandan significativamente menos VRAM que modelos comparables. La siguiente tabla muestra valores de referencia para Q4_K_M.
| Modelo | VRAM en Q4_K_M | VRAM en Q8 | VRAM en FP16 |
|---|---|---|---|
| Phi-3 mini / Phi-3.5 mini | ca. 2,5 GB | ca. 4 GB | ca. 8 GB |
| Phi-3 small | ca. 5 GB | ca. 8 GB | ca. 15 GB |
| Phi-3 medium / Phi-4 | ca. 9 GB | ca. 15 GB | ca. 28 GB |
| Phi-3.5 MoE | ca. 24 GB | ca. 45 GB | ca. 84 GB |
Estos valores son aproximados y pueden variar ligeramente. Además, necesitarás entre 1 y 2 GB adicionales para el contexto. Encontrarás más detalles en RAM y requisitos de VRAM y en Tamaño de modelo y consumo de memoria.
Rendimiento y desempeño
Phi-3 mini y Phi-3.5 mini resultan impresionantes considerando su tamaño. Con 3,8 mil millones de parámetros, alcanzan un desempeño comparable al de modelos de 7B a 10B. Funcionan bien para chat, codificación básica, resúmenes y preguntas fundamentales. Con razonamiento complejo o codificación avanzada encuentran limitaciones.
Phi-3 small se sitúa al nivel de otros modelos de 7B como Llama 3.1 8B o Mistral 7B. El desempeño es sólido, aunque no sobresaliente. La ventaja radica en su eficiencia y licencia MIT.
Phi-3 medium y Phi-4 ofrecen notablemente más capacidad. Phi-4 destaca especialmente en matemáticas y programación gracias a su entrenamiento especializado. En benchmarks de matemáticas logra resultados comparables a modelos del doble de tamaño. Para un modelo de 14B parámetros, el desempeño es excepcional.
Phi-3.5 MoE es el más potente de la línea Phi. Su arquitectura MoE con 16 expertos alcanza un rendimiento equivalente al de modelos de 70B, pero ejecuta más rápidamente. Sin embargo, requiere mucho VRAM porque todos los 42 mil millones de parámetros deben residir en memoria.
Por qué los modelos pequeños importan
Los Small Language Models como Phi no son simplemente versiones más débiles de modelos grandes. Poseen ventajas propias que los modelos grandes no pueden ofrecer.
Velocidad: Los modelos pequeños generan tokens más rápidamente y responden con mayor celeridad. Para aplicaciones interactivas como chat, esto representa una mejora significativa.
Eficiencia de hardware: Requieren menos VRAM y menor consumo de energía. Esto los hace ideales para laptops, dispositivos móviles y despliegue en edge. No necesitas una tarjeta gráfica costosa para ejecutar modelos Phi.
Costos: Menos hardware implica menores gastos. Una tarjeta gráfica con 4 GB de VRAM cuesta una fracción de una con 24 GB. Esto hace que la IA local sea accesible para muchas más personas.
Privacidad en cualquier dispositivo: Cuando un modelo es lo suficientemente pequeño como para ejecutarse en un smartphone, los datos permanecen completamente en el dispositivo. Sin nube, sin transferencias, sin preocupaciones sobre privacidad.
Especialización: Los modelos pequeños pueden ajustarse para tareas específicas sin que el entrenamiento resulte prohibitivo. Un fine-tune de Phi-3 mini es viable en una sola GPU, mientras que un fine-tune de Llama 70B requiere recursos significativos.
Casos de uso para modelos Phi
| Caso de uso | Modelo recomendado | Por qué |
|---|---|---|
| Chat en hardware limitado | Phi-3 mini | Funciona con 4 GB de VRAM |
| Matemáticas y programación | Phi-4 | Especializado en estas áreas |
| Despliegue en edge | Phi-3.5 mini | Compacto y multilingüe |
| Laptop sin GPU | Phi-3 mini | Se ejecuta aceptablemente en CPU |
| Máximo rendimiento | Phi-3.5 MoE | Arquitectura MoE con alto desempeño |
| Proyectos comerciales | Todos los modelos Phi | Licencia MIT sin restricciones |
Si no estás seguro de cuál elegir, el artículo Encontrar el modelo adecuado te ayudará en la decisión.
Ejecutar modelos Phi con Ollama
Ollama es el método más sencillo para iniciar modelos Phi localmente. Solo necesitas un comando en la terminal.
Iniciar Phi-3 mini:
ollama run phi3
Iniciar Phi-3.5 mini:
ollama run phi3.5
Iniciar Phi-4:
ollama run phi4
Ollama descarga automáticamente una versión cuantizada apropiada, por defecto Q4_K_M. Si deseas usar un nivel de cuantización diferente, puedes especificarlo:
ollama run phi3:3.8b-q5_K_M
Para eliminar modelos que ya no necesites, utiliza el siguiente comando. Más información en Gestionar modelos:
ollama rm phi3
Tropiezos comunes
1. Expectativas de rendimiento demasiado altas: Los modelos Phi son pequeños, y eso conlleva limitaciones. Phi-3 mini es adecuado para tareas simples, pero no para razonamiento complejo o programación avanzada. Si necesitas mayor capacidad, opta por Phi-3 medium o Phi-4.
2. Context length limitado en Phi-4: Phi-4 tiene un context length de 16.000 tokens, significativamente menor que Phi-3 con 128.000 tokens. Para documentos largos, Phi-4 es menos adecuado. Usa Phi-3.5 mini si requieres contexto extenso.
3. El modelo MoE consume mucho VRAM: Phi-3.5 MoE cuenta con 42 mil millones de parámetros en total. Incluso cuantizado, necesitas aproximadamente 24 GB de VRAM. Esto es notablemente más que para otros modelos Phi. Verifica tu hardware antes de cargar este modelo.
4. Sobrestimar la calidad en alemán: Los modelos Phi se entrenan principalmente en inglés. Phi-3.5 mini tiene multilingüismo mejorado, pero el alemán no está al nivel de Qwen o Mistral. Para aplicaciones exclusivamente en alemán, otros modelos suelen ser superiores.
5. Usar versiones antiguas: Phi-1 y Phi-2 son más antiguos y considerablemente más débiles. Cuando ejecutes un modelo Phi, siempre usa Phi-3, Phi-3.5 o Phi-4.
6. Elegir el tamaño incorrecto para la tarea: Phi-3 mini es apropiado para tareas sencillas, pero no para las complejas. Phi-4 es fuerte en matemáticas, pero no para documentos extensos. Selecciona el modelo según el caso de uso, no solo por tamaño.
7. Esperar capacidades de visión: Los modelos Phi son modelos de texto puro. No pueden procesar imágenes. Si necesitas análisis de imágenes, usa Llama 3.2 Vision o Qwen VL.
Hardware, costos y seguridad
Hardware: Los modelos Phi son extremadamente eficientes en hardware. Phi-3 mini funciona en una tarjeta gráfica con 4 GB de VRAM, incluso en una antigua GTX 1050. Phi-3 medium y Phi-4 requieren aproximadamente 9 GB de VRAM, lo que encaja bien en una RTX 3060 con 12 GB. Phi-3.5 MoE necesita alrededor de 24 GB de VRAM y requiere una RTX 3090 o 4090. En una Mac con Apple Silicon, Phi-3 mini funciona con 8 GB de RAM, y Phi-4 con 16 GB de RAM.
Costos: Los modelos son gratuitos y están bajo licencia MIT, que permite uso comercial sin restricciones. Los costos de hardware son mínimos: para Phi-3 mini no necesitas una tarjeta gráfica especial, funciona en casi cualquier ordenador. Esto convierte a Phi en la opción más económica para iniciarse en IA local.
Seguridad: Los modelos Phi se ejecutan localmente, tus datos permanecen en tu máquina. La licencia MIT te otorga control total sobre el uso, sin limitaciones. Ten en cuenta que los modelos Phi carecen de filtros de seguridad integrados. Para aplicaciones en producción, deberías implementar medidas adicionales. Una ventaja de su reducido tamaño es que los modelos Phi pueden ejecutarse en dispositivos sin conexión a Internet, garantizando máxima seguridad de datos.
Enlaces útiles
- Modelos de IA local - Resumen de todos los artículos sobre modelos
- Buscar modelo - Ayuda para elegir el modelo adecuado
- Modelos Llama - Comparativa de la serie open source de Meta
- Modelos Mistral - La alternativa europea comparada
- Modelos Qwen - Comparativa de la serie multilingüe de Alibaba
- Ollama - La forma más simple de ejecutar modelos locales
- Gestionar modelos - Administra modelos en Ollama
- Cuantización - Cómo reducir el tamaño de los modelos
- Requisitos de RAM y VRAM - Comprender las necesidades de memoria
- Tamaño de modelo y requisitos de almacenamiento - Fundamentos de hardware
- ¿Qué es IA local? - Artículo introductorio
Preguntas frecuentes
¿Cuál es el primer modelo Phi que debería probar?
Phi-3 mini es la mejor opción para comenzar. Funciona en casi cualquier hardware con 4 GB de VRAM y ofrece un rendimiento notable para su tamaño. Inicia con ollama run phi3.
¿Qué es un Small Language Model?
Un Small Language Model (SLM) es un modelo de lenguaje con pocos miles de millones de parámetros. A diferencia de los Large Language Models (LLMs) con 70 mil millones de parámetros o más, los SLMs son compactos, rápidos y eficientes en hardware. Los modelos Phi son la serie SLM más conocida.
¿Es Phi-4 mejor que Phi-3?
Phi-4 es la generación más reciente y ofrece un rendimiento significativamente mejor en matemáticas, programación y razonamiento. Sin embargo, tiene un contexto más corto de 16.000 tokens comparado con 128.000 en Phi-3. Elige Phi-4 para matemáticas y programación, o Phi-3 y Phi-3.5 para documentos largos.
¿Puedo ejecutar Phi en una laptop sin tarjeta gráfica?
Sí. Phi-3 mini es lo suficientemente compacto para funcionar aceptablemente en CPU. La velocidad será menor que en GPU, pero es usable para tareas simples de chat. Con Ollama funciona directamente sin configuración especial.
¿Son los modelos Phi gratuitos?
Sí. Todos los modelos Phi están bajo licencia MIT, una de las licencias open source más permisivas. Puedes usarlos libremente, modificarlos y también utilizarlos comercialmente sin restricciones.
¿Qué tal es Phi en alemán?
Los modelos Phi fueron entrenados principalmente en inglés. Phi-3.5 mini tiene multilingüismo mejorado, pero el alemán no alcanza el nivel de Qwen o Mistral. Para tareas simples en alemán es suficiente, pero para textos complejos otros modelos son mejores.
¿Qué es Phi-3.5 MoE?
Phi-3.5 MoE es un modelo Mixture-of-Experts con 16 expertos de 3,8 mil millones de parámetros cada uno. En cada consulta se activan 2 expertos. Es el modelo Phi más potente, pero requiere aproximadamente 24 GB de VRAM cuantizado.
¿Puede Phi comprender imágenes?
No. Todos los modelos Phi son modelos de texto puro. No pueden procesar imágenes. Si necesitas análisis de imágenes, usa Llama 3.2 Vision o Qwen VL.
¿Es Phi mejor que Llama o Mistral?
Depende del caso de uso. Phi-3 mini es más eficiente que Llama 3.1 8B y funciona en hardware más débil. Para máximo rendimiento, Llama 3.3 70B o Qwen 2.5 72B son mejores opciones. Para despliegue en edge y hardware limitado, Phi es la mejor solución. En matemáticas, Phi-4 destaca particularmente.
¿Qué significa Textbook Quality Training?
Microsoft entrena los modelos Phi con datos de alta calidad cuidadosamente filtrados, estructurados como libros de texto. En lugar de usar enormes cantidades de datos brutos de internet, Microsoft utiliza datos curados con explicaciones claras y ejemplos. Esto permite que los modelos pequeños logren un rendimiento sorprendentemente bueno.
¿Puedo usar Phi en proyectos comerciales?
Sí, sin restricciones. La licencia MIT permite uso comercial, modificación y distribución sin condiciones. No hay limitaciones respecto al número de usuarios o ingresos, a diferencia de la licencia Llama de Meta.
Fuentes
- Microsoft Research - Resumen de modelos Phi y documentación
- Biblioteca de modelos Ollama - Modelos Phi
- Hugging Face - Página del modelo Microsoft Phi
- Informes técnicos de Microsoft Research para Phi-3, Phi-3.5 y Phi-4


