Skip to content
BotServBotServ
PhiPhi-3Phi-4MicrosoftOllamaIA localcompacto

Modelos Phi: IA compacta de Microsoft

Modelos Phi-3, Phi-3.5 y Phi-4. Pequeños modelos con gran rendimiento. Requisitos de hardware y uso local explicado.

S

schutzgeist

13 min read
Modelos Phi: IA compacta de Microsoft

Modelos Phi: la IA compacta de Microsoft

Qué encontrarás en este artículo

  • Qué modelos Phi existen y cómo se diferencian las generaciones 3, 3.5 y 4
  • Qué es un Small Language Model y por qué importan los modelos pequeños
  • Cuánta VRAM necesitas para cada modelo Phi
  • Cómo ejecutar modelos Phi localmente con Ollama
  • Las fortalezas y limitaciones de los modelos compactos

Introducción

Phi es la línea de modelos de Microsoft que apuesta por un enfoque diferente: pequeños pero potentes. Mientras otros fabricantes construyen modelos cada vez más grandes, Microsoft toma el camino opuesto con Phi. Estos modelos están deliberadamente optimizados para ser compactos y aun así alcanzan un rendimiento que esperarías de modelos significativamente más grandes. Microsoft los llama “Small Language Models” o SLMs.

Si necesitas ejecutar IA local en hardware limitado, los modelos Phi son especialmente interesantes. Funcionan en laptops sin GPU potente, en dispositivos edge e incluso en smartphones. En este artículo obtendrás una visión completa de la línea, sus características particulares y cómo implementarlos localmente.

¿Por qué necesito Phi?

Los modelos Phi resultan atractivos por varias razones. Primero, son extremadamente compactos. El modelo más pequeño, Phi-3 mini, tiene solo 3,8 mil millones de parámetros y funciona en una GPU con 4 GB de VRAM. Esto convierte a Phi en la opción ideal para usuarios sin acceso a hardware costoso.

Segundo, el rendimiento respecto al tamaño es notable. Microsoft utiliza un enfoque de entrenamiento especial llamado “Textbook Quality”. En lugar de usar enormes cantidades de datos sin procesar de internet, Microsoft entrena con datos de alta calidad cuidadosamente filtrados, estructurados como libros de texto. El resultado son modelos que frecuentemente superan a otros modelos del mismo tamaño entrenados convencionalmente.

Tercero, los modelos Phi son versátiles. Funcionan bien para chat, codificación simple, resúmenes de texto y tareas básicas de razonamiento. Para problemas complejos no son la primera opción, pero para el día a día son completamente suficientes.

Cuarto, el despliegue en edge es fundamental. Los modelos Phi son lo bastante pequeños para ejecutarse en dispositivos móviles, navegadores o dispositivos IoT. Esto abre posibilidades de aplicación que serían imposibles con modelos más grandes.

Phi en breve

Phi es una serie de Small Language Models desarrollada por Microsoft Research. Los modelos se basan en la arquitectura Transformer y están construidos como modelos solo decodificadores. La diferencia clave respecto a otras líneas radica en el entrenamiento: Microsoft utiliza datos filtrados de alta calidad en lugar de datos sin procesar de internet.

Los nombres de los modelos siguen un esquema simple: “Phi” seguido del número de versión y el tamaño. Phi-3 mini tiene 3,8 mil millones de parámetros, Phi-3 small tiene 7,4 mil millones, Phi-3 medium tiene 14 mil millones. Las generaciones Phi-3, Phi-3.5 y Phi-4 se construyen una sobre otra, donde cada generación introduce mejoras.

Los modelos están optimizados como versiones Instruct para diálogos e instrucciones. Se distribuyen bajo la licencia MIT, una de las licencias de código abierto más permisivas, permitiendo uso comercial sin restricciones.

Para quién es este artículo

Este artículo está dirigido a:

  • Principiantes que buscan un modelo compacto para hardware limitado
  • Usuarios domésticos que quieren ejecutar IA en un laptop sin GPU potente
  • Desarrolladores que desean desplegar modelos en dispositivos edge o navegadores
  • Usuarios con presupuesto limitado que no quieren invertir en una GPU cara
  • Cualquiera que quiera entender qué son los Small Language Models y por qué son importantes

Términos clave

TérminoSignificado
SLMSmall Language Model, un modelo de lenguaje compacto
ParámetrosLos valores aprendidos del modelo, expresados en miles de millones (B)
Textbook QualityEnfoque de entrenamiento con datos de alta calidad y estructura ordenada
InstructVersión de un modelo optimizada para instrucciones
Edge DeploymentDespliegue de modelos en dispositivos finales en lugar de servidores
TokenizerDivide el texto en tokens que el modelo puede procesar
Context LengthNúmero máximo de tokens que el modelo puede procesar simultáneamente
QuantisierungReducción de la precisión numérica para ahorrar VRAM
GGUFFormato de archivo para modelos cuantificados, usado por Ollama
Fine-TuneReentrenamiento de un modelo con datos especializados

Los modelos Phi en perspectiva

Microsoft ha desarrollado la línea Phi en varias generaciones. Cada una introduce mejoras en rendimiento, eficiencia y capacidades.

Phi-3

Phi-3 es la tercera generación, lanzada en abril de 2024. Incluye tres variantes:

  • Phi-3 mini (3,8B): El modelo más pequeño de la generación. Tiene 3,8 mil millones de parámetros y una context length de 128.000 tokens. A pesar de su tamaño compacto, alcanza en muchos benchmarks el nivel de modelos tres veces más grandes. Funciona en una GPU con 4 GB de VRAM en forma cuantificada.
  • Phi-3 small (7,4B): Un modelo de tamaño medio con 7,4 mil millones de parámetros. Ofrece rendimiento significativamente mejor que mini y es comparable con modelos de 7B de otros fabricantes. La context length es de 128.000 tokens.
  • Phi-3 medium (14B): El modelo más grande de Phi-3 con 14 mil millones de parámetros. Proporciona el mejor rendimiento de la generación, aunque requiere más VRAM.

Phi-3.5

Phi-3.5 es una generación intermedia lanzada en agosto de 2024. Incluye dos modelos:

  • Phi-3.5 mini (3,8B): Una versión mejorada de Phi-3 mini con mejor multilingüismo y contexto más largo. Soporta 128.000 tokens de context length y está entrenado en varios idiomas incluyendo alemán, francés y español.
  • Phi-3.5 MoE (16x3,8B): Un modelo de Mixture-of-Experts con 16 expertos de 3,8 mil millones de parámetros cada uno. En cada solicitud se activan 2 expertos. El número total de parámetros es aproximadamente 42 mil millones, pero solo 6,6 mil millones están activos por solicitud. Este es el modelo Phi más potente, pero requiere considerablemente más VRAM.

Phi-4

Phi-4 es la generación más reciente, lanzada en diciembre de 2024. Introduce una novedad importante: entrenamiento especializado en matemáticas y razonamiento.

  • Phi-4 (14B): Un modelo de 14B con capacidades significativamente mejoradas en matemáticas, programación y razonamiento. Alcanza en estas áreas un rendimiento comparable con modelos que tienen el doble de tamaño. La context length es de 16.000 tokens. Phi-4 se distribuye bajo licencia MIT.

Especificaciones técnicas

ModeloParámetrosContext LengthArquitecturaLicencia
Phi-3 mini3,8B128KDenseMIT
Phi-3 small7,4B128KDenseMIT
Phi-3 medium14B128KDenseMIT
Phi-3.5 mini3,8B128KDenseMIT
Phi-3.5 MoE42B (6,6B activos)128KMoE (16x3,8B)MIT
Phi-414B16KDenseMIT

Requisitos de VRAM de los modelos Phi

Los requisitos de VRAM constituyen una de las mayores ventajas de los modelos Phi. Al ser compactos, demandan significativamente menos VRAM que modelos comparables. La siguiente tabla muestra valores de referencia para Q4_K_M.

ModeloVRAM en Q4_K_MVRAM en Q8VRAM en FP16
Phi-3 mini / Phi-3.5 minica. 2,5 GBca. 4 GBca. 8 GB
Phi-3 smallca. 5 GBca. 8 GBca. 15 GB
Phi-3 medium / Phi-4ca. 9 GBca. 15 GBca. 28 GB
Phi-3.5 MoEca. 24 GBca. 45 GBca. 84 GB

Estos valores son aproximados y pueden variar ligeramente. Además, necesitarás entre 1 y 2 GB adicionales para el contexto. Encontrarás más detalles en RAM y requisitos de VRAM y en Tamaño de modelo y consumo de memoria.

Rendimiento y desempeño

Phi-3 mini y Phi-3.5 mini resultan impresionantes considerando su tamaño. Con 3,8 mil millones de parámetros, alcanzan un desempeño comparable al de modelos de 7B a 10B. Funcionan bien para chat, codificación básica, resúmenes y preguntas fundamentales. Con razonamiento complejo o codificación avanzada encuentran limitaciones.

Phi-3 small se sitúa al nivel de otros modelos de 7B como Llama 3.1 8B o Mistral 7B. El desempeño es sólido, aunque no sobresaliente. La ventaja radica en su eficiencia y licencia MIT.

Phi-3 medium y Phi-4 ofrecen notablemente más capacidad. Phi-4 destaca especialmente en matemáticas y programación gracias a su entrenamiento especializado. En benchmarks de matemáticas logra resultados comparables a modelos del doble de tamaño. Para un modelo de 14B parámetros, el desempeño es excepcional.

Phi-3.5 MoE es el más potente de la línea Phi. Su arquitectura MoE con 16 expertos alcanza un rendimiento equivalente al de modelos de 70B, pero ejecuta más rápidamente. Sin embargo, requiere mucho VRAM porque todos los 42 mil millones de parámetros deben residir en memoria.

Por qué los modelos pequeños importan

Los Small Language Models como Phi no son simplemente versiones más débiles de modelos grandes. Poseen ventajas propias que los modelos grandes no pueden ofrecer.

Velocidad: Los modelos pequeños generan tokens más rápidamente y responden con mayor celeridad. Para aplicaciones interactivas como chat, esto representa una mejora significativa.

Eficiencia de hardware: Requieren menos VRAM y menor consumo de energía. Esto los hace ideales para laptops, dispositivos móviles y despliegue en edge. No necesitas una tarjeta gráfica costosa para ejecutar modelos Phi.

Costos: Menos hardware implica menores gastos. Una tarjeta gráfica con 4 GB de VRAM cuesta una fracción de una con 24 GB. Esto hace que la IA local sea accesible para muchas más personas.

Privacidad en cualquier dispositivo: Cuando un modelo es lo suficientemente pequeño como para ejecutarse en un smartphone, los datos permanecen completamente en el dispositivo. Sin nube, sin transferencias, sin preocupaciones sobre privacidad.

Especialización: Los modelos pequeños pueden ajustarse para tareas específicas sin que el entrenamiento resulte prohibitivo. Un fine-tune de Phi-3 mini es viable en una sola GPU, mientras que un fine-tune de Llama 70B requiere recursos significativos.

Casos de uso para modelos Phi

Caso de usoModelo recomendadoPor qué
Chat en hardware limitadoPhi-3 miniFunciona con 4 GB de VRAM
Matemáticas y programaciónPhi-4Especializado en estas áreas
Despliegue en edgePhi-3.5 miniCompacto y multilingüe
Laptop sin GPUPhi-3 miniSe ejecuta aceptablemente en CPU
Máximo rendimientoPhi-3.5 MoEArquitectura MoE con alto desempeño
Proyectos comercialesTodos los modelos PhiLicencia MIT sin restricciones

Si no estás seguro de cuál elegir, el artículo Encontrar el modelo adecuado te ayudará en la decisión.

Ejecutar modelos Phi con Ollama

Ollama es el método más sencillo para iniciar modelos Phi localmente. Solo necesitas un comando en la terminal.

Iniciar Phi-3 mini:

ollama run phi3

Iniciar Phi-3.5 mini:

ollama run phi3.5

Iniciar Phi-4:

ollama run phi4

Ollama descarga automáticamente una versión cuantizada apropiada, por defecto Q4_K_M. Si deseas usar un nivel de cuantización diferente, puedes especificarlo:

ollama run phi3:3.8b-q5_K_M

Para eliminar modelos que ya no necesites, utiliza el siguiente comando. Más información en Gestionar modelos:

ollama rm phi3

Tropiezos comunes

1. Expectativas de rendimiento demasiado altas: Los modelos Phi son pequeños, y eso conlleva limitaciones. Phi-3 mini es adecuado para tareas simples, pero no para razonamiento complejo o programación avanzada. Si necesitas mayor capacidad, opta por Phi-3 medium o Phi-4.

2. Context length limitado en Phi-4: Phi-4 tiene un context length de 16.000 tokens, significativamente menor que Phi-3 con 128.000 tokens. Para documentos largos, Phi-4 es menos adecuado. Usa Phi-3.5 mini si requieres contexto extenso.

3. El modelo MoE consume mucho VRAM: Phi-3.5 MoE cuenta con 42 mil millones de parámetros en total. Incluso cuantizado, necesitas aproximadamente 24 GB de VRAM. Esto es notablemente más que para otros modelos Phi. Verifica tu hardware antes de cargar este modelo.

4. Sobrestimar la calidad en alemán: Los modelos Phi se entrenan principalmente en inglés. Phi-3.5 mini tiene multilingüismo mejorado, pero el alemán no está al nivel de Qwen o Mistral. Para aplicaciones exclusivamente en alemán, otros modelos suelen ser superiores.

5. Usar versiones antiguas: Phi-1 y Phi-2 son más antiguos y considerablemente más débiles. Cuando ejecutes un modelo Phi, siempre usa Phi-3, Phi-3.5 o Phi-4.

6. Elegir el tamaño incorrecto para la tarea: Phi-3 mini es apropiado para tareas sencillas, pero no para las complejas. Phi-4 es fuerte en matemáticas, pero no para documentos extensos. Selecciona el modelo según el caso de uso, no solo por tamaño.

7. Esperar capacidades de visión: Los modelos Phi son modelos de texto puro. No pueden procesar imágenes. Si necesitas análisis de imágenes, usa Llama 3.2 Vision o Qwen VL.

Hardware, costos y seguridad

Hardware: Los modelos Phi son extremadamente eficientes en hardware. Phi-3 mini funciona en una tarjeta gráfica con 4 GB de VRAM, incluso en una antigua GTX 1050. Phi-3 medium y Phi-4 requieren aproximadamente 9 GB de VRAM, lo que encaja bien en una RTX 3060 con 12 GB. Phi-3.5 MoE necesita alrededor de 24 GB de VRAM y requiere una RTX 3090 o 4090. En una Mac con Apple Silicon, Phi-3 mini funciona con 8 GB de RAM, y Phi-4 con 16 GB de RAM.

Costos: Los modelos son gratuitos y están bajo licencia MIT, que permite uso comercial sin restricciones. Los costos de hardware son mínimos: para Phi-3 mini no necesitas una tarjeta gráfica especial, funciona en casi cualquier ordenador. Esto convierte a Phi en la opción más económica para iniciarse en IA local.

Seguridad: Los modelos Phi se ejecutan localmente, tus datos permanecen en tu máquina. La licencia MIT te otorga control total sobre el uso, sin limitaciones. Ten en cuenta que los modelos Phi carecen de filtros de seguridad integrados. Para aplicaciones en producción, deberías implementar medidas adicionales. Una ventaja de su reducido tamaño es que los modelos Phi pueden ejecutarse en dispositivos sin conexión a Internet, garantizando máxima seguridad de datos.

Enlaces útiles

Preguntas frecuentes

¿Cuál es el primer modelo Phi que debería probar?

Phi-3 mini es la mejor opción para comenzar. Funciona en casi cualquier hardware con 4 GB de VRAM y ofrece un rendimiento notable para su tamaño. Inicia con ollama run phi3.

¿Qué es un Small Language Model?

Un Small Language Model (SLM) es un modelo de lenguaje con pocos miles de millones de parámetros. A diferencia de los Large Language Models (LLMs) con 70 mil millones de parámetros o más, los SLMs son compactos, rápidos y eficientes en hardware. Los modelos Phi son la serie SLM más conocida.

¿Es Phi-4 mejor que Phi-3?

Phi-4 es la generación más reciente y ofrece un rendimiento significativamente mejor en matemáticas, programación y razonamiento. Sin embargo, tiene un contexto más corto de 16.000 tokens comparado con 128.000 en Phi-3. Elige Phi-4 para matemáticas y programación, o Phi-3 y Phi-3.5 para documentos largos.

¿Puedo ejecutar Phi en una laptop sin tarjeta gráfica?

Sí. Phi-3 mini es lo suficientemente compacto para funcionar aceptablemente en CPU. La velocidad será menor que en GPU, pero es usable para tareas simples de chat. Con Ollama funciona directamente sin configuración especial.

¿Son los modelos Phi gratuitos?

Sí. Todos los modelos Phi están bajo licencia MIT, una de las licencias open source más permisivas. Puedes usarlos libremente, modificarlos y también utilizarlos comercialmente sin restricciones.

¿Qué tal es Phi en alemán?

Los modelos Phi fueron entrenados principalmente en inglés. Phi-3.5 mini tiene multilingüismo mejorado, pero el alemán no alcanza el nivel de Qwen o Mistral. Para tareas simples en alemán es suficiente, pero para textos complejos otros modelos son mejores.

¿Qué es Phi-3.5 MoE?

Phi-3.5 MoE es un modelo Mixture-of-Experts con 16 expertos de 3,8 mil millones de parámetros cada uno. En cada consulta se activan 2 expertos. Es el modelo Phi más potente, pero requiere aproximadamente 24 GB de VRAM cuantizado.

¿Puede Phi comprender imágenes?

No. Todos los modelos Phi son modelos de texto puro. No pueden procesar imágenes. Si necesitas análisis de imágenes, usa Llama 3.2 Vision o Qwen VL.

¿Es Phi mejor que Llama o Mistral?

Depende del caso de uso. Phi-3 mini es más eficiente que Llama 3.1 8B y funciona en hardware más débil. Para máximo rendimiento, Llama 3.3 70B o Qwen 2.5 72B son mejores opciones. Para despliegue en edge y hardware limitado, Phi es la mejor solución. En matemáticas, Phi-4 destaca particularmente.

¿Qué significa Textbook Quality Training?

Microsoft entrena los modelos Phi con datos de alta calidad cuidadosamente filtrados, estructurados como libros de texto. En lugar de usar enormes cantidades de datos brutos de internet, Microsoft utiliza datos curados con explicaciones claras y ejemplos. Esto permite que los modelos pequeños logren un rendimiento sorprendentemente bueno.

¿Puedo usar Phi en proyectos comerciales?

Sí, sin restricciones. La licencia MIT permite uso comercial, modificación y distribución sin condiciones. No hay limitaciones respecto al número de usuarios o ingresos, a diferencia de la licencia Llama de Meta.

Fuentes

  • Microsoft Research - Resumen de modelos Phi y documentación
  • Biblioteca de modelos Ollama - Modelos Phi
  • Hugging Face - Página del modelo Microsoft Phi
  • Informes técnicos de Microsoft Research para Phi-3, Phi-3.5 y Phi-4
Volver al blog
Share:

Entradas relacionadas