Fundamentos de IA Local
Qué cubre este artículo
- Qué es la IA local y cuándo tiene sentido usarla.
- Las diferencias entre IA local e IA en la nube.
- Conceptos clave como cuantización, longitud de contexto y requisitos de memoria.
- Referencias a todos los artículos fundamentales.
Introducción
IA local significa ejecutar modelos de lenguaje en tu propio ordenador o servidor. Privacidad de datos, independencia de proveedores y control total sobre tus datos y flujos de trabajo son las razones principales. Si empiezas en este ámbito, necesitas entender qué requisitos de hardware existen, cómo hacer modelos más pequeños y por qué la ventana de contexto importa.
¿Por qué necesito aprender los fundamentos de IA local?
Quienes comienzan sin fundamentos suelen fracasar en cosas que parecen simples. Un ejemplo: descargas un modelo de 13B y te preguntas por qué no funciona en tu ordenador con 16 GB de RAM. Sin conocimientos básicos, no sabes que necesitas cuantización para reducir el modelo a 8 GB. O usas un modelo con una ventana de contexto pequeña y te preguntas por qué no entiende documentos largos.
Los fundamentos también te ayudan a decidir si la IA local tiene sentido para tu caso de uso. Para experimentos cortos, la nube suele ser suficiente. Para datos sensibles o uso continuo sin costos de API, la IA local vale la pena.
IA local explicada brevemente
IA local carga un modelo de lenguaje en tu ordenador y lo ejecuta allí. Para esto necesitas un entorno de ejecución como Ollama o LM Studio, que carga el modelo y proporciona una API. El modelo reside en la RAM o VRAM y calcula respuestas localmente. Ningún dato sale de tu ordenador.
La diferencia con la IA en la nube es simple: en la nube envías tus entradas a un servidor de un proveedor como OpenAI o Anthropic. En IA local, todo permanece en tu ordenador. No cuesta nada en API, pero necesita hardware adecuado.
Para quién es esta sección
- Quieres ejecutar IA localmente y saber qué puede hacer tu ordenador.
- Te preguntas si la IA local tiene sentido para tu caso de uso.
- Eres principiante y quieres entender los conceptos antes de instalar Ollama.
- No necesitas conocimientos previos profundos. Los términos técnicos se explican aquí en línea.
Términos importantes
- LLM - Large Language Model, un modelo grande de lenguaje. Ejemplos son Llama 3.1, Qwen 2.5 o Mistral.
- Cuantización - Reducción de la precisión del modelo para ahorrar memoria. Así, 16 GB se convierten en 8 GB o menos.
- Longitud de contexto - Longitud máxima de entrada que el modelo puede procesar a la vez. Se mide en tokens.
- Ollama - Entorno de ejecución local para modelos de lenguaje. Carga modelos y proporciona una API.
- LM Studio - Aplicación gráfica para modelos locales con interfaz de usuario.
- Token - Elemento de significado más pequeño para un modelo de lenguaje. Una palabra corresponde aproximadamente a 1,5 tokens.
- Inferencia - Ejecutar un modelo para calcular respuestas. El entrenamiento es crear un modelo, la inferencia es usarlo.
Contenido y artículos
- ¿Qué es la IA local? - Definición, ventajas y casos de uso típicos.
- IA local vs. IA en la nube - ¿Cuándo vale la pena la IA local, cuándo la nube?
- Ejecutar LLM localmente - Primeros pasos con Ollama, LM Studio o Docker.
- Cuantización - Cómo encajan modelos grandes en hardware más pequeño.
- Longitud de contexto - Cuánto texto puede procesar un modelo a la vez.
- Requisitos de RAM y VRAM - ¿Qué necesita tu ordenador para modelos locales?
- Glosario de IA - Todos los términos importantes de la A a la Z explicados claramente.
Obstáculos típicos
- El modelo no cabe en memoria - Sin cuantización, los modelos grandes no funcionan en hardware de consumidor. Verifica de antemano cuánta memoria necesita el modelo.
- La ventana de contexto es demasiado pequeña - Un modelo con contexto de 4K no entiende documentos largos. Para RAG necesitas un modelo con una ventana de contexto más grande.
- Costos en la nube vs. costos de hardware - La IA local no es gratis. Pagas en hardware y electricidad. Para uso ocasional, la nube puede ser más barata.
- No todos los modelos funcionan localmente - Algunos modelos están optimizados para infraestructura en la nube. Verifica si hay una versión cuantizada disponible.
Enlaces relacionados
FAQ - Preguntas frecuentes
¿Qué es la IA local?
IA local significa ejecutar modelos de lenguaje en tu propio ordenador o servidor. Los modelos residen en la RAM o VRAM y calculan respuestas localmente. Ningún dato sale de tu ordenador. Más información en el artículo ¿Qué es la IA local?
¿Cuál es la diferencia entre IA local e IA en la nube?
En IA en la nube envías entradas a un servidor de un proveedor. En IA local, todo permanece en tu ordenador. La IA local no cuesta nada en API, pero necesita hardware adecuado. Más información en el artículo IA local vs. IA en la nube.
¿Qué es la cuantización?
La cuantización reduce la precisión de un modelo para ahorrar memoria. Así, un modelo de 16 GB se convierte en 8 GB o menos. Esto permite ejecutar modelos más grandes en hardware más pequeño. Más información en el artículo Cuantización.
¿Qué es la longitud de contexto?
La longitud de contexto es la máxima entrada que un modelo puede procesar a la vez. Se mide en tokens. Un modelo con contexto de 8K entiende documentos más largos que uno con contexto de 4K. Más información en el artículo Longitud de contexto.
¿Vale la pena la IA local para principiantes?
Sí. Herramientas como Ollama permiten empezar con poco esfuerzo. Para modelos más grandes necesitas hardware adecuado.
¿Necesito una tarjeta gráfica para IA local?
Para modelos pequeños suele bastar la CPU. Para respuestas más rápidas y modelos más grandes, se recomienda una GPU con VRAM suficiente.
¿Cuánta RAM necesito para IA local?
Para modelos de 7B, al menos 16 GB de RAM, mejor 32 GB. Modelos más grandes como 70B necesitan 64 GB o más. Más información en el artículo Requisitos de RAM y VRAM.
¿Qué software necesito para IA local?
La solución más simple es Ollama. Carga modelos y proporciona una API. LM Studio es una alternativa gráfica. Más información en la descripción general Software de IA Local.
¿Qué es un token?
Un token es el elemento de significado más pequeño para un modelo de lenguaje. Una palabra corresponde aproximadamente a 1,5 tokens. La longitud de contexto se mide en tokens.
¿Cuál es la diferencia entre entrenamiento e inferencia?
El entrenamiento es crear un modelo con grandes cantidades de datos. La inferencia es ejecutar un modelo terminado para calcular respuestas. La IA local usa inferencia.
¿Son los modelos locales tan buenos como los de la nube?
Los modelos locales grandes como Llama 3.1 70B se acercan mucho a los modelos de la nube. Los modelos pequeños de 7B son más débiles, pero suficientes para muchas tareas. La brecha disminuye a medida que los modelos de código abierto mejoran.
¿Puedo ejecutar IA local con Docker?
Sí. Ollama, LM Studio y muchos frameworks se pueden ejecutar en Docker. Es especialmente útil si quieres ejecutar varios servicios aislados.


