IA Local
Qué cubre este artículo
- Qué es la IA local y para qué sirve.
- Los contenidos disponibles sobre IA Local en BotServ.
- Referencias a fundamentos, software, modelos, RAG y áreas relacionadas.
Introducción
La IA local se ejecuta en tu propio equipo o servidor. Privacidad de datos, control e independencia de proveedores en la nube son sus principales ventajas. Esta sección te lleva desde los fundamentos, pasando por software y modelos, hasta RAG y agentes locales.
¿Por qué necesito IA local?
Si usas IA regularmente, los gastos en llamadas API con proveedores en la nube crecen rápidamente. Con IA local desaparecen estos costes recurrentes. Inviertes una sola vez en hardware y luego solo pagas electricidad. Además está el aspecto de privacidad: los datos sensibles nunca salen de tu equipo.
Un ejemplo: quieres hacer que documentos internos sean buscables mediante RAG. En la nube tendrías que subir esos documentos a un proveedor. En local, todo permanece en tu máquina. Para muchas empresas, abogados o particulares, esto es una ventaja decisiva.
IA local en pocas palabras
La IA local carga un modelo de lenguaje en tu equipo y lo ejecuta ahí. Para esto necesitas un entorno de ejecución como Ollama o LM Studio, que carga el modelo y proporciona una API. El modelo reside en RAM o VRAM y calcula respuestas localmente. Ningún dato sale de tu equipo.
¿Para quién es esta sección?
- Quieres ejecutar IA localmente y saber qué puede hacer tu equipo.
- Buscas software, modelos o soluciones RAG para autoalojamiento.
- Eres principiante y quieres entender los conceptos antes de instalar Ollama.
- No necesitas conocimientos previos profundos. Los términos técnicos se explican inline en los artículos.
Contenido y artículos
- Fundamentos - Qué es IA local, cuantización, longitud de contexto, RAM y VRAM.
- Software - Ollama, LM Studio y herramientas para operación local.
- Modelos - Cómo encontrar modelos locales adecuados.
- RAG Local - Fundamentos de RAG, chunking, embeddings y bases de datos vectoriales.
Términos importantes
- LLM - Large Language Model, modelo de lenguaje extenso. Ejemplos: Llama 3.1, Qwen 2.5 o Mistral.
- Ollama - Entorno de ejecución local para modelos de lenguaje. Carga modelos y proporciona una API.
- LM Studio - Aplicación gráfica para modelos locales con interfaz de usuario.
- Cuantización - Reduce la precisión de un modelo para ahorrar memoria.
- RAG - Retrieval-Augmented Generation. Busca fragmentos de texto relevantes en una base de datos y los proporciona al modelo como contexto.
- Base de datos vectorial - Almacena embeddings para búsquedas RAG. Ejemplos: Chroma y Qdrant.
Tropiezos típicos
- El modelo no cabe en memoria - Sin cuantización, los modelos grandes no corren en hardware de consumidor. Verifica antes cuánta memoria necesita el modelo.
- La ventana de contexto es demasiado pequeña - Un modelo con contexto de 4K no entiende documentos largos. Para RAG necesitas un modelo con ventana de contexto mayor.
- Costes en nube vs. costes de hardware - La IA local no es gratis. Inviertes en hardware y electricidad. Para uso ocasional, la nube puede ser más barata.
Enlaces complementarios
FAQ - Preguntas frecuentes
¿Qué es IA local?
IA local significa ejecutar modelos de lenguaje en tu propio equipo o servidor. Los modelos residen en RAM o VRAM y calculan respuestas localmente. Ningún dato sale de tu equipo. Más información en Fundamentos de IA Local.
¿Cuál es la diferencia entre IA local e IA en nube?
Con IA en nube, envías entradas a un servidor de un proveedor. Con IA local, todo permanece en tu equipo. La IA local no tiene costes de API, pero requiere hardware adecuado.
¿Qué software necesito para IA local?
La solución más simple es Ollama. Carga modelos y proporciona una API. LM Studio es una alternativa gráfica. Más información en Software de IA Local.
¿Qué es cuantización?
La cuantización reduce la precisión de un modelo para ahorrar memoria. Un modelo de 16 GB se convierte así en 8 GB o menos. Esto permite ejecutar modelos más grandes en hardware más pequeño.
¿Necesito una tarjeta gráfica para IA local?
Para modelos pequeños suele ser suficiente la CPU. Para respuestas más rápidas y modelos mayores se recomienda una GPU con suficiente VRAM.
¿Cuánta RAM necesito para IA local?
Para modelos de 7B al menos 16 GB de RAM, preferiblemente 32 GB. Modelos más grandes como 70B necesitan 64 GB o más.
¿Qué es RAG?
RAG significa Retrieval-Augmented Generation. El modelo busca fragmentos de texto relevantes en una base de datos y los utiliza como contexto para la respuesta. Más información en RAG Local.
¿Qué es una base de datos vectorial?
Una base de datos vectorial almacena embeddings, es decir, representaciones numéricas de textos. Se utiliza para búsquedas RAG. Ejemplos: Chroma y Qdrant.
¿Son los modelos locales tan buenos como los de nube?
Modelos locales grandes como Llama 3.1 70B se aproximan mucho a los de nube. Modelos pequeños de 7B son más débiles, pero suficientes para muchas tareas. La brecha se reduce conforme mejoran los modelos de código abierto.
¿Puedo ejecutar IA local con Docker?
Sí. Ollama, LM Studio y muchos frameworks se pueden ejecutar en Docker. Es especialmente útil cuando quieres mantener varios servicios aislados.


