Skip to content
BotServBotServ
GlosarioTérminosLLMCuantizaciónTool-CallingRAMVRAMAgenteRAG

Glosario de Fundamentos de IA

Glosario de IA: términos clave sobre IA local, agentes de IA y hardware explicados. LLM, cuantización, Tool-Calling y más.

S

schutzgeist

15 min read
Glosario de Fundamentos de IA

Glosario de Fundamentos de IA

Qué cubre este glosario

  • Todos los términos clave de los artículos de fundamentos de BotServ.
  • Explicaciones accesibles para principiantes, con ejemplos.
  • Referencias cruzadas a los artículos donde se explica cada término en detalle.
  • Organizado por temas: IA local, agentes de IA, hardware de IA.

Introducción al glosario de fundamentos de IA

Quien se adentra en IA local, agentes de IA y hardware de IA se encuentra con muchos términos técnicos. Este glosario reúne todos los conceptos centrales de los artículos de fundamentos de BotServ en un único lugar. Cada término tiene una explicación breve y accesible, frecuentemente acompañada de un ejemplo. Si necesitas más detalles, encontrarás un enlace al artículo de fundamentos correspondiente.

Términos de IA local

LLM

LLM significa Large Language Model, o modelo de lenguaje grande. Un LLM es una IA capaz de procesar y generar texto. Ejemplos incluyen Llama 3.1, Qwen 2.5 o Mistral. Un LLM consta de miles de millones de parámetros y fue entrenado con enormes volúmenes de texto. Más información en Qué es IA local.

Inferencia

La inferencia es el proceso mediante el cual un modelo ya entrenado procesa una entrada y genera una respuesta. Cuando ejecutas Ollama, introduces un prompt y recibes una respuesta, eso es inferencia. Lo opuesto es el entrenamiento, que es la creación del modelo. Más información en Ejecutar un LLM localmente.

Entrenamiento

El entrenamiento es la creación de un modelo. El modelo se entrena con enormes volúmenes de datos para que pueda comprender y generar texto. El entrenamiento requiere una potencia computacional inmensa y tarda semanas o meses. La inferencia es el uso del modelo terminado. Más información en Qué es IA local.

Token

Un token es la unidad más pequeña que procesa un modelo de lenguaje. Puede ser una palabra, parte de una palabra o un carácter. En alemán, una palabra corresponde aproximadamente a 1,3 a 1,5 tokens. La longitud de contexto de un modelo se mide en tokens. Más información en Longitud de contexto.

Longitud de contexto

La longitud de contexto, también llamada ventana de contexto, es el número máximo de tokens que un modelo puede procesar de una vez. Un modelo con 8.000 tokens de contexto puede leer aproximadamente 6.000 palabras simultáneamente. Los textos más largos deben dividirse o resumirse. Más información en Longitud de contexto.

Ventana de contexto

Sinónimo de longitud de contexto. Ambos términos designan la longitud máxima de entrada de un modelo en tokens.

KV-Cache

El KV-Cache es un búfer intermedio que el modelo construye durante la inferencia. Almacena valores intermedios para cada token procesado. Con contextos largos, el KV-Cache crece y consume memoria adicional. Esta es la razón por la que contextos largos requieren más VRAM o RAM. Más información en Longitud de contexto.

Prompt

Un prompt es la entrada que le das a un modelo de lenguaje. Puede ser una pregunta, una instrucción o un texto que el modelo debe procesar. El prompt más la respuesta del modelo deben caber juntos dentro de la ventana de contexto.

Completion

Una completion es la respuesta que el modelo genera después de un prompt. En modelos de chat, la completion es el mensaje que el modelo devuelve.

System Prompt

El system prompt es una instrucción que el modelo recibe al inicio de una conversación. Define el rol, comportamiento y límites del modelo. Ejemplo: “Eres un asistente útil para IA local. Responde en español.”

Ollama

Ollama es un entorno de ejecución para modelos de lenguaje locales. Descarga modelos, los inicia y proporciona una API. Ollama es la forma más sencilla de iniciarse en IA local. Más información en Ejecutar un LLM localmente y en Ollama.

LM Studio

LM Studio es una aplicación gráfica para modelos de lenguaje locales. Ofrece una interfaz para cargar y probar modelos. LM Studio es una alternativa a Ollama para usuarios que prefieren hacer clic en lugar de escribir comandos. Más información en Ejecutar un LLM localmente.

GGUF

GGUF es un formato de archivo para modelos de lenguaje cuantizados. Lo utilizan llama.cpp y Ollama. Los archivos GGUF contienen el modelo en forma comprimida, permitiendo que se ejecute con menos memoria. Más información en Cuantización.

Cuantización

La cuantización reduce la precisión de los pesos del modelo para ahorrar memoria. Un modelo originalmente entrenado con valores de 16 bits se reduce a 4, 5 u 8 bits. Esto disminuye significativamente los requisitos de memoria. La desventaja: la calidad de las respuestas puede degradarse ligeramente. Más información en Cuantización.

FP16

FP16 son números flotantes de 16 bits. Este es el formato estándar en el que se entrenan los modelos. Un modelo FP16 es grande y requiere mucha memoria. Para IA local, generalmente se cuantiza.

INT8

INT8 es una representación entera de 8 bits. Un modelo en INT8 requiere aproximadamente la mitad de memoria que en FP16. La calidad suele mantenerse cercana al original.

INT4

INT4 es una representación de 4 bits. Un modelo en INT4 requiere aproximadamente una cuarta parte de la memoria de FP16. INT4 es el nivel de cuantización más común para IA local en hardware de consumo.

Q4, Q5, Q6, Q8

Estas abreviaturas designan niveles de cuantización de 4, 5, 6 u 8 bits respectivamente. Q4 ahorra más memoria, Q8 ofrece la mejor calidad. Más información en Cuantización.

K-Quantisierung

K-Quantisierung es una cuantización mixta mejorada. Almacena partes más sensibles del modelo con más bits que las menos sensibles. Q4_K_M es mejor que Q4_0 porque proporciona más precisión a los pesos importantes. Más información en Cuantización.

RAG

RAG significa Retrieval-Augmented Generation. El modelo busca pasajes de texto relevantes en una base de datos y los utiliza como contexto para la respuesta. RAG permite usar un modelo con tus propios documentos sin entrenarlo de nuevo. Más información en RAG local.

Embedding

Un embedding es una representación numérica de texto. El texto se convierte en un vector de números que captura su significado. Los embeddings se utilizan para la búsqueda en sistemas RAG. Más información en Modelos de embedding.

Base de datos vectorial

Una base de datos vectorial almacena embeddings y permite buscar textos similares. Ejemplos incluyen Chroma y Qdrant. Las bases de datos vectoriales son un componente central de los sistemas RAG. Más información en Bases de datos vectoriales.

Chunking

Chunking es el proceso de dividir documentos en fragmentos más pequeños antes de cargarlos en una base de datos vectorial. Cada fragmento se convierte en un embedding. Un buen chunking es importante para obtener buenos resultados en RAG. Más información en Chunking.

Autohospedaje

El autohospedaje significa ejecutar software en tu propio hardware en lugar de utilizarlo como un servicio en la nube. La IA local es una forma de autohospedaje. Encontrarás más información en el artículo ¿Qué es la IA local?.

IA en la nube

La IA en la nube significa que el modelo se ejecuta en servidores de un proveedor. Envías tu entrada a través de una API o navegador, y recibes la respuesta. Ejemplos de esto son ChatGPT, Claude y Gemini. Encontrarás más información en el artículo IA local vs. IA en la nube.

API

API significa Application Programming Interface. Una API es una interfaz a través de la cual los programas se comunican entre sí. Ollama, por ejemplo, ofrece una API en http://localhost:11434 mediante la cual otros programas pueden acceder al modelo.

Híbrido

Una configuración híbrida combina IA local e IA en la nube. Las tareas simples o no sensibles se ejecutan en la nube, mientras que las tareas sensibles o frecuentes se ejecutan localmente. Encontrarás más información en el artículo IA local vs. IA en la nube.

RGPD

El RGPD (Reglamento General de Protección de Datos) regula el tratamiento de datos personales en la UE. La IA local ayuda a cumplir con él porque los datos nunca abandonan tu red. Encontrarás más información en el artículo IA local vs. IA en la nube.

Modelfile

Un Modelfile es un archivo de configuración para Ollama. Define qué modelo se carga, qué prompt del sistema se utiliza y qué parámetros se aplican. Es similar a un Dockerfile, pero para modelos de IA.

Parámetros

Los parámetros son los pesos de un modelo. Se aprenden durante el entrenamiento y determinan cómo procesa el modelo las entradas. Los modelos suelen nombrarse según su cantidad de parámetros, por ejemplo 7B para 7 mil millones de parámetros.

Términos de agentes de IA

Agente

Un agente es un sistema de IA que persigue un objetivo y ejecuta acciones de forma independiente. Observa su entorno, planifica pasos y utiliza herramientas para alcanzar su objetivo. Encontrarás más información en el artículo ¿Qué es un agente de IA?.

Agente de IA

Sinónimo de agente. Un agente de IA utiliza un modelo de lenguaje como cerebro y herramientas como manos para completar tareas.

Chatbot

Un chatbot es un sistema de diálogo que responde a las entradas con texto. Reacciona, pero no planifica de forma independiente ni utiliza herramientas. Encontrarás más información en el artículo Chatbot vs. agente de IA.

Herramienta

Una herramienta es una función externa que un agente puede invocar. Los ejemplos incluyen búsqueda web, acceso a archivos, consultas a bases de datos o envío de correos electrónicos. Las herramientas hacen que un agente sea realmente útil.

Llamada de herramientas

La llamada de herramientas es la capacidad de un modelo de lenguaje para invocar funciones externas. El modelo no solo genera texto, sino un mensaje estructurado con el nombre de la función y sus parámetros. Tu programa ejecuta la función y devuelve el resultado. Encontrarás más información en el artículo Llamada de herramientas.

Function Calling

Sinónimo de llamada de herramientas. Ambos términos designan la misma capacidad.

Schema

Un schema describe una herramienta para el modelo. Contiene el nombre, una descripción y los parámetros con sus tipos. El modelo utiliza el schema para decidir si invocar la herramienta y cómo hacerlo.

Memoria

La memoria es el almacenamiento de un agente. La memoria a corto plazo retiene los pasos actuales y resultados intermedios. La memoria a largo plazo almacena conocimiento a lo largo de múltiples sesiones.

Memory

Término en inglés para memoria. Véase arriba.

Planificación

La planificación es la división de un objetivo en pasos individuales. El agente planifica qué acción ejecutar a continuación y ajusta el plan según los resultados intermedios.

Autonomía

La autonomía describe cuánta independencia tiene un agente para tomar decisiones. Mayor autonomía significa más posibilidades, pero también más riesgo. Los agentes autónomos deben ejecutarse en entornos aislados.

Multi-agentes

Multi-agentes significa que varios agentes con diferentes roles colaboran entre sí. Un agente escribe código, otro lo revisa, un tercero lo documenta. Los ejemplos incluyen CrewAI y AutoGen. Encontrarás más información en la descripción general de frameworks.

Workflow

Un workflow es una secuencia de pasos que un agente ejecuta. Los workflows pueden ser lineales o ramificados. Un workflow de investigación podría verse así: buscar, leer, resumir, guardar.

MCP

MCP significa Model Context Protocol. Es un estándar para herramientas y contexto que los agentes pueden utilizar. MCP facilita compartir herramientas entre diferentes frameworks.

Reasoning

Reasoning es la capacidad de un modelo para pensar lógicamente y sacar conclusiones. Los modelos con buen reasoning son más adecuados para agentes porque planifican mejor los pasos.

ReAct

ReAct es una arquitectura de agentes que combina reasoning y actuación. El agente primero razona (Reason), luego actúa (Act), luego observa el resultado (Observe) y comienza de nuevo. Encontrarás más información en el artículo ¿Qué es un agente de IA?.

Plan-and-Execute

Plan-and-Execute es una arquitectura de agentes en la que el agente primero crea un plan completo y luego lo ejecuta paso a paso. A diferencia de ReAct, el plan se crea de antemano, no paso a paso.

Sandbox

Una sandbox es un entorno aislado en el que se ejecuta un agente. Previene que el agente ejecute acciones inesperadas en el sistema real. El aislamiento en sandbox es importante para la seguridad de agentes autónomos.

Aprobación humana

La aprobación humana (Human-in-the-Loop) significa que un ser humano debe confirmar acciones críticas de un agente antes de su ejecución. Esto aumenta la seguridad en workflows autónomos.

Framework

Un framework es una biblioteca de software que te ayuda a construir agentes. Los frameworks manejan el ciclo de observación, planificación y ejecución. Los ejemplos incluyen LangGraph, CrewAI y AutoGen. Encontrarás más información en la descripción general de frameworks.

Términos de hardware de IA

RAM

RAM (Random Access Memory) es la memoria de acceso aleatorio de tu ordenador. Está disponible para la CPU y todos los programas. En la inferencia de CPU, el modelo reside en RAM. Encontrarás más información en el artículo RAM vs. VRAM.

VRAM

VRAM (Video RAM) es la memoria en una tarjeta gráfica dedicada. Está disponible exclusivamente para la GPU y es significativamente más rápida que la RAM para cálculos de IA. En la inferencia de GPU, el modelo reside en VRAM. Encontrarás más información en el artículo RAM vs. VRAM.

GPU

GPU significa Graphics Processing Unit, es decir, el procesador en la tarjeta gráfica. Las GPU tienen muchos núcleos de procesamiento paralelos y son significativamente más rápidas que las CPU para la inferencia de IA. Encontrarás más información en el artículo RAM vs. VRAM.

CPU

CPU significa Central Processing Unit, es decir, el procesador principal del ordenador. Las CPU tienen pocos núcleos, pero flexibles. La inferencia de IA en la CPU es posible, pero más lenta que en GPU.

Descarga de GPU

La descarga de GPU (GPU-Offloading) consiste en transferir partes de un modelo a la GPU cuando no cabe completamente en VRAM. El resto permanece en RAM. Esta aproximación es más lenta que la inferencia GPU completa, pero más rápida que la inferencia pura en CPU. Encontrarás más detalles en el artículo RAM vs. VRAM.

Ancho de banda de memoria

El ancho de banda de memoria es la velocidad a la que se transfieren datos entre la memoria y el procesador. Un ancho de banda elevado es crucial para IA porque se necesita mover grandes volúmenes de datos. VRAM generalmente ofrece mayor ancho de banda que RAM.

Unified Memory

Unified Memory permite que CPU y GPU compartan el mismo espacio de memoria. Una Mac con 32 GB de RAM puede utilizar esos mismos 32 GB para la GPU. En una tarjeta gráfica convencional, el VRAM es independiente. Más información en el artículo RAM vs. VRAM.

Shared Memory

Sinónimo de Unified Memory. Ambos términos se refieren a memoria compartida entre CPU y GPU.

APU

APU significa Accelerated Processing Unit. Una APU integra CPU y GPU en un solo chip. Ejemplos incluyen Apple Silicon y AMD Ryzen AI Max. La ventaja es que ambos procesadores pueden acceder a la misma memoria. Más información en Fundamentos de Hardware de IA.

Apple Silicon

Apple Silicon es la denominación de los chips propios de Apple, como M1, M2, M3 y M4. Integran CPU y GPU en un único chip y utilizan Unified Memory. Apple Silicon es muy popular para IA local porque aprovecha la memoria de manera muy eficiente. Más información en el artículo RAM vs. VRAM.

TOPS

TOPS significa Tera Operations Per Second. Es la unidad de medida para la potencia de cálculo de IA. Un valor TOPS más alto indica que un chip puede ejecutar potencialmente más operaciones de IA por segundo. Sin embargo, TOPS no lo dice todo, ya que el ancho de banda de memoria y la arquitectura son igualmente importantes. Más información en Fundamentos de Hardware de IA.

NTOPS

NTOPS significa NPU TOPS, es decir, la potencia de cálculo de IA de la NPU (Neural Processing Unit). Las NPUs son aceleradores de IA especializados en chips modernos. NTOPS miden solo el rendimiento de la NPU, no el de la GPU.

SSD

SSD significa Solid State Drive, un tipo de almacenamiento en flash. Una SSD carga modelos significativamente más rápido que un disco duro convencional (HDD). Las SSD NVMe son aún más rápidas que las SSD SATA.

NVMe

NVMe es un estándar de interfaz para SSD. Las SSD NVMe son considerablemente más rápidas que las SSD SATA y cargan modelos grandes en segundos en lugar de minutos. Para IA local se recomienda utilizar una SSD NVMe.

Requisitos de memoria

Los requisitos de memoria se refieren a la RAM o VRAM que necesita un modelo durante la inferencia. Dependen del tamaño del modelo, la cuantización y el KV-cache. Más información en el artículo Requisitos de RAM y VRAM.

Enlaces y recursos adicionales del glosario

Preguntas frecuentes sobre el glosario

¿Cuál es la diferencia entre entrenamiento e inferencia?

El entrenamiento consiste en crear un modelo a partir de grandes volúmenes de datos. La inferencia es el uso del modelo terminado para calcular respuestas. IA local utiliza inferencia.

¿Cuál es la diferencia entre RAM y VRAM?

RAM es la memoria principal del ordenador, VRAM es la memoria de la tarjeta gráfica. En inferencia por CPU el modelo reside en RAM, en inferencia por GPU está en VRAM. La inferencia por GPU es mucho más rápida. Más información en el artículo RAM vs. VRAM.

¿Cuál es la diferencia entre Tool-Calling y Function Calling?

Ninguna. Ambos términos designan la misma capacidad: un modelo de lenguaje que puede invocar funciones externas. Más información en el artículo Tool-Calling.

¿Cuál es la diferencia entre longitud de contexto y ventana de contexto?

Ninguna. Ambos términos se refieren al número máximo de tokens que un modelo puede procesar de una sola vez. Más información en el artículo Longitud de contexto.

¿Cuál es la diferencia entre cuantización y compresión?

La cuantización es una forma específica de compresión. Reduce la precisión de los pesos del modelo, por ejemplo de 16 bits a 4 bits. Compresión es el término más general.

¿Cuál es la diferencia entre un agente y un chatbot?

Un chatbot responde a entradas con texto. Un agente planifica múltiples pasos, utiliza herramientas y persigue un objetivo. Más información en el artículo Chatbot vs. Agente de IA.

¿Cuál es la diferencia entre Unified Memory y Shared Memory?

Ninguna. Ambos términos se refieren a memoria compartida entre CPU y GPU, como en Apple Silicon o Ryzen AI Max.

¿Cuál es la diferencia entre Q4_0 y Q4_K_M?

Q4_0 cuantiza todos los pesos de manera uniforme. Q4_K_M utiliza cuantización mixta que almacena con más bits las partes más sensibles del modelo. Q4_K_M generalmente proporciona mejores resultados. Más información en el artículo Cuantización.

¿Qué significa GGUF?

GGUF es un formato de archivo para modelos de lenguaje cuantizados. Lo utilizan llama.cpp y Ollama. Los archivos GGUF contienen el modelo en forma comprimida.

¿Cuál es la diferencia entre RAG y Fine-Tuning?

RAG busca fragmentos de texto relevantes en una base de datos y los proporciona al modelo como contexto. Fine-Tuning continúa entrenando el modelo con nuevos datos. RAG es más simple y flexible, Fine-Tuning requiere más trabajo pero está más profundamente integrado.

¿Cuál es la diferencia entre TOPS y TFLOPS?

TOPS mide operaciones enteras (INT), TFLOPS mide operaciones de punto flotante (FP). Para inferencia de IA con modelos cuantizados TOPS es más relevante. Para entrenamiento TFLOPS es más importante.

¿Cuál es la diferencia entre MCP y Tool-Calling?

Tool-Calling es la capacidad del modelo de invocar funciones. MCP es un estándar que define cómo se estruturan y proporcionan las herramientas y el contexto. MCP utiliza Tool-Calling como mecanismo.

Volver al blog
Share:

Nächster Artikel in IA Local

Weiterlesen
IA Local vs IA en la Nube

Entradas relacionadas