Skip to content
BotServBotServ
Papers de IATransformerAttention is all you needRAG PaperInvestigación LLMarXiv

Papers de IA Esenciales: Transformer, LLM, RAG y Agentes

Los papers de IA más importantes explicados. Transformer, LLaMA, RAG, Mixture of Experts y más, con guía práctica.

S

schutzgeist

6 min read

Papers clave de IA: Transformers, LLMs, RAG y Agentes

Qué encontrarás en este artículo

  • Qué trabajos han moldeado el ecosistema moderno de IA.
  • De qué trata cada paper, explicado en términos simples.
  • Cuáles son accesibles para principiantes y cuáles requieren experiencia.
  • Dónde descargar los papers gratuitamente (casi todos en arXiv).

Introducción

Detrás de cada herramienta como Ollama, vLLM o un sistema RAG existe un paper. Quien entiende la idea original, entiende también por qué los tools actuales funcionan como lo hacen. Esta guía ordena los trabajos más influyentes por tema y dificultad. La clasificación está enfocada en lo práctico: qué valor tiene el paper para ti, no qué tan matemáticamente elegante es.

Fundamentos: Transformers y Atención

Attention Is All You Need (Vaswani et al., 2017)

El paper que lo cambió todo. Introdujo la arquitectura Transformer: en lugar de procesar el texto palabra por palabra (como los RNNs), el modelo observa todas las palabras simultáneamente y pondera cuáles son importantes entre sí. Esta “Attention” es la razón por la cual existen los LLMs modernos.

  • Por qué leerlo: Todos los LLMs actuales (Llama, Qwen, GPT) se construyen sobre esta idea. Si quieres entender cuantización, ventanas de contexto u optimizaciones de atención, necesitas esta base.
  • Dificultad: Media. El concepto es accesible, las fórmulas son intermedias.
  • Link: arXiv:1706.03762

BERT (Devlin et al., 2018)

Bidirectional Encoder Representations from Transformers. BERT lee el texto en ambas direcciones y revolucionó las tareas de comprensión de texto. Menos relevante para chatbots, pero crucial para embeddings y clasificación.

  • Por qué leerlo: Los embeddings para RAG y búsqueda semántica provienen de esta línea de investigación. Si usas bases de datos vectoriales, deberías saber de dónde vienen los embeddings.
  • Dificultad: Media.
  • Link: arXiv:1810.04805

GPT-3: Language Models are Few-Shot Learners (Brown et al., 2020)

El paper que demostró que un modelo suficientemente grande puede resolver tareas sin haber sido entrenado específicamente para ellas. Few-Shot Learning mediante ejemplos en el prompt. El punto de partida de la era de los chatbots.

  • Por qué leerlo: Explica por qué funciona el Prompt Engineering y por qué el tamaño del modelo importa.
  • Dificultad: Simple a media. La parte central es legible, los detalles sobre configuración de entrenamiento son opcionales.
  • Link: arXiv:2005.14165

Modelos de peso abierto

LLaMA: Open and Efficient Foundation Language Models (Touvron et al., 2023)

Meta publicó LLaMA como modelo de peso abierto. El paper documenta cómo entrenar un modelo potente con menos parámetros usando más datos y de mejor calidad. Después llegaron Llama 2, 3 y derivados.

  • Por qué leerlo: Es la base de casi todos los modelos locales en BotServ. Los modelos Llama son la referencia.
  • Dificultad: Media.
  • Link: arXiv:2302.13971

Mistral 7B (Jiang et al., 2023)

Un modelo de 7B parámetros que superó a otros más grandes. El paper presenta técnicas como Grouped-Query Attention y Sliding-Window Attention, que hoy son estándar.

  • Por qué leerlo: Si quieres entender por qué un modelo “pequeño” puede ser efectivo y qué significa Sliding-Window Attention.
  • Dificultad: Media.
  • Link: arXiv:2310.06825

Mixtral of Experts (Jiang et al., 2024)

Mixture of Experts: el modelo contiene muchos “expertos”, pero solo algunos se activan por token. Ahorra potencia computacional sin sacrificar calidad. Hoy es la base de muchos modelos abiertos grandes.

  • Por qué leerlo: Explica por qué existen modelos como Mixtral, Qwen-MoE y similares. Relevante para modelos MoE.
  • Dificultad: Media a avanzada.
  • Link: arXiv:2401.04088

Retrieval-Augmented Generation (RAG)

RAG: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (Lewis et al., 2020)

El paper original de RAG. Un modelo recupera conocimiento de un almacén de documentos en lugar de aprenderlo todo durante el entrenamiento. Esto le permite usar datos actuales o privados sin necesidad de reentrenamiento.

  • Por qué leerlo: Todos los bots de conocimiento local y configuraciones RAG se basan en esta idea.
  • Dificultad: Media. La idea es simple, los detalles son opcionales.
  • Link: arXiv:2005.11401

Dense Passage Retrieval (Karpukhin et al., 2020)

Demuestra que la búsqueda basada en embeddings supera a la búsqueda por palabras clave cuando tienes buenos embeddings. Es la base de la búsqueda semántica y las bases de datos vectoriales.

  • Por qué leerlo: Si trabajas con Chroma, Qdrant o similares, estás usando técnicas de este paper.
  • Dificultad: Avanzada.
  • Link: arXiv:2004.04906

Agentes y Uso de herramientas

ReAct: Synergizing Reasoning and Acting (Yao et al., 2022)

El modelo alterna entre pensar (Reasoning) y actuar (Acting). Así nacen los agentes que primero reflexionan, luego invocan una herramienta, y después continúan pensando. Es la base de casi todos los frameworks de agentes.

Toolformer (Schick et al., 2023)

Un modelo aprende por sí solo cuándo y qué herramienta invocar. Fue precursor del Function Calling e interfaces tipo MCP.

  • Por qué leerlo: Explica la lógica detrás del uso de herramientas, relevante para MCP.
  • Dificultad: Avanzada.
  • Link: arXiv:2302.04761

Eficiencia: Por qué la IA local es viable

GPTQ / AWQ / GGUF-Quantisierung

No hay un único paper, sino una serie. GPTQ (2022) mostró que un modelo puede cuantizarse a 4 bits sin pérdida significativa. AWQ y otros siguieron. Estos trabajos hacen posible ejecutar IA local en hardware de consumidor.

FlashAttention (Dao et al., 2022)

Un truco que reduce drasticamente el consumo de memoria de la operación de atención. Permite contextos más largos e inferencia más rápida. Hoy está integrado en casi todos los motores de inferencia.

  • Por qué leerlo: Explica por qué son posibles contextos de 100k+ tokens y por qué la VRAM es tan importante.
  • Dificultad: Avanzada.
  • Link: arXiv:2205.14135

Cómo encontrar más papers

  • arXiv.org - El servidor de preprints principal. Busca en “cs.CL” (Computation and Language) o “cs.LG” (Machine Learning).
  • Papers with Code - paperswithcode.com vincula papers con el código correspondiente.
  • Semantic Scholar - semanticscholar.org encuentra trabajos relacionados.
  • Hugging Face Daily Papers - huggingface.co/papers cura diariamente trabajos relevantes.

Consejos para leer papers

  1. Abstract y Conclusion primero. Si no es suficiente, revisa los diagramas.
  2. No necesitas entender cada fórmula. La idea es más importante que la derivación.
  3. Escanea los trabajos relacionados. A menudo, papers relacionados están mejor escritos.
  4. Usa páginas con TL;DR. Para muchos papers existen explicaciones de la comunidad (por ejemplo, en Hugging Face o en blogs).

Enlaces relacionados

  • Literatur - Descripción general de libros, papers y blogs.
  • Blogs - Blogs y newsletters recomendados.
  • IA Local - Implementación práctica de conceptos de papers.
  • Glosario - Términos como Attention, Embedding y MoE explicados claramente.

FAQ - Preguntas frecuentes

¿Debo leer estos papers para usar IA local? No. Para uso práctico, los artículos en BotServ son suficientes. Los papers son para quienes quieren entender por qué las cosas funcionan.

¿Cuál es el paper más accesible para comenzar? “Attention Is All You Need” y “ReAct” son relativamente legibles. GPTQ y FlashAttention son para usuarios avanzados.

¿Por qué los papers en arXiv son gratuitos? arXiv es un servidor de preprints: los autores suben sus trabajos antes de la revisión por pares oficial. Esto hace la ciencia accesible y acelera el intercambio de conocimiento.

¿Qué tan actual es esta lista? Contiene papers fundamentales que no envejecen. Para los trabajos más recientes, consulta las recomendaciones de blogs y newsletters en la página de Blogs.

Volver al blog
Share:

Entradas relacionadas