Calculadora de contexto para modelos de lenguaje
Qué cubre este artículo
- Cómo estimar la longitud de tu prompt.
- Cuántos tokens puede procesar un modelo.
- Cómo mantener bajo control la entrada, documentos y respuestas.
- Cómo los contextos largos afectan la velocidad y la memoria.
Introducción: Calculadora de contexto para modelos de lenguaje
Todo modelo de lenguaje tiene una ventana de contexto máxima. Es la cantidad de tokens que puede procesar de una sola vez. Si ingresas demasiado texto, pierdes información. Si ingresas muy poco, obtienes respuestas imprecisas. Una calculadora de contexto te ayuda a encontrar el equilibrio correcto.
Los tokens no son simplemente palabras. Un token puede ser una palabra, parte de una palabra o un carácter. El español generalmente requiere más tokens por palabra que el inglés. Si estimas esto correctamente, puedes planificar mejor y evitar costos innecesarios.
¿Por qué necesito una calculadora de contexto?
Los documentos largos, las respuestas RAG y las instrucciones del sistema detalladas consumen rápidamente muchos tokens. Sin un cálculo aproximado, superas la ventana de contexto o desperdicias memoria. Especialmente con servicios en la nube, un contexto largo genera costos más altos. Si trabajas localmente, aún así debes asegurar que tu hardware sea suficiente.
La calculadora de contexto explicada brevemente
Las magnitudes más importantes:
- Token: Bloques individuales que procesa el modelo.
- Ventana de contexto: Número máximo de tokens que el modelo ve de una vez.
- Entrada: Toda la información que recibe el modelo.
- Salida: La respuesta del modelo, que también consume tokens.
- Chunking: Dividir textos largos en pasajes más pequeños.
Estimaciones típicas de tokens:
- Una oración corta en español: 15 a 25 tokens.
- Una página A4 de texto: 500 a 900 tokens.
- Una página A4 de texto en inglés: 400 a 700 tokens.
- Un PDF técnico: 1.000 a 2.000 tokens por página.
Para quién es la calculadora de contexto
- Para usuarios que ingresan documentos largos en IA.
- Para desarrolladores de RAG que necesitan elegir el tamaño de chunk correcto.
- Para principiantes que quieren entender tokens.
- Para cualquiera que quiera mantener bajo control los costos en la nube o el uso de VRAM.
Términos clave relacionados con contexto
- Context Window: Ventana de contexto.
- System Prompt: Instrucciones para el comportamiento del modelo.
- Few-Shot: Ejemplos que muestran al modelo cómo debe responder.
- Truncation: Corte de texto que es demasiado largo.
- Overflow: Exceder la ventana de contexto.
- Output Token: Longitud de la respuesta en tokens.
Ejemplos prácticos para la calculadora de contexto
Modelo con ventana de contexto de 8K
- System Prompt: 200 tokens
- 5 chunks de documentos: 300 tokens cada uno = 1.500 tokens
- Pregunta del usuario: 50 tokens
- Reservado para respuesta: 500 tokens
- Total: 2.250 tokens
- Buffer libre: 5.750 tokens
- Resultado: Cabe sin problema.
Modelo con ventana de contexto de 4K
- System Prompt: 300 tokens
- 10 chunks: 250 tokens cada uno = 2.500 tokens
- Pregunta del usuario: 100 tokens
- Reservado para respuesta: 500 tokens
- Total: 3.400 tokens
- Buffer libre: 600 tokens
- Resultado: Ajustado, pero posible. Elige menos chunks.
Modelo con ventana de contexto de 128K
- System Prompt: 500 tokens
- 30 chunks largos: 1.000 tokens cada uno = 30.000 tokens
- Pregunta del usuario: 200 tokens
- Reservado para respuesta: 2.000 tokens
- Total: 32.700 tokens
- Buffer libre: 95.300 tokens
- Resultado: Mucho espacio, pero contextos largos ralentizan la respuesta.
Trampas típicas con el contexto
- No confundas tokens con palabras: El español generalmente requiere más tokens.
- No olvides la respuesta: La respuesta también necesita espacio en la ventana.
- No subestimes el system prompt: Las instrucciones largas consumen mucho contexto.
- No hagas chunks demasiado grandes: Los documentos largos no caben en la ventana.
- No olvides los resultados rerankeados: Varios chunks recuperados se suman rápidamente.
Enlaces e información adicional
FAQ: Calculadora de contexto
¿Cuántos tokens tiene una palabra en español? Aproximadamente 1,2 a 1,5 tokens por palabra, dependiendo de la longitud de la palabra y la puntuación.
¿Qué pasa si el contexto es demasiado largo? El modelo trunca el texto o no puede proporcionar una respuesta completa.
¿Una ventana de contexto más grande siempre es mejor? No necesariamente. Las ventanas grandes ralentizan la respuesta e incrementan el uso de memoria.
¿Cómo mido tokens en Python?
Con librerías tokenizadoras como tiktoken o los tokenizadores de Hugging Face.
¿Debo usar siempre el contexto máximo? No. Usa lo que necesites y reserva espacio para la respuesta.
Fuentes y referencias
- OpenAI Tokenizer: https://platform.openai.com/tokenizer
- Hugging Face Tokenizers: https://huggingface.co/docs/tokenizers/
- Ollama Model Contexts: https://ollama.com/
Resumen: Calculadora de contexto para modelos de lenguaje
La calculadora de contexto te ayuda a mantener bajo control la longitud de prompts y respuestas. Los tokens, la ventana de contexto, la entrada y la salida determinan si un modelo puede procesar correctamente la tarea que necesitas. Cuando planificas un buffer y divides documentos grandes en chunks apropiados, evitas interrupciones y tiempos de espera prolongados.


