Planificación y reflexión: cómo piensan los agentes de IA
Qué aborda este artículo sobre planificación y reflexión
- Aprenderás por qué los agentes de IA sin planificación deambulan sin rumbo y malgastan recursos
- Entenderás las estrategias clave: ReAct, Plan-and-Execute, Tree-of-Thought y Chain-of-Thought
- Verás cómo funcionan la reflexión y la autocorrección, y por qué marcan la diferencia
- Obtendrás ejemplos concretos del ciclo Think-Act-Observe y el enfoque Plan-First
- Descubrirás los escollos típicos y cómo evitarlos
Introducción: planificación y reflexión explicadas
Imagina que le das a un agente de IA la tarea de elaborar un análisis de mercado para un producto nuevo. ¿Qué pasa si el agente simplemente se pone a trabajar sin pensar? Sin planificación, salta entre tareas, busca aquí y allá, y al final le faltan datos importantes. Exactamente aquí es donde entran en juego la planificación y la reflexión.
Planificación significa que el agente se detiene a pensar qué pasos necesita y en qué orden, antes de empezar. Reflexión significa que después de cada paso verifica si el resultado es útil o si necesita mejorar. Juntas, estas dos capacidades transforman una herramienta simple en un agente que aborda tareas complejas de manera estructurada.
Si eres nuevo en agentes de IA, primero echa un vistazo al artículo ¿Qué es un agente de IA?. Allí aclaramos los conceptos fundamentales. También el tema Memoria del agente está estrechamente relacionado con la planificación y la reflexión, porque un agente necesita recordar los pasos previos que ha realizado.
¿Por qué necesito planificación y reflexión?
Un agente sin planificación es como alguien a quien se le pide construir una casa pero simplemente comienza apilando ladrillos. No tiene cimiento, no tiene plano de construcción y no tiene concepto. El resultado: un montón de ladrillos, no una casa.
En la práctica se ve así: le dices al agente que elabore un análisis de mercado. Sin planificación hace lo siguiente:
- Busca el producto pero solo encuentra publicidad en lugar de datos
- Cambia al análisis de competencia pero aún no tiene datos base
- Prueba una herramienta, sin darse cuenta de que es la API equivocada
- Vuelve a la búsqueda del producto
- Después de 20 pasos ha gastado tokens pero no tiene un análisis útil
El problema no es que el agente sea tonto. Simplemente no tiene una estrategia para descomponer la tarea y abordarla sistemáticamente. La planificación le da esa estrategia. La reflexión le da la capacidad de detectar errores y corregirlos antes de que se propaguen a través de todos los pasos siguientes.
Con planificación, el mismo agente ve la tarea así:
- Descompone la tarea en pasos: recopilar datos, analizar competencia, identificar tendencias, escribir informe
- Ejecuta cada paso uno tras otro
- Después de cada paso verifica el resultado
- Si un paso falla, reflexiona sobre por qué y prueba un camino diferente
La diferencia es dramática. El agente planificado alcanza el objetivo con menos tokens porque no salta adelante y atrás. Ofrece un mejor resultado porque cada paso se construye sobre el anterior. Y es más robusto porque detecta errores y los corrige.
Planificación y reflexión explicadas brevemente
Imagina dos cocineros. Ambos deben preparar un menú de tres platos.
El primer cocinero lee la receta, reflexiona sobre qué ingredientes necesita y planifica el orden: primero la salsa porque debe cocer, luego el plato principal, y el postre al final porque se sirve frío. Verifica después de cada paso si la salsa tiene la consistencia correcta, si la carne está cocida. Eso es planificación y reflexión.
El segundo cocinero simplemente empieza. Lanza ingredientes a la sartén, se da cuenta diez minutos después de que olvidó la salsa, corre a la despensa, descubre que la nata se acabó, intenta reemplazarla con leche, nota que la carne ahora se está quemando. Al final hay un menú caótico y probablemente incomible sobre la mesa.
La planificación es el plano. La reflexión es el control de calidad después de cada paso. Juntas aseguran que el agente no solo trabaja, sino que trabaja de manera significativa.
En el mundo de los agentes de IA existen diferentes estrategias para esto, que exploraremos en este artículo. Las más importantes son ReAct, Plan-and-Execute, Tree-of-Thought y Chain-of-Thought. Todas comparten algo en común: obligan al agente a pensar antes y mientras actúa.
¿Para quién es la planificación y reflexión?
La planificación y la reflexión son relevantes para cualquiera que trabaje con agentes de IA, ya sea principiante o avanzado.
Para principiantes: Si acabas de comenzar con agentes de IA, es importante entender que un agente no simplemente “funciona”, sino que su calidad depende mucho de cómo piensa. Si sabes cómo funciona la planificación, puedes escribir mejores prompts y obtener mejores resultados.
Para desarrolladores: Si construyes tus propios agentes, debes elegir qué estrategia de planificación usas. La elección afecta cuántos tokens consume el agente, qué tan rápido es y cuán confiable funciona. Frameworks como LangGraph te proporcionan herramientas para implementar planificación y reflexión.
Para tomadores de decisiones: Si quieres desplegar agentes de IA en tu empresa, debes entender que la planificación y la reflexión marcan la diferencia entre una herramienta útil y un experimento costoso. Un agente que no reflexiona puede cometer errores que resulten caros.
Para los curiosos: Incluso si no construyes agentes, la comprensión de la planificación y la reflexión te ayuda a entender mejor qué pueden hacer los sistemas de IA y dónde están sus límites.
Si quieres saber más sobre el panorama general, echa un vistazo al artículo sobre Sistemas de agentes.
Términos importantes alrededor de planificación y reflexión
| Término | Significado |
|---|---|
| Planificación | El agente descompone una tarea en pasos y fija el orden |
| Reflexión | El agente verifica sus propios resultados y aprende de ellos |
| ReAct | Estrategia en la que el pensamiento y la acción se alternan: Think, Act, Observe |
| Plan-and-Execute | Estrategia donde se crea un plan completo primero y luego se ejecuta |
| Self-Correction | El agente reconoce sus propios errores y los corrige automáticamente |
| Reasoning | El pensamiento lógico y la deducción del agente |
| Thought-Action-Observation | El ciclo de tres pasos en el enfoque ReAct |
| Task Decomposition | Dividir una tarea grande en tareas más pequeñas |
| Replanning | Ajustar el plan cuando un paso falla o surge información nueva |
| Chain-of-Thought | Pensamiento paso a paso donde cada paso se construye sobre el anterior |
Estrategias de planificación para agentes de IA
Hay varias estrategias sobre cómo un agente puede planificar. Cada una tiene sus fortalezas y debilidades. Aquí aprendes las cuatro más importantes.
ReAct: Think, Act, Observe
ReAct es la estrategia más conocida para agentes de IA. El nombre viene de “Reasoning” y “Acting”. El agente trabaja en un ciclo de tres pasos:
- Think (Pensar): El agente reflexiona sobre qué debería hacer a continuación y por qué.
- Act (Actuar): El agente ejecuta una acción, por ejemplo llamar a una herramienta o iniciar una búsqueda.
- Observe (Observar): El agente examina el resultado de la acción y reflexiona sobre qué significa para el siguiente paso.
Este ciclo se repite hasta que la tarea se completa. La gran ventaja de ReAct es que el agente permanece flexible. Después de cada paso puede decidir si continúa como se planeó o si cambia de dirección.
La desventaja: En tareas complejas el agente puede perder de vista el panorama general, porque no tiene un plan fijo sino que avanza paso a paso. Esto puede llevar a muchos pasos y alto consumo de tokens.
Plan-and-Execute: Primero planificar, luego ejecutar
Plan-and-Execute es el contrapeso de ReAct. Aquí el agente elabora un plan completo con todos los pasos antes de ejecutar ni una sola acción.
- Plan: El agente divide la tarea en subtareas y establece el orden.
- Execute: El agente trabaja cada paso del plan secuencialmente.
La ventaja es que el agente tiene una estructura clara desde el principio. Sabe adónde va y no pierde tiempo probando al azar. Es especialmente útil en tareas complejas que requieren múltiples pasos.
La desventaja: si un paso falla, el agente debe ajustar el plan. Esto se llama replanning. Si no funciona bien, el agente se queda atrapado porque el resto del plan depende del paso que falló.
Tree-of-Thought: Explorar múltiples caminos
Tree-of-Thought va un paso más allá. En lugar de seguir un solo camino, el agente explora varios caminos de solución posibles simultáneamente, como un árbol con múltiples ramas.
- El agente considera varios próximos pasos posibles.
- Sigue cada paso un poco y evalúa cuán prometedor es.
- Elige el mejor camino y profundiza, o descarta ramas inútiles.
Es especialmente útil para tareas donde existen múltiples caminos de solución y no está claro cuál es el mejor desde el principio. La desventaja es que Tree-of-Thought consume muchos tokens porque el agente explora varios caminos a la vez.
Chain-of-Thought: Pensamiento paso a paso
Chain-of-Thought es la forma más simple del pensamiento estructurado. El agente piensa paso a paso, donde cada paso se construye sobre el anterior. Es como una deducción matemática: primero la premisa, luego la primera conclusión, luego la siguiente.
Chain-of-Thought no es una estrategia completa de agente como ReAct o Plan-and-Execute, sino una forma de pensar que se usa en otras estrategias. Ayuda al agente a mantenerse lógico y evitar saltos que lleven a errores.
Reflexión y autocorrección
La planificación es una mitad. La reflexión es la otra. Sin reflexión, un agente puede tener un plan perfecto y aun así fallar porque no se da cuenta cuando algo sale mal.
Reflexión significa que el agente verifica su resultado después de cada paso o cada acción. Se hace preguntas como:
- ¿Coincide el resultado con lo que esperaba?
- ¿Es el resultado útil para el próximo paso?
- ¿Cometí un error?
- ¿Necesito corregir algo?
Cuando el agente detecta un error, puede corregirlo de dos maneras:
Autocorrección dentro del paso: El agente se da cuenta durante la ejecución que algo no es correcto y se corrige inmediatamente. Por ejemplo: llama a una API, recibe un mensaje de error, reconoce que el parámetro era incorrecto e intenta de nuevo con el parámetro correcto.
Reflexión después del paso: El agente examina el resultado terminado de un paso y decide si es lo suficientemente bueno. Si no, reflexiona sobre qué debe hacer diferente, y ejecuta el paso nuevamente, posiblemente con una estrategia distinta.
El ciclo de reflexión se ve así:
- Ejecutar paso
- Verificar resultado
- Si hay error: analizar causa y corregir paso
- Si hay éxito: ir al próximo paso
- Repetir hasta completar la tarea
Este ciclo es crucial para la confiabilidad de un agente. Un agente que no reflexiona puede cometer errores que se propagan a través de todos los pasos siguientes. Un agente que reflexiona detecta errores temprano y los corrige antes de que causen daño.
Ejemplo: Un agente con ReAct
Veamos cómo un agente ReAct ejecuta una tarea concreta. La tarea es: encuentra los tres competidores más grandes de una empresa específica y compara sus precios.
Paso 1: Think
El agente piensa: Primero debo averiguar quién es la empresa y en qué industria opera. Luego puedo buscar competidores.
Paso 1: Act
El agente llama una función de búsqueda con el nombre de la empresa.
Paso 1: Observe
La búsqueda devuelve información sobre la empresa: es un proveedor de SaaS en gestión de proyectos.
Paso 2: Think
El agente piensa: Ahora sé en qué industria opera la empresa. Debo buscar los competidores más grandes en SaaS de gestión de proyectos.
Paso 2: Act
El agente busca “mayores proveedores de SaaS de gestión de proyectos”.
Paso 2: Observe
La búsqueda devuelve una lista de proveedores. El agente identifica tres que ofrecen características similares.
Paso 3: Think
El agente piensa: Tengo tres competidores. Ahora debo averiguar sus precios. Visitaré los sitios web de los tres proveedores y buscaré sus páginas de precios.
Paso 3: Act
El agente accede al sitio web del primer competidor y busca la página de precios.
Paso 3: Observe
El sitio web proporciona información de precios. El agente anota los precios.
Paso 4: Think
El agente piensa: Primer competidor hecho. Ahora el segundo.
Paso 4: Act
El agente accede al sitio web del segundo competidor.
Paso 4: Observe
El sitio web no proporciona precios directos, solo “Precio bajo solicitud”.
Paso 5: Think
El agente piensa: El segundo competidor no tiene precios públicos. Anoto esto y paso al tercer competidor. Después puedo intentar encontrar los precios de otra forma.
Paso 5: Act
El agente accede al sitio web del tercer competidor.
Paso 5: Observe
El sitio web proporciona información de precios.
Paso 6: Think
El agente piensa: Tengo precios de dos competidores y “Precio bajo solicitud” para el tercero. Ahora puedo crear una comparación y señalar que los precios del segundo proveedor no están disponibles públicamente.
Paso 6: Act
El agente crea el informe de comparación.
Paso 6: Observe
El informe está completo y contiene toda la información disponible.
Ves cómo el agente reflexiona, actúa y observa en cada paso. Se mantiene flexible y puede reaccionar ante resultados inesperados, como los precios faltantes del segundo competidor.
Ejemplo: Un agente con Plan-and-Execute
Ahora la misma tarea, pero con Plan-and-Execute. El agente crea un plan primero y luego lo ejecuta.
Plan:
- Identificar la empresa y determinar su industria
- Encontrar los tres competidores más grandes en la industria
- Investigar precios de cada competidor
- Crear informe de comparación
Execute Paso 1: El agente identifica la empresa como proveedor de SaaS en gestión de proyectos. Éxito, pasar al siguiente paso.
Execute Paso 2: El agente encuentra tres competidores. Éxito, pasar al siguiente paso.
Execute Paso 3a: El agente investiga precios del primer competidor. Éxito, precios encontrados.
Execute Paso 3b: El agente investiga precios del segundo competidor. Éxito parcial, solo “Precio bajo solicitud” disponible. Aquí el agente debe reflexionar: ¿Es esto lo suficientemente bueno? Decide que sí, y anota la limitación.
Execute Paso 3c: El agente investiga precios del tercer competidor. Éxito, precios encontrados.
Execute Paso 4: El agente crea el informe de comparación con todos los datos recopilados.
La diferencia con ReAct: El agente supo desde el principio qué pasos estaban por venir. No tuvo que reflexionar en cada paso sobre qué viene después. Esto hace el proceso más eficiente y claro.
Sin embargo: Si en el Paso 3b hubiera ocurrido algo completamente inesperado, por ejemplo si el segundo competidor no tuviera sitio web, el agente tendría que replanificar. Este es el punto donde Plan-and-Execute se vuelve más complicado que ReAct.
Reflexión en la práctica
¿Cómo se implementa la reflexión en la práctica? Aquí hay un patrón simple que encontrarás en muchos frameworks.
Después de cada paso, el agente realiza una fase de reflexión. Esta fase consta de tres partes:
1. Evaluación: El agente examina el resultado y lo valúa. ¿Ha logrado lo que debía lograr? ¿Es completo, correcto y utilizable?
2. Análisis de causas: Si el resultado no es lo suficientemente bueno, el agente reflexiona sobre el por qué. ¿Fue incorrecto el enfoque? ¿Fueron incompletos los datos? ¿No funcionó la herramienta?
3. Corrección: El agente decide qué necesita hacer de manera diferente y ejecuta el paso nuevamente con una estrategia ajustada.
En frameworks como LangGraph puedes implementar esta fase de reflexión como un nodo independiente en el grafo. El agente pasa por el nodo de reflexión después de cada paso de ejecución, y solo si la reflexión resulta positiva, procede al siguiente paso.
Un detalle importante: la reflexión consume tokens. En cada paso, el agente piensa adicionalmente, lo que consume tiempo de cómputo y dinero. Debes evaluar si la confiabilidad adicional justifica los costos. Para tareas simples, la reflexión puede ser excesiva. Para tareas complejas donde los errores son costosos, es indispensable.
Las aprobaciones humanas también juegan un rol aquí. En pasos críticos, el agente puede solicitar confirmación a una persona antes de continuar. Esta es una forma de reflexión externa que es particularmente útil en tareas sensibles.
Errores típicos en planificación y reflexión
La planificación y reflexión son poderosas, pero hay errores típicos que deberías evitar.
1. Sobreplanificación en tareas simples
No toda tarea requiere un plan detallado. Si la tarea es simple, la planificación consume más tiempo y tokens de los que ahorra. Para una búsqueda simple, ReAct es frecuentemente mejor que Plan-and-Execute porque el agente puede comenzar directamente.
2. Planes demasiado rígidos
Un plan es una hipótesis, no una ley. Si el agente se adhiere a un plan fijo aunque la realidad sea diferente, fracasará. Los buenos agentes pueden replanificar y ajustar su plan cuando emergen nuevas informaciones.
3. Reflexión sin consecuencias
La reflexión solo es útil si el agente actúa sobre las conclusiones que extrae. Si el agente advierte que un paso fue defectuoso pero continúa de todas formas, la reflexión no tiene valor. El agente debe ser capaz de corregir errores, no simplemente identificarlos.
4. Bucles infinitos por autocorrección
La autocorrección puede caer en bucles infinitos. El agente intenta corregir un paso, falla nuevamente, corrige otra vez, falla de nuevo. Debes establecer un número máximo de intentos para que el agente eventualmente desista y pruebe otro camino o pida ayuda a una persona.
5. Explosión de tokens por Tree-of-Thought
Tree-of-Thought puede consumir cantidades extremas de tokens si el agente explora demasiadas rutas. Debes limitar la amplitud y profundidad del árbol, de lo contrario los costos se dispararán.
6. Memoria insuficiente
La planificación y reflexión funcionan solo si el agente recuerda sus pasos previos. Sin memoria de agente, el agente olvida lo que ya ha hecho y comienza desde cero repetidamente. La memoria es el requisito previo para una reflexión significativa.
7. Demasiada reflexión en cada paso
Si el agente reflexiona después de cada paso diminuto, invierte más tiempo pensando que trabajando. La reflexión debe aplicarse en los lugares correctos, no indiscriminadamente después de cada acción.
8. Ignorar errores de herramientas
A veces las herramientas fallan y el agente simplemente ignora el error y continúa. Esto conduce a resultados inutilizables. El agente debe detectar errores de herramientas y responder a ellos, ya sea mediante corrección o replanificación.
Hardware, costos y seguridad en planificación y reflexión
La planificación y reflexión tienen implicaciones en hardware, costos y seguridad que deberías conocer.
Hardware: La planificación y reflexión requieren más capacidad de cómputo que la simple ejecución. El agente realiza pasos de razonamiento adicionales que producen y procesan tokens. Si trabajas localmente, necesitas hardware suficientemente potente. Más información en el artículo ¿Qué es la IA local?.
Costos: Cada paso de pensamiento y cada reflexión consume tokens. Con modelos basados en la nube, estos costos se acumulan rápidamente. Un agente ReAct que ejecuta 20 pasos con reflexión en cada uno consume significativamente más tokens que un agente simple que hace cinco pasos sin reflexión. Debes evaluar si la confiabilidad adicional justifica los costos.
Regla general: cuanto más compleja y propensa a errores sea la tarea, más vale la pena la reflexión. Para tareas simples con estructura clara, frecuentemente basta una estrategia simple sin reflexión exhaustiva.
Seguridad: La reflexión también puede ser una ganancia de seguridad. Un agente que verifica sus resultados comete menos errores que podrían causar problemas de seguridad. Si el agente desea eliminar un archivo, por ejemplo, la reflexión puede asegurar que sea realmente el archivo correcto. Las aprobaciones humanas complementan la reflexión al activar a una persona en pasos críticos.
Latencia: La planificación y reflexión aumentan la latencia, es decir, el tiempo hasta que el agente proporciona un resultado. Para tareas que deben completarse rápidamente, esto puede ser un problema. Plan-and-Execute es frecuentemente más rápido que ReAct aquí porque el agente avanza rápidamente a través de los pasos después de la fase de planificación.
Enlaces adicionales e información sobre planificación y reflexión
- Fundamentos de agentes de IA - Descripción general de todos los artículos de fundamentos
- ¿Qué es un agente de IA? - Lo básico, si aún estás comenzando
- Sistemas de agentes - Cómo varios agentes trabajan juntos
- Invocación de herramientas - Cómo los agentes invocan herramientas, lo que hace posible la fase de acción
- Memoria de agente - Cómo los agentes recuerdan pasos, la base para la reflexión
- Aprobaciones humanas - Cuando el agente solicita confirmación a una persona
- Frameworks - Descripción general de los frameworks con los que construyes agentes
- LangGraph - Un framework que modela la planificación y reflexión como grafos
FAQ: Planificación y reflexión - Preguntas típicas
¿Cuál es la diferencia entre ReAct y Plan-and-Execute?
ReAct funciona paso a paso, sin plan fijo. El agente reflexiona nuevamente en cada paso sobre qué hacer a continuación. Plan-and-Execute crea primero un plan completo y luego lo ejecuta. ReAct es más flexible, Plan-and-Execute es más estructurado.
¿Necesita cada agente planificación?
No. Para tareas simples con pocos pasos, frecuentemente basta un agente simple sin planificación explícita. La planificación se vuelve importante cuando las tareas son complejas, tienen muchos pasos o son interdependientes.
¿Qué es exactamente la autocorrección?
La autocorrección significa que el agente identifica y corrige sus propios errores sin intervención humana. Puede suceder dentro de un paso si el agente advierte que un parámetro fue incorrecto, o después de un paso si el resultado no es utilizable.
¿No consume la reflexión muchos tokens?
Sí, la reflexión consume tokens adicionales porque el agente piensa extra. Debes evaluar si la confiabilidad adicional justifica los costos. Para tareas complejas esto es generalmente el caso, para tareas simples no.
¿Qué es la replanificación?
La replanificación significa que el agente ajusta su plan cuando un paso falla o cuando emergen nuevas informaciones. Esto es particularmente importante en Plan-and-Execute porque el plan original se basa en suposiciones que pueden cambiar.
¿Cómo evito bucles infinitos con autocorrección?
Establece un número máximo de intentos. Si el agente no puede corregir un paso después de, por ejemplo, tres intentos, debe desistir y probar otro camino o pedir ayuda a una persona.
¿Qué es Tree-of-Thought y cuándo lo necesito?
Tree-of-Thought es una estrategia donde el agente explora múltiples rutas de solución simultáneamente. Lo necesitas para tareas donde hay varios caminos y el mejor no es obvio de antemano. Es costoso y caro, por lo que solo tiene sentido para problemas complejos.
¿Cómo se relaciona Chain-of-Thought con la planificación?
Chain-of-Thought es un modo de pensamiento donde el agente procede lógicamente paso a paso. No es una estrategia de planificación independiente, sino que se usa en otras estrategias como ReAct o Plan-and-Execute para hacer el pensamiento más estructurado.
¿Puede un agente sin memoria reflexionar?
No, la reflexión presupone memoria. El agente debe recordar sus pasos y resultados previos para verificarlos. Sin memoria, el agente olvida qué ha hecho y no puede realizar reflexión significativa.
¿Qué framework es adecuado para planificación y reflexión?
LangGraph es particularmente adecuado porque modela la planificación y reflexión como grafos. Puedes integrar nodos de reflexión que se ejecutan después de cada paso. Más información en el artículo sobre LangGraph y en la descripción general de los frameworks.
¿Es la reflexión en agentes lo mismo que la reflexión en humanos?
No exactamente. En humanos, la reflexión es un proceso consciente, frecuentemente emocional. En agentes de IA, es un paso de evaluación estructurado donde el agente verifica su resultado contra las expectativas. El mecanismo es diferente, pero la idea es similar: aprender de los resultados y mejorar.
Fuentes y referencias
- ReAct: Synergizing Reasoning and Acting in Language Models, Yao et al., 2022
- Tree of Thoughts: Deliberate Problem Solving with Large Language Models, Yao et al., 2023
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, Wei et al., 2022
- Reflexion: Language Agents with Verbal Reinforcement Learning, Shinn et al., 2023
- LangGraph Documentación, langchain-ai.github.io/langgraph/
- Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning by Large Language Models, Wang et al., 2023


