Skip to content
BotServBotServ
PlanificaciónReflexiónReActPlan-and-ExecuteSelf-CorrectionAgente IAReasoning

Planificación y Reflexión: Cómo Piensan los Agentes IA

Cómo los agentes IA planifican, toman decisiones y aprenden de errores: ReAct, Plan-and-Execute, Reflexión y Self-Correction explicados.

S

schutzgeist

18 min read
Planificación y Reflexión: Cómo Piensan los Agentes IA

Planificación y reflexión: cómo piensan los agentes de IA

Qué aborda este artículo sobre planificación y reflexión

  • Aprenderás por qué los agentes de IA sin planificación deambulan sin rumbo y malgastan recursos
  • Entenderás las estrategias clave: ReAct, Plan-and-Execute, Tree-of-Thought y Chain-of-Thought
  • Verás cómo funcionan la reflexión y la autocorrección, y por qué marcan la diferencia
  • Obtendrás ejemplos concretos del ciclo Think-Act-Observe y el enfoque Plan-First
  • Descubrirás los escollos típicos y cómo evitarlos

Introducción: planificación y reflexión explicadas

Imagina que le das a un agente de IA la tarea de elaborar un análisis de mercado para un producto nuevo. ¿Qué pasa si el agente simplemente se pone a trabajar sin pensar? Sin planificación, salta entre tareas, busca aquí y allá, y al final le faltan datos importantes. Exactamente aquí es donde entran en juego la planificación y la reflexión.

Planificación significa que el agente se detiene a pensar qué pasos necesita y en qué orden, antes de empezar. Reflexión significa que después de cada paso verifica si el resultado es útil o si necesita mejorar. Juntas, estas dos capacidades transforman una herramienta simple en un agente que aborda tareas complejas de manera estructurada.

Si eres nuevo en agentes de IA, primero echa un vistazo al artículo ¿Qué es un agente de IA?. Allí aclaramos los conceptos fundamentales. También el tema Memoria del agente está estrechamente relacionado con la planificación y la reflexión, porque un agente necesita recordar los pasos previos que ha realizado.

¿Por qué necesito planificación y reflexión?

Un agente sin planificación es como alguien a quien se le pide construir una casa pero simplemente comienza apilando ladrillos. No tiene cimiento, no tiene plano de construcción y no tiene concepto. El resultado: un montón de ladrillos, no una casa.

En la práctica se ve así: le dices al agente que elabore un análisis de mercado. Sin planificación hace lo siguiente:

  1. Busca el producto pero solo encuentra publicidad en lugar de datos
  2. Cambia al análisis de competencia pero aún no tiene datos base
  3. Prueba una herramienta, sin darse cuenta de que es la API equivocada
  4. Vuelve a la búsqueda del producto
  5. Después de 20 pasos ha gastado tokens pero no tiene un análisis útil

El problema no es que el agente sea tonto. Simplemente no tiene una estrategia para descomponer la tarea y abordarla sistemáticamente. La planificación le da esa estrategia. La reflexión le da la capacidad de detectar errores y corregirlos antes de que se propaguen a través de todos los pasos siguientes.

Con planificación, el mismo agente ve la tarea así:

  1. Descompone la tarea en pasos: recopilar datos, analizar competencia, identificar tendencias, escribir informe
  2. Ejecuta cada paso uno tras otro
  3. Después de cada paso verifica el resultado
  4. Si un paso falla, reflexiona sobre por qué y prueba un camino diferente

La diferencia es dramática. El agente planificado alcanza el objetivo con menos tokens porque no salta adelante y atrás. Ofrece un mejor resultado porque cada paso se construye sobre el anterior. Y es más robusto porque detecta errores y los corrige.

Planificación y reflexión explicadas brevemente

Imagina dos cocineros. Ambos deben preparar un menú de tres platos.

El primer cocinero lee la receta, reflexiona sobre qué ingredientes necesita y planifica el orden: primero la salsa porque debe cocer, luego el plato principal, y el postre al final porque se sirve frío. Verifica después de cada paso si la salsa tiene la consistencia correcta, si la carne está cocida. Eso es planificación y reflexión.

El segundo cocinero simplemente empieza. Lanza ingredientes a la sartén, se da cuenta diez minutos después de que olvidó la salsa, corre a la despensa, descubre que la nata se acabó, intenta reemplazarla con leche, nota que la carne ahora se está quemando. Al final hay un menú caótico y probablemente incomible sobre la mesa.

La planificación es el plano. La reflexión es el control de calidad después de cada paso. Juntas aseguran que el agente no solo trabaja, sino que trabaja de manera significativa.

En el mundo de los agentes de IA existen diferentes estrategias para esto, que exploraremos en este artículo. Las más importantes son ReAct, Plan-and-Execute, Tree-of-Thought y Chain-of-Thought. Todas comparten algo en común: obligan al agente a pensar antes y mientras actúa.

¿Para quién es la planificación y reflexión?

La planificación y la reflexión son relevantes para cualquiera que trabaje con agentes de IA, ya sea principiante o avanzado.

Para principiantes: Si acabas de comenzar con agentes de IA, es importante entender que un agente no simplemente “funciona”, sino que su calidad depende mucho de cómo piensa. Si sabes cómo funciona la planificación, puedes escribir mejores prompts y obtener mejores resultados.

Para desarrolladores: Si construyes tus propios agentes, debes elegir qué estrategia de planificación usas. La elección afecta cuántos tokens consume el agente, qué tan rápido es y cuán confiable funciona. Frameworks como LangGraph te proporcionan herramientas para implementar planificación y reflexión.

Para tomadores de decisiones: Si quieres desplegar agentes de IA en tu empresa, debes entender que la planificación y la reflexión marcan la diferencia entre una herramienta útil y un experimento costoso. Un agente que no reflexiona puede cometer errores que resulten caros.

Para los curiosos: Incluso si no construyes agentes, la comprensión de la planificación y la reflexión te ayuda a entender mejor qué pueden hacer los sistemas de IA y dónde están sus límites.

Si quieres saber más sobre el panorama general, echa un vistazo al artículo sobre Sistemas de agentes.

Términos importantes alrededor de planificación y reflexión

TérminoSignificado
PlanificaciónEl agente descompone una tarea en pasos y fija el orden
ReflexiónEl agente verifica sus propios resultados y aprende de ellos
ReActEstrategia en la que el pensamiento y la acción se alternan: Think, Act, Observe
Plan-and-ExecuteEstrategia donde se crea un plan completo primero y luego se ejecuta
Self-CorrectionEl agente reconoce sus propios errores y los corrige automáticamente
ReasoningEl pensamiento lógico y la deducción del agente
Thought-Action-ObservationEl ciclo de tres pasos en el enfoque ReAct
Task DecompositionDividir una tarea grande en tareas más pequeñas
ReplanningAjustar el plan cuando un paso falla o surge información nueva
Chain-of-ThoughtPensamiento paso a paso donde cada paso se construye sobre el anterior

Estrategias de planificación para agentes de IA

Hay varias estrategias sobre cómo un agente puede planificar. Cada una tiene sus fortalezas y debilidades. Aquí aprendes las cuatro más importantes.

ReAct: Think, Act, Observe

ReAct es la estrategia más conocida para agentes de IA. El nombre viene de “Reasoning” y “Acting”. El agente trabaja en un ciclo de tres pasos:

  1. Think (Pensar): El agente reflexiona sobre qué debería hacer a continuación y por qué.
  2. Act (Actuar): El agente ejecuta una acción, por ejemplo llamar a una herramienta o iniciar una búsqueda.
  3. Observe (Observar): El agente examina el resultado de la acción y reflexiona sobre qué significa para el siguiente paso.

Este ciclo se repite hasta que la tarea se completa. La gran ventaja de ReAct es que el agente permanece flexible. Después de cada paso puede decidir si continúa como se planeó o si cambia de dirección.

La desventaja: En tareas complejas el agente puede perder de vista el panorama general, porque no tiene un plan fijo sino que avanza paso a paso. Esto puede llevar a muchos pasos y alto consumo de tokens.

Plan-and-Execute: Primero planificar, luego ejecutar

Plan-and-Execute es el contrapeso de ReAct. Aquí el agente elabora un plan completo con todos los pasos antes de ejecutar ni una sola acción.

  1. Plan: El agente divide la tarea en subtareas y establece el orden.
  2. Execute: El agente trabaja cada paso del plan secuencialmente.

La ventaja es que el agente tiene una estructura clara desde el principio. Sabe adónde va y no pierde tiempo probando al azar. Es especialmente útil en tareas complejas que requieren múltiples pasos.

La desventaja: si un paso falla, el agente debe ajustar el plan. Esto se llama replanning. Si no funciona bien, el agente se queda atrapado porque el resto del plan depende del paso que falló.

Tree-of-Thought: Explorar múltiples caminos

Tree-of-Thought va un paso más allá. En lugar de seguir un solo camino, el agente explora varios caminos de solución posibles simultáneamente, como un árbol con múltiples ramas.

  1. El agente considera varios próximos pasos posibles.
  2. Sigue cada paso un poco y evalúa cuán prometedor es.
  3. Elige el mejor camino y profundiza, o descarta ramas inútiles.

Es especialmente útil para tareas donde existen múltiples caminos de solución y no está claro cuál es el mejor desde el principio. La desventaja es que Tree-of-Thought consume muchos tokens porque el agente explora varios caminos a la vez.

Chain-of-Thought: Pensamiento paso a paso

Chain-of-Thought es la forma más simple del pensamiento estructurado. El agente piensa paso a paso, donde cada paso se construye sobre el anterior. Es como una deducción matemática: primero la premisa, luego la primera conclusión, luego la siguiente.

Chain-of-Thought no es una estrategia completa de agente como ReAct o Plan-and-Execute, sino una forma de pensar que se usa en otras estrategias. Ayuda al agente a mantenerse lógico y evitar saltos que lleven a errores.

Reflexión y autocorrección

La planificación es una mitad. La reflexión es la otra. Sin reflexión, un agente puede tener un plan perfecto y aun así fallar porque no se da cuenta cuando algo sale mal.

Reflexión significa que el agente verifica su resultado después de cada paso o cada acción. Se hace preguntas como:

  • ¿Coincide el resultado con lo que esperaba?
  • ¿Es el resultado útil para el próximo paso?
  • ¿Cometí un error?
  • ¿Necesito corregir algo?

Cuando el agente detecta un error, puede corregirlo de dos maneras:

Autocorrección dentro del paso: El agente se da cuenta durante la ejecución que algo no es correcto y se corrige inmediatamente. Por ejemplo: llama a una API, recibe un mensaje de error, reconoce que el parámetro era incorrecto e intenta de nuevo con el parámetro correcto.

Reflexión después del paso: El agente examina el resultado terminado de un paso y decide si es lo suficientemente bueno. Si no, reflexiona sobre qué debe hacer diferente, y ejecuta el paso nuevamente, posiblemente con una estrategia distinta.

El ciclo de reflexión se ve así:

  1. Ejecutar paso
  2. Verificar resultado
  3. Si hay error: analizar causa y corregir paso
  4. Si hay éxito: ir al próximo paso
  5. Repetir hasta completar la tarea

Este ciclo es crucial para la confiabilidad de un agente. Un agente que no reflexiona puede cometer errores que se propagan a través de todos los pasos siguientes. Un agente que reflexiona detecta errores temprano y los corrige antes de que causen daño.

Ejemplo: Un agente con ReAct

Veamos cómo un agente ReAct ejecuta una tarea concreta. La tarea es: encuentra los tres competidores más grandes de una empresa específica y compara sus precios.

Paso 1: Think

El agente piensa: Primero debo averiguar quién es la empresa y en qué industria opera. Luego puedo buscar competidores.

Paso 1: Act

El agente llama una función de búsqueda con el nombre de la empresa.

Paso 1: Observe

La búsqueda devuelve información sobre la empresa: es un proveedor de SaaS en gestión de proyectos.

Paso 2: Think

El agente piensa: Ahora sé en qué industria opera la empresa. Debo buscar los competidores más grandes en SaaS de gestión de proyectos.

Paso 2: Act

El agente busca “mayores proveedores de SaaS de gestión de proyectos”.

Paso 2: Observe

La búsqueda devuelve una lista de proveedores. El agente identifica tres que ofrecen características similares.

Paso 3: Think

El agente piensa: Tengo tres competidores. Ahora debo averiguar sus precios. Visitaré los sitios web de los tres proveedores y buscaré sus páginas de precios.

Paso 3: Act

El agente accede al sitio web del primer competidor y busca la página de precios.

Paso 3: Observe

El sitio web proporciona información de precios. El agente anota los precios.

Paso 4: Think

El agente piensa: Primer competidor hecho. Ahora el segundo.

Paso 4: Act

El agente accede al sitio web del segundo competidor.

Paso 4: Observe

El sitio web no proporciona precios directos, solo “Precio bajo solicitud”.

Paso 5: Think

El agente piensa: El segundo competidor no tiene precios públicos. Anoto esto y paso al tercer competidor. Después puedo intentar encontrar los precios de otra forma.

Paso 5: Act

El agente accede al sitio web del tercer competidor.

Paso 5: Observe

El sitio web proporciona información de precios.

Paso 6: Think

El agente piensa: Tengo precios de dos competidores y “Precio bajo solicitud” para el tercero. Ahora puedo crear una comparación y señalar que los precios del segundo proveedor no están disponibles públicamente.

Paso 6: Act

El agente crea el informe de comparación.

Paso 6: Observe

El informe está completo y contiene toda la información disponible.

Ves cómo el agente reflexiona, actúa y observa en cada paso. Se mantiene flexible y puede reaccionar ante resultados inesperados, como los precios faltantes del segundo competidor.

Ejemplo: Un agente con Plan-and-Execute

Ahora la misma tarea, pero con Plan-and-Execute. El agente crea un plan primero y luego lo ejecuta.

Plan:

  1. Identificar la empresa y determinar su industria
  2. Encontrar los tres competidores más grandes en la industria
  3. Investigar precios de cada competidor
  4. Crear informe de comparación

Execute Paso 1: El agente identifica la empresa como proveedor de SaaS en gestión de proyectos. Éxito, pasar al siguiente paso.

Execute Paso 2: El agente encuentra tres competidores. Éxito, pasar al siguiente paso.

Execute Paso 3a: El agente investiga precios del primer competidor. Éxito, precios encontrados.

Execute Paso 3b: El agente investiga precios del segundo competidor. Éxito parcial, solo “Precio bajo solicitud” disponible. Aquí el agente debe reflexionar: ¿Es esto lo suficientemente bueno? Decide que sí, y anota la limitación.

Execute Paso 3c: El agente investiga precios del tercer competidor. Éxito, precios encontrados.

Execute Paso 4: El agente crea el informe de comparación con todos los datos recopilados.

La diferencia con ReAct: El agente supo desde el principio qué pasos estaban por venir. No tuvo que reflexionar en cada paso sobre qué viene después. Esto hace el proceso más eficiente y claro.

Sin embargo: Si en el Paso 3b hubiera ocurrido algo completamente inesperado, por ejemplo si el segundo competidor no tuviera sitio web, el agente tendría que replanificar. Este es el punto donde Plan-and-Execute se vuelve más complicado que ReAct.

Reflexión en la práctica

¿Cómo se implementa la reflexión en la práctica? Aquí hay un patrón simple que encontrarás en muchos frameworks.

Después de cada paso, el agente realiza una fase de reflexión. Esta fase consta de tres partes:

1. Evaluación: El agente examina el resultado y lo valúa. ¿Ha logrado lo que debía lograr? ¿Es completo, correcto y utilizable?

2. Análisis de causas: Si el resultado no es lo suficientemente bueno, el agente reflexiona sobre el por qué. ¿Fue incorrecto el enfoque? ¿Fueron incompletos los datos? ¿No funcionó la herramienta?

3. Corrección: El agente decide qué necesita hacer de manera diferente y ejecuta el paso nuevamente con una estrategia ajustada.

En frameworks como LangGraph puedes implementar esta fase de reflexión como un nodo independiente en el grafo. El agente pasa por el nodo de reflexión después de cada paso de ejecución, y solo si la reflexión resulta positiva, procede al siguiente paso.

Un detalle importante: la reflexión consume tokens. En cada paso, el agente piensa adicionalmente, lo que consume tiempo de cómputo y dinero. Debes evaluar si la confiabilidad adicional justifica los costos. Para tareas simples, la reflexión puede ser excesiva. Para tareas complejas donde los errores son costosos, es indispensable.

Las aprobaciones humanas también juegan un rol aquí. En pasos críticos, el agente puede solicitar confirmación a una persona antes de continuar. Esta es una forma de reflexión externa que es particularmente útil en tareas sensibles.

Errores típicos en planificación y reflexión

La planificación y reflexión son poderosas, pero hay errores típicos que deberías evitar.

1. Sobreplanificación en tareas simples

No toda tarea requiere un plan detallado. Si la tarea es simple, la planificación consume más tiempo y tokens de los que ahorra. Para una búsqueda simple, ReAct es frecuentemente mejor que Plan-and-Execute porque el agente puede comenzar directamente.

2. Planes demasiado rígidos

Un plan es una hipótesis, no una ley. Si el agente se adhiere a un plan fijo aunque la realidad sea diferente, fracasará. Los buenos agentes pueden replanificar y ajustar su plan cuando emergen nuevas informaciones.

3. Reflexión sin consecuencias

La reflexión solo es útil si el agente actúa sobre las conclusiones que extrae. Si el agente advierte que un paso fue defectuoso pero continúa de todas formas, la reflexión no tiene valor. El agente debe ser capaz de corregir errores, no simplemente identificarlos.

4. Bucles infinitos por autocorrección

La autocorrección puede caer en bucles infinitos. El agente intenta corregir un paso, falla nuevamente, corrige otra vez, falla de nuevo. Debes establecer un número máximo de intentos para que el agente eventualmente desista y pruebe otro camino o pida ayuda a una persona.

5. Explosión de tokens por Tree-of-Thought

Tree-of-Thought puede consumir cantidades extremas de tokens si el agente explora demasiadas rutas. Debes limitar la amplitud y profundidad del árbol, de lo contrario los costos se dispararán.

6. Memoria insuficiente

La planificación y reflexión funcionan solo si el agente recuerda sus pasos previos. Sin memoria de agente, el agente olvida lo que ya ha hecho y comienza desde cero repetidamente. La memoria es el requisito previo para una reflexión significativa.

7. Demasiada reflexión en cada paso

Si el agente reflexiona después de cada paso diminuto, invierte más tiempo pensando que trabajando. La reflexión debe aplicarse en los lugares correctos, no indiscriminadamente después de cada acción.

8. Ignorar errores de herramientas

A veces las herramientas fallan y el agente simplemente ignora el error y continúa. Esto conduce a resultados inutilizables. El agente debe detectar errores de herramientas y responder a ellos, ya sea mediante corrección o replanificación.

Hardware, costos y seguridad en planificación y reflexión

La planificación y reflexión tienen implicaciones en hardware, costos y seguridad que deberías conocer.

Hardware: La planificación y reflexión requieren más capacidad de cómputo que la simple ejecución. El agente realiza pasos de razonamiento adicionales que producen y procesan tokens. Si trabajas localmente, necesitas hardware suficientemente potente. Más información en el artículo ¿Qué es la IA local?.

Costos: Cada paso de pensamiento y cada reflexión consume tokens. Con modelos basados en la nube, estos costos se acumulan rápidamente. Un agente ReAct que ejecuta 20 pasos con reflexión en cada uno consume significativamente más tokens que un agente simple que hace cinco pasos sin reflexión. Debes evaluar si la confiabilidad adicional justifica los costos.

Regla general: cuanto más compleja y propensa a errores sea la tarea, más vale la pena la reflexión. Para tareas simples con estructura clara, frecuentemente basta una estrategia simple sin reflexión exhaustiva.

Seguridad: La reflexión también puede ser una ganancia de seguridad. Un agente que verifica sus resultados comete menos errores que podrían causar problemas de seguridad. Si el agente desea eliminar un archivo, por ejemplo, la reflexión puede asegurar que sea realmente el archivo correcto. Las aprobaciones humanas complementan la reflexión al activar a una persona en pasos críticos.

Latencia: La planificación y reflexión aumentan la latencia, es decir, el tiempo hasta que el agente proporciona un resultado. Para tareas que deben completarse rápidamente, esto puede ser un problema. Plan-and-Execute es frecuentemente más rápido que ReAct aquí porque el agente avanza rápidamente a través de los pasos después de la fase de planificación.

Enlaces adicionales e información sobre planificación y reflexión

FAQ: Planificación y reflexión - Preguntas típicas

¿Cuál es la diferencia entre ReAct y Plan-and-Execute?

ReAct funciona paso a paso, sin plan fijo. El agente reflexiona nuevamente en cada paso sobre qué hacer a continuación. Plan-and-Execute crea primero un plan completo y luego lo ejecuta. ReAct es más flexible, Plan-and-Execute es más estructurado.

¿Necesita cada agente planificación?

No. Para tareas simples con pocos pasos, frecuentemente basta un agente simple sin planificación explícita. La planificación se vuelve importante cuando las tareas son complejas, tienen muchos pasos o son interdependientes.

¿Qué es exactamente la autocorrección?

La autocorrección significa que el agente identifica y corrige sus propios errores sin intervención humana. Puede suceder dentro de un paso si el agente advierte que un parámetro fue incorrecto, o después de un paso si el resultado no es utilizable.

¿No consume la reflexión muchos tokens?

Sí, la reflexión consume tokens adicionales porque el agente piensa extra. Debes evaluar si la confiabilidad adicional justifica los costos. Para tareas complejas esto es generalmente el caso, para tareas simples no.

¿Qué es la replanificación?

La replanificación significa que el agente ajusta su plan cuando un paso falla o cuando emergen nuevas informaciones. Esto es particularmente importante en Plan-and-Execute porque el plan original se basa en suposiciones que pueden cambiar.

¿Cómo evito bucles infinitos con autocorrección?

Establece un número máximo de intentos. Si el agente no puede corregir un paso después de, por ejemplo, tres intentos, debe desistir y probar otro camino o pedir ayuda a una persona.

¿Qué es Tree-of-Thought y cuándo lo necesito?

Tree-of-Thought es una estrategia donde el agente explora múltiples rutas de solución simultáneamente. Lo necesitas para tareas donde hay varios caminos y el mejor no es obvio de antemano. Es costoso y caro, por lo que solo tiene sentido para problemas complejos.

¿Cómo se relaciona Chain-of-Thought con la planificación?

Chain-of-Thought es un modo de pensamiento donde el agente procede lógicamente paso a paso. No es una estrategia de planificación independiente, sino que se usa en otras estrategias como ReAct o Plan-and-Execute para hacer el pensamiento más estructurado.

¿Puede un agente sin memoria reflexionar?

No, la reflexión presupone memoria. El agente debe recordar sus pasos y resultados previos para verificarlos. Sin memoria, el agente olvida qué ha hecho y no puede realizar reflexión significativa.

¿Qué framework es adecuado para planificación y reflexión?

LangGraph es particularmente adecuado porque modela la planificación y reflexión como grafos. Puedes integrar nodos de reflexión que se ejecutan después de cada paso. Más información en el artículo sobre LangGraph y en la descripción general de los frameworks.

¿Es la reflexión en agentes lo mismo que la reflexión en humanos?

No exactamente. En humanos, la reflexión es un proceso consciente, frecuentemente emocional. En agentes de IA, es un paso de evaluación estructurado donde el agente verifica su resultado contra las expectativas. El mecanismo es diferente, pero la idea es similar: aprender de los resultados y mejorar.

Fuentes y referencias

  • ReAct: Synergizing Reasoning and Acting in Language Models, Yao et al., 2022
  • Tree of Thoughts: Deliberate Problem Solving with Large Language Models, Yao et al., 2023
  • Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, Wei et al., 2022
  • Reflexion: Language Agents with Verbal Reinforcement Learning, Shinn et al., 2023
  • LangGraph Documentación, langchain-ai.github.io/langgraph/
  • Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning by Large Language Models, Wang et al., 2023
Volver al blog
Share:

Entradas relacionadas