Planung und Reflexion: Wie KI-Agenten denken
Was dieser Artikel über Planung und Reflexion behandelt
- Du lernst, warum KI-Agenten ohne Planung ziellos herumirren und Ressourcen verschwenden
- Du verstehst die wichtigsten Strategien: ReAct, Plan-and-Execute, Tree-of-Thought und Chain-of-Thought
- Du siehst, wie Reflexion und Self-Correction funktionieren und warum sie den Unterschied machen
- Du bekommst konkrete Beispiele für den Think-Act-Observe-Zyklus und den Plan-First-Ansatz
- Du erfährst, welche Stolpersteine typisch sind und wie Du sie vermeidest
Einleitung: Planung und Reflexion verständlich erklärt
Stell Dir vor, Du gibst einem KI-Agenten die Aufgabe, eine Marktanalyse für ein neues Produkt zu erstellen. Was passiert, wenn der Agent einfach drauflosarbeitet? Ohne Planung springt er zwischen Aufgaben hin und her, sucht mal hier, mal dort, und am Ende fehlen wichtige Daten. Genau hier kommen Planung und Reflexion ins Spiel.
Planung bedeutet, dass der Agent sich überlegt, welche Schritte in welcher Reihenfolge nötig sind, bevor er loslegt. Reflexion bedeutet, dass er nach jedem Schritt prüft, ob das Ergebnis brauchbar ist oder ob er nachbessern muss. Beide Fähigkeiten zusammen machen aus einem simplen Werkzeug einen Agenten, der komplexe Aufgaben strukturiert abarbeitet.
Wenn Du noch neu bei KI-Agenten bist, schau Dir zuerst den Artikel Was ist ein KI-Agent? an. Dort klären wir die Grundlagen. Auch das Thema Agenten-Gedächtnis ist eng mit Planung und Reflexion verbunden, denn ein Agent muss sich an seine bisherigen Schritte erinnern können.
Warum brauche ich Planung und Reflexion?
Ein Agent ohne Planung ist wie jemand, der ein Haus bauen soll, aber einfach anfängt, Ziegel aufeinanderzustapeln. Er hat kein Fundament, keinen Bauplan und kein Konzept. Das Ergebnis: ein Haufen Ziegel, kein Haus.
Konkret sieht das so aus: Du sagst dem Agenten, er soll eine Marktanalyse erstellen. Ohne Planung macht er Folgendes:
- Er sucht nach dem Produkt, findet aber nur Werbung statt Daten
- Er wechselt zur Konkurrenzanalyse, hat aber noch keine Basisdaten
- Er probiert ein Tool, merkt nicht, dass es die falsche API ist
- Er springt zurück zur Produktsuche
- Nach 20 Schritten hat er Tokens verbraucht, aber keine brauchbare Analyse
Das Problem ist nicht, dass der Agent dumm ist. Er hat nur keine Strategie, um die Aufgabe zu zerlegen und systematisch abzuarbeiten. Planung gibt ihm diese Strategie. Reflexion gibt ihm die Fähigkeit, Fehler zu erkennen und zu korrigieren, bevor sie sich durch alle folgenden Schritte ziehen.
Mit Planung sieht derselbe Agent die Aufgabe so:
- Er zerlegt die Aufgabe in Teilschritte: Daten sammeln, Konkurrenz analysieren, Trends identifizieren, Bericht schreiben
- Er arbeitet jeden Schritt nacheinander ab
- Nach jedem Schritt prüft er das Ergebnis
- Wenn ein Schritt fehlschlägt, überlegt er, warum, und probiert einen anderen Weg
Der Unterschied ist dramatisch. Der geplante Agent kommt mit weniger Tokens zum Ziel, weil er nicht hin und her springt. Er liefert ein besseres Ergebnis, weil jeder Schritt auf dem vorherigen aufbaut. Und er ist robuster, weil er Fehler erkennt und korrigiert.
Planung und Reflexion kurz erklärt
Stell Dir zwei Köche vor. Beide sollen ein Drei-Gänge-Menü kochen.
Der erste Koch liest das Rezept, überlegt, welche Zutaten er braucht, plant die Reihenfolge: zuerst die Soße, weil sie köcheln muss, dann den Hauptgang, und das Dessert zuletzt, weil es kalt serviert wird. Er prüft nach jedem Schritt, ob die Soße die richtige Konsistenz hat, ob das Fleisch durch ist. Das ist Planung und Reflexion.
Der zweite Koch fängt einfach an. Er wirft Zutaten in die Pfanne, merkt nach zehn Minuten, dass er die Soße vergessen hat, rennt zur Vorratskammer, stellt fest, dass Sahne leer ist, probiert es mit Milch, merkt, dass das Fleisch inzwischen anbrennt. Am Ende steht ein chaosreiches und wahrscheinlich ungenießbares Menü auf dem Tisch.
Planung ist der Bauplan. Reflexion ist die Qualitätskontrolle nach jedem Schritt. Beides zusammen sorgt dafür, dass der Agent nicht nur arbeitet, sondern sinnvoll arbeitet.
In der Welt der KI-Agenten gibt es dafür verschiedene Strategien, die wir uns in diesem Artikel ansehen. Die wichtigsten sind ReAct, Plan-and-Execute, Tree-of-Thought und Chain-of-Thought. Alle haben gemeinsam, dass sie den Agenten zwingen, nachzudenken, bevor und während er handelt.
Für wen ist Planung und Reflexion gedacht?
Planung und Reflexion sind für jeden relevant, der mit KI-Agenten arbeitet, egal ob Anfänger oder Fortgeschrittener.
Für Anfänger: Wenn Du gerade erst mit KI-Agenten startest, ist es wichtig zu verstehen, dass ein Agent nicht einfach “funktioniert”, sondern dass seine Qualität stark davon abhängt, wie er denkt. Wenn Du weißt, wie Planung funktioniert, kannst Du bessere Prompts schreiben und bessere Ergebnisse bekommen.
Für Entwickler: Wenn Du eigene Agenten baust, musst Du Dich entscheiden, welche Planungsstrategie Du verwendest. Die Wahl beeinflusst, wie viele Tokens der Agent verbraucht, wie schnell er ist und wie zuverlässig er arbeitet. Frameworks wie LangGraph geben Dir Werkzeuge an die Hand, um Planung und Reflexion zu implementieren.
Für Entscheider: Wenn Du KI-Agenten in Deinem Unternehmen einsetzen willst, musst Du verstehen, dass Planung und Reflexion den Unterschied zwischen einem nützlichen Werkzeug und einem teuren Experiment ausmachen. Ein Agent, der nicht reflektiert, kann Fehler machen, die teuer werden.
Für Neugierige: Auch wenn Du keine Agenten baust, hilft Dir das Verständnis von Planung und Reflexion, besser zu verstehen, was KI-Systeme können und wo ihre Grenzen liegen.
Wenn Du mehr über das größere Bild wissen willst, schau Dir den Artikel zu Agentensystemen an.
Wichtige Begriffe rund um Planung und Reflexion
| Begriff | Bedeutung |
|---|---|
| Planung | Der Agent zerlegt eine Aufgabe in Teilschritte und legt die Reihenfolge fest |
| Reflexion | Der Agent prüft seine eigenen Ergebnisse und lernt daraus |
| ReAct | Strategie, bei der Denken und Handeln abwechseln: Think, Act, Observe |
| Plan-and-Execute | Strategie, bei der erst ein kompletter Plan erstellt und dann ausgeführt wird |
| Self-Correction | Der Agent erkennt eigene Fehler und korrigiert sie selbstständig |
| Reasoning | Das logische Denken und Schlussfolgern des Agenten |
| Thought-Action-Observation | Der Drei-Schritte-Zyklus im ReAct-Ansatz |
| Task Decomposition | Das Zerlegen einer großen Aufgabe in kleinere Teilaufgaben |
| Replanning | Anpassen des Plans, wenn ein Schritt fehlschlägt oder neue Infos auftauchen |
| Chain-of-Thought | Schrittweises Denken, bei dem jeder Schritt auf dem vorherigen aufbaut |
Planungsstrategien für KI-Agenten
Es gibt mehrere Strategien, wie ein Agent planen kann. Jede hat ihre Stärken und Schwächen. Hier lernst Du die vier wichtigsten kennen.
ReAct: Think, Act, Observe
ReAct ist die bekannteste Strategie für KI-Agenten. Der Name setzt sich aus “Reasoning” und “Acting” zusammen. Der Agent arbeitet in einem Zyklus aus drei Schritten:
- Think (Denken): Der Agent überlegt, was er als Nächstes tun sollte und warum.
- Act (Handeln): Der Agent führt eine Aktion aus, zum Beispiel ein Tool aufrufen oder eine Suche starten.
- Observe (Beobachten): Der Agent schaut sich das Ergebnis der Aktion an und überlegt, was es für den nächsten Schritt bedeutet.
Dieser Zyklus wiederholt sich, bis die Aufgabe erledigt ist. Der große Vorteil von ReAct ist, dass der Agent flexibel bleibt. Er kann nach jedem Schritt entscheiden, ob er weitermacht wie geplant oder ob er den Weg wechselt.
Der Nachteil: Bei komplexen Aufgaben kann der Agent den Überblick verlieren, weil er keinen festen Plan hat, sondern sich Schritt für Schritt vorarbeitet. Das kann zu vielen Schritten und hohem Token-Verbrauch führen.
Plan-and-Execute: Erst planen, dann ausführen
Plan-and-Execute ist das Gegenstück zu ReAct. Hier erstellt der Agent zuerst einen kompletten Plan mit allen Schritten, bevor er auch nur eine Aktion ausführt.
- Plan: Der Agent zerlegt die Aufgabe in Teilschritte und legt die Reihenfolge fest.
- Execute: Der Agent arbeitet jeden Schritt des Plans nacheinander ab.
Der Vorteil ist, dass der Agent von Anfang an eine klare Struktur hat. Er weiß, wohin die Reise geht, und verschwendet keine Zeit mit Ausprobieren. Das ist besonders bei komplexen Aufgaben hilfreich, die viele Schritte erfordern.
Der Nachteil: Wenn ein Schritt fehlschlägt, muss der Agent den Plan anpassen. Das nennt man Replanning. Wenn das nicht gut funktioniert, bleibt der Agent stecken, weil der Rest des Plans auf dem gescheiterten Schritt aufbaut.
Tree-of-Thought: Mehrere Wege erkunden
Tree-of-Thought geht einen Schritt weiter. Statt nur einen Weg zu verfolgen, erkundet der Agent mehrere mögliche Lösungswege gleichzeitig, wie ein Baum mit mehreren Ästen.
- Der Agent überlegt mehrere mögliche nächste Schritte.
- Er verfolgt jeden Schritt ein Stück weit und bewertet, wie vielversprechend er ist.
- Er wählt den besten Weg und geht tiefer, oder er bricht unbrauchbare Äste ab.
Das ist besonders nützlich bei Aufgaben, bei denen es mehrere Lösungswege gibt und der beste Weg nicht von vornherein klar ist. Der Nachteil ist, dass Tree-of-Thought viele Tokens verbraucht, weil der Agent mehrere Wege gleichzeitig erkundet.
Chain-of-Thought: Schrittweises Denken
Chain-of-Thought ist die einfachste Form des strukturierten Denkens. Der Agent denkt Schritt für Schritt, wobei jeder Schritt auf dem vorherigen aufbaut. Es ist wie eine mathematische Herleitung: erst die Prämisse, dann der erste Schluss, dann der nächste.
Chain-of-Thought ist keine vollständige Agenten-Strategie wie ReAct oder Plan-and-Execute, sondern eine Denkweise, die in anderen Strategien verwendet wird. Sie hilft dem Agenten, logisch zu bleiben und nicht Sprünge zu machen, die zu Fehlern führen.
Reflexion und Self-Correction
Planung ist die eine Hälfte. Reflexion ist die andere. Ohne Reflexion kann ein Agent einen perfekten Plan haben und trotzdem scheitern, weil er nicht merkt, wenn etwas schiefgeht.
Reflexion bedeutet, dass der Agent nach jedem Schritt oder nach jeder Aktion sein Ergebnis prüft. Er stellt sich Fragen wie:
- Entspricht das Ergebnis dem, was ich erwartet habe?
- Ist das Ergebnis brauchbar für den nächsten Schritt?
- Habe ich einen Fehler gemacht?
- Muss ich etwas korrigieren?
Wenn der Agent einen Fehler erkennt, kann er ihn auf zwei Arten korrigieren:
Self-Correction innerhalb des Schritts: Der Agent merkt während der Ausführung, dass etwas nicht stimmt, und korrigiert sich sofort. Zum Beispiel: Er ruft eine API auf, bekommt eine Fehlermeldung, erkennt, dass der Parameter falsch war, und probiert es mit dem richtigen Parameter.
Reflexion nach dem Schritt: Der Agent schaut sich das fertige Ergebnis eines Schritts an und entscheidet, ob es gut genug ist. Wenn nicht, überlegt er, was er anders machen muss, und führt den Schritt erneut aus, gegebenenfalls mit einer anderen Strategie.
Der Reflexionszyklus sieht so aus:
- Schritt ausführen
- Ergebnis prüfen
- Bei Fehler: Ursache analysieren und Schritt korrigieren
- Bei Erfolg: zum nächsten Schritt gehen
- Wiederholen, bis die Aufgabe erledigt ist
Dieser Zyklus ist entscheidend für die Zuverlässigkeit eines Agenten. Ein Agent, der nicht reflektiert, kann Fehler machen, die sich durch alle folgenden Schritte ziehen. Ein Agent, der reflektiert, fängt Fehler früh ab und korrigiert sie, bevor sie Schaden anrichten.
Beispiel: Ein Agent mit ReAct
Schauen wir uns an, wie ein ReAct-Agent eine konkrete Aufgabe abarbeitet. Die Aufgabe lautet: Finde die drei größten Konkurrenten von einem bestimmten Unternehmen und vergleiche deren Preise.
Schritt 1: Think
Der Agent denkt: Ich muss zuerst herausfinden, wer das Unternehmen ist und in welcher Branche es tätig ist. Dann kann ich nach Konkurrenten suchen.
Schritt 1: Act
Der Agent ruft eine Suchfunktion auf mit dem Namen des Unternehmens.
Schritt 1: Observe
Die Suche liefert Informationen über das Unternehmen: Es ist ein SaaS-Anbieter im Bereich Projektmanagement.
Schritt 2: Think
Der Agent denkt: Jetzt weiß ich, in welcher Branche das Unternehmen tätig ist. Ich muss nach den größten Konkurrenten im Bereich Projektmanagement-SaaS suchen.
Schritt 2: Act
Der Agent sucht nach “größte Projektmanagement-SaaS-Anbieter”.
Schritt 2: Observe
Die Suche liefert eine Liste von Anbietern. Der Agent identifiziert drei, die ähnliche Funktionen anbieten.
Schritt 3: Think
Der Agent denkt: Ich habe drei Konkurrenten. Jetzt muss ich deren Preise herausfinden. Ich besuche die Websites der drei Anbieter und suche nach Preisseiten.
Schritt 3: Act
Der Agent ruft die Website des ersten Konkurrenten auf und sucht nach der Preisseite.
Schritt 3: Observe
Die Website liefert die Preisinformationen. Der Agent notiert sich die Preise.
Schritt 4: Think
Der Agent denkt: Erster Konkurrent erledigt. Jetzt der zweite.
Schritt 4: Act
Der Agent ruft die Website des zweiten Konkurrenten auf.
Schritt 4: Observe
Die Website liefert keine direkten Preise, sondern nur “Preis auf Anfrage”.
Schritt 5: Think
Der Agent denkt: Der zweite Konkurrent hat keine öffentlichen Preise. Ich notiere mir das und gehe zum dritten Konkurrenten. Später kann ich versuchen, die Preise über einen anderen Weg zu finden.
Schritt 5: Act
Der Agent ruft die Website des dritten Konkurrenten auf.
Schritt 5: Observe
Die Website liefert die Preisinformationen.
Schritt 6: Think
Der Agent denkt: Ich habe Preise von zwei Konkurrenten und eine “Preis auf Anfrage” beim dritten. Ich kann jetzt einen Vergleich erstellen und darauf hinweisen, dass die Preise des zweiten Anbieters nicht öffentlich verfügbar sind.
Schritt 6: Act
Der Agent erstellt den Vergleichsbericht.
Schritt 6: Observe
Der Bericht ist vollständig und enthält alle verfügbaren Informationen.
Du siehst, wie der Agent bei jedem Schritt nachdenkt, handelt und das Ergebnis beobachtet. Er bleibt flexibel und kann auf unerwartete Ergebnisse reagieren, wie die fehlenden Preise beim zweiten Konkurrenten.
Beispiel: Ein Agent mit Plan-and-Execute
Jetzt dieselbe Aufgabe, aber mit Plan-and-Execute. Der Agent erstellt zuerst einen Plan und führt ihn dann aus.
Plan:
- Unternehmen identifizieren und Branche bestimmen
- Drei größte Konkurrenten in der Branche finden
- Preise jedes Konkurrenten recherchieren
- Vergleichsbericht erstellen
Execute Schritt 1: Der Agent identifiziert das Unternehmen als SaaS-Anbieter im Bereich Projektmanagement. Erfolg, weiter zum nächsten Schritt.
Execute Schritt 2: Der Agent findet drei Konkurrenten. Erfolg, weiter zum nächsten Schritt.
Execute Schritt 3a: Der Agent recherchiert die Preise des ersten Konkurrenten. Erfolg, Preise gefunden.
Execute Schritt 3b: Der Agent recherchiert die Preise des zweiten Konkurrenten. Teilerfolg, nur “Preis auf Anfrage” verfügbar. Hier muss der Agent reflektieren: Ist das gut genug? Er entscheidet, ja, und notiert die Einschränkung.
Execute Schritt 3c: Der Agent recherchiert die Preise des dritten Konkurrenten. Erfolg, Preise gefunden.
Execute Schritt 4: Der Agent erstellt den Vergleichsbericht mit allen gesammelten Daten.
Der Unterschied zu ReAct: Der Agent hat von Anfang an gewusst, welche Schritte anstehen. Er musste nicht bei jedem Schritt neu überlegen, was als Nächstes kommt. Das macht den Prozess effizienter und übersichtlicher.
Allerdings: Wenn in Schritt 3b etwas völlig Unerwartetes passiert wäre, zum Beispiel wenn der zweite Konkurrent gar keine Website hätte, müsste der Agent replannen. Das ist der Punkt, an dem Plan-and-Execute komplizierter wird als ReAct.
Reflexion in der Praxis
Wie implementiert man Reflexion in der Praxis? Hier ist ein einfaches Muster, das Du in vielen Frameworks wiederfindest.
Nach jedem Schritt führt der Agent eine Reflexionsphase durch. Diese Phase besteht aus drei Teilen:
1. Bewertung: Der Agent schaut sich das Ergebnis an und bewertet es. Hat es das erreicht, was es erreichen sollte? Ist es vollständig, korrekt und brauchbar?
2. Ursachenanalyse: Wenn das Ergebnis nicht gut genug ist, überlegt der Agent, warum. War der Ansatz falsch? Waren die Daten unvollständig? Hat das Tool nicht funktioniert?
3. Korrektur: Der Agent entscheidet, was er anders machen muss, und führt den Schritt erneut aus, mit einer angepassten Strategie.
In Frameworks wie LangGraph kannst Du diese Reflexionsphase als eigenen Knoten im Graphen implementieren. Der Agent geht nach jedem Ausführungsschritt durch den Reflexionsknoten, und nur wenn die Reflexion positiv ausfällt, geht er zum nächsten Schritt weiter.
Ein wichtiges Detail: Reflexion kostet Tokens. Bei jedem Schritt denkt der Agent zusätzlich nach, was Rechenzeit und Geld verbraucht. Du musst abwägen, ob die zusätzliche Zuverlässigkeit die Kosten wert ist. Bei einfachen Aufgaben kann Reflexion übertrieben sein. Bei komplexen Aufgaben, bei denen Fehler teuer sind, ist sie unverzichtbar.
Auch menschliche Freigaben spielen hier eine Rolle. Bei kritischen Schritten kann der Agent einen Menschen um Bestätigung bitten, bevor er weitermacht. Das ist eine Form der externen Reflexion, die besonders bei sensiblen Aufgaben sinnvoll ist.
Typische Stolpersteine bei Planung und Reflexion
Planung und Reflexion sind mächtig, aber es gibt typische Fehler, die Du vermeiden solltest.
1. Überplanung bei einfachen Aufgaben
Nicht jede Aufgabe braucht einen detaillierten Plan. Wenn die Aufgabe einfach ist, kostet die Planung mehr Zeit und Tokens als sie spart. Bei einer einfachen Suche ist ReAct oft besser als Plan-and-Execute, weil der Agent direkt loslegen kann.
2. Zu starre Pläne
Ein Plan ist eine Hypothese, kein Gesetz. Wenn der Agent an einem festen Plan festhält, obwohl die Realität anders aussieht, scheitert er. Gute Agenten können replanen und ihren Plan anpassen, wenn neue Informationen auftauchen.
3. Reflexion ohne Konsequenz
Reflexion ist nur nützlich, wenn der Agent aus den Erkenntnissen Konsequenzen zieht. Wenn der Agent merkt, dass ein Schritt fehlerhaft war, aber trotzdem weitermacht, hat die Reflexion keinen Wert. Der Agent muss die Fähigkeit haben, Fehler zu korrigieren, nicht nur zu erkennen.
4. Endlosschleifen durch Self-Correction
Self-Correction kann in eine Endlosschleife geraten. Der Agent versucht, einen Schritt zu korrigieren, scheitert wieder, korrigiert erneut, scheitert wieder. Du musst eine maximale Anzahl an Versuchen festlegen, damit der Agent irgendwann aufgibt und einen anderen Weg probiert oder einen Menschen um Hilfe bittet.
5. Token-Explosion durch Tree-of-Thought
Tree-of-Thought kann extrem viele Tokens verbrauchen, wenn der Agent zu viele Wege erkundet. Du musst die Breite und Tiefe des Baums begrenzen, sonst explodieren die Kosten.
6. Fehlendes Gedächtnis
Planung und Reflexion funktionieren nur, wenn der Agent sich an seine bisherigen Schritte erinnert. Ohne Agenten-Gedächtnis vergisst der Agent, was er schon gemacht hat, und fängt immer wieder von vorn an. Das Gedächtnis ist die Voraussetzung für sinnvolle Reflexion.
7. Zu viel Reflexion bei jedem Schritt
Wenn der Agent nach jedem winzigen Schritt reflektiert, verbringt er mehr Zeit mit Nachdenken als mit Arbeiten. Reflexion sollte an den richtigen Stellen eingesetzt, nicht pauschal nach jeder Aktion.
8. Ignorieren von Tool-Fehlern
Manchmal schlagen Tools fehl, und der Agent ignoriert den Fehler einfach und macht weiter. Das führt zu unbrauchbaren Ergebnissen. Der Agent muss Tool-Fehler erkennen und darauf reagieren, entweder durch Korrektur oder durch Replanning.
Hardware, Kosten und Sicherheit bei Planung und Reflexion
Planung und Reflexion haben Auswirkungen auf Hardware, Kosten und Sicherheit, die Du kennen solltest.
Hardware: Planung und Reflexion benötigen mehr Rechenleistung als einfaches Ausführen. Der Agent führt zusätzliche Reasoning-Schritte durch, die Tokens produzieren und verarbeiten. Wenn Du lokal arbeitest, brauchst Du eine ausreichend leistungsstarke Hardware. Mehr dazu im Artikel Was ist lokale KI?.
Kosten: Jeder Think-Schritt und jede Reflexion kostet Tokens. Bei cloud-basierten Modellen summieren sich diese Kosten schnell. Ein ReAct-Agent, der 20 Schritte mit jeweils einer Reflexion durchführt, verbraucht deutlich mehr Tokens als ein simpler Agent, der nur fünf Schritte ohne Reflexion macht. Du musst abwägen, ob die zusätzliche Zuverlässigkeit die Kosten wert ist.
Faustregel: Je komplexer und fehleranfälliger die Aufgabe, desto mehr lohnt sich Reflexion. Bei einfachen Aufgaben mit klarer Struktur reicht oft eine einfache Strategie ohne ausführliche Reflexion.
Sicherheit: Reflexion kann auch ein Sicherheitsgewinn sein. Ein Agent, der seine Ergebnisse prüft, macht weniger Fehler, die zu Sicherheitsproblemen führen könnten. Wenn der Agent zum Beispiel eine Datei löschen will, kann die Reflexion sicherstellen, dass es wirklich die richtige Datei ist. Menschliche Freigaben ergänzen die Reflexion, indem sie bei kritischen Schritten einen Menschen einschalten.
Latenz: Planung und Reflexion erhöhen die Latenz, also die Zeit, bis der Agent ein Ergebnis liefert. Bei Aufgaben, die schnell erledigt sein müssen, kann das ein Problem sein. Plan-and-Execute ist hier oft schneller als ReAct, weil der Agent nach der Planungsphase zügig durch die Schritte geht.
Weiterführende Links und Infos zu Planung und Reflexion
- KI-Agenten Grundlagen - Übersicht aller Grundlagenartikel
- Was ist ein KI-Agent? - Die Basics, falls Du noch am Anfang stehst
- Agentensysteme - Wie mehrere Agenten zusammenarbeiten
- Tool-Calling - Wie Agenten Werkzeuge aufrufen, was die Act-Phase möglich macht
- Agenten-Gedächtnis - Wie Agenten sich an Schritte erinnern, die Grundlage für Reflexion
- Menschliche Freigaben - Wenn der Agent einen Menschen um Bestätigung bittet
- Frameworks - Übersicht der Frameworks, mit denen Du Agenten baust
- LangGraph - Ein Framework, das Planung und Reflexion als Graphen modelliert
FAQ: Planung und Reflexion - Typische Fragen
Was ist der Unterschied zwischen ReAct und Plan-and-Execute?
ReAct arbeitet Schritt für Schritt, ohne festen Plan. Der Agent überlegt bei jedem Schritt neu, was als Nächstes kommt. Plan-and-Execute erstellt zuerst einen kompletten Plan und führt ihn dann aus. ReAct ist flexibler, Plan-and-Execute ist strukturierter.
Braucht jeder Agent Planung?
Nein. Bei einfachen Aufgaben mit wenigen Schritten reicht oft ein simpler Agent ohne explizite Planung. Planung wird wichtig, wenn Aufgaben komplex sind, viele Schritte haben oder voneinander abhängen.
Was ist Self-Correction genau?
Self-Correction bedeutet, dass der Agent eigene Fehler erkennt und korrigiert, ohne dass ein Mensch eingreift. Das kann innerhalb eines Schritts passieren, wenn der Agent merkt, dass ein Parameter falsch war, oder nach einem Schritt, wenn das Ergebnis nicht brauchbar ist.
Kostet Reflexion nicht viele Tokens?
Ja, Reflexion kostet zusätzliche Tokens, weil der Agent extra denkt. Du musst abwägen, ob die zusätzliche Zuverlässigkeit die Kosten wert ist. Bei komplexen Aufgaben ist das meist der Fall, bei einfachen nicht.
Was ist Replanning?
Replanning bedeutet, dass der Agent seinen Plan anpasst, wenn ein Schritt fehlschlägt oder neue Informationen auftauchen. Das ist bei Plan-and-Execute besonders wichtig, weil der ursprüngliche Plan auf Annahmen beruht, die sich ändern können.
Wie verhindere ich Endlosschleifen bei Self-Correction?
Setze eine maximale Anzahl an Versuchen fest. Wenn der Agent einen Schritt nach zum Beispiel drei Versuchen nicht korrigieren kann, soll er aufgeben und einen anderen Weg probieren oder einen Menschen um Hilfe bitten.
Was ist Tree-of-Thought und wann brauche ich es?
Tree-of-Thought ist eine Strategie, bei der der Agent mehrere Lösungswege gleichzeitig erkundet. Du brauchst es bei Aufgaben, bei denen es mehrere Wege gibt und der beste nicht von vornherein klar ist. Es ist aufwändig und teuer, also nur bei komplexen Problemen sinnvoll.
Wie hängt Chain-of-Thought mit Planung zusammen?
Chain-of-Thought ist eine Denkweise, bei der der Agent Schritt für Schritt logisch vorgeht. Sie ist keine eigene Planungsstrategie, sondern wird in anderen Strategien wie ReAct oder Plan-and-Execute verwendet, um das Denken strukturierter zu machen.
Kann ein Agent ohne Gedächtnis reflektieren?
Nein, Reflexion setzt Gedächtnis voraus. Der Agent muss sich an seine bisherigen Schritte und Ergebnisse erinnern, um sie zu prüfen. Ohne Gedächtnis vergisst der Agent, was er gemacht hat, und kann keine sinnvolle Reflexion durchführen.
Welches Framework eignet sich für Planung und Reflexion?
LangGraph ist besonders geeignet, weil es Planung und Reflexion als Graphen modelliert. Du kannst Reflexionsknoten einbauen, die nach jedem Schritt durchlaufen werden. Mehr dazu im Artikel zu LangGraph und in der Übersicht der Frameworks.
Ist Reflexion dasselbe wie Reflexion bei Menschen?
Nein, nicht ganz. Bei Menschen ist Reflexion ein bewusster, oft emotionaler Prozess. Bei KI-Agenten ist es ein strukturierter Bewertungsschritt, bei dem der Agent sein Ergebnis gegen Erwartungen prüft. Der Mechanismus ist anders, aber die Idee ist ähnlich: aus Ergebnissen lernen und sich verbessern.
Quellen und weiterführende Literatur
- ReAct: Synergizing Reasoning and Acting in Language Models, Yao et al., 2022
- Tree of Thoughts: Deliberate Problem Solving with Large Language Models, Yao et al., 2023
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, Wei et al., 2022
- Reflexion: Language Agents with Verbal Reinforcement Learning, Shinn et al., 2023
- LangGraph Dokumentation, langchain-ai.github.io/langgraph/
- Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning by Large Language Models, Wang et al., 2023


