Skip to content
BotServBotServ
KontextTokenRechnerKIKontextfensterPrompt

Kontextrechner für Sprachmodelle

Maximale Token, Kontextlänge und Kosten überschlagen. Einfach berechnen, wie viel Text ein Modell verarbeiten kann.

S

schutzgeist

3 min read
Kontextrechner für Sprachmodelle

Kontextrechner für Sprachmodelle

Was dieser Artikel über den Kontextrechner behandelt

  • Wie Du die Länge Deines Prompts abschätzt.
  • Wie viele Token ein Modell verarbeiten kann.
  • Wie Du Eingabe, Dokumente und Antworten im Blick behältst.
  • Wie sich lange Kontexte auf Geschwindigkeit und Speicher auswirken.

Einleitung: Kontextrechner für Sprachmodelle

Jedes Sprachmodell hat ein maximales Kontextfenster. Das ist die Menge an Token, die es auf einmal verarbeiten kann. Wer zu viel Text eingibt, verliert Informationen. Wer zu wenig gibt, erhält ungenaue Antworten. Ein Kontextrechner hilft, das richtige Maß zu finden.

Token sind keine einfachen Wörter. Ein Token kann ein Wort, ein Teilwort oder ein Zeichen sein. Deutsch braucht oft etwas mehr Token pro Wort als Englisch. Wer das einschätzt, kann besser planen und unnötige Kosten vermeiden.

Warum brauche ich einen Kontextrechner?

Lange Dokumente, RAG-Antworten und ausführliche Systemanweisungen verbrauchen schnell viele Token. Ohne Überschlagsrechnung überschreitet man das Kontextfenster oder verschwendet Speicher. Besonders bei Cloud-Diensten führt ein langer Kontext zu höheren Kosten. Wer lokal arbeitet, muss dennoch darauf achten, dass die Hardware ausreicht.

Kontextrechner kurz erklärt

Die wichtigsten Größen:

  • Token: Einzelne Bausteine, die das Modell verarbeitet.
  • Kontextfenster: Maximale Anzahl Token, die das Modell auf einmal sieht.
  • Input: Alle Informationen, die das Modell bekommt.
  • Output: Die Antwort des Modells, die ebenfalls Token verbraucht.
  • Chunking: Aufteilen langer Texte in kleinere Passagen.

Typische Token-Schätzungen:

  • Ein kurzer deutscher Satz: 15 bis 25 Token.
  • Eine A4-Seite Text: 500 bis 900 Token.
  • Eine DIN-A4-Seite englischer Text: 400 bis 700 Token.
  • Ein technisches PDF: 1.000 bis 2.000 Token pro Seite.

Für wen ist der Kontextrechner gedacht?

  • Für Nutzer, die lange Dokumente in KI eingeben.
  • Für RAG-Entwickler, die die richtige Chunk-Größe wählen.
  • Für Einsteiger, die Token verstehen wollen.
  • Für alle, die Cloud-Kosten oder VRAM-Bedarf im Blick behalten wollen.

Wichtige Begriffe rund um Kontext

  • Context Window: Englisch für Kontextfenster.
  • System-Prompt: Vorgaben für das Verhalten des Modells.
  • Few-Shot: Beispiele, die dem Modell zeigen, wie es antworten soll.
  • Truncation: Abschneiden von Text, der zu lang ist.
  • Overflow: Überschreiten des Kontextfensters.
  • Output-Token: Antwortlänge in Token.

Praxisbeispiele für den Kontextrechner

Modell mit 8K Kontextfenster

  • System-Prompt: 200 Token
  • 5 Chunks aus Dokumenten: je 300 Token = 1.500 Token
  • Nutzerfrage: 50 Token
  • Reserviert für Antwort: 500 Token
  • Gesamt: 2.250 Token
  • Freier Puffer: 5.750 Token
  • Ergebnis: Passt problemlos.

Modell mit 4K Kontextfenster

  • System-Prompt: 300 Token
  • 10 Chunks: je 250 Token = 2.500 Token
  • Nutzerfrage: 100 Token
  • Reserviert für Antwort: 500 Token
  • Gesamt: 3.400 Token
  • Freier Puffer: 600 Token
  • Ergebnis: Knapp, aber möglich. Weniger Chunks wählen.

Modell mit 128K Kontextfenster

  • System-Prompt: 500 Token
  • 30 lange Chunks: je 1.000 Token = 30.000 Token
  • Nutzerfrage: 200 Token
  • Reserviert für Antwort: 2.000 Token
  • Gesamt: 32.700 Token
  • Freier Puffer: 95.300 Token
  • Ergebnis: Viel Platz, aber lange Kontexte verlangsamen die Antwort.

Typische Stolpersteine beim Kontext

  • Token ≠ Wörter rechnen: Deutsche Sprache braucht oft mehr Token.
  • Antwort vergessen: Auch die Antwort braucht Platz im Fenster.
  • System-Prompt unterschätzen: Lange Anweisungen fressen viel Kontext.
  • Zu große Chunks: Lange Dokumente passen nicht in das Fenster.
  • Vergessene Reranking-Ergebnisse: Mehrere abgerufene Chunks summieren sich schnell.

FAQ: Kontextrechner

Wie viele Token hat ein deutsches Wort? Ca. 1,2 bis 1,5 Token pro Wort, je nach Wortlänge und Zeichensetzung.

Was passiert bei zu langem Kontext? Das Modell schneidet Text ab oder kann keine vollständige Antwort geben.

Ist ein größeres Kontextfenster immer besser? Nicht zwingend. Große Fenster verlangsamen die Antwort und erhöhen den Speicherbedarf.

Wie messe ich Token in Python? Mit Tokenizer-Bibliotheken wie tiktoken oder den Tokenizern von Hugging Face.

Sollte ich immer den maximalen Kontext nutzen? Nein. Nimm so viel wie nötig und reserviere Platz für die Antwort.

Quellen und weiterführende Literatur

Zusammenfassung: Kontextrechner für Sprachmodelle

Der Kontextrechner hilft, die Länge von Prompts und Antworten im Blick zu behalten. Token, Kontextfenster, Input und Output bestimmen, ob ein Modell die gewünschte Aufgabe sauber bearbeiten kann. Wer Puffer einplant und große Dokumente in passende Chunks teilt, vermeidet Abbrüche und lange Wartezeiten.

Zurück zum KI Blog
Share:

Ähnliche Beiträge