KoboldCpp: Rollenspiel und kreative Texte lokal
Was dieser Artikel über KoboldCpp behandelt
- Was KoboldCpp ist und warum es die erste Wahl für lokales Rollenspiel und Storytelling mit KI ist
- Wie Du KoboldCpp installierst, Modelle lädst und die verschiedenen Story-Modi nutzt
- Wie World Info und Memory funktionieren, damit Deine Geschichten konsistent bleiben
- Wie Du die GPU-Konfiguration für maximale Performance einrichtest
- Wann KoboldCpp die richtige Wahl ist und wann Du besser zu Ollama oder LM Studio greifst
Einleitung: KoboldCpp verständlich erklärt
Wenn Du Dich mit lokaler KI beschäftigst, stößt Du schnell auf Werkzeuge, die Modelle laden und Text generieren. Die meisten davon sind aber auf Dialoge oder Code ausgelegt, nicht auf kreatives Schreiben. Genau hier setzt KoboldCpp an. Es ist eine Inferenz-Engine, die speziell für Rollenspiel, Storytelling und interaktive Texte gebaut wurde.
KoboldCpp basiert auf llama.cpp und erweitert dessen Inferenz-Kern um Funktionen, die für kreatives Schreiben unverzichtbar sind: World Info, ein Memory-System, verschiedene Story-Modi und eine Oberfläche, die auf das Schreiben von Geschichten zugeschnitten ist. Wenn Du noch ganz am Anfang stehst, hilft Dir der Artikel Was ist lokale KI? als Einstieg.
Dieser Artikel erklärt Dir, was KoboldCpp macht, wie Du es installierst und einsetzt, und wie es sich von anderen Lokale KI Software-Tools unterscheidet.
Warum brauche ich KoboldCpp?
Stell Dir vor, Du möchtest ein Rollenspiel mit einer KI spielen oder eine interaktive Geschichte schreiben, die sich an Deine Eingaben anpasst. Du probierst es mit einem normalen Chat-Tool aus, aber das Modell vergisst nach wenigen Absätzen, wer die Figuren sind, wo die Geschichte spielt und welche Regeln Du festgelegt hast. Jedes Mal, wenn Du eine Szene beschreibst, musst Du dem Modell alles neu erklären.
Genau dieses Problem löst KoboldCpp. Es bringt ein World Info-System mit, das automatisch Hintergrundinformationen in den Context einspeist, sobald ein bestimmtes Wort auftaucht. Es hat ein Memory-System, das wichtige Ereignisse festhält, und einen Author’s Note-Mechanismus, der Stil und Tonfall Deiner Geschichte steuert. All das passiert im Hintergrund, ohne dass Du bei jeder Eingabe alles wiederholen musst.
Wer Lokale KI Software für kreatives Schreiben nutzen will, kommt an KoboldCpp vorbei, weil es die Inferenz nicht nur ausführt, sondern sie um die Funktionen ergänzt, die Geschichten konsistent halten.
KoboldCpp kurz erklärt
KoboldCpp ist eine eigenständige Inferenz-Engine, die auf llama.cpp aufbaut und um Storytelling-Funktionen erweitert wurde. Es wird als einzelnes Programm ausgeliefert, das ohne Python-Installation oder komplexe Abhängigkeiten auskommt. Du lädst eine ausführbare Datei herunter, startest sie, wählst ein Modell und kannst sofort loslegen.
Die wichtigsten Komponenten:
- Inferenz-Kern: Basiert auf llama.cpp und unterstützt GGUF-Modelle.
- Story-Modi: Story Mode, Chat Mode und Adventure Mode für verschiedene Anwendungsfälle.
- World Info: Ein System für kontextsensitive Hintergrundinformationen.
- Memory: Ein Speicher für wichtige Ereignisse, der über den eigentlichen Context hinausgeht.
- Author’s Note: Ein Mechanismus, um Stil und Tonfall der Geschichte zu steuern.
- Web-Oberfläche: Eine im Browser laufende Oberfläche, die auf das Schreiben von Geschichten zugeschnitten ist.
Modelle werden im GGUF-Format geladen, dem Standardformat für lokale Inferenz. Mehr zur Theorie findest Du im Artikel LLM lokal betreiben.
Für wen ist KoboldCpp gedacht?
KoboldCpp richtet sich an mehrere Zielgruppen:
- Rollenspielerinnen und Rollenspieler, die solo oder mit Freunden Abenteuer mit KI-Unterstützung spielen wollen.
- Autorinnen und Autoren, die KI als Werkzeug für kreatives Schreiben nutzen, ohne die Kontrolle abzugeben.
- Text-Adventure-Fans, die interaktive Geschichten erleben und gestalten möchten.
- Experimentierfreudige Nutzerinnen und Nutzer, die die Storytelling-Funktionen von KI-Modellen ausreizen wollen.
Wenn Du einfach nur schnell ein Modell ausprobieren möchtest, ohne Dich mit Story-Modi und World Info zu beschäftigen, bist Du mit Ollama oder LM Studio besser bedient. Diese Tools sind auf Dialoge und allgemeine Inferenz ausgelegt, nicht auf kreatives Schreiben.
Wichtige Begriffe rund um KoboldCpp
| Begriff | Erklärung |
|---|---|
| KoboldCpp | Inferenz-Engine für Rollenspiel und Storytelling, basierend auf llama.cpp |
| World Info | System für kontextsensitive Hintergrundinformationen, das bei Schlüsselwörtern aktiviert wird |
| Memory | Speicher für wichtige Ereignisse, der über den normalen Context hinausgeht |
| Author’s Note | Kurzer Text, der regelmäßig in den Context eingefügt wird, um Stil und Ton zu steuern |
| Story Mode | Modus für kreatives Schreiben, das Modell führt Deine Eingaben als Erzählung weiter |
| Chat Mode | Modus für Dialoge, das Modell antwortet als Gesprächspartner |
| Adventure Mode | Modus für Text-Adventures, das Modell reagiert auf Deine Aktionen wie ein Spielmeister |
| GGUF | Dateiformat für quantisierte Modelle, Standardformat für lokale Inferenz |
| Context | Maximale Anzahl an Tokens, die das Modell gleichzeitig verarbeiten kann |
| Token | Kleinste Einheit, die ein Modell verarbeitet, entspricht etwa einem Wort oder Wortteil |
Was macht KoboldCpp besonders?
Drei Eigenschaften heben KoboldCpp von anderen Inferenz-Engines ab:
Storytelling als Kernfunktion. Während Tools wie Ollama auf Dialoge ausgelegt sind, ist KoboldCpp von Grund auf für kreatives Schreiben gebaut. Die drei Story-Modi, das Memory-System und World Info sind keine nachträglichen Add-ons, sondern zentrale Bestandteile der Oberfläche. Du musst keine Prompts basteln, um das Modell zum Erzählen zu bringen, Du wählst einfach den passenden Modus.
World Info für konsistente Welten. World Info ist das Herzstück von KoboldCpp. Du legst Einträge an, die aus einem Schlüsselwort und einem Text bestehen. Sobald das Schlüsselwort in Deiner Geschichte auftaucht, wird der zugehörige Text in den Context eingespeist. So weiß das Modell automatisch, dass “Eldoria” ein Königreich im Norden ist, sobald der Name fällt, ohne dass Du es jedes Mal neu erklären musst. Das ist besonders bei langen Geschichten mit vielen Figuren und Orten unverzichtbar.
Memory für langfristige Konsistenz. Der Context eines Modells ist begrenzt, typischerweise auf 4096 oder 8192 Tokens. In einer langen Geschichte passen nicht alle Ereignisse in den Context. Das Memory-System von KoboldCpp speichert wichtige Ereignisse in einem separaten Bereich und fügt sie regelmäßig in den Context ein, sodass das Modell den Überblick behält, auch wenn die Geschichte hunderte Absätze lang wird.
Installation
KoboldCpp ist besonders einfach zu installieren, weil es als einzelne ausführbare Datei ausgeliefert wird. Du brauchst kein Python, keine virtuelle Umgebung und keine Build-Tools.
Download: Lade die aktuelle Version vom GitHub-Repository unter Releases herunter. Es gibt verschiedene Varianten für unterschiedliche Hardware-Konfigurationen.
Windows: Lade die koboldcpp.exe herunter. Wähle die Variante mit CUDA-Support, wenn Du eine Nvidia-GPU hast, oder die CPU-Variante, wenn Du keine GPU nutzen möchtest. Ein Doppelklick auf die Datei startet den Konfigurationsdialog, in dem Du Modell, GPU-Layer und Context-Größe einstellst.
macOS: Für Macs mit Apple Silicon gibt es eine eigene Variante mit Metal-Support. Lade die entsprechende Datei herunter und führe sie aus. Da macOS-Apps aus dem Internet manchmal blockiert werden, musst Du möglicherweise unter “Systemeinstellungen” > “Sicherheit” die Ausführung erlauben.
Linux: Lade die passende Variante herunter und mache sie ausführbar:
chmod +x koboldcpp
./koboldcpp
Nach dem Start öffnet sich ein Konfigurationsdialog. Dort wählst Du Dein GGUF-Modell aus, stellst die GPU-Layer ein und legst die Context-Größe fest. Mit einem Klick auf “Launch” startet die Inferenz-Engine und die Web-Oberfläche öffnet sich im Browser.
Modelle laden
KoboldCpp nutzt das GGUF-Format, das auch von llama.cpp verwendet wird. Das bedeutet, dass Du jede GGUF-Datei nutzen kannst, die für llama.cpp kompatibel ist.
Lade Modelle von Plattformen wie Hugging Face herunter. Für Rollenspiel und Storytelling haben sich folgende Modellfamilien bewährt:
- Mistral und Mistral-Nemo: Gute Allrounder mit solider Erzählqualität.
- Llama 3 und Llama 3.1: Aktuelle Modelle mit guter Instruktionstreue.
- Qwen 2.5: Vielseitige Modelle, die auch auf Deutsch gut funktionieren.
- Command R: Speziell für längere Texte und RAG-Anwendungen optimiert.
Für den Einstieg empfiehlt sich eine Q4_K_M-Quantisierung, die einen guten Kompromiss zwischen Größe, Geschwindigkeit und Qualität bietet. Mehr zur Theorie im Artikel Quantisierung.
Im Konfigurationsdialog wählst Du einfach die heruntergeladene GGUF-Datei aus. KoboldCpp erkennt die Modellarchitektur automatisch und stellt die Inferenz-Parameter entsprechend ein.
Story-Modi
KoboldCpp bietet drei Modi, die jeweils für unterschiedliche Anwendungsfälle gedacht sind.
Story Mode
Im Story Mode schreibst Du Text und das Modell führt die Erzählung weiter. Du gibst einen Absatz ein, das Modell generiert den nächsten, Du schreibst weiter, und so weiter. Dieser Modus ist ideal für kreatives Schreiben, bei dem Du die Kontrolle über die Geschichte behältst, aber das Modell die Last des eigentlichen Schreibens übernimmt.
Du kannst den generierten Text jederzeit bearbeiten, löschen oder neu generieren lassen. Das gibt Dir volle Kontrolle über den Verlauf der Geschichte.
Chat Mode
Im Chat Mode führst Du ein Gespräch mit dem Modell. Jede Nachricht hat eine Rolle wie “User”, “Assistant” oder “Character”. Dieser Modus ist nützlich, wenn Du mit einer KI-Figur interagieren möchtest, etwa für Rollenspiel-Dialoge oder Charakterentwicklung.
Du kannst mehrere Charaktere definieren, jeweils mit eigener Persönlichkeit und Stimme. Das Modell wechselt zwischen den Rollen, je nachdem, wer gerade spricht.
Adventure Mode
Im Adventure Mode agierst Du wie in einem Text-Adventure. Du beschreibst, was Dein Charakter tut, und das Modell reagiert wie ein Spielmeister, der die Welt simuliert. Dieser Modus eignet sich für solo-Rollenspiele oder interaktive Geschichten mit Spielmechaniken.
Der Adventure Mode nutzt typischerweise Modelle, die für Instruktionen trainiert wurden, da sie besser auf Aktionen reagieren und die Welt konsistent simulieren können.
World Info und Memory
World Info und Memory sind die beiden Funktionen, die KoboldCpp von einfachen Chat-Tools unterscheiden. Sie sorgen dafür, dass Deine Geschichten konsistent bleiben, auch wenn sie lang werden.
World Info einrichten
World Info-Einträge bestehen aus drei Teilen:
- Schlüsselwörter: Wörter, die den Eintrag aktivieren. Sobald eines davon im Text auftaucht, wird der Eintrag in den Context eingespeist.
- Inhalt: Der Text, der bei Aktivierung in den Context eingefügt wird. Hier beschreibst Du Figuren, Orte, Gegenstände oder Regeln.
- Priorität: Bestimmt, welche Einträge zuerst geladen werden, wenn der Context begrenzt ist.
Ein Beispiel: Du legst einen Eintrag mit dem Schlüsselwort “Eldoria” an. Als Inhalt schreibst Du: “Eldoria ist ein Königreich im Norden, bekannt für seine Bergfestungen und den Drachenorden.” Sobald “Eldoria” in Deiner Geschichte auftaucht, weiß das Modell automatisch, was es ist.
Du kannst beliebig viele Einträge anlegen. KoboldCpp verwaltet sie automatisch und fügt nur die relevanten in den Context ein.
Memory für Konsistenz
Das Memory-System speichert wichtige Ereignisse, die über den normalen Context hinausgehen. Du schreibst eine Zusammenfassung der bisherigen Handlung in das Memory-Feld, und KoboldCpp fügt sie regelmäßig in den Context ein.
Das ist besonders nützlich, wenn Deine Geschichte länger wird als der Context es zulässt. Ohne Memory würde das Modell vergessen, was am Anfang passiert ist. Mit Memory behält es den Überblick, auch nach hunderten Absätzen.
Kombiniert mit der Author’s Note, einem kurzen Text, der Stil und Ton steuert, hast Du ein mächtiges Werkzeug, um langfristig konsistente Geschichten zu schreiben.
GPU-Konfiguration
KoboldCpp nutzt die GPU-Backends von llama.cpp, darunter CUDA für Nvidia-GPUs und Metal für Apple Silicon. Im Konfigurationsdialog stellst Du ein, wie viele Layer des Modells auf die GPU ausgelagert werden.
GPU Layers: Je mehr Layer auf die GPU ausgelagert werden, desto schneller läuft die Inferenz. Der limitierende Faktor ist der VRAM. Als Faustregel gilt: Ein 7B-Modell in Q4-Quantisierung braucht etwa 4 bis 5 GB VRAM für alle Layer. Ein 13B-Modell braucht etwa 8 bis 9 GB.
CUDA (Nvidia): Wähle die CUDA-Variante beim Download, wenn Du eine Nvidia-GPU hast. Im Konfigurationsdialog gibst Du die Anzahl der GPU-Layer ein. Starte mit einem hohen Wert und reduziere, wenn der VRAM nicht ausreicht.
Metal (Apple Silicon): Auf Macs mit M1- bis M4-Chips nutzt KoboldCpp Metal für GPU-Beschleunigung. Der Unified Memory von Apple Silicon ist hier ein Vorteil, da CPU und GPU denselben Speicher nutzen. Du kannst in der Regel alle Layer auf die GPU auslagern, solange der Arbeitsspeicher ausreicht.
CPU-only: Wenn Du keine GPU hast oder nutzen möchtest, läuft KoboldCpp auch rein auf der CPU. Die Inferenz ist deutlich langsamer, aber für kreatives Schreiben, wo Du ohnehin Pausen zum Lesen und Überlegen hast, ist das oft akzeptabel. Mehr dazu im Artikel CPU vs. GPU.
KoboldCpp vs. Ollama vs. LM Studio
| Eigenschaft | KoboldCpp | Ollama | LM Studio |
|---|---|---|---|
| Zielgruppe | Rollenspieler, Autoren | Einsteiger, Entwickler | Einsteiger, visuelle Nutzer |
| Fokus | Storytelling, Rollenspiel | Dialoge, API-Nutzung | Allgemeine Inferenz |
| Oberfläche | Web-Oberfläche für Geschichten | Kommandozeile, API | Grafische Desktop-App |
| World Info | Ja, integriert | Nein | Nein |
| Memory-System | Ja, integriert | Nein | Nein |
| Story-Modi | Story, Chat, Adventure | Nur Chat | Nur Chat |
| GPU-Support | CUDA, Metal | CUDA, Metal | CUDA, Metal |
| Installation | Einzelne Datei, kein Python | Ein Befehl | Download, Drag-and-Drop |
| API | OpenAI-kompatibel | OpenAI-kompatibel | OpenAI-kompatibel |
Wann KoboldCpp: Wenn Du Rollenspiel, Storytelling oder interaktive Geschichten mit KI schreiben willst und Funktionen wie World Info und Memory brauchst.
Wann Ollama: Wenn Du schnell loslegen willst und eine saubere CLI mit API bevorzugst. Ollama ist besser für Dialoge und allgemeine Inferenz, nicht für kreatives Schreiben. Mehr im Artikel Ollama.
Wann LM Studio: Wenn Du eine grafische Oberfläche bevorzugst und Modelle per Klick herunterladen und testen willst. LM Studio ist ein Allrounder, hat aber keine Storytelling-Funktionen. Mehr im Artikel LM Studio.
Typische Stolpersteine bei KoboldCpp
1. Zu viele World Info-Einträge. Wenn Du hunderte Einträge anlegst, kann der Context überlaufen. KoboldCpp wählt zwar nach Priorität aus, aber wenn zu viele Einträge gleichzeitig aktiv sind, bleibt wenig Platz für die eigentliche Geschichte. Beschränke Dich auf die wichtigsten Einträge und nutze gezielte Schlüsselwörter.
2. Memory nicht gepflegt. Das Memory-Feld ist kein Selbstläufer. Wenn Deine Geschichte länger wird, musst Du die Zusammenfassung regelmäßig aktualisieren. Eine veraltete Memory führt zu Widersprüchen, weil das Modell auf veralteten Informationen aufbaut.
3. Falsche GPU-Layer-Anzahl. Wenn Du zu viele Layer auf die GPU legst, bricht die Inferenz mit einem Speicherfehler ab. Starte mit einem moderate Wert und erhöhe schrittweise, bis der VRAM fast voll ist. Beobachte den VRAM-Verbrauch im Task-Manager oder mit nvidia-smi.
4. Falsches Modell für den Modus. Nicht jedes Modell eignet sich für jeden Modus. Ein reines Chat-Modell funktioniert im Story Mode oft schlecht, weil es Dialoge statt Erzählungen generiert. Modelle, die für Instruktionen trainiert wurden, sind im Adventure Mode meist besser. Probiere verschiedene Modelle aus.
5. Context zu klein eingestellt. Ein zu kleiner Context führt dazu, dass das Modell den Anfang der Geschichte vergisst. Setze die Context-Größe auf mindestens 4096, besser 8192 Tokens, wenn Dein Modell und Dein RAM es zulassen. Bedenke, dass größerer Context mehr RAM benötigt.
6. Veraltete KoboldCpp-Version. KoboldCpp wird regelmäßig aktualisiert, mit neuen Funktionen und Bugfixes. Eine alte Version kann Inkompatibilitäten mit neueren GGUF-Dateien haben. Prüfe gelegentlich die Release-Seite auf GitHub und lade die aktuelle Version herunter.
7. Author’s Note zu lang. Die Author’s Note sollte kurz sein, ein bis zwei Sätze. Wenn Du sie mit langen Anweisungen füllst, verbraucht sie wertvollen Context-Platz und das Modell ignoriert sie möglicherweise. Halte sie prägnant und spezifisch.
8. Schlüsselwörter zu allgemein. Wenn Du “der” oder “und” als Schlüsselwort für einen World Info-Eintrag wählst, wird der Eintrag ständig aktiviert und verbraucht Context. Wähle spezifische Eigennamen und Begriffe, die eindeutig mit dem Eintrag verbunden sind.
Hardware, Kosten und Sicherheit bei KoboldCpp
Hardware: KoboldCpp läuft auf fast jeder Hardware, auf der auch llama.cpp läuft. Für akzeptable Performance mit 7B-Modellen brauchst Du mindestens 8 GB RAM und eine CPU mit AVX2. Eine GPU mit 8 GB VRAM ermöglicht GPU-Offloading und deutlich schnellere Inferenz. Für 13B- oder 33B-Modelle sind 16 GB bzw. 32 GB RAM bzw. VRAM empfehlenswert. Auf Macs mit Apple Silicon profitierst Du vom Unified Memory, der das Auslagern aller Layer auf die GPU erlaubt.
Kosten: KoboldCpp ist Open Source und komplett kostenlos. Die einzigen Kosten entstehen durch die Hardware, auf der Du es betreibst. Es fallen keine API-Kosten oder Abogebühren an, was einen wesentlichen Vorteil gegenüber Cloud-basierten KI-Diensten darstellt.
Sicherheit: Da KoboldCpp lokal läuft, verlassen Deine Geschichten und Daten nie Deinen Rechner. Das ist besonders relevant für kreatives Schreiben mit sensiblen Themen oder persönlichen Inhalten. Du musst keine Daten an externe Server senden. Achte trotzdem darauf, dass Modelle, die Du herunterlädst, aus vertrauenswürdigen Quellen stammen, da GGUF-Dateien theoretisch manipuliert sein könnten.
Weiterführende Links und Infos zu KoboldCpp
- KoboldCpp auf GitHub - Offizielles Repository mit Releases und Dokumentation
- KoboldCpp Releases - Download der aktuellen Versionen
- GGUF-Modelle auf Hugging Face - Große Auswahl an fertigen GGUF-Dateien
- llama.cpp - Die Inferenz-Engine, auf der KoboldCpp basiert
- Ollama - Alternative für Dialoge und API-Nutzung
- LM Studio - Grafische Desktop-App für allgemeine Inferenz
- Quantisierung - Hintergrundwissen zu GGUF und Quantisierungsstufen
- LLM lokal betreiben - Grundlagen zum lokalen Betrieb von LLMs
FAQ: KoboldCpp - Typische Fragen
Was ist KoboldCpp genau? KoboldCpp ist eine Inferenz-Engine, die auf llama.cpp basiert und um Funktionen für Rollenspiel, Storytelling und kreatives Schreiben erweitert wurde. Es wird als einzelne ausführbare Datei ausgeliefert und benötigt kein Python.
Brauche ich eine GPU für KoboldCpp? Nein. KoboldCpp läuft auch rein auf der CPU. Eine GPU beschleunigt die Inferenz erheblich, ist aber keine Voraussetzung. Für kreatives Schreiben, wo Du ohnehin Pausen hast, ist CPU-only oft akzeptabel.
Was ist der Unterschied zwischen KoboldCpp und Ollama? Ollama ist auf Dialoge und API-Nutzung ausgelegt, KoboldCpp auf Storytelling und Rollenspiel. KoboldCpp hat World Info, ein Memory-System und verschiedene Story-Modi, die Ollama fehlen. Beide nutzen llama.cpp als Inferenz-Kern.
Kann ich meine Ollama-Modelle in KoboldCpp nutzen? Ja, solange die Modelle im GGUF-Format vorliegen. KoboldCpp nutzt dasselbe Format wie llama.cpp. Du musst nur den Pfad zur GGUF-Datei im Konfigurationsdialog angeben.
Wie funktioniert World Info? World Info-Einträge bestehen aus Schlüsselwörtern und einem Text. Sobald ein Schlüsselwort in Deiner Geschichte auftaucht, wird der zugehörige Text in den Context eingespeist. So weiß das Modell automatisch, was ein Ort oder eine Figur ist, ohne dass Du es jedes Mal neu erklären musst.
Was macht die Author’s Note? Die Author’s Note ist ein kurzer Text, der regelmäßig in den Context eingefügt wird, um Stil und Ton der Geschichte zu steuern. Du kannst zum Beispiel schreiben “Schreibe in einem düsteren, atmosphärischen Stil” und das Modell passt sich an.
Welches Modell ist am besten für Rollenspiel? Das hängt von Deinen Vorlieben ab. Mistral und Llama 3 sind gute Allrounder. Command R ist für längere Texte optimiert. Probiere verschiedene Modelle aus und vergleiche die Ergebnisse. Achte darauf, dass das Modell für Instruktionen trainiert wurde, wenn Du den Adventure Mode nutzt.
Kann ich KoboldCpp in meine eigene Anwendung einbinden? Ja. KoboldCpp bietet eine OpenAI-kompatible API, die Du aus eigenen Anwendungen ansprechen kannst. Starte den Server-Modus und sende Requests an die API-Endpunkte.
Wie aktualisiere ich KoboldCpp? Lade einfach die neueste Version von der Release-Seite auf GitHub herunter und ersetze die alte Datei. Deine Einstellungen und World Info-Einträge bleiben erhalten, wenn Du sie exportierst oder die Konfigurationsdatei sicherst.
Ist KoboldCpp kostenlos? Ja, KoboldCpp ist Open Source und kostenlos. Du kannst es kostenlos nutzen, auch für kommerzielle Projekte.
Brauche ich Internet, um KoboldCpp zu nutzen? Nur für den Download von KoboldCpp selbst und von GGUF-Modellen. Die Inferenz und das Storytelling laufen vollständig offline auf Deinem Rechner.
Quellen und weiterführende Literatur
- LostRuins. (2023). KoboldCpp [Software]. GitHub. https://github.com/LostRuins/koboldcpp
- KoboldCpp Documentation. GitHub. https://github.com/LostRuins/koboldcpp/wiki
- GGUF Format Specification. Hugging Face. https://github.com/ggerganov/ggml/blob/master/docs/gguf.md
- Gerganov, G. (2023). llama.cpp [Software]. GitHub. https://github.com/ggerganov/llama.cpp
- GGUF-Modelle auf Hugging Face. https://huggingface.co/models?library=gguf


