Skip to content
BotServBotServ
Stirling-PDFPDFOCRSelf-HostingDockerOpen SourceDokumente

Stirling-PDF self-hosted: PDF-Werkzeugkasten im Browser

Stirling-PDF self-hosten: PDFs mergen, splitten, OCR, konvertieren, lokal und DSGVO-freundlich. Docker-Setup, n8n-Integration und Praxisbeispiele.

S

schutzgeist

3 min read
Stirling-PDF self-hosted

Stirling-PDF self-hosted: PDF-Werkzeugkasten im Browser

Was dieser Artikel behandelt

  • Was Stirling-PDF ist und warum es die wichtigste self-hosted PDF-Lösung ist.
  • Docker-Setup in 5 Minuten.
  • Die über 50 Werkzeuge im Überblick, mit Fokus auf die, die Du wirklich brauchst.
  • Integration in Workflows (n8n, OCR für Paperless) und lokale KI-Pipelines.
  • Konfiguration, Sicherheit und Praxisbeispiele.

Einleitung

PDFs mergen, splitten, signieren, OCRen, komprimieren, dafür benutzen die meisten Online-Dienste wie iLovePDF oder SmallPDF. Dabei gehen Deine Dokumente an Dritte. Stirling-PDF ist die self-hosted Antwort: ein kompletter PDF-Werkzeugkasten als Web-App, Open Source (GPL), ein Docker-Container, keine Daten verlassen Deinen Server.

Für BotServ-Nutzer ist Stirling-PDF besonders relevant: Es ist die Brücke zwischen Dokumenten-Workflows und lokaler KI: OCR für RAG-Pipelines, PDF-Bearbeitung in n8n-Workflows, automatisierte Dokumentenverarbeitung.

Typische Anwendungsszenarien

  • Dokumente für RAG vorbereiten: Scans OCRen, dann an die Embedding-Pipeline → Lokales RAG.
  • Paperless-ngx ergänzen: Stirling-PDF als flexible PDF-Werkbank neben dem DMS, siehe Paperless-ngx.
  • Automatisierte Workflows: n8n ruft Stirling-PDF-API: eingehende Mail-PDFs komprimieren, OCRen, weiterverarbeiten.
  • Firmen-Dokumente: Rechnungen, Verträge bearbeiten, ohne Upload zu iLovePDF.
  • PDF-Formulare: Ausfüllen, flatten, signieren, lokal.

Installation: Docker in 5 Minuten

# docker-compose.yml
services:
  stirling-pdf:
    image: stirlingtools/stirling-pdf:latest
    container_name: stirling-pdf
    ports:
      - "127.0.0.1:8080:8080"
    volumes:
      - ./configs:/configs
      - ./logs:/logs
    environment:
      - DOCKER_ENABLE_SECURITY=false      # für internes Netz
      - LANGS=deu,eng                     # Tesseract-Sprachen für OCR
      - SYSTEM_DEFAULTLOCALE=de-DE
    restart: always
docker compose up -d

Fertig, unter http://localhost:8080 läuft die Web-UI. Für externen Zugriff: Reverse Proxy + Auth (siehe Sicherheit).

Die wichtigsten Werkzeuge

Über 50 Funktionen, die Kernaussage: alles was iLovePDF kann, lokal.

KategorieWerkzeugePraxis-Nutzen
OrganisierenMerge, Split, Rotate, Reorder, Remove PagesDokumente zusammensetzen
KonvertierenPDF↔Word/Bilder/HTML/MarkdownImport/Export-Pipelines
OCRTesseract-basiertScans durchsuchbar machen (Input für RAG!)
SicherheitSignieren, Wasserzeichen, Passwort, SanitizeFirmen-Dokumente schützen
OptimierenKomprimieren, FlattenE-Mail-Versand, Archiv
BilderBild↔PDF, FarbanpassungScan-Nachbearbeitung

Praxisbeispiel: OCR-Pipeline für RAG

Der Workflow, der Stirling-PDF zum KI-Baustein macht:

Scan-PDF (nur Bild, kein Text)
    │
    ▼
Stirling-PDF /api/v1/convert/ocr/pdf
    │ (Tesseract deu)
    ▼
Durchsuchbares PDF
    │
    ▼
Text extrahieren → Chunking → Embeddings → Qdrant
    │
    ▼
RAG-Chatbot beantwortet Fragen zu den Dokumenten

API-Aufruf aus Python:

import requests

with open("scan.pdf", "rb") as f:
    r = requests.post(
        "http://stirling-pdf:8080/api/v1/convert/ocr/pdf",
        files={"fileInput": f},
        data={"languages": "deu", "sidecar": "false", "ocrRenderType": "hocr"},
    )
with open("scan_ocred.pdf", "wb") as f:
    f.write(r.content)

n8n-Integration

Stirling-PDF hat eine REST-API, n8n ruft sie per HTTP-Request-Node:

Trigger (E-Mail mit PDF)
    │
    ▼
HTTP Request → POST /api/v1/convert/ocr/pdf
    │
    ▼
HTTP Request → POST /api/v1/convert/pdf/text
    │
    ▼
Code-Node: Text chunken
    │
    ▼
Ollama-Embeddings → Qdrant

Siehe n8n für die n8n-Grundlagen.

Konfiguration

settings.yml im configs-Mount, die wichtigsten Optionen:

security:
  enableLogin: true        # Login einschalten für externen Zugriff

system:
  defaultLocale: de-DE
  maxFileSize: 100MB
  enableUrlToPDF: false    # Sicherheit: keine URL-Fetches

ui:
  appName: "Mein PDF-Tool"
  homeDescription: "Lokale PDF-Werkbank"

enterprise:
  enabled: false           # Pro-Features brauchen Lizenz; Community reicht meist

Sicherheit

  • Login einschalten (enableLogin: true) wenn der Dienst nicht nur localhost ist, sonst kann jeder im Netz Deine PDFs nutzen.
  • Internal only: Auf demselben Host wie Paperless/n8n → 127.0.0.1:8080 Binding reicht.
  • Sanitize: Stirling kann PDFs von Scripts/Metadaten bereinigen, gut bei Eingangs-Dokumenten.
  • Dateigrößen-Limit: Gegen DoS auf Shared-Servern.

Stirling-PDF vs. Alternativen

ToolStärkeSchwäche
Stirling-PDFVollständige PDF-Werkbank, API, aktiv gepflegtJava (schwerer als nötig)
Paperless-ngxDokumenten-Management mit KI-TaggingKein PDF-Editor
PDF-Toolbox/CUPSMinimalKein Web-UI
iLovePDF etc.Kein SetupDaten an Dritte

Key Takeaways:

  • Stirling-PDF = self-hosted iLovePDF: 50+ PDF-Werkzeuge im Browser.
  • Ein Docker-Container, REST-API, keine Daten raus.
  • Killer-Use-Case: OCR für Scans → Input für RAG/Paperless.
  • n8n-Integration macht es zum Automatisierungs-Baustein.
  • Login einschalten wenn nicht nur localhost.

FAQ

Ist Stirling-PDF kostenlos?

Ja, Open Source (GPL). Es gibt eine Enterprise-Version mit SSO und Advanced Features, für die meisten reicht die Community-Edition komplett.

Kann Stirling-PDF OCR auf Deutsch?

Ja: Tesseract unterstützt deu. In docker-compose LANGS=deu,eng setzen, dann OCR mit deutscher Spracherkennung.

Hat es eine API?

Ja, eine vollständige REST-API unter /api/v1/, damit ist Stirling-PDF ein Baustein für n8n-Workflows und eigene Skripte.

Stirling-PDF oder Paperless-ngx?

Verschiedene Zwecke: Paperless ist ein DMS (Ablage, Tagging, Suche). Stirling-PDF ist ein PDF-Werkzeugkasten (Editieren, OCR, Konvertieren). Beide zusammen sind stark: Paperless archiviert, Stirling bearbeitet.

Wie viele Ressourcen braucht es?

Java-App: ~500 MB bis 1 GB RAM im Leerlauf, mehr bei OCR-Läufen. Läuft problemlos neben anderen Diensten auf einem Mini-PC.

Mehrere Benutzer?

Ja, mit Login aktiviert gibt es Benutzerkonten und Rollen. Ohne Login ist es ein Single-User-Tool.

Quellen und weiterführende Literatur

Zurück zum KI Blog
Share:

Ähnliche Beiträge