Eine kundenspezifische Fachanwendung aus dem Jahr 2025. Die öffentliche Darstellung bleibt bewusst abstrahiert: Auftraggeber, Dokumentinhalte, Aktenzeichen und Beträge werden nicht genannt.
Ausgangssituation
Bei der Bearbeitung eingehender Gläubigerdokumente müssen zahlreiche unterschiedliche PDF-Dokumente analysiert, klassifiziert und dem passenden Bearbeitungsprozess zugeordnet werden.
Die dafür nötigen Informationen liegen überwiegend unstrukturiert vor. Aufbau, Formulierungen und Qualität unterscheiden sich deutlich, je nachdem wer das Dokument verschickt hat. Ein Teil liegt lediglich als Scan vor.
Ziel war eine Fachanwendung, die Dokumente automatisiert aufbereitet, analysiert und die relevanten Informationen strukturiert für die Weiterverarbeitung bereitstellt.
Die Herausforderung
Eine rein regelbasierte Lösung stößt bei unterschiedlich formulierten Dokumenten schnell an Grenzen. Ein Sprachmodell für jeden einzelnen Verarbeitungsschritt einzusetzen wäre umgekehrt langsam, teuer und schlechter reproduzierbar.
Entwickelt wurde deshalb eine hybride Architektur. Je nach Aufgabe kommen klassische Softwarelogik, Mustererkennung, Sprachverarbeitung, trainierte Klassifikationsmodelle oder Sprachmodelle zum Einsatz.
Die Verarbeitungspipeline
1. Dokumentenerfassung
PDF-Dokumente werden eingelesen und für die weitere Verarbeitung vorbereitet.
2. Textextraktion und OCR
Fehlt einem Dokument eine verwertbare Textebene, werden gescannte Inhalte über Texterkennung erschlossen.
3. Regelbasierte Analyse
Eindeutig erkennbare Strukturen und bekannte Muster werden deterministisch verarbeitet. Solche Informationen lassen sich damit reproduzierbar erkennen, ohne für jeden Schritt ein Modell aufzurufen.
4. Sprachverarbeitung
Sprachverarbeitende Verfahren analysieren die Texte und identifizieren relevante sprachliche und fachliche Strukturen.
5. Entitätserkennung
Entitäten und charakteristische Informationen im Dokument werden erkannt und strukturiert aufbereitet.
6. Dokumentklassifikation
Ein trainierbares Textklassifikationsmodell unterstützt die automatische Zuordnung unterschiedlicher Dokumenttypen.
7. Analyse durch ein Sprachmodell
Für Aufgaben, die ein breiteres semantisches Verständnis erfordern, lassen sich Large Language Models einsetzen.
8. Strukturierung und Weiterverarbeitung
Die Ergebnisse der einzelnen Verfahren werden zusammengeführt. Daraus entstehen strukturierte Informationen, die die Fachanwendung oder nachgelagerte Systeme weiterverarbeiten können.
Hybride KI-Architektur
Ein wesentliches Architekturprinzip besteht darin, die Verfahren gezielt zu kombinieren. Die Verarbeitung folgt deshalb nicht dem Muster Dokument → LLM → Antwort, sondern einer kontrollierbaren Kette:
PDF / Scan → OCR → Regeln → NLP → Entitäten → Klassifikation → LLM → Fachlogik → Ergebnis
Für jeden Schritt lässt sich damit das Verfahren wählen, das hinsichtlich Genauigkeit, Reproduzierbarkeit, Geschwindigkeit und Kosten am besten passt.
Local AI und externe Modelle
Die Anwendung ist so ausgelegt, dass unterschiedliche LLM-Backends verwendet werden können. Neben externen Schnittstellen lassen sich Modelle lokal über Ollama oder LM Studio betreiben.
Damit sind verschiedene Betriebsmodelle möglich:
- vollständig lokale Verarbeitung
- Nutzung externer Schnittstellen
- Kombination lokaler und externer Modelle
- Auswahl des Modells je nach Anwendungsfall
Bei sensiblen Dokumenten eröffnet die lokale Verarbeitung eine zusätzliche Option bei der Gestaltung der System- und Datenschutzarchitektur.
Mehr als ein Prototyp
Die KI-Komponenten sind in eine vollständige Fachanwendung eingebettet. Zum System gehören unter anderem Benutzer- und Rollenverwaltung, Backend und REST-Schnittstellen, persistente Datenhaltung, Administrationsfunktionen, die Verwaltung von Trainingsdaten, konfigurierbare Erkennungsmuster, OCR-Konfiguration, konfigurierbare LLM-Backends sowie eine Weboberfläche für Bedienung und Administration.
Erst dadurch wurde aus einzelnen Verfahren eine praktisch nutzbare Anwendung.
Technologien
Backend – Python, Flask, SQLAlchemy, REST, JWT Frontend – Vue.js, Vite, Bootstrap KI und Sprachverarbeitung – spaCy, Named Entity Recognition, Textklassifikation, Machine Learning, Large Language Models Dokumentenverarbeitung – PDF-Verarbeitung, OCR, Tesseract, TrOCR LLM-Anbindung – Ollama, LM Studio, externe Schnittstellen
Ergebnis
Das Projekt zeigt, wie aus einem konkreten fachlichen Problem eine vollständige KI-gestützte Softwarelösung entsteht. Die KI wurde dabei nicht isoliert betrachtet, sondern als Bestandteil einer Gesamtarchitektur aus Dokumentenverarbeitung, Machine Learning, Fachlogik, Backend, Benutzeroberfläche und Systemintegration entwickelt.
Der Ansatz lässt sich auf andere dokumentenintensive Prozesse übertragen – etwa auf Verträge, Rechnungen, Versicherungsunterlagen oder Behördenkommunikation.
Zum fachlichen Hintergrund: KI-gestützte Softwarelösungen.