[ CASE STUDY // APPLIED AI ]

KI-gestützte Dokumentenanalyse und Prozesssteuerung

Hybride Verarbeitungskette aus Texterkennung, Regeln, Sprachverarbeitung, Klassifikation und Sprachmodellen – als kundenspezifische Fachanwendung umgesetzt.

Hybride KI-Verarbeitungspipeline

Ein Dokument durchläuft neun aufeinander folgende Stufen: PDF oder Scan, Texterkennung, regelbasierte Analyse, Sprachverarbeitung, Entitätserkennung, Klassifikation, Analyse durch ein Sprachmodell, Fachlogik und strukturiertes Ergebnis. Das Ergebnis geht anschließend über eine Schnittstelle an das Fachverfahren.

  1. 01 PDF / SCAN
  2. 02 OCR
  3. 03 REGELN
  4. 04 NLP
  5. 05 ENTITÄTEN
  6. 06 KLASSIFIKATION
  7. 07 LLM
  8. 08 FACHLOGIK
  9. 09 ERGEBNIS

FACHVERFAHREN · API

Eine kundenspezifische Fachanwendung aus dem Jahr 2025. Die öffentliche Darstellung bleibt bewusst abstrahiert: Auftraggeber, Dokumentinhalte, Aktenzeichen und Beträge werden nicht genannt.

Ausgangssituation

Bei der Bearbeitung eingehender Gläubigerdokumente müssen zahlreiche unterschiedliche PDF-Dokumente analysiert, klassifiziert und dem passenden Bearbeitungsprozess zugeordnet werden.

Die dafür nötigen Informationen liegen überwiegend unstrukturiert vor. Aufbau, Formulierungen und Qualität unterscheiden sich deutlich, je nachdem wer das Dokument verschickt hat. Ein Teil liegt lediglich als Scan vor.

Ziel war eine Fachanwendung, die Dokumente automatisiert aufbereitet, analysiert und die relevanten Informationen strukturiert für die Weiterverarbeitung bereitstellt.

Die Herausforderung

Eine rein regelbasierte Lösung stößt bei unterschiedlich formulierten Dokumenten schnell an Grenzen. Ein Sprachmodell für jeden einzelnen Verarbeitungsschritt einzusetzen wäre umgekehrt langsam, teuer und schlechter reproduzierbar.

Entwickelt wurde deshalb eine hybride Architektur. Je nach Aufgabe kommen klassische Softwarelogik, Mustererkennung, Sprachverarbeitung, trainierte Klassifikationsmodelle oder Sprachmodelle zum Einsatz.

Die Verarbeitungspipeline

1. Dokumentenerfassung

PDF-Dokumente werden eingelesen und für die weitere Verarbeitung vorbereitet.

2. Textextraktion und OCR

Fehlt einem Dokument eine verwertbare Textebene, werden gescannte Inhalte über Texterkennung erschlossen.

3. Regelbasierte Analyse

Eindeutig erkennbare Strukturen und bekannte Muster werden deterministisch verarbeitet. Solche Informationen lassen sich damit reproduzierbar erkennen, ohne für jeden Schritt ein Modell aufzurufen.

4. Sprachverarbeitung

Sprachverarbeitende Verfahren analysieren die Texte und identifizieren relevante sprachliche und fachliche Strukturen.

5. Entitätserkennung

Entitäten und charakteristische Informationen im Dokument werden erkannt und strukturiert aufbereitet.

6. Dokumentklassifikation

Ein trainierbares Textklassifikationsmodell unterstützt die automatische Zuordnung unterschiedlicher Dokumenttypen.

7. Analyse durch ein Sprachmodell

Für Aufgaben, die ein breiteres semantisches Verständnis erfordern, lassen sich Large Language Models einsetzen.

8. Strukturierung und Weiterverarbeitung

Die Ergebnisse der einzelnen Verfahren werden zusammengeführt. Daraus entstehen strukturierte Informationen, die die Fachanwendung oder nachgelagerte Systeme weiterverarbeiten können.

Hybride KI-Architektur

Ein wesentliches Architekturprinzip besteht darin, die Verfahren gezielt zu kombinieren. Die Verarbeitung folgt deshalb nicht dem Muster Dokument → LLM → Antwort, sondern einer kontrollierbaren Kette:

Text
PDF / Scan → OCR → Regeln → NLP → Entitäten → Klassifikation → LLM → Fachlogik → Ergebnis

Für jeden Schritt lässt sich damit das Verfahren wählen, das hinsichtlich Genauigkeit, Reproduzierbarkeit, Geschwindigkeit und Kosten am besten passt.

Local AI und externe Modelle

Die Anwendung ist so ausgelegt, dass unterschiedliche LLM-Backends verwendet werden können. Neben externen Schnittstellen lassen sich Modelle lokal über Ollama oder LM Studio betreiben.

Damit sind verschiedene Betriebsmodelle möglich:

  • vollständig lokale Verarbeitung
  • Nutzung externer Schnittstellen
  • Kombination lokaler und externer Modelle
  • Auswahl des Modells je nach Anwendungsfall

Bei sensiblen Dokumenten eröffnet die lokale Verarbeitung eine zusätzliche Option bei der Gestaltung der System- und Datenschutzarchitektur.

Mehr als ein Prototyp

Die KI-Komponenten sind in eine vollständige Fachanwendung eingebettet. Zum System gehören unter anderem Benutzer- und Rollenverwaltung, Backend und REST-Schnittstellen, persistente Datenhaltung, Administrationsfunktionen, die Verwaltung von Trainingsdaten, konfigurierbare Erkennungsmuster, OCR-Konfiguration, konfigurierbare LLM-Backends sowie eine Weboberfläche für Bedienung und Administration.

Erst dadurch wurde aus einzelnen Verfahren eine praktisch nutzbare Anwendung.

Technologien

Backend – Python, Flask, SQLAlchemy, REST, JWT Frontend – Vue.js, Vite, Bootstrap KI und Sprachverarbeitung – spaCy, Named Entity Recognition, Textklassifikation, Machine Learning, Large Language Models Dokumentenverarbeitung – PDF-Verarbeitung, OCR, Tesseract, TrOCR LLM-Anbindung – Ollama, LM Studio, externe Schnittstellen

Ergebnis

Das Projekt zeigt, wie aus einem konkreten fachlichen Problem eine vollständige KI-gestützte Softwarelösung entsteht. Die KI wurde dabei nicht isoliert betrachtet, sondern als Bestandteil einer Gesamtarchitektur aus Dokumentenverarbeitung, Machine Learning, Fachlogik, Backend, Benutzeroberfläche und Systemintegration entwickelt.

Der Ansatz lässt sich auf andere dokumentenintensive Prozesse übertragen – etwa auf Verträge, Rechnungen, Versicherungsunterlagen oder Behördenkommunikation.

Zum fachlichen Hintergrund: KI-gestützte Softwarelösungen.

Technische Ausgangslage besprechen