Zum Inhalt springen

← Alle Projekte

In Entwicklung

Baitz Substrakt

Dokumentenextraktion, die den Betrieb nicht verlässt: vollständig lokal, auf normaler Hardware, ohne GPU.

Das Problem

Die häufigste Frage bei KI-Projekten ist nicht, ob KI funktioniert, sondern wohin die Daten dabei fließen. Für Belege, Verträge und Patientendokumente ist die ehrlichste Antwort oft: Sie dürfen das Haus nicht verlassen.

Der Ansatz

Substrakt ist eine Desktop-Anwendung, die Dokumente vollständig lokal verarbeitet. Entscheidend ist, wie das durchgesetzt wird: nicht per Konfigurationsschalter, der sich unbemerkt umgehen ließe, sondern technisch. Jeder ausgehende Netzwerkzugriff läuft durch genau eine Stelle im Code. Das Frontend hat keinen HTTP-Client, der Verarbeitungsdienst keine Netzwerkbibliothek, und drei Prüfungen in der CI setzen das bei jedem Commit durch. Diese Prüfung ist negativ getestet: Ein testweise eingebauter Netzwerkaufruf lässt den Build nachweislich scheitern.

  • Drei Prozesse, eine Richtung: React-Frontend, Rust-Shell als Nadelöhr, Python-Sidecar auf localhost mit Sitzungstoken.
  • Gemessen statt versprochen: 12 bis 16 ms je PDF-Seite mit Text-Layer, gegen ein Budget von 100 ms.
  • Zielhardware ist ein normales Notebook mit 16 GB RAM, keine GPU, kein Serverschrank.
  • Ehrliches Fehlverhalten: Ein Bild ohne OCR meldet sich als „kein Text“, statt eine leere Extraktion als Erfolg auszugeben.

Stand

In Entwicklung, Stufe 1 von 3 abgeschlossen: Laden, Anzeigen und Indizieren von PDF, Excel und Bildern funktionieren und sind gemessen. Die automatische Feldextraktion und die Anbindung eines lokalen Sprachmodells folgen als nächste Stufen. Ich zeige lieber einen belegbaren Zwischenstand als ein fertiges Produkt zu versprechen.