Enterprise-KI verständlich, prüfbar und vertrauenswürdig machen.
Organisationen verarbeiten täglich Tausende Verträge, Rechnungen und Berichte. Maschinelles Lernen extrahiert die strukturierten Informationen in Sekunden — doch Fachanwender brauchen Sicherheit, bevor sie auf dieser Grundlage handeln. Die Herausforderung war nicht, ein klügeres Modell zu bauen. Sie bestand darin, einen Ablauf zu gestalten, der Menschen hilft, KI-generierte Informationen schnell zu prüfen, ihre Herkunft zu verstehen und sie bei Bedarf souverän zu korrigieren.
Auf einen Blick
- Auftraggeber
- PwC — Enterprise-Plattform für Dokumentenintelligenz
- Rolle
- Product Design, UX-Strategie, Interaction Design, Prototyping — gemeinsam mit Produktmanagern und Machine-Learning-Engineers. Mein Part: der Prüfablauf von Anfang bis Ende — die Verknüpfung mit Belegen, die Darstellung von Unsicherheit und die Korrekturschleife.
- Das Problem
- Die Nutzer prüften sogar Vorhersagen mit hoher Konfidenz von Hand nach. Der Engpass war nicht die Modellgenauigkeit, sondern die Überprüfung.
- Die Entscheidung
- Den gesamten Ablauf um eine Frage herum gestalten — „Warum hat die KI diese Vorhersage getroffen?“ Belege eine Interaktion entfernt. Unsicherheit sichtbar. Korrekturen fließen ins Training.
- Das Ergebnis
- Die Überprüfung war nicht länger der langsamste Teil des Ablaufs — Details unterliegen der Vertraulichkeit.
Die Dokumente meiner Auftraggeber sind vertraulich — so arbeite ich in regulierten Organisationen. Die Demo unten ist eine originalgetreue Rekonstruktion des Interaktionsmodells — mit fiktiven Daten.
Die Überlegungen sind echt; die Rechnung ist es nicht.
01 — Das Produkt
Eine Plattform, die Geschäftsdokumente liest, damit niemand sie selbst lesen muss.
Das Modell ist vortrainiert und lernt aus jeder Korrektur weiter. Statt jede Seite von Hand zu lesen, erhalten die Nutzer vorhergesagte Werte — und bevor diese Werte in nachgelagerte Geschäftssysteme fließen, prüft und genehmigt sie ein Mensch. Dieser Mensch ist der eigentliche Nutzer des Produkts — und sein Vertrauen ist das eigentliche Feature.
02 — Die Herausforderung
Die Nutzer misstrauten der KI nicht, weil sie Fehler machte.
Sie misstrauten ihr, weil sie nicht schnell prüfen konnten, ob eine Vorhersage stimmte. Selbst Vorhersagen mit hoher Konfidenz wurden von Hand mit dem Originaldokument abgeglichen. Dieselbe Schleife, in jeder Prüfsitzung:
- Den extrahierten Wert lesen. Das Dokument durchsuchen. Den passenden Satz finden.
- Die Vorhersage bestätigen. Zurück zur Liste der Extraktionen.
- Wiederholen — bei einem Dokument mit Dutzenden Feldern.
Dieses ständige Umschalten wurde zum langsamsten Teil des Ablaufs. Das Problem war nicht die Genauigkeit. Es war die Überprüfung.
Das Designziel war deshalb, den Aufwand für die Antwort auf eine einzige einfache Frage zu senken — und für nichts anderes:
„Warum hat die KI diese Vorhersage getroffen?“
03 — Designentscheidung 01
Jede Vorhersage an ihrer Quelle festmachen.
Niemand muss mehr lange Dokumente durchsuchen: Wird ein extrahierter Wert ausgewählt, hebt die Oberfläche sofort die zugehörige Stelle im Dokument hervor. Vorhersage und Beleg bleiben gleichzeitig sichtbar — statt nach Informationen zu jagen, prüfen die Nutzer sie einfach. In der Demo unten stecken alle drei Designentscheidungen. Versuchen Sie, die Liste abzuarbeiten:
1 automatisch freigegeben · 4 offen zur Prüfung
Rechnung_2025-0417_Nordwind.pdf
Rechnung ausgestellt von , Hamburg, für im Februar 2025 erbrachte Fracht- und Lagerleistungen.
Rechnungsnummer: .
Rechnungsdatum: — zahlbar innerhalb von 14 Tagen.
Der zu zahlende Gesamtbetrag beträgt inkl. MwSt.
Extrahierte Werte
Automatisch freigegeben — Modell und Dokument stimmen überein.
Beleg im Dokument hervorgehoben.
Beleg im Dokument hervorgehoben.
Beleg im Dokument hervorgehoben.
Im Dokument steht: „Nordwind Logistics GmbH“
Wert auswählen ↔ Quelle sehen. Die Konfidenz entscheidet, wie viel Aufmerksamkeit ein Wert verlangt — und Korrekturen fließen ins Training zurück.
04 — Designentscheidung 02
Unsicherheit sichtbar machen.
Ein Konfidenzwert allein hilft selten dabei, zu entscheiden, worauf man sich konzentrieren soll. Deshalb setzt die Oberfläche auf visuelle Priorität — sie lenkt die Aufmerksamkeit auf die Vorhersagen, bei denen menschliches Urteil am meisten zählt, und lässt die sicheren Werte still durchlaufen.
Läuft still durch
Modell und Dokument stimmen überein — freigegeben, ohne dass ein Mensch je hinschauen muss.
Einen Blick wert
Plausibel, aber nicht sicher — für einen kurzen Blick hervorgehoben.
Bestätigung erforderlich
Das Modell ist unsicher — genau hier zählt menschliches Urteil am meisten.
Was jede Vorhersage von einem Menschen verlangt — Beispielwerte aus der Demo oben; die Oberfläche zeigt Priorität, nicht Rohwerte.
Statt die Nutzer einen Wert deuten zu lassen, sagt die Oberfläche: Dieser hier verdient Ihre Aufmerksamkeit — und lässt die sicheren Werte still durchlaufen.
05 — Designentscheidung 03
Korrekturen zum Teil des Lernprozesses machen.
Die Prüfung ist nicht das Ende des Ablaufs. Sie ist der Weg, auf dem das Modell besser wird. Ist eine Vorhersage falsch, aktualisieren die Nutzer den Wert, während der ursprüngliche Beleg erhalten bleibt — Sie haben es in der Demo getan, als Sie Nordwind in Nordwind Logistics GmbH korrigiert haben. Die Korrektur bleibt mit dem Dokument verknüpft: hochwertiges Feedback für künftiges Training, ohne den Arbeitsfluss je zu unterbrechen. Korrigieren fühlt sich an wie Prüfen, nicht wie Debugging.
06 — Designprinzipien
Vier Prinzipien leiteten jede Interaktion.
- Jede Vorhersage sollte erklärbar sein.
- Belege sollten immer nur eine Interaktion entfernt sein.
- Die Oberfläche sollte Aufmerksamkeit lenken, statt sie zu fordern.
- Korrigieren sollte sich wie Prüfen anfühlen — nicht wie Debugging.
07 — Ergebnis
Statt Menschen zu bitten, der KI zu vertrauen, gibt ihnen das Produkt die Mittel, sie zu überprüfen.
Indem die Oberfläche das Umschalten reduziert, jede Vorhersage mit ihrer Quelle verbindet und Unsicherheit handhabbar macht, wird die Prüfung schneller, verständlicher und besser geeignet für Enterprise-Umgebungen, in denen Genauigkeit eine Haftungsfrage ist, keine Geschmacksfrage. Interaktionsdesign kann komplexe KI-Systeme transparent wirken lassen — nicht, indem es Unsicherheit verbirgt, sondern indem es Menschen die Informationen gibt, die sie für sichere Entscheidungen brauchen.
Konkrete Zahlen unterliegen der Vertraulichkeit — das Prüfmodell oben ist der Teil, der sich übertragen lässt.
Rückblick
Früher hielt ich Vertrauen in KI für ein Problem der Modellqualität.
Ist es aber nicht. Vertrauen entsteht aus Nachprüfbarkeit, nicht aus Behauptungen — und eine KI zu korrigieren, sollte sich anfühlen wie das Prüfen eines Dokuments, nicht wie das Debuggen von Software.
Ihre KI trifft auf Menschen, die sich keine falsche Antwort leisten können?
Dann ist der Prüfablauf das Produkt. Ich gestalte die Prüfschleife — Belege, Unsicherheit, Korrektur — als funktionierenden Prototyp, den Ihre echten Prüfer testen können, bevor das Modell live geht. Nirgends lässt sich Vertrauen günstiger gewinnen als vor dem Launch.