Künstliche Intelligenz in der Verwaltung „KI bereitet vor, der Mensch entscheidet“

Ein Gastbeitrag von René Tillmann und Daniel Schaffeld 4 min Lesedauer

Anbieter zum Thema

Der Human-in-the-loop ist integraler Bestandteil beinahe jeder KI-Strategie. Doch damit wird nur die schlussendliche Verantwortung benannt. Was der Entscheider allerdings von der KI ausgespielt bekommt, ist nicht reguliert.

Daniel Schaffeld und René Tillmann entwickeln mit neo:sense ein KI-Tool, das regelgebundene Dokumente wie Verträge regelbasiert prüft und korrigiert.(Bild:  wevy.ai)
Daniel Schaffeld und René Tillmann entwickeln mit neo:sense ein KI-Tool, das regelgebundene Dokumente wie Verträge regelbasiert prüft und korrigiert.
(Bild: wevy.ai)

„KI bereitet vor, der Mensch entscheidet.“ Der titelgebende Satz klingt nach einer klaren Aufgabenteilung und genau deshalb taucht er inzwischen in beinahe jeder Digitalstrategie von Verwaltungen auf. Geklärt ist damit jedoch nur, wer am Ende verantwortlich ist, wenn etwas schiefgeht. Ungeklärt bleibt, was diese Person zu sehen bekommt, bevor sie entscheidet. Und das ist der Grund, warum der Grundsatz in der Praxis oft zu kurz greift: Er wird zur Floskel, solange niemand sagt, was er technisch voraussetzt.

Der Grundsatz, der gerade zum Standard wird

Dass trotz KI-Unterstützung am Ende ein Mensch verantwortlich bleiben soll, bestreitet niemand ernsthaft. Auch die europäische KI-Verordnung verlangt für Hochrisiko-KI-Systeme in Artikel 14 menschliche Aufsicht: Die aufsichtführende Person muss die Ausgabe „richtig interpretieren“ können, bevor sie sie übernimmt. Was der Mensch dafür konkret sehen und nachvollziehen können muss, bleibt allerdings offen.

Woran die Umsetzung in der Praxis scheitert

Viele der derzeit in Verwaltungen erprobten KI-Anwendungen sind generativ: Ein Sprachmodell liest ein Dokument oder einen Bescheidentwurf und liefert eine Einschätzung dazu, auf deren Basis ein Mensch entscheiden soll. Das Problem ist, dass die Einschätzung nur zeigt, was auffiel. Es bleibt offen, was gar nicht erst betrachtet wurde. Der Mensch in der Verantwortung hat nun zwei Optionen: Blind vertrauen, dann ist die Kontrolle jedoch reine Formsache, oder das Dokument noch einmal komplett selbst durcharbeiten, dann hätte er sich die KI sparen können. Beide Optionen sind schlecht und zeigen, dass „Der Mensch entscheidet“ mehr nach Sicherheit klingt, als es bietet, solange nicht feststeht, was geprüft wurde und was nicht.

Zwei Fallbeispiele, eine gemeinsame Lücke

Beispiele aus diesem Sommer zeigen, wie sehr diese Lücke untergeht. Bremen beschloss im August nach zehn Monaten wissenschaftlicher Begleitung durch die Universität Bremen eine KI-Strategie für die Verwaltung. Das Ziel war ein rechtsstaatlicher KI-Einsatz, ohne Anbieterabhängigkeit und mit voller Datenhoheit. All das ist richtig, doch es bleibt offen, was ein KI-System liefern muss, damit die zuständige Person das Ergebnis überhaupt prüfen kann.

Bayern macht es andersherum und will künftig ermöglichen, dass Bescheide vollautomatisch ergehen, auch bei Baugenehmigungen, Kfz-Zulassungen oder im Sozialrecht, wo bislang behördliches Ermessen eine Rolle spielte. Was das System dafür vorlegen muss, steht im Entwurf nicht. Doch Verantwortung verschwindet nicht dadurch, dass ein System an der Erstellung oder Entscheidung beteiligt ist.

Beide Ansätze klären, ob eine Maschine entscheiden darf. Was sie vorlegen muss, klärt keiner.

Was regelbasierte Prüfung von generativen Assistenten unterscheidet

Technisch lösbar wäre das Problem, unabhängig davon, wer am Ende unterschreibt. Entscheidend ist, dass jemand vorher festlegt, wonach überhaupt gesucht wird. Wie kann das aussehen?

Bei einer generativen Prüfung mit einem Sprachmodell stellt man per Prompting eine frei formulierte Frage, deren Antwort bei Wiederholung anders ausfallen kann. Bei einer regelbasierten Prüfung steht dagegen vorher schriftlich fest, was geprüft wird: Jede Regel ist in eine möglichst kleine Frage zerlegt, die sich nur mit Ja oder Nein beantworten lässt, etwa „Ist die Kündigungsfrist eingehalten?“. Hinterher zeigt ein Protokoll, welche Regel an welcher Stelle zu welchem Ergebnis führte. Drei Fragen lassen sich damit mit „Ja“ beantworten: Steht vorher fest, was als vollständig gilt? Kommt beim zweiten Durchlauf dasselbe heraus? Und bleibt das Prüfergebnis nachvollziehbar, wenn der Anbieter sein Modell austauscht?

Ein Beispiel macht das greifbar: Bei einem Förderantrag lässt sich automatisiert prüfen, ob Fristen eingehalten wurden und Pflichtunterlagen wie der Kosten- und Finanzierungsplan vollständig vorliegen – klare Ja/Nein-Fragen. Ob das Vorhaben selbst förderwürdig ist, bleibt Ermessenssache einer Fachperson.

Ein Einwand mit Lücke

Der Rechtsprofessor Mario Martini aus München kritisiert den bayerischen Entwurf, und in einem Punkt sehen wir es wie er: Um Ermessen auszuüben, genügt es nicht, aus Daten Wahrscheinlichkeiten zu berechnen. Bei einem zweiten Punkt widersprechen wir: Martini hält die Entscheidungslogik eines Systems für nicht vollständig offenlegbar, weshalb der Mensch diese Lücke schließen müsse. Für ein trainiertes Sprachmodell trifft das aus unserer Sicht zu, für ein vorab schriftlich festgelegtes Regelwerk dagegen nicht. Dort muss nicht das Modell erklärt werden, sondern die geprüfte Regel.

Jetzt Newsletter abonnieren

Wöchentlich die wichtigsten Infos zur Digitalisierung in der Verwaltung

Mit Klick auf „Newsletter abonnieren“ erkläre ich mich mit der Verarbeitung und Nutzung meiner Daten gemäß Einwilligungserklärung (bitte aufklappen für Details) einverstanden und akzeptiere die Nutzungsbedingungen. Weitere Informationen finde ich in unserer Datenschutzerklärung. Die Einwilligungserklärung bezieht sich u. a. auf die Zusendung von redaktionellen Newslettern per E-Mail und auf den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern (z. B. LinkedIn, Google, Meta).

Aufklappen für Details zu Ihrer Einwilligung

Fazit: Eine Maschine muss dokumentierbar arbeiten

Bevor eine Maschine entscheiden darf, muss klar sein, was sie vorlegen muss: Sie muss zeigen, welche Regel sie an welcher Stelle mit welchem Ergebnis geprüft hat, auch dort, wo nichts zu beanstanden war. Dafür braucht es aus unserer Sicht vor allem eine klare Vorgabe, etwa: „Der Einsatz von KI-Systemen zur Prüfung von Anträgen und Dokumenten ist nur zulässig, wenn für jede geprüfte Regel Fundstelle, Ergebnis und im Fall einer Beanstandung deren Grund dokumentiert werden.“ Denn Menschen, die eine Entscheidung verantworten, sollten wissen, was geprüft wurde und was nicht.

Die Autoren
René Tillmann ist Mitgründer der WEYV Technology GmbH aus Köln. Zuvor war er mehr als 20 Jahre im Enterprise-IT-Geschäft tätig, seit 2015 zudem Geschäftsführer der hijob GmbH.

Bildquelle: wevy.ai


Daniel Schaffeld ist Mitgründer der WEYV Technology GmbH aus Köln. Zuvor war er mehr als 15 Jahre Geschäftsführer digitaler Unternehmen, darunter sechs Jahre an der Spitze der fotocommunity GmbH.

Bildquelle: wevy.ai

(ID:50975412)