Eine überprüfbare Aufgabe auswählen

Ein brauchbarer erster KI-Test hat eine klar benannte Eingabe und ein Ergebnis, das jemand beurteilen kann. Für ein Unternehmen könnte das die Zuordnung eingehender Anfragen zu vorhandenen Themen sein. Eine andere Möglichkeit ist die Suche in einem abgegrenzten Bestand interner Dokumente. In beiden Fällen lässt sich prüfen, ob die Unterstützung bei der täglichen Arbeit hilft.

Beschreiben Sie vor dem Test, was heute geschieht und an welcher Stelle Zeit verloren geht. Muss jemand lange suchen, unstrukturierte Texte lesen oder Informationen mehrfach übertragen? Daraus ergibt sich, welche Unterstützung Sie überhaupt brauchen. Bei einer festen Zuordnung nach Kundennummer genügt möglicherweise eine gewöhnliche Regel. KI ist vor allem dann zu prüfen, wenn Sprache oder wechselnde Inhalte eingeordnet werden müssen.

Begrenzen Sie die Folgen eines Fehlers. Für einen ersten Versuch sind Vorschläge, die eine Person vor der Verwendung prüft, leichter zu kontrollieren als selbstständig versandte Antworten oder Änderungen an Kundendaten. Die Freigabe muss im Ablauf tatsächlich stattfinden können, auch bei hohem Arbeitsaufkommen.

Den Informationsbestand vorbereiten

Für eine interne Suche müssen die zugrunde liegenden Dokumente auffindbar, lesbar und einer gültigen Fassung zugeordnet sein. Zwei widersprüchliche Anleitungen bleiben widersprüchlich, wenn eine KI sie verarbeitet. Legen Sie fest, wer Dokumente pflegt und wie ersetzte Versionen aus dem verwendeten Bestand entfernt werden.

Prüfen Sie die Zugriffsrechte vor dem Test. Eine Suchfunktion darf einem Mitarbeiter keine Inhalte erschließen, die er im ursprünglichen System nicht lesen darf. Die Anwendung muss diese Einschränkung beim Abruf berücksichtigen. Eine bloße Anweisung an das Sprachmodell ersetzt keine technische Zugriffskontrolle.

Erfassen Sie außerdem, welche Daten die eingesetzten Dienste erhalten und wie diese dort verarbeitet und aufbewahrt werden. Prüfen Sie die konkreten Vertragsbedingungen und Einstellungen des gewählten Angebots. Für einen ersten Funktionstest können anonymisierte oder eigens erstellte Beispieldaten ausreichen; vertrauliche Dokumente sollten nicht beiläufig in einen beliebigen Testzugang gelangen.

Erfolg vor der ersten Vorführung definieren

Sammeln Sie typische Aufgaben und bekannte Sonderfälle aus dem vorgesehenen Ablauf. Für eine Themenzuordnung halten fachkundige Mitarbeiter vorher fest, welche Kategorie jeweils passt und wann eine Anfrage nicht eindeutig zugeordnet werden kann. Für eine Dokumentensuche notieren sie, wo die gesuchte Information steht und welche Antwort durch den Bestand nicht gedeckt wäre.

Trennen Sie die Beispiele, mit denen Sie die Anwendung verbessern, von einem Bestand für die abschließende Prüfung. Sonst messen Sie vor allem, wie gut die Lösung an die bereits bekannten Fälle angepasst wurde. Lassen Sie bei uneindeutigen Aufgaben zunächst die beteiligten Menschen klären, was als richtig gelten soll.

Bewerten Sie Fehler nach ihren Folgen. Eine unnötige Rückfrage kann hinnehmbar sein, eine falsche Auskunft zu einer verbindlichen Zusage möglicherweise nicht. Ein selbstbewusst formulierter Text ist kein Qualitätsnachweis. Auch eine vom Modell angegebene Sicherheit sollte ohne eigene Überprüfung nicht über eine automatische Freigabe entscheiden.

  • Richtigkeit und Vollständigkeit anhand vorher festgelegter Kriterien prüfen
  • Unbelegte Aussagen und falsche Quellenzuordnungen gesondert erfassen
  • Unklare Fälle zur menschlichen Bearbeitung weitergeben
  • Bearbeitungszeit einschließlich Kontrolle und Korrekturen messen
  • Abbruchkriterien festhalten, bevor über die Einführung entschieden wird

Ausgaben und Aktionen voneinander trennen

Ein Sprachmodell kann einen Vorschlag erzeugen, ohne sofort etwas im Unternehmen zu verändern. Die Anwendung kann eine Kategorie anzeigen oder einen Text zur Prüfung ablegen. Erst nach einer Freigabe wird daraus eine Aktion, etwa die Weiterleitung einer Anfrage. Speichern Sie, wer den Vorschlag übernommen oder geändert hat.

Zusätzliche Vorsicht braucht die Verarbeitung fremder Inhalte. OWASP beschreibt unter dem Begriff Prompt Injection, wie Anweisungen in Eingaben oder Dokumenten das Verhalten eines Sprachmodells beeinflussen können. Daher sollten eingelesene Texte nicht darüber bestimmen können, auf welche Systeme die Anwendung zugreift oder welche Aktionen sie ausführt.

Beschränken Sie die verfügbaren Werkzeuge und Berechtigungen auf die Aufgabe. Prüfen Sie erzeugte Daten, bevor sie an andere Systeme übergeben werden. Bei Aktionen mit größeren Folgen sollte eine fachliche Freigabe außerhalb des Modells entscheiden. Ein passender Prompt allein bietet dafür keine ausreichende Kontrolle.

OWASP: Prompt Injection und Gegenmaßnahmen

OWASP: Funktionen und Berechtigungen von KI-Anwendungen begrenzen

Den gesamten Bearbeitungsaufwand vergleichen

Erfassen Sie neben den Gebühren für den Dienst auch die Vorbereitung der Daten, die technische Integration und die laufende Prüfung. Wenn ein Vorschlag schnell erscheint, aber lange kontrolliert werden muss, kann der gesamte Vorgang weiterhin aufwendig sein. Vergleichen Sie deshalb den bisherigen Ablauf mit der vollständigen Bearbeitung einschließlich Korrekturen.

Achten Sie auf die Art der Nacharbeit. Eine falsch gesetzte Kategorie lässt sich möglicherweise leicht ändern. Eine flüssig formulierte Antwort mit mehreren unauffälligen sachlichen Fehlern kann eine vollständige Recherche erfordern. Halten Sie solche Unterschiede im Testprotokoll fest, damit ein guter Durchschnitt einzelne problematische Fälle nicht verdeckt.

Nach dem Test eine begründete Entscheidung treffen

Dokumentieren Sie, welche Aufgaben die Lösung ausreichend erfüllt, welche Fehler auftreten und welche Fälle weiterhin manuell bearbeitet werden. Daraus folgt die Entscheidung, den Umfang zu erweitern, den Versuch anzupassen oder ihn zu beenden. Ein Test verpflichtet nicht zur Einführung.

Für den Betrieb braucht es einen Verantwortlichen für Rückmeldungen, einen Ersatzablauf bei Ausfällen und eine erneute Prüfung nach relevanten Änderungen. Dazu können ein anderes Modell, neue Anweisungen oder ein veränderter Dokumentenbestand gehören. Bewahren Sie die Testfälle auf, damit Sie die Qualität später mit denselben Maßstäben vergleichen können.

Der freiwillige NIST-Rahmen zum Umgang mit KI-Risiken kann helfen, Verantwortlichkeiten, Bewertung und laufende Kontrolle zu ordnen. Für Ihr Vorhaben sollte daraus eine kurze, benutzbare Arbeitsunterlage entstehen: Aufgabe, zulässige Daten, Prüfkriterien, Freigaben und die Person, die bei Problemen handelt.

NIST: AI Risk Management Framework