Die 73 Überprüfungskommentare des Chefs in einen Datensatz verwandeln: Erstellung eines digitalen Zwillings eines Prüfers
OpenAI
Ein Entwickler in einer großen Organisation automatisierte IT-Machbarkeitsberichte mit einer LLM-Pipeline und sah sich einer Überprüfung mit 73 Kommentaren seines Vorgesetzten gegenüber. Anstatt manuell zu korrigieren, extrahierten sie die Kommentare aus DOCX-Dateien, gruppierten sie mit einem LLM in 16 Muster und 6 Gruppen und erstellten eine Regeln-Checkliste. Die Integration der Checkliste in die Pipeline als separater Validierungsschritt und die Kennzeichnung der Quelle jeder Aussage (aus Lastenheft, Schätzung oder Annahme) reduzierten wiederholte Korrekturen drastisch. Der nächste Stapel Dokumente bestand die Überprüfung ohne wiederkehrende Kommentare.
Ein Mitarbeiter eines großen Unternehmens erstellt technische Machbarkeitsstudien für KI-Projekte – eine Aufgabe, die er mit einem LLM-Agenten automatisiert hat, der Projektdokumente sammelt, Texte extrahiert, ein strukturiertes JSON ausfüllt und ein DOCX aus einer Vorlage generiert. Nachdem er neun Berichte eingereicht hatte, gab sein Vorgesetzter sie mit 73 Kommentaren zurück, von denen viele sich wiederholten und fehlende Quellen, unbelegte Behauptungen und Widersprüche betrafen. Er extrahierte die Kommentare mit Python aus den DOCX-Dateien und ließ dann ein LLM die 73 Kommentare in 16 Muster in sechs Gruppen clustern – darunter Einhaltung des Auftrags, Belegbarkeit, Kompetenzgrenzen, architektonische Entscheidungen, Tiefe der Fragen und Phasenentscheidungen. Er stellte fest, dass fast alle Kommentare erkenntnistheoretischer Natur waren – sie verlangten eine klare Kennzeichnung des Wahrheitsstatus von Behauptungen, da das LLM einheitlich selbstbewussten Text produziert. Er nahm drei Änderungen an seiner Pipeline vor: Er kennzeichnete jede Behauptung als [B] für aus dem Auftrag, [E] für fachliche Einschätzung oder [D] für Annahme; er fügte eine Checkliste als eigenen Pipelineschritt hinzu; und er speicherte die Checkliste im dauerhaften Speicher des Agenten. Die nächsten vier Dokumente gingen ohne wiederholte Kommentare durch, und es blieben nur neue inhaltliche Punkte. Der Autor räumt ein, dass die Stichprobengröße klein ist und der Effekt teilweise auf die Quellenkennzeichnung selbst zurückzuführen ist – nicht darauf, dass sie den Prüfer umgangen, sondern dass sie dessen implizite Qualitätsstandards formalisiert.
Quelle: Habr — хаб ИИ —
Original
