AgentenToepassingen 🇷🇺 12.08.2026 01:02

73 beoordelingsopmerkingen van de baas omzetten in een dataset: een digitale tweeling van een beoordelaar creëren

OpenAIOpenAI
Een ontwikkelaar bij een grote organisatie automatiseerde IT-haalbaarheidsrapporten met behulp van een LLM-pijplijn en kreeg te maken met een beoordeling met 73 opmerkingen van hun manager. In plaats van handmatig te corrigeren, haalden ze de opmerkingen uit DOCX-bestanden, groepeerden ze met een LLM in 16 patronen en 6 groepen, en bouwden een regelschecklist. Het integreren van de checklist in de pijplijn als een aparte validatiestap en het markeren van de bron van elke verklaring (uit de briefing, schatting of aanname) verminderde herhaalde correcties drastisch. De volgende batch documenten ging zonder terugkerende opmerkingen.
Een medewerker van een grote organisatie schrijft technische haalbaarheidsrapporten voor AI-projecten, een taak die hij had geautomatiseerd met een LLM-agent die projectdocumenten verzamelt, tekst extraheert, een gestructureerde JSON invult en een DOCX genereert op basis van een sjabloon. Na het indienen van negen rapporten stuurde zijn manager ze terug met 73 opmerkingen, waarvan veel repetitief en gerelateerd aan ontbrekende bronnen, ongegronde beweringen en tegenstrijdigheden. Hij gebruikte Python om opmerkingen uit de DOCX-bestanden te extraheren en liet vervolgens een LLM de 73 opmerkingen clusteren in 16 patronen verdeeld over 6 groepen, waaronder naleving van de opdracht, bewijskracht, competentiegrenzen, architectuurkeuzes, diepgang van vragen en fasering. Hij constateerde dat bijna alle opmerkingen epistemologisch waren — ze eisten een duidelijke status van beweringen, omdat de LLM uniform zelfverzekerde tekst produceert. Hij bracht drie wijzigingen aan in de pijplijn: het markeren van elke bewering als [B] van de opdracht, [E] expertschatting of [D] aanname; het toevoegen van een checklist als aparte stap in de pijplijn; en het opslaan van de checklist in het permanente geheugen van de agent. De volgende vier documenten werden goedgekeurd zonder herhaalde opmerkingen, en alleen nieuwe inhoudelijke punten bleven over. De auteur erkent de kleine steekproef en dat het effect gedeeltelijk voortkomt uit de bronmarkering zelf, niet om de reviewer te omzeilen, maar om de impliciete kwaliteitsnormen van de reviewer te formaliseren.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws