Transformando os 73 Comentários de Revisão do Chefe em um Conjunto de Dados: Criando um Gêmeo Digital de um Revisor
OpenAI
Um desenvolvedor em uma grande organização automatizou relatórios de viabilidade de TI usando um pipeline de LLM e enfrentou uma revisão com 73 comentários de seu gerente. Em vez de corrigir manualmente, eles extraíram os comentários de arquivos DOCX, agruparam-os com um LLM em 16 padrões e 6 grupos, e construíram uma lista de verificação de regras. Integrar a lista de verificação ao pipeline como uma etapa de validação separada e marcar a fonte de cada afirmação (do briefing, estimativa ou suposição) reduziu drasticamente as correções repetidas. O próximo lote de documentos passou sem comentários recorrentes.
Um funcionário de uma grande organização escreve relatórios de viabilidade técnica para projetos de IA, uma tarefa que ele automatizou com um agente de LLM que coleta documentos do projeto, extrai texto, preenche um JSON estruturado e gera um DOCX a partir de um modelo. Após submeter nove relatórios, seu gerente os devolveu com 73 comentários, muitos repetitivos e relacionados a fontes ausentes, afirmações sem suporte e contradições. Ele usou Python para extrair os comentários dos arquivos DOCX e, em seguida, um LLM agrupou os 73 comentários em 16 padrões em 6 grupos, incluindo aderência ao briefing, suporte evidencial, limites de competência, escolhas arquiteturais, profundidade das perguntas e gate de estágios. Ele identificou que quase todos os comentários eram epistemológicos — exigindo status claros das afirmações, uma vez que o LLM produz texto uniformemente confiante. Ele fez três mudanças no pipeline: marcar cada afirmação como [B] do briefing, [E] estimativa de especialista ou [D] suposição; adicionar uma lista de verificação como uma etapa separada do pipeline; e armazenar a lista de verificação na memória persistente do agente. Os quatro documentos seguintes passaram sem comentários repetidos, e apenas novos problemas substantivos permaneceram. O autor reconhece o pequeno tamanho da amostra e que o efeito se deve em parte à própria marcação da fonte, não para ignorar o revisor, mas para formalizar os padrões implícitos de qualidade do revisor.
Fonte: Habr — хаб ИИ —
original
