상사의 리뷰 코멘트 73개를 데이터셋으로 전환: 리뷰어의 디지털 트윈 만들기
OpenAI
대규모 조직의 한 개발자가 LLM 파이프라인을 사용하여 IT 타당성 보고서를 자동화했고, 상사로부터 73개의 코멘트가 포함된 리뷰를 받았습니다. 수동으로 수정하는 대신, DOCX 파일에서 코멘트를 추출하고 LLM으로 16개의 패턴과 6개의 그룹으로 클러스터링하여 규칙 체크리스트를 구축했습니다. 이 체크리스트를 파이프라인에 별도의 검증 단계로 통합하고, 모든 문장의 출처(브리프, 견적, 또는 가정)를 표시함으로써 반복적인 수정을 크게 줄였습니다. 다음 배치의 문서는 반복적인 코멘트 없이 통과했습니다.
대형 조직의 한 직원은 AI 프로젝트의 기술 타당성 보고서를 작성하는 일을 맡고 있다. 그는 LLM 에이전트를 이용해 이 작업을 자동화했는데, 에이전트는 프로젝트 문서를 수집하고, 텍스트를 추출하고, 구조화된 JSON을 채우고, 템플릿에서 DOCX를 생성한다. 아홉 개의 보고서를 제출한 후, 그의 관리자는 73개의 주석과 함께 보고서를 반환했다. 많은 주석은 반복적이었고, 출처 누락, 근거 없는 주장, 모순과 관련된 것이었다. 그는 Python을 사용하여 DOCX 파일에서 주석을 추출한 다음, LLM을 통해 73개의 주석을 6개 그룹의 16개 패턴으로 클러스터링했다. 여기에는 브리프 준수, 증거 지원, 역량 경계, 아키텍처 선택, 질문의 깊이, 단계 게이팅이 포함되었다. 그는 거의 모든 주석이 인식론적이라는 것을 확인했다. 즉, LLM이 균일하게 확신에 찬 텍스트를 생성하기 때문에 주장의 상태를 명확히 요구하는 것이었다. 그는 세 가지 파이프라인 변경을 수행했다: 각 주장을 [B](브리프에서), [E](전문가 추정), [D](가정)로 표시하고, 체크리스트를 별도의 파이프라인 단계로 추가하고, 에이전트의 영구 메모리에 체크리스트를 저장했다. 이후 네 개의 문서는 반복적인 주석 없이 통과되었고, 새로운 실질적인 문제만 남았다. 저자는 표본 크기가 작고, 효과가 부분적으로는 소스 표시 자체에서 비롯되며, 이를 검토자를 우회하는 데 사용하는 것이 아니라 검토자의 암묵적 품질 기준을 공식화하는 데 사용한다는 점을 인정한다.
출처: Habr — хаб ИИ —
원문
