エージェントアプリケーション 🇷🇺 12.08.2026 01:02

上司のレビュー指摘73件をデータセット化:レビュアーのデジタルツインを作る

OpenAIOpenAI
大手組織の開発者が、LLMパイプラインを使用してIT実現可能性レポートを自動化し、上司から73件のレビューコメントを受けた。手動で修正する代わりに、DOCXファイルからコメントを抽出し、LLMで16パターンと6グループにクラスタリングして、ルールチェックリストを作成した。チェックリストをパイプラインに独立した検証ステップとして統合し、すべてのステートメントの出所(ブリーフ、見積もり、または仮定から)をマークすることで、繰り返しの修正が大幅に減少した。次のバッチのドキュメントは、繰り返しのコメントなしで通過した。
ある大規模組織の従業員が、AIプロジェクトの技術的実現可能性レポートを作成している。彼はこの作業を、プロジェクト文書を収集し、テキストを抽出し、構造化されたJSONを埋め、テンプレートからDOCXを生成するLLMエージェントで自動化していた。9件のレポートを提出した後、上司から73件のコメントが返却された。その多くは繰り返しであり、出典の欠落、裏付けのない主張、矛盾に関連していた。彼はPythonを使用してDOCXファイルからコメントを抽出し、LLMに73件のコメントを6つのグループの16パターンにクラスタリングさせた。これには、依頼内容の遵守、証拠の裏付け、能力の境界、アーキテクチャの選択、質問の深さ、ステージゲートが含まれる。彼は、ほぼすべてのコメントが認識論的なものであり、主張の明確なステータスを要求していることを特定した。LLMは一様に自信に満ちたテキストを生成するからだ。彼はパイプラインに3つの変更を加えた。各主張に[B](依頼事項から)、[E](専門家の見積もり)、[D](仮定)のマークを付けること、チェックリストを別のパイプラインステップとして追加すること、チェックリストをエージェントの永続メモリに保存することである。次の4つの文書は、繰り返しのコメントなしで通過し、新しい実質的な問題のみが残った。著者は、サンプルサイズが小さく、効果の一部はソースのマーキング自体によるものであり、レビュアーを迂回するためではなく、レビュアーの暗黙の品質基準を形式化するためであることを認めている。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース