智能体应用 🇷🇺 12.08.2026 01:02

把老板的73条审查意见变成数据集:打造审查者的数字孪生

OpenAIOpenAI
一位大型机构的开发者使用大语言模型(LLM)流水线自动化IT可行性报告,期间遭遇了经理的73条审查意见。他们没有逐条手动修正,而是从DOCX文件中提取这些意见,用LLM将其聚类为16种模式和6大类别,并构建了一份规则检查清单。将清单作为独立的验证步骤集成到流水线中,并标注每条陈述的来源(来自简报、估算或假设),大幅减少了重复修正。下一批文档顺利通过,没有出现重复的意见。
一家大型组织的员工负责为AI项目撰写技术可行性报告,他此前已将该任务自动化,利用LLM代理来收集项目文档、提取文本、填充结构化JSON,并从模板生成DOCX。提交九份报告后,他的经理退回了这些报告,附带了73条评论,许多评论重复,涉及来源缺失、未经证实的声明以及相互矛盾之处。他用Python从DOCX文件中提取评论,然后让LLM将73条评论归纳为6组共16个模式,包括对任务简报的遵循、证据支持、能力边界、架构选择、问题深度和阶段门控。他意识到几乎所有的评论都是认识论层面的——要求明确声明的状态,因为LLM生成的文本总是显得自信满满。他对流程做了三项调整:将每条声明标记为[B](来自简报)、[E](专家估计)或[D](假设);在流程中新增一个单独的检查清单步骤;并将检查清单存储在代理的持久内存中。接下来的四份文档没有出现重复评论,仅剩下新的实质性问题。作者承认样本量较小,且效果部分源于来源标记本身,并非利用这些标记来绕过审阅者,而是将审阅者隐含的质量标准正式化。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻