测试中的AI Agent:强大结果源自工程回路而非提示词
National Institute of Standards and Technology
International Organization for Standardization
IEEE
International Software Testing Qualifications Board
提出了一种测试中AI Agent的方法论,摆脱了对提示词和模型的依赖。工程回路包括强制性规则、确定性执行器和预期结果的显式模型,确保结果可验证、可复现且有用。
文章描述了一种构建测试用AI智能体的方法,该方法不依赖理想输入数据或模型生成的猜测。相反,智能体会收集可用证据、构建明确的验收模型、通过多种独立手段(应用程序编程接口、数据库、用户界面)进行验证、记录知识边界,并将最终决策留给人类。工程回路包括场景技能、安全规则、项目配置、确定性执行器和证据链。关键测试方法论包括:基于风险的测试(优先测试关键模块)、探索性测试(在需求不完整的情况下工作)、利用独立预言机(预先制定的可观察期望)进行验收准则测试、系统/集成思维(追踪状态链)以及边界分类(不因相邻未完成任务而惩罚当前任务)。文章强调,智能体响应的质量不取决于模型,而取决于验证回路。
来源: Habr — хаб ИИ —
原文
