인프라 LLM 에이전트가 거짓말하지 않도록 훈련하는 방법
DeepSeek
인프라 사고 조사를 위한 읽기 전용 AI 에이전트가 구축되었습니다. 초기에는 그럴듯하지만 쓸모없는 답변을 제공했습니다. 팀은 LLM을 애플리케이션 내부로 이동하고, 도구 계약(tool contract), 증거 가드(evidence guard), 구조화된 계획을 추가하여 문제를 해결했습니다. 마지막 실행에서는 45개의 테스트 시나리오 중 44개가 통과했습니다.
내부 읽기 전용 LLM 에이전트가 '서비스가 왜 502를 반환하는가?'와 같은 인프라 질문에 답변하기 위해 구축되었습니다. 이 에이전트는 Go를 사용했고 LangChain 없이 개발되었으며, DeepSeek-V4-Flash와 Qwen3.6-27B-FP8 모델을 OpenAI 호환 API를 통해 호출했습니다. 첫 번째 버전은 자유로운 ReAct 루프를 사용했으며, 형식적으로는 정확하지만 종종 오해를 불러일으키는 답변을 생성했습니다. 예를 들어, 프록시에서 과도하게 큰 응답 헤더로 인해 502 오류가 발생했을 때, 에이전트는 '애플리케이션 수준에서 오류 없음'이라고 결론을 내려 실제 원인을 놓쳤습니다. 잘못된 범위, 잘못된 시간 의미론, 잘못된 부정 결론, 증거 손실, 통제되지 않은 재계획의 다섯 가지 오류 클래스가 식별되었습니다. 해결책은 LLM을 엄격한 애플리케이션 프레임워크 내에 내장하는 것이었습니다. 도구 호출은 증거, 출력 종류, 신선도, 부정 의미론, 읽기 전용 상태를 정의하는 확장 계약 x-agent에 의해 관리됩니다. 플래너는 먼저 목표(예: symptom.http_502, route.edge_to_ingress)와 중지 조건을 수립합니다. 모든 필수 목표가 해결되거나 명시적으로 사용 불가능해야 합니다. 증거 가드는 모든 목표가 충족되기 전에 최종화자가 결론을 내리지 못하도록 방지합니다. 도구 선택은 단계적으로 이루어집니다: 정책 필터, 어휘 사전 필터, LLM 재순위화(상위 8개), 그 다음 목표 관련성 게이트입니다. 위험한 의도는 결정론적 사전 경로를 가집니다. 최종 평가에서는 45개 시나리오 중 44개가 통과했으며(29개 필수 시나리오는 모두 통과), 각각 두 번씩 실행되었습니다. 유일하게 실패한 테스트는 선택적 용량 보고서 형식이었습니다. 에이전트는 읽기 전용 상태를 유지하며, 프로덕션 변경 사항에 대한 결정은 사람이 내립니다.
출처: Habr — хаб ИИ —
원문
