Cách huấn luyện tác nhân LLM hạ tầng không nói dối
DeepSeek
Một tác nhân AI chỉ-đọc cho điều tra sự cố hạ tầng đã được xây dựng. Ban đầu, nó đưa ra các câu trả lời có vẻ hợp lý nhưng vô ích. Nhóm đã giải quyết vấn đề bằng cách đưa LLM vào bên trong ứng dụng, thêm hợp đồng công cụ, bộ kiểm tra bằng chứng và lập kế hoạch có cấu trúc. Trong lần chạy cuối, 44 trên 45 kịch bản kiểm thử đã thành công.
Một tác nhân LLM chỉ đọc nội bộ đã được xây dựng để trả lời các câu hỏi về hạ tầng như 'tại sao dịch vụ trả về 502?'. Nó sử dụng Go, không dùng LangChain, và gọi các mô hình DeepSeek-V4-Flash và Qwen3.6-27B-FP8 thông qua API tương thích OpenAI. Phiên bản đầu tiên sử dụng vòng lặp ReAct miễn phí và đưa ra các câu trả lời chính xác về mặt hình thức nhưng thường gây hiểu lầm. Ví dụ, khi lỗi 502 do header phản hồi quá lớn ở proxy, tác nhân kết luận 'không có lỗi ở cấp ứng dụng', bỏ qua nguyên nhân thực sự. Năm loại lỗi đã được xác định: phạm vi sai, ngữ nghĩa thời gian sai, kết luận phủ định sai, mất bằng chứng và lập kế hoạch lại không kiểm soát. Giải pháp là nhúng LLM vào trong một khung ứng dụng chặt chẽ. Các lệnh gọi công cụ được điều chỉnh bởi một hợp đồng mở rộng x-agent, xác định bằng chứng, loại đầu ra, độ tươi mới, ngữ nghĩa phủ định và trạng thái chỉ đọc. Trình lập kế hoạch trước tiên xây dựng các mục tiêu (ví dụ: symptom.http_502, route.edge_to_ingress) và một điều kiện dừng: mọi mục tiêu bắt buộc phải được giải quyết hoặc không khả dụng một cách rõ ràng. Một bộ bảo vệ bằng chứng ngăn trình hoàn thiện đưa ra kết luận trước khi tất cả mục tiêu được đáp ứng. Việc chọn công cụ được thực hiện theo từng giai đoạn: bộ lọc chính sách, bộ lọc trước từ vựng, xếp hạng lại bằng LLM (top 8), sau đó cổng liên quan mục tiêu. Các ý định rủi ro có các tuyến tiền xác định. Trong đánh giá cuối cùng, 44 trên 45 kịch bản đã vượt qua (29/29 bắt buộc), mỗi kịch bản chạy hai lần. Thử nghiệm thất bại duy nhất là một báo cáo dung lượng tùy chọn về định dạng. Tác nhân vẫn ở chế độ chỉ đọc; con người quyết định các thay đổi trên môi trường sản xuất.
Nguồn: Habr — хаб ИИ —
bản gốc
