Biến 73 nhận xét của sếp thành bộ dữ liệu: Tạo bản sao kỹ thuật số của người đánh giá
OpenAI
Một nhà phát triển tại một tổ chức lớn đã tự động hóa các báo cáo khả thi về công nghệ thông tin bằng quy trình mô hình ngôn ngữ lớn (Large Language Model - LLM) và phải đối mặt với một bài đánh giá gồm 73 nhận xét từ quản lý của họ. Thay vì sửa chữa thủ công, họ đã trích xuất các nhận xét từ các tệp DOCX, phân cụm chúng bằng LLM thành 16 mẫu và 6 nhóm, và xây dựng một danh sách kiểm tra quy tắc. Việc tích hợp danh sách kiểm tra vào quy trình như một bước xác thực riêng biệt và đánh dấu nguồn của mỗi tuyên bố (từ bản tóm tắt, ước tính hoặc giả định) đã giảm đáng kể các lần sửa lặp lại. Loạt tài liệu tiếp theo đã vượt qua mà không có nhận xét lặp lại.
Một nhân viên tại một tổ chức lớn viết các báo cáo đánh giá tính khả thi về mặt kỹ thuật cho các dự án AI, một công việc mà anh ta đã tự động hóa bằng một tác tử LLM thu thập tài liệu dự án, trích xuất văn bản, điền vào một JSON có cấu trúc, và tạo ra một tệp DOCX từ một mẫu. Sau khi nộp chín báo cáo, quản lý của anh ta đã trả lại với 73 nhận xét, nhiều trong số đó lặp lại và liên quan đến việc thiếu nguồn, các tuyên bố không được hỗ trợ, và các mâu thuẫn. Anh ta đã sử dụng Python để trích xuất các nhận xét từ các tệp DOCX, sau đó yêu cầu một LLM phân nhóm 73 nhận xét thành 16 mẫu trong 6 nhóm, bao gồm tuân thủ yêu cầu, hỗ trợ bằng chứng, ranh giới năng lực, lựa chọn kiến trúc, độ sâu của câu hỏi, và kiểm soát theo giai đoạn. Anh ta xác định rằng gần như tất cả các nhận xét đều mang tính nhận thức luận — yêu cầu trạng thái rõ ràng của các tuyên bố, vì LLM tạo ra văn bản tự tin một cách đồng nhất. Anh ta đã thực hiện ba thay đổi trong quy trình: đánh dấu mỗi tuyên bố là [B] từ yêu cầu, [E] ước tính chuyên gia, hoặc [D] giả định; thêm một danh sách kiểm tra như một bước riêng trong quy trình; và lưu trữ danh sách kiểm tra trong bộ nhớ bền vững của tác tử. Bốn tài liệu tiếp theo đã được thông qua mà không có các nhận xét lặp lại, và chỉ còn các vấn đề mới có tính thực chất. Tác giả thừa nhận rằng cỡ mẫu nhỏ và hiệu quả một phần đến từ việc đánh dấu nguồn, không phải để vượt qua người đánh giá mà để chính thức hóa các tiêu chuẩn chất lượng ngầm của người đánh giá.
Nguồn: Habr — хаб ИИ —
bản gốc
