Điều các chatbot LLM thiếu: Ý thức về mục đích
OpenAI
Meta
Các chatbot LLM hiện đại rất xuất sắc trong các truy vấn đơn lẻ nhưng lại mất tập trung trong các hội thoại nhiều lượt. Nghiên cứu cho thấy các mô hình nhanh chóng lệch khỏi lời nhắc hệ thống chỉ sau vài vòng trò chuyện. Tác giả đề xuất phương pháp "hội thoại theo định hướng mục đích" có tính đến các mục tiêu dài hạn và tương tác lặp đi lặp lại.
Các chatbot LLM không ngừng được cải thiện, nhưng tiến bộ của chúng được đo bằng các chuẩn mực như MMLU, HumanEval và MATH, vốn kiểm tra phản hồi một lượt. Tuy nhiên, các tác vụ thực tế như lập kế hoạch du lịch hay tự động hóa các vấn đề trên GitHub yêu cầu hội thoại nhiều lượt với sự tinh chỉnh yêu cầu. Các nhà nghiên cứu đã chỉ ra rằng ngay cả những mô hình tiên tiến như LLaMA2-chat-70B và GPT-3.5-turbo-16k cũng mất đi sự tuân thủ lời nhắc hệ thống sau khoảng 1,6 nghìn token (khoảng 16 lượt). Điều này được xác nhận bởi một thí nghiệm trong đó hai tác tử LLM giao tiếp với nhau, và sau đó kiểm tra mức độ mỗi tác tử tuân theo hướng dẫn của nó. Vấn đề là việc huấn luyện thông qua Học Tăng cường từ Phản hồi của Con người (RLHF) không tính đến lập kế hoạch đa bước — nó tối ưu hóa các phản hồi một lượt thay vì các mục tiêu dài hạn. Tác giả đề xuất một cách tiếp cận "hội thoại định hướng mục tiêu", trong đó chatbot đóng vai trò trợ lý dần dần làm rõ ý định của người dùng. Ví dụ về các hệ thống như vậy bao gồm "hội thoại định hướng giải pháp" và nền tảng Sotopia, mô hình hóa việc ra quyết định hợp tác. Để tạo ra những trợ lý thực sự, chúng ta không chỉ cần tạo văn bản mà còn thiết kế các hội thoại như những trò chơi định hướng mục tiêu, nơi mỗi phát ngôn thay đổi mô hình thế giới của người đối thoại.
Nguồn: The Gradient —
bản gốc
