Nghiên cứu 🇺🇸 27.07.2026 07:02

ABBEL: Huấn luyện LLM cập nhật niềm tin cho tương tác dài hạn hiệu quả

CursorCursor Alibaba/QwenAlibaba/Qwen
ABBEL là một khung nền tảng cải thiện hiệu suất của các mô hình ngôn ngữ lớn (LLM) trong các tác vụ dài hạn bằng cách cách ly và giám sát nội dung thông tin của các bản tóm tắt sử dụng trạng thái niềm tin bằng ngôn ngữ tự nhiên. Nó thu hẹp khoảng cách hiệu suất so với các mô hình ngữ cảnh đầy đủ khoảng 50%, đồng thời giảm một nửa số bước huấn luyện và sử dụng ít bộ nhớ hơn đáng kể.
ABBEL (Autoencoder Belief Bottleneck for Efficient Learning) giải quyết vấn đề các mô hình ngôn ngữ lớn (LLM) gặp khó khăn với các tương tác dài khi toàn bộ lịch sử ngữ cảnh không thể nằm gọn trong cửa sổ ngữ cảnh. Thay vì tóm tắt đệ quy truyền thống, ABBEL xây dựng các bản tóm tắt như các trạng thái niềm tin (belief states) mà mô hình cập nhật định kỳ. Chấm điểm niềm tin (belief grading) thêm một nhiệm vụ học tăng cường (RL) phụ trợ thưởng cho các niềm tin dựa trên khả năng tái tạo các quan sát gần đây của chúng. Trong môi trường lập trình cộng tác CollabBench, ABBEL với chấm điểm niềm tin dựa trên tái tạo đạt tỷ lệ vượt qua bài kiểm tra (test pass rate) là 0,48 (so với 0,52 của ngữ cảnh đầy đủ) và tỷ lệ thành công (success rate) là 0,36 (so với 0,39), đồng thời chỉ sử dụng 6,01 token đỉnh so với 14,08 của ngữ cảnh đầy đủ, và chỉ cần 50 bước huấn luyện thay vì 100. Trong nhiệm vụ Combination Lock, chấm điểm niềm tin dựa trên kiến thức miền cho phép ABBEL tiến gần hoặc vượt quá hiệu suất của ngữ cảnh đầy đủ. Trong QA đa mục tiêu, Peak Belief Length Penalty giảm sử dụng bộ nhớ với tổn thất hiệu suất tối thiểu. Bài báo được viết bởi Lidayan và cộng sự từ Berkeley AI.
Nguồn: BAIR (Berkeley AI) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới