Nghiên cứuTác tử 🇺🇸 14.08.2026 20:03

Hàm phần thưởng tùy chỉnh cho học tăng cường nhiều lượt với Amazon Nova Forge

Amazon/AWSAmazon/AWS
Amazon Nova Forge cho phép các hàm phần thưởng tùy chỉnh cho học tăng cường nhiều lượt, cho phép các nhóm xác định kết quả tốt trông như thế nào trong khi dịch vụ điều phối các cuộc gọi và trạng thái hội thoại. Bài viết bao gồm việc thiết kế các phần thưởng nhiều lượt tổng hợp cho GRPO, thực thi mã do mô hình tạo ra một cách an toàn, và các cạm bẫy có thể làm sụp đổ tín hiệu phần thưởng.
Trong học tăng cường (RL) đa lượt, hàm phần thưởng tùy chỉnh quyết định mô hình học được gì, và một phần thưởng sai một cách tinh vi có thể dạy mô hình điều sai dù đường cong huấn luyện vẫn khỏe mạnh. Amazon Nova Forge chạy logic phần thưởng trong môi trường của riêng bạn thông qua Bring Your Own Orchestration (BYOO), với tùy chọn RL đa lượt không máy chủ hiện đã có sẵn rộng rãi. Bài viết tập trung vào việc thiết kế một phần thưởng đa lượt tổng hợp mà Group Relative Policy Optimization (GRPO) có thể học từ đó, bao gồm một ví dụ cụ thể về việc dạy Amazon Nova Lite 2.0 biết hỏi trước khi viết mã trong một nhiệm vụ cộng tác viết mã đa lượt. Ví dụ sử dụng phần thưởng gồm bốn thành phần: tính đúng đắn, đã_hỏi_trước_khi_viết_mã, đoán_ngay_lập_tức, và phạt_vòng_lặp. Bài viết cũng đề cập đến việc thực thi mã do mô hình tạo ra một cách an toàn, với các biện pháp phòng ngừa như không tiết lộ thông tin xác thực hoặc mạng, áp dụng giới hạn tài nguyên, và xác thực số lượng bài kiểm tra. Phần về cạm bẫy thảo luận về hack phần thưởng, mất ổn định huấn luyện, và sụp đổ phần thưởng, nhấn mạnh rằng tín hiệu phần thưởng chỉ ảnh hưởng đến việc học thông qua sự biến thiên trong một nhóm, vì vậy một thành phần có giá trị như nhau cho mọi hoàn thành sẽ không đóng góp gì vào gradient. Tầm quan trọng của việc mở khóa các hành vi mong muốn và phạt các chế độ thất bại được nhấn mạnh, cùng với nhu cầu theo dõi từng thành phần để tin tưởng những gì quá trình huấn luyện đang học.
Nguồn: AWS ML blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới