RisetAgen 🇺🇸 14.08.2026 20:03

Fungsi Reward Kustom untuk Pembelajaran Penguatan Multi-Turn dengan Amazon Nova Forge

Amazon/AWSAmazon/AWS
Amazon Nova Forge memungkinkan fungsi reward kustom untuk pembelajaran penguatan multi-turn, memungkinkan tim untuk mendefinisikan seperti apa hasil yang baik sementara layanan mengoordinasikan rollout dan status percakapan. Postingan ini mencakup desain reward multi-turn komposit untuk GRPO, mengeksekusi kode yang dihasilkan model dengan aman, dan jebakan yang dapat merusak sinyal reward.
Dalam pembelajaran penguatan (RL) multi-giliran, fungsi reward kustom menentukan apa yang dipelajari model, dan reward yang salah secara halus dapat mengajarkan hal yang salah meskipun kurva pelatihan terlihat sehat. Amazon Nova Forge menjalankan logika reward di lingkungan Anda sendiri melalui Bring Your Own Orchestration (BYOO), dengan opsi RL multi-giliran tanpa server yang kini tersedia secara umum. Postingan ini berfokus pada merancang reward multi-giliran komposit yang dapat dipelajari oleh Group Relative Policy Optimization (GRPO), termasuk contoh kerja mengajarkan Amazon Nova Lite 2.0 untuk bertanya sebelum menulis kode dalam tugas kolaboratif pengodean multi-giliran. Contoh ini menggunakan reward empat komponen: kebenaran, bertanya_sebelum_menulis_kode, menebak_langsung, dan penalti_perulangan. Ini juga membahas cara menjalankan kode yang dihasilkan model secara aman, dengan tindakan pencegahan seperti tidak mengekspos kredensial atau jaringan, menerapkan batas sumber daya, dan memvalidasi jumlah tes. Bagian jebakan membahas peretasan reward, ketidakstabilan pelatihan, dan keruntuhan reward, dengan menekankan bahwa sinyal reward memengaruhi pembelajaran hanya melalui variasi dalam grup, sehingga istilah yang mengambil nilai yang sama untuk setiap penyelesaian tidak memberikan kontribusi apa pun pada gradien. Pentingnya membuka perilaku yang diinginkan dan memberi penalti pada mode kegagalan disorot, bersama dengan kebutuhan untuk menginstrumentasikan setiap komponen agar dapat mempercayai apa yang dipelajari pelatihan.
Sumber: AWS ML blog — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru