Kategori Penskalakan Waktu Inferensi untuk Penalaran LLM yang Lebih Baik
OpenAI
Penskalakan waktu inferensi meningkatkan kualitas jawaban LLM dengan menggunakan lebih banyak komputasi selama inferensi. Artikel ini mengategorikan pendekatan dan meninjau makalah terbaru, menunjukkan bahwa penyedia LLM utama bergantung pada teknik semacam itu.
Penskalaan waktu inferensi telah menjadi metode utama untuk meningkatkan kinerja LLM dengan mengalokasikan komputasi tambahan saat inferensi. Artikel ini mengelompokkan teknik ke dalam kategori seperti Chain-of-Thought prompting, Self-Consistency, Best-of-N ranking, Rejection Sampling with a Verifier, Self-Refinement, dan Search Over Solution Paths. Artikel ini juga mengulas makalah-makalah terbaru dan mencatat bahwa LLM berpemilik menggunakan metode-metode ini. Penulis membagi bab buku tentang topik ini menjadi dua bagian, yang tersedia dalam akses awal, serta membagikan ide dan catatan tambahan yang tidak masuk dalam bab akhir.
Sumber: Sebastian Raschka —
asli
