Catégories de passage à l'échelle au moment de l'inférence pour un meilleur raisonnement des LLM
OpenAI
Le passage à l'échelle au moment de l'inférence améliore la qualité des réponses des LLM en utilisant davantage de calcul lors de l'inférence. Cet article catégorise les approches et passe en revue des articles récents, montrant que les principaux fournisseurs de LLM s'appuient sur de telles techniques.
Le scaling au moment de l'inférence est devenu une méthode clé pour améliorer les performances des LLM en allouant des ressources de calcul supplémentaires lors de l'inférence. L'article regroupe les techniques en catégories telles que le Chain-of-Thought prompting, l'auto-consistance (Self-Consistency), le classement Best-of-N, l'échantillonnage par rejet avec un vérificateur (Rejection Sampling with a Verifier), l'auto-affinement (Self-Refinement) et la recherche sur les chemins de solution (Search Over Solution Paths). Il donne également un aperçu des articles récents et note que les LLM propriétaires utilisent ces méthodes. L'auteur a divisé un chapitre de livre sur ce sujet en deux parties, disponibles en accès anticipé, et partage des idées et notes supplémentaires qui n'ont pas trouvé leur place dans le chapitre final.
Source: Sebastian Raschka —
original
