Categorias de Escalonamento no Momento da Inferência para Melhorar o Raciocínio de LLMs
OpenAI
O escalonamento no momento da inferência melhora a qualidade das respostas de LLMs ao usar mais poder computacional durante a inferência. Este artigo categoriza as abordagens e revisa artigos recentes, mostrando que os principais provedores de LLMs dependem dessas técnicas.
O escalonamento em tempo de inferência tornou-se um método fundamental para melhorar o desempenho de LLMs ao alocar poder computacional extra durante a inferência. O artigo agrupa técnicas em categorias como Promptagem em Cadeia de Pensamento, Autoconsistência, Ranqueamento Best-of-N (melhor de N), Amostragem por Rejeição com um Verificador, Autorrefinamento e Busca sobre Caminhos de Solução. Também oferece uma visão geral de artigos recentes e observa que LLMs proprietários utilizam esses métodos. O autor dividiu um capítulo de livro sobre este tópico em duas partes, disponíveis em acesso antecipado, e compartilha ideias e notas adicionais que não couberam no capítulo final.
Fonte: Sebastian Raschka —
original
