Google avalia alinhamento de tendências comportamentais em modelos de linguagem de grande escala
Google/DeepMind
A Google Research apresenta uma estrutura que converte questionários psicológicos em testes de julgamento situacional (SJTs) para avaliar o alinhamento comportamental de LLMs. Testes com 25 modelos revelam que modelos menores frequentemente se desviam do consenso humano, enquanto modelos maiores mostram alinhamento melhorado, mas imperfeito. O estudo também constata que os modelos são excessivamente confiantes quando as opiniões humanas divergem.
O Google Research apresenta um framework para avaliar disposições comportamentais em LLMs, adaptando questionários psicológicos estabelecidos em testes de julgamento situacional. O framework testa modelos em cenários realistas, como compostura profissional e resolução de conflitos. A análise de 25 LLMs mostra que modelos menores (com menos de 25 bilhões de parâmetros) têm alinhamento direcional acentuadamente inferior, muitas vezes em taxas próximas ao acaso, enquanto modelos de fronteira maiores (com mais de 120 bilhões de parâmetros) alcançam alinhamento quase perfeito sob consenso humano unânime, mas estagnam na faixa dos 80% baixos a médios quando o consenso é menor. Os modelos tendem a incentivar a abertura emocional onde humanos recomendam compostura, priorizar harmonia sobre assertividade e exibir maior impulsividade. O estudo também revela que os modelos são sistematicamente excessivamente confiantes quando os anotadores humanos discordam, falhando em representar a gama de opiniões. Isso destaca a necessidade de melhor alinhamento comportamental para navegar adequadamente nas dinâmicas sociais.
Fonte: Google Research —
original
