Prateleiras vazias ou chaves perdidas? A recordação é o gargalo da factualidade paramétrica
Google Research
OpenAI
Google/DeepMind
O Google Research apresenta o perfil de conhecimento, uma estrutura que separa a codificação da recordação em LLMs. Usando o WikiProfile, um benchmark de 2.150 fatos da Wikipédia, eles descobrem que LLMs de ponta como Gemini e GPT-5 codificam quase todos os fatos, mas lutam para recordar muitos, deslocando o gargalo da aquisição de conhecimento para a utilização.
Os cientistas do Google Research, Nitay Calderon e Gal Yona, propõem um arcabouço comportamental chamado perfilagem de conhecimento para distinguir se erros factuais em LLMs (Modelos de Linguagem de Grande Porte) decorrem de falta de conhecimento (falha de codificação) ou de conhecimento inacessível (falha de recordação). Eles apresentam o WikiProfile, um benchmark com 2.150 fatos derivados da Wikipédia, cada um acompanhado de perguntas que investigam codificação, recordação e reconhecimento. Avaliando 13 LLMs com e sem raciocínio, eles mostram que modelos de fronteira, como Gemini-3-Pro e GPT-5, codificam 95–98% dos fatos, mas falham em recordar diretamente 26–34%, mesmo com raciocínio, falhando em 11–12%. O escalonamento na família Gemma 3 reduz falhas de codificação, mas as falhas de recordação persistem, indicando que a recordação é o gargalo. A recordação é afetada pelo contexto de treinamento, fatos de cauda longa são codificados, mas difíceis de recordar, e a maldição da reversão é reformulada como um problema de recordação, já que o reconhecimento em tarefas de múltipla escolha não é prejudicado. O raciocínio melhora a recordação principalmente para fatos raros e reversos, recuperando 40–65% dos fatos codificados, mas não diretamente conhecidos, atuando como um mecanismo de facilitação da recordação, em vez de raciocínio puro.
Fonte: Google Research —
original
