Máquinas Que Não Sabem Contar, Mas Adivinham Números
OpenAI
Anthropic
Meta
Mistral
Google/DeepMind
Os modelos de linguagem (LLMs, na sigla em inglês) conseguem prever valores numéricos a partir de dados tabulares sem qualquer ajuste fino, às vezes igualando ou até superando ferramentas especializadas em regressão. No entanto, têm limitações fundamentais: tratam os números como texto, carecem de interpretabilidade e são dispendiosos. Novos modelos especializados em tabelas, como o TabPFN, superam os LLMs em tabelas puramente numéricas.
O artigo explora por que os grandes modelos de linguagem (LLMs) conseguem prever quantidades numéricas apesar de não compreenderem verdadeiramente os números. Ao contrário das ferramentas tradicionais de regressão, como o XGBoost, que usam uma abordagem baseada em árvores de decisão, os LLMs processam números como cadeias de caracteres, dividindo-os em tokens de forma arbitrária. Em um experimento de 2024 conduzido por pesquisadores da Universidade do Arizona e da Universidade Técnica de Cluj-Napoca, LLMs como GPT-4 e Claude 3 receberam uma tabela de exemplos e foram solicitados a prever um valor ausente. Sem qualquer ajuste fino, eles tiveram desempenho comparável ao de programas especializados, e na função Friedman #2, o Claude 3 até superou cinco dessas ferramentas. Curiosamente, aumentar o número de exemplos melhorou a precisão, o que não pode ser atribuído à sorte. Esse aprendizado em contexto é notável porque não requer treinamento adicional. No entanto, os LLMs são não confiáveis: suas previsões variam com a ordem das linhas e a precisão dos números, e eles não têm um limite, às vezes dando respostas extremamente incorretas. Apesar de serem ordens de grandeza mais caros por previsão do que as ferramentas clássicas, os LLMs se destacam quando os dados são escassos, contêm texto ou quando os nomes das colunas carregam significado. Novos modelos especializados como o TabPFN, publicado na Nature no início de 2025, superam os LLMs em tabelas puramente numéricas com poucos dados, levando menos de três segundos para vencer uma combinação de métodos clássicos que rodou por quatro horas. A recomendação é usar LLMs apenas quando houver poucos dados ou texto significativo, e considerá-los como um complemento, e não um substituto, para as ferramentas clássicas.
Fonte: Habr — хаб ИИ —
original
