PesquisaAgentes 🇨🇳 10.08.2026 18:02

IA Expõe Falhas em 99,2% dos Principais Artigos!

OpenAIOpenAI
Auditorias recentes usando agentes de IA revelaram que muitos artigos de topo de conferências de IA não são reproduzíveis e contêm erros objetivos. Um estudo descobriu que 99,2% dos artigos tinham pelo menos um erro, com uma média de 4,7 erros por artigo. Essa tendência sugere novas oportunidades de pesquisa em auditoria acadêmica.
Pesquisadores usaram agentes de IA para auditar artigos das principais conferências de IA, descobrindo que muitos resultados publicados não podem ser reproduzidos. Por exemplo, uma auditoria com agentes de IA de todas as 168 apresentações orais na ICML 2026 revelou que, de 92 artigos com pelo menos cinco alegações verificáveis, apenas 34 conseguiram reproduzir mais de 40% das conclusões, e apenas 8 conseguiram reproduzir mais de 80%. Além disso, quatro artigos dependiam de um modelo que foi retirado do ar, tornando seus resultados permanentemente irreproduzíveis. Outro estudo desenvolveu um verificador de artigos baseado no GPT-5, que analisou artigos das principais conferências de IA, descobrindo que, em média, cada artigo continha 4,7 erros objetivos, e 99,2% dos artigos tinham pelo menos um problema. Erros matemáticos e de fórmulas eram os mais comuns (54,0%). O número de erros por artigo da NeurIPS aumentou de 3,8 em 2021 para 5,9 em 2025. Esses resultados destacam um problema crescente na reprodutibilidade científica e sugerem oportunidades para novas direções de pesquisa, como revisar artigos antigos e corrigir erros. Além disso, um químico teórico do Laboratório de Zhejiang descobriu que a IA previu pontos de ebulição diferentes de um banco de dados de 75 anos, e após verificação manual, a IA estava correta, revelando erros em medições centenárias. Isso mostra que a IA agora pode auxiliar na reavaliação da literatura científica histórica.
Fonte: QbitAI 量子位 — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas