Pesquisa 🇺🇸 13.08.2026 20:03

O que aprendemos ao reproduzir 2.200 artigos do ICML

Hugging FaceHugging Face AnthropicAnthropic OpenAIOpenAI CursorCursor alphaXivalphaXiv
A Hugging Face, em parceria com a alphaXiv, realizou o desafio de Reproduções Abertas do ICML 2026, no qual participantes usaram agentes de codificação de IA para tentar reproduzir 2.200 artigos. Os resultados: 51% dos artigos examinados tiveram pelo menos uma afirmação verificada, 23% tiveram uma afirmação refutada ou contestada, e 242 artigos tiveram veredictos conflitantes. A supervisão humana mostrou-se crucial, pois os agentes atingiram limites e ocorreram falsas refutações; o evento é considerado a maior auditoria em nível de afirmação de uma conferência de aprendizado de máquina até hoje.
A Hugging Face e a alphaXiv organizaram o desafio de Reproduções Abertas do ICML 2026, de 15 de julho a 2 de agosto de 2026, convidando participantes a reproduzir artigos da conferência usando agentes de codificação de IA, como Claude Code, Codex, Cursor e Pi. Os participantes receberam US$ 20 em créditos de computação e lançaram 2.962 trabalhos em nuvem; onde a reprodução completa era impossível, foram usadas reproduções simplificadas em dados sintéticos. Dos 2.200 artigos examinados, 1.103 (51%) tiveram pelo menos uma alegação verificada de forma independente, incluindo 266 totalmente reproduzidos e 632 parcialmente reproduzidos, sem nenhuma falsificação; 3.978 alegações individuais foram confirmadas. No entanto, 496 (23%) tiveram pelo menos uma alegação falsificada ou contestada, incluindo 49 com todas as alegações falsificadas e 242 onde equipes independentes chegaram a veredictos opostos sobre as mesmas alegações. Falsificações confirmadas notáveis incluem a prova de um artigo sobre paginação que falhou após k=1024, um teorema que colapsou no passo 224, um artigo teórico que usou divergência KL reversa enquanto o código usava KL direta, e uma avaliação diluída por tokens de preenchimento EOS. Os organizadores reverificaram todas as falsificações alegadas e contataram os autores, que responderam positivamente. O desafio também destacou que os agentes encontraram limites, como loops locais e interpretações equivocadas, e que a supervisão humana foi essencial para obter resultados confiáveis, como visto no vencedor com supervisão humana, que julgou pessoalmente pares de imagens. O evento é considerado a maior auditoria aberta, alegação por alegação, de uma conferência de aprendizado de máquina, e todos os diários de bordo, veredictos, rastros e artefatos são públicos.
Fonte: Hugging Face blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas