Investigación 🇺🇸 13.08.2026 20:03

Lo que aprendimos al reproducir 2.200 artículos de ICML

Hugging FaceHugging Face AnthropicAnthropic OpenAIOpenAI CursorCursor alphaXivalphaXiv
Hugging Face, en colaboración con alphaXiv, organizó el desafío de Reproducciones Abiertas de ICML 2026, donde los participantes usaron agentes de programación con IA para intentar reproducir 2.200 artículos. Los resultados: el 51% de los artículos examinados tenían al menos una afirmación verificada, el 23% tenía una afirmación refutada o en disputa, y 242 artículos tenían veredictos contradictorios. La supervisión humana resultó crucial, ya que los agentes alcanzaron límites y se produjeron falsas refutaciones; el evento se considera la mayor auditoría a nivel de afirmaciones de una conferencia de aprendizaje automático hasta la fecha.
Hugging Face y alphaXiv organizaron el desafío de Reproducciones Abiertas de ICML 2026 del 15 de julio al 2 de agosto de 2026, invitando a los participantes a reproducir artículos de la conferencia utilizando agentes de codificación de IA como Claude Code, Codex, Cursor y Pi. Los participantes recibieron $20 en créditos de cómputo y lanzaron 2,962 trabajos en la nube; cuando la reproducción completa era imposible, se utilizaron reproducciones de juguete con datos sintéticos. De los 2,200 artículos examinados, 1,103 (51%) tenían al menos una afirmación verificada de forma independiente, incluyendo 266 totalmente reproducidos y 632 parcialmente reproducidos sin falsificaciones; se confirmaron 3,978 afirmaciones individuales. Sin embargo, 496 (23%) tenían al menos una afirmación falsificada o cuestionada, incluyendo 49 con todas las afirmaciones falsificadas y 242 donde equipos independientes llegaron a veredictos opuestos sobre las mismas afirmaciones. Falsificaciones confirmadas notables incluyen la prueba de un artículo sobre paginación que falla después de k=1024, un teorema que colapsa en el paso 224, un artículo teórico que utiliza la divergencia KL inversa mientras que el código usaba la KL directa, y una evaluación diluida por tokens de relleno EOS. Los organizadores re-verificaron todas las falsificaciones reclamadas y contactaron a los autores, quienes respondieron positivamente. El desafío también destacó que los agentes alcanzaron límites, como bucles locales e interpretaciones erróneas, y que la supervisión humana era esencial para obtener resultados fiables, como se vio en el ganador con intervención humana que juzgó personalmente pares de imágenes. El evento se considera la auditoría abierta más grande, afirmación por afirmación, de una conferencia de aprendizaje automático, y todos los cuadernos de bitácora, veredictos, trazas y artefactos son públicos.
Fuente: Hugging Face blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas