Estudio contradice a Anthropic y OpenAI: la investigación autónoma en IA sigue lejos
Anthropic
OpenAI
Sakana AI
Google DeepMind
Un nuevo estudio con participación de Princeton y el Instituto de Seguridad de la IA del Reino Unido concluye que los modelos de IA de frontera actuales no logran investigación autónoma, a pesar de las afirmaciones de grandes laboratorios como Anthropic y OpenAI. Usando un método de 'Evaluación Sombra' con artículos inéditos de NeurIPS, los autores humanos rechazaron todo el trabajo generado por IA. Los agentes tuvieron dificultades con el juicio científico, la resolución creativa de problemas y la gestión de recursos.
Investigadores de Princeton y del Instituto de Seguridad de IA del Reino Unido llevaron a cabo un estudio para probar empíricamente si los agentes de IA pueden realizar investigación de IA independiente. Utilizaron un método llamado 'Evaluación en Sombra', donde se les daba a los agentes de IA la pregunta de investigación central de artículos no publicados, y los autores humanos originales evaluaban los resultados como revisores de conferencias. Los agentes utilizaron Claude Opus 4.8 con razonamiento extra-alto, funcionaron durante seis días con un presupuesto de API de 3.000 dólares, acceso a GPU y acceso web, operando dentro del marco de agentes OpenClaw. Los autores originales rechazaron ambos artículos generados por IA, uno con 'Rechazo Fuerte', citando datos mal motivados, prosa ilegible y falta de contribuciones novedosas. El análisis identificó cinco debilidades sistemáticas: falta de criterio para la calidad de investigación publicable, fracaso en la resolución creativa de problemas (los agentes redujeron sus afirmaciones en lugar de generar nuevas hipótesis), retroceso ineficaz (abandonando objetivos ambiciosos prematuramente), falta de conciencia de recursos (los agentes usaron menos de la mitad de su presupuesto) y desviación de instrucciones (olvidando instrucciones explícitas, excediendo los límites de longitud). En contraste, los agentes manejaron con éxito todo el trabajo de ingeniería, incluida la búsqueda de literatura, la depuración de código GPU, la ejecución de cientos de experimentos y la compilación de artículos en LaTeX. No se encontró un hackeo de recompensas significativo. Para verificar sus resultados, repitieron un experimento con GPT-5.6 Sol y el andamiaje Codex de OpenAI, encontrando modos de fallo casi idénticos. El estudio contradice las afirmaciones de Anthropic (quien publicó 'Cuando la IA se construye a sí misma') y de OpenAI (quien dijo que GPT-5.6 Sol ahorró semanas en el entrenamiento posterior). Los autores señalan que la tarjeta del sistema no menciona esta contribución. Concluyen que los modelos de vanguardia pueden manejar la ingeniería, pero tienen dificultades con preguntas de investigación abiertas que requieren semanas. El estudio también critica el proceso de revisión por pares, citando el artículo de Sakana AI sobre AI Scientist-v2 que fue aceptado en un taller pero luego retirado debido a errores de citación.
Fuente: The Decoder (DE) —
original
