AgentesInvestigación 🇩🇪 01.08.2026 17:02

Informe de campo de OpenAI: los agentes de IA reescriben software de investigación frágil, pero los investigadores deben verificarlo rigurosamente

OpenAIOpenAI AnthropicAnthropic
OpenAI y socios académicos descubrieron que los agentes de codificación con IA pueden acelerar y mantener software de investigación antiguo, pero la carga se desplaza de la programación a la verificación. En ocho estudios de caso, los agentes modernizaron herramientas, algunas ejecutándose más de 60 veces más rápido, aunque a menudo mostraban confianza mientras producían código incorrecto. Los investigadores enfatizan la necesidad de validación independiente y supervisión científica.
Un informe de campo de OpenAI y socios académicos documenta ocho casos de estudio, principalmente en biología, donde agentes de codificación como Codex y Claude Code se utilizaron para mantener, optimizar o reescribir software de investigación. Los proyectos abarcaron desde mantenimiento simple hasta reescrituras completas en lenguajes modernos. Por ejemplo, GPT-5.5 modernizó el proceso de compilación de la biblioteca de Python cyvcf2, mientras que dos agentes, Claude Code y Codex, migraron aproximadamente 10,000 líneas de MHCflurry de TensorFlow a PyTorch. El proyecto rustar-aligner reescribió STAR, una herramienta de C/C++ de varios miles de líneas, en Rust, logrando una concordancia del 99.815% y 99.883% con el original en los conjuntos de datos de prueba. RustQC, que agrupaba 15 herramientas de control de calidad, redujo el tiempo de ejecución de 15 horas 34 minutos a 14 minutos 54 segundos, un factor de más de 60. HelixForge, un reemplazo para BamSurgeon, fue 59.6 veces más rápido en general, con el cálculo central 98.6 veces más rápido. Sin embargo, los agentes a menudo parecían seguros pero estaban equivocados; por ejemplo, en la reescritura de bayesm, dos procedimientos contenían errores sutiles, incluido un parámetro de control invertido y un factor de escala defectuoso. Los investigadores concluyeron que los humanos deben definir objetivos, criterios de éxito y métodos de validación, mientras que los agentes se encargan de la implementación. El informe estima ahorros de tiempo significativos; por ejemplo, mantener NumPy podría ahorrar alrededor de 650 horas al año, pero destaca el mantenimiento a largo plazo y la responsabilidad como desafíos clave. Algunos cambios se fusionaron upstream, mientras que otros, como FastQC, fueron rechazados por el autor original, lo que llevó a que las mejoras se incorporaran a la versión original en Java. El informe es retrospectivo y se basa en autoinformes, y señala que el cuello de botella se está desplazando de la implementación a la validación y la revisión científica. Este patrón se refleja en un estudio de METR y en un estudio sobre la frustración de los equipos de desarrolladores con el código de IA. El informe se alinea con la estrategia científica más amplia de OpenAI, que incluye un equipo dedicado liderado por Kevin Weil y el lanzamiento de GPT-Rosalind.
Fuente: The Decoder (DE) — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas