Seguridad de IAInvestigación 🇩🇪 13.08.2026 13:02

Investigadores de IA advirtieron sobre la automejora autónoma y ahora ven los primeros hitos alcanzados

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind Sakana AISakana AI
Severin Field, fellow de IAPS, encuestó a 25 investigadores de OpenAI, Anthropic, Google DeepMind, Meta y universidades estadounidenses sobre la automejora recursiva (RSI). En una publicación de blog, informa que varios de los hitos que enumeraron ya se han logrado, como el rendimiento de nivel oro en la Olimpiada de Matemáticas y artículos de talleres generados por IA. Field también advierte de un 'cambio de incentivos' que podría llevar a mantener los modelos poderosos internamente.
En una entrada de blog para el boletín The Attack Surface, Severin Field resume los resultados de un estudio de entrevistas realizado a finales del verano de 2025. De los 25 investigadores entrevistados, 20 clasificaron la automatización de la investigación en IA como uno de los riesgos de IA más graves y urgentes. La auto-mejora recursiva (RSI, por sus siglas en inglés) se refiere a un sistema que es lo suficientemente bueno en el desarrollo de IA como para construir una versión más fuerte de sí mismo, un ciclo que podría continuar. Field argumenta que RSI ya no es solo una promesa de marketing. Como medida de progreso, los entrevistados citaron repetidamente el punto de referencia Task Horizon de la organización sin fines de lucro METR, que muestra que la duración de las tareas que los agentes de IA pueden completar de forma autónoma se duplica aproximadamente cada seis meses desde 2019 (algunos analistas afirman que cada cuatro meses desde 2024). El punto en disputa no es la auto-mejora en sí misma, sino su recursividad, es decir, si las mejoras se convertirán en un bucle autosostenido. Los escépticos dicen que se necesita un avance en memoria, creatividad o en distinguir hipótesis verdaderas de falsas, porque no hay datos de entrenamiento ni claves de solución para ideas que cambien el paradigma. Desde las entrevistas, se han logrado varios hitos: OpenAI y Google DeepMind alcanzaron un rendimiento de nivel oro en la Olimpiada de Matemáticas, el 'AI Scientist' de Sakana produjo un artículo de taller revisado por pares, Andrej Karpathy construyó una configuración de agente que ejecuta ciclos de entrenamiento de forma independiente, y Anthropic informó que su modelo Claude ahora escribe más del 80% del código para su propio código de producción. Solo cuatro de los 20 encuestados esperan que los modelos con capacidad de investigación aparezcan como productos públicos; la mitad espera un uso puramente interno, y el resto espera versiones públicas destiladas. Field describe un posible 'cambio de incentivos': una vez que la IA acelere notablemente su propia investigación, retenerla se vuelve más valioso que venderla. Como evidencia, cita un incidente de seguridad con un modelo interno de OpenAI que escapó de su entorno de pruebas en julio de 2026 y comprometió Hugging Face, y la restricción temporal de acceso por parte del gobierno de Estados Unidos a Claude Mythos de Anthropic. Field deriva tres recomendaciones: audiencias que interroguen bajo juramento a directores ejecutivos e investigadores sobre la investigación automatizada en IA, un punto de referencia estatal Task Horizon con un programa de entrevistas anónimo en el Centro para la Seguridad e Innovación en IA, e investigación sobre la verificación de acuerdos internacionales de IA, sin los cuales los acuerdos con China serían prácticamente inaplicables. Señala que el debate apenas ha llegado a Washington mientras los laboratorios siguen avanzando rápidamente. Recientemente, 1,224 empleados de las principales empresas de IA, incluidos los científicos jefe de OpenAI y Meta, firmaron una declaración abierta advirtiendo que sus empresas podrían pronto automatizar la investigación en IA.
Fuente: The Decoder (DE) — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas