⚡ ÚLTIMA HORA
La sociedad puede ser reward-hackeada, igual que los entornos cibernéticos:…Imagina un ejército de optimizadores de puntos de tarjetas de crédito jugando con el sistema… para siempre…
Anthropic
Google DeepMind
Investigadores del King's College de Londres, la Universidad de Fudan y el Instituto Alan Turing desarrollaron SocioHack, un punto de referencia que prueba la capacidad de la IA para 'jugar con el sistema' en escenarios del mundo real como puntos de tarjetas de crédito y calificaciones escolares. Mientras tanto, Anthropic informó de un aumento de 8 veces en el código fusionado en 2026 en comparación con 2021-2024, lo que sugiere una mejora recursiva prosaica. Además, la Universidad de Zúrich y Google DeepMind demostraron drones entrenados con aprendizaje por refuerzo que superaron a un campeón humano de carreras de drones, con implicaciones para la guerra.
Un artículo de Kings College London, la Universidad de Fudan y el Instituto Alan Turing presenta SocioHack, un punto de referencia con 72 entornos simulados donde modelos entrenados con aprendizaje por refuerzo (RL, por sus siglas en inglés) pueden descubrir estrategias formalmente conformes pero que socavan los propósitos previstos, como maximizar puntos de tarjetas de crédito o inflar calificaciones. El punto de referencia incluye subconjuntos Histórico, Sintético y de Ficción, y los modelos de lenguaje grandes (LLM, por sus siglas en inglés) habilitados con RL lograron un 61,25% de exhaustividad y un 90,85% de precisión al redescubrir lagunas históricas. Por separado, Anthropic observó un aumento de 8 veces en el código fusionado en 2026 en relación con el período 2021-2024, lo que indica señales preliminares de una mejora recursiva prosaica, aunque aún no se observan cambios de paradigma impulsados por la creatividad. Investigadores de la Universidad de Zúrich y Google DeepMind entrenaron drones cuadricópteros utilizando RL multiagente (PPO con codificador Perceiver) que superaron a un piloto humano cinco veces campeón suizo en carreras que superan los 22 m/s, con un 100% de finalización de carreras frente al 53,33% del humano. El entrenamiento duró 27 horas en una sola GPU RTX 4090, y las políticas se generalizaron con cero disparos a implementación en el mundo real mediante aleatorización de dominio. El piloto humano señaló las formaciones cerradas de los agentes y el aumento de la carga cognitiva.
Fuente: Import AI —
original
