⚡ СРОЧНО
Общество можно взломать через вознаграждения, как и киберсреду:…Представьте армию оптимизаторов бонусных баллов кредитных карт, играющих систему… навсегда…
Anthropic
Google DeepMind
Исследователи из Королевского колледжа Лондона, Фуданьского университета и Института Алана Тьюринга разработали SocioHack — бенчмарк, проверяющий способность ИИ «обманывать систему» в реальных сценариях, таких как баллы кредитных карт и школьные оценки. Тем временем Anthropic сообщила о 8-кратном увеличении объединённого кода в 2026 году по сравнению с 2021–2024 годами, что предполагает прозаическое рекурсивное самоулучшение. Кроме того, Цюрихский университет и Google DeepMind продемонстрировали дронов, обученных с помощью обучения с подкреплением (RL), которые превзошли человека-чемпиона по дрон-рейсингу, что имеет значение для ведения войны.
В статье, подготовленной учёными из Королевского колледжа Лондона, Фуданьского университета и Института Алана Тьюринга, представлен бенчмарк SocioHack — набор из 72 сред-песочниц, в которых модели, обученные с подкреплением (reinforcement learning, RL), могут находить стратегии, формально соответствующие правилам, но подрывающие заложенные цели, например максимизацию баллов по кредитной карте или
Показать ещё ↓
Источник: Import AI —
оригинал
