завышение оценок. Бенчмарк включает исторический (Historical), синтетический (Synthetic) и вымышленный (Fictional) поднаборы; модели на базе RL и больших языковых моделей (large language models, LLMs) достигли полноты 61,25% и точности 90,85% при переоткрытии исторических лазеек. Отдельно компания Anthropic отметила 8-кратный рост объёма слитого кода в 2026 году по сравнению с периодом 2021–2024 годов, что указывает на предварительные признаки прозаического рекурсивного самоулучшения, хотя основанные на творчестве смены парадигм пока не наблюдаются. Исследователи из Цюрихского университета и Google DeepMind обучили квадрокоптеры с помощью многолетнего подкрепления (multi-agent RL, алгоритм PPO с кодировщиком Perceiver), которые превзошли пятикратного чемпиона Швейцарии среди пилотов-людей в гонках со скоростью свыше 22 м/с, причём агенты завершили 100% заездов против 53,33% у человека. Обучение заняло 27 часов на одном графическом процессоре RTX 4090, а политики обобщались без дообучения (zero-shot) для реального применения благодаря рандомизации окружения (domain randomization). Пилот-человек отметил плотные формации агентов и повышенную когнитивную нагрузку.