модель периодически обновляет. Оценка убеждений добавляет вспомогательную задачу обучения с подкреплением, которая поощряет убеждения на основе того, насколько хорошо они могут восстановить недавние наблюдения. В среде совместного программирования CollabBench ABBEL с оценкой убеждений на основе восстановления достиг уровня прохождения тестов 0,48 (по сравнению с 0,52 для полного контекста) и уровня успешности 0,36 (по сравнению с 0,39), при этом использовалось 6,01 пиковых токенов против 14,08 для полного контекста, и требовалось всего 50 шагов обучения против 100. В задаче «Комбинационный замок» оценка убеждений на основе предметных знаний позволила ABBEL приблизиться к производительности полного контекста или превзойти её. В многокритериальном задачнике по QA (ответам на вопросы) штраф за пиковую длину убеждений снизил использование памяти с минимальной потерей производительности. Статья написана Лидаяном и другими из Berkeley AI.