обучающую политику (teacher policy) с ошибкой в знаке, из-за чего та промахивалась во всех 60 попытках. Три недели ушло на отладку метрик: выяснилось, что среда записывала часть метрик во вложенный словарь, поэтому пробник и колбэк учебного плана (curriculum callback) считывали нули. После исправления ошибок был реализован асимметричный критик с привилегированным вектором из симулятора, а вспомогательная задача модели мира (world-model) — предсказывать этот вектор — заставила сеть долгой краткосрочной памяти (Long Short-Term Memory, LSTM) интегрировать динамику. Финальная модель достигла 50% косинусного сходства между направлением носа и истинным направлением на цель в «слепой» период — против −3% у фильтра Калмана и 41% у чисто нейросетевого пилота.