исправления, но и как активный обучающий сигнал для RL-агента, который динамически подстраивает тысячи управляющих параметров, компенсируя дрейф. Эксперимент на 105-кубитном процессоре Willow с искусственно внесённым дрейфом показал улучшение логической стабильности в 3,5 раза. Даже после экспертной калибровки RL-дообучение дополнительно снизило частоту логических ошибок на 20%. Достигнуты рекордные показатели: менее одной логической ошибки на тысячу циклов коррекции для поверхностного кода и одна на сто для цветового кода. Численные симуляции для сотен кубитов подтвердили, что число требуемых итераций обучения не зависит от размера системы, а значит метод масштабируем.