планирования. Архитектура использует гибридное внимание с соотношением 5:1 между линейным вниманием KDA и слоями MLA, а внимание Lightning Attention модернизировано до KDA для лучшего отслеживания состояний. Активация экспертов на токен снижена с 1/32 до 1/64, что повышает эффективность. Инженерные улучшения включают кластерное кэширование для снижения задержки первого токена на 60–80% и многопротокольную среду совместной работы на основе многоагентного взаимодействия для обеспечения стабильности.