(MoE). Два показательных сигнала — это Mooncake от Moonshot AI и CMX от NVIDIA. Mooncake — это дисaggregated-архитектура, ориентированная на KV-кэш, которая организует простаивающие ресурсы CPU, DRAM, SSD и сетевых карт в распределенный кэш-пул, увеличивая эффективную емкость запросов на 59%–498% в тестах. Платформа NVIDIA CMX Context Memory Storage Platform добавляет уровень «G3.5» между HBM и общим хранилищем, обеспечивая общую контекстную память масштаба петабайт внутри GPU-подобного пула, что потенциально дает до 5-кратного улучшения устойчивой пропускной способности токенов и энергоэффективности. Эти системы подчеркивают, что состояние вывода становится ключевым ресурсом, и хранилище должно участвовать в размещении, миграции и повторном использовании данных. В результате появляются AI-SSD, которые делятся на две категории: AI-оптимизированные корпоративные SSD (например, InnoGrit Dongting-N3X, Huawei OceanDisk LC 560) и AI-SSD, участвующие в выводе. Три заметных пути для последних: aiDAPTIV от Phison (с использованием выделенных кэш-SSD и промежуточного ПО), SPU+iSA от Longsys (использующее интеллект на стороне хранилища) и межслойная координация от Infplane-Maxio. Конкуренция в области AI-SSD в конечном счете будет определяться полным путем данных, требующим сотрудничества между NAND-флэш-памятью, FTL, прошивкой, драйверами, промежуточным ПО и фреймворками вывода. AI-SSD не заменят HBM, VRAM или DRAM, а сформируют более тонкую иерархию хранения, где данные размещаются на основе температуры доступа, а миграцией управляют программное и аппаратное обеспечение.