Однако традиционные SSD не приспособлены для постоянных задач инференса: они спроектированы для файлового и блочного хранения с упором на последовательную пропускную способность, случайные IOPS (операции ввода-вывода в секунду) и надёжность, тогда как инференс LLM требует подачи данных со строгими временными ограничениями. KV Cache записывается на этапе prefill и многократно считывается; MoE перед вычислением каждого слоя требует конкретных весов экспертов; один пропущенный такт чтения может приостановить работу GPU, NPU или CPU. Пиковые значения IOPS при высокой глубине очереди не эквивалентны стабильной задержке при мелкогранулированном доступе с низкой глубиной очереди. NAND Flash читается постранично и стирается блоками, а FTL (Flash Translation Layer, слой трансляции флеш-памяти) вызывает усиление записи и хвостовые задержки; непрерывная запись KV Cache создаёт дополнительную нагрузку на ресурс флеш-памяти. Традиционная разметка LBA (Logical Block Addressing, логическая адресация блоков) игнорирует смысловые связи между слоями, экспертами и блоками KV Cache, разбрасывая связанные данные и не позволяя выполнять предсказуемое параллельное чтение. Файловые системы, блочные устройства и программные стеки NVMe добавляют дополнительную задержку. Без адресной раскладки, разделения кэша, приоритетного планирования, асинхронной предвыборки и управления ресурсом, ориентированных на порядок выполнения модели, SSD не могут стабильно участвовать в генерации токенов наравне с DRAM или VRAM.

Показать ещё ↓