с нативным ядром внимания MLX и до 20 раз ускорения префилла по сравнению с реализацией сообщества mlx-lm на ядре Mamba SSM. K-Search использует итеративный цикл оптимизации, в котором большая языковая модель (LLM) размышляет об оптимизациях, генерирует ядра-кандидаты, компилирует и тестирует их на реальном оборудовании. Слой трансляции включает таблицы сопоставления концепций, подсказки, специфичные для MLX, и повторно используемые утверждения, сохраняющие экспертное поведение ядер. Работа демонстрирует, что поиск ядер на основе ИИ может переносить знания об оптимизации между экосистемами оборудования без необходимости начинать с нуля.