PrismML, основанное на Qwen 3.6 27B, предлагает бинарную и троичную версии, которые занимают 3.8 ГБ и 7.17 ГБ соответственно, по сравнению с оригинальными 53.8 ГБ. Компания утверждает сохранение до 90-95% исходных возможностей, но тесты автора показывают около 75% для математики и кодирования и 60% для сложного многокомпонентного вызова функций, что все равно впечатляет для модели, меньшей в 10 раз. Автор отмечает, что троичная модель превосходит оригинал по скорости, генерируя текст быстрее. Кроме того, включен спекулятивный драфтер DSpark для повышения скорости генерации на 35% без потери качества. Однако модель требует специальной ветки llama.cpp из-за нестандартных форматов квантования, и автор демонстрирует, как ее собрать и запустить. Автор заключает, что это значительное достижение, предлагающее качество, сопоставимое с более крупными квантованными моделями, при этом помещаясь в меньший объем видеопамяти, что делает ее пригодной для локального развертывания и потенциально для мобильных устройств, таких как iPhone 17 Pro Max.