SWD напрямую разлагает плотную матрицу весов на две разреженные матрицы A и B, где общие промежуточные измерения становятся «узкими местами» (bottleneck units), которые можно независимо оценивать, отбирать и удалять (абляция). Это позволяет исследователям извлекать задачные контуры непосредственно из весов. В экспериментах с одной матрицей, при сопоставимой точности замены, SWD требует менее 1% данных, необходимых методам на основе обучения, таким как Transcoder. На моделях GPT-2, Qwen2.5 и Qwen3.5-27B SWD обычно достигает тех же целевых показателей достаточности и необходимости с меньшим количеством «узких мест» и активных соединений. Метод масштабируется до моделей с 27 миллиардами параметров и покрывает все 48 матриц весов внимания и MLP модели GPT-2 Small, включая версию без данных, не требующую калибровочного текста. В статье сообщается, что на GPT-2 Small SWD достигает низкого значения дельты перекрёстной энтропии (CE) всего с несколькими тысячами калибровочных токенов, в то время как базовые методы на основе обучения требуют около 10^6 токенов. Полная замена модели на GPT-2 Small с использованием SWD-FT снижает CE с 3.90 до 3.44 при том же количестве соединений, используя около 20,6 миллионов токенов по сравнению с 2,884 миллиардами для базового разреженного предобучения. Семантический анализ высокоранговых «узких мест» на задаче GreaterThan показывает, что четыре из шести реагируют на числа, годы, количества или меры. Целенаправленный эксперимент по редактированию одного компонента (c205) увеличил разрыв логитов для правильного ответа на 0,216 с минимальными побочными эффектами, демонстрируя, что направления, полученные с помощью SWD, могут использоваться для точного контроля поведения.