ИсследованияМодели 🇨🇳 15.08.2026 11:03

Новый путь к интерпретируемости больших языковых моделей: декомпозиция весов с затратами данных менее 1%

OpenAI Alibaba/Qwen
Исследователи из IQuest Research, Safe AI Forum, Оксфорда, Стэнфорда и Университета Цинхуа предлагают метод разреженной декомпозиции весов (SWD) для интерпретации больших языковых моделей путем разложения предобученных матриц весов на разреженные факторы, что устраняет необходимость обучения отдельных заменяющих сетей. SWD использует менее 1% данных, требуемых для базовых методов, основанных на обучении, таких как Transcoder, масштабируется до моделей с 27 миллиардами параметров и позволяет извлекать схемы и выполнять целевую правку непосредственно из весов.
IQuest Research Institute совместно с коллегами из Safe AI Forum, Оксфордского университета, Стэнфордского университета и Университета Цинхуа предлагает новый подход к механистической интерпретируемости больших языковых моделей, названный разреженной декомпозицией весов (Sparse Weight Decomposition, SWD). Вместо обучения отдельной сети с разреженным представлением для аппроксимации слоёв модели,
Показать ещё ↓
Источник: QbitAI 量子位 — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости