⚡ BREAKING
Inovasi Arsitektur LLM: Berbagi KV, Embedding Per-Lapisan, dan Perhatian Terkompresi
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute
Sebastian Raschka mengulas kemajuan terbaru arsitektur LLM open-weight yang berfokus pada efisiensi konteks panjang. Teknik utama meliputi berbagi KV antar lapisan (Gemma 4), embedding per-lapisan (Gemma 4 E2B/E4B), penganggaran perhatian per-lapisan (Laguna XS.2), perhatian konvolusional terkompresi (ZAYA1), dan mHC dengan perhatian terkompresi (DeepSeek V4). Ini mengurangi ukuran cache KV dan lalu lintas memori untuk penalaran dan alur kerja agen.
Sebastian Raschka meninjau perubahan arsitektur open-weight LLM terkini yang bertujuan mengurangi biaya konteks panjang. Pada Gemma 4 E2B/E4B, lapisan akhir menggunakan kembali status key-value dari lapisan awal (cross-layer attention), menghemat sekitar setengah ukuran cache KV (misalnya, 2,7 GB pada konteks 128K). Selain itu, model-model ini menggunakan per-layer embeddings (PLE) untuk meningkatkan kapasitas tanpa memperbesar tumpukan transformer utama—jumlah parameter 'efektif' lebih kecil dari total termasuk embeddings. Laguna XS.2 oleh Poolside memvariasikan biaya perhatian per lapisan, dengan 30 lapisan sliding-window (window 512) dan 10 lapisan full-attention. ZAYA1-8B memperkenalkan compressed convolutional attention, dan DeepSeek V4 menggunakan mHC dan compressed attention. Penyesuaian ini didorong oleh kebutuhan yang semakin besar akan pemrosesan konteks panjang yang efisien dalam model penalaran dan alur kerja agen.
Sumber: Sebastian Raschka —
asli
