ModelPerangkat Keras & Inferensi 🇷🇺 28.07.2026 20:02

Cara Saya Mengecilkan Embedder Rusia menjadi 24 Juta Parameter — dan Hampir Merusaknya dengan Satu Digit

DeepPavlovDeepPavlov BAAIBAAI MicrosoftMicrosoft
Seorang insinyur melatih dense retriever Rusia yang ringan, STRIZH, dengan 24,4 juta parameter dan 4 lapisan, untuk RAG (Retrieval-Augmented Generation) lokal pada GPU bersama. Satu angka yang salah dalam konfigurasi tokenizer (model_max_length=256) menurunkan Recall@10 dari 0,589 menjadi 0,448, hampir membatalkan seluruh pekerjaan. Model ini dirancang untuk retrieval tahap pertama yang cepat pada AMD Strix Halo, bersaing dengan bge-m3 dalam skenario co-residency.
Penulis mengembangkan retriever dense Rusia berukuran kecil bernama STRIZH untuk sistem RAG lokal yang berjalan pada node AMD Strix Halo dengan memori terpadu 128 GB. iGPU pada node tersebut digunakan bersama oleh LLM generatif, embedder, reranker, dan pengindeksan ulang berkala, sehingga diperlukan retriever ringan untuk mengurangi persaingan komputasi. Setelah upaya regresi embedding menggunakan loss MSE gagal, penulis berhasil melatih model donor retrieval dengan 12 lapisan menggunakan pembelajaran kontrastif, lalu menyulingnya menjadi 4 lapisan. STRIZH memiliki 24,4 juta parameter, ukuran vektor 384, mean pooling, tanpa prefiks query/passage, dan mendukung konteks hingga 8192 token. Pada korpus lokal, model ini mencapai Recall@10 sebesar 0,751 pada subset yang difilter dan 0,800 pada set penuh. Dalam benchmark ko-residensi dengan Qwen3.6-35B-A3B, STRIZH hanya menyebabkan penurunan throughput generasi sebesar 2% dibandingkan 7% untuk bge-m3 pada beban online 200 query/detik, dan mengindeks 46 batch/detik dibandingkan 4,9. Namun, ada kesalahan yang ditemukan setelah publikasi: konfigurasi tokenizer memiliki model_max_length=256, yang jika diterapkan menyebabkan penurunan Recall@10 dari 0,589 menjadi 0,448. Penulis mencatat bahwa STRIZH tidak dimaksudkan untuk menggantikan model yang lebih besar seperti USER2-small atau bge-m3, tetapi untuk mengisi ceruk untuk retrieval dense yang efisien di bawah batasan anggaran komputasi yang ketat.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru