MallitLaitteisto ja päättely 🇷🇺 28.07.2026 20:02

Näin kutistin venäläisen upotuskoneen 24 miljoonaan parametriin – ja melkein pilasin sen yhdellä numerolla

DeepPavlovDeepPavlov BAAIBAAI MicrosoftMicrosoft
Insinööri koulutti kevyen venäläisen tiheän hakukoneen, STRIZH:n, jossa on 24,4 miljoonaa parametria ja 4 kerrosta, paikalliseen RAG-käyttöön jaetulla GPU:lla. Yksi väärä numero tokenisaattorin asetuksissa (model_max_length=256) pudotti Recall@10:n arvosta 0,589 arvoon 0,448, mikä melkein mitätöi työn. Malli on tarkoitettu nopeaan ensimmäisen vaiheen hakuun AMD Strix Halo -laitteella, ja se kilpailee bge-m3:n kanssa rinnakkaisasennusskenaarioissa.
Kirjoittaja kehitti pienen venäjänkielisen tiheän haun mallin nimeltä STRIZH paikallista RAG-järjestelmää varten, joka toimii AMD Strix Halo -solmussa, jossa on 128 Gt yhtenäistä muistia. Solmun iGPU on jaettu generatiivisen LLM:n, upottajan, uudelleenjärjestäjän ja säännöllisen indeksoinnin kesken, joten kevyt hakija on tarpeen laskennallisen kilpailun vähentämiseksi. Epäonnistuneen upotusregressioyrityksen jälkeen keskimääräisen neliövirheen (MSE) avulla kirjoittaja onnistui kouluttamaan 12 kerroksen hakumallin kontrastiivisella oppimisella ja tislaamaan sen sitten 4 kerrokseen. STRIZH:ssa on 24,4 miljoonaa parametria, vektorikoko 384, keskiarvopoolaus, ei kysely- eikä kappale-etuliitteitä, ja se tukee enintään 8192 tokenin kontekstia. Paikallisessa korpuksessa se saavutti Recall@10-arvon 0,751 suodatetussa osajoukossa ja 0,800 koko joukossa. Rinnakkaisajossa Qwen3.6-35B-A3B:n kanssa STRIZH aiheutti vain 2 prosentin laskun generoinnin suorituskyvyssä verrattuna bge-m3:n 7 prosenttiin 200 kyselyn sekuntinopeudella verkossa, ja se indeksoi 46 erää sekunnissa verrattuna 4,9:ään. Julkaisun jälkeen löydettiin kuitenkin virhe: tokenisoijan konfiguraatiossa oli model_max_length=256, mikä pakotettuna johti Recall@10-arvon laskuun 0,589:stä 0,448:aan. Kirjoittaja huomauttaa, että STRIZH ei ole tarkoitettu korvaamaan suurempia malleja, kuten USER2-small tai bge-m3, vaan täyttämään aikarajan tehokkaalle tiheälle haulle tiukkojen laskentabudjettien alla.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset