Laitteisto ja päättelyAvoin lähdekoodi 🇺🇸 28.07.2026 11:02

1-bittisen Bonsai-27B-mallin käyttöönotto PrismML llama.cpp:llä paikalliseen päättelyyn

PrismMLPrismML
Tässä opetusohjelmassa käsitellään 1-bittisen kvantisoidun Bonsai-27B-kielimallin käyttöönottoa käyttäen PrismML-haaraa llama.cpp:stä. Se kattaa GPU-ympäristön asennuksen, CUDA-yhteensopivien binäärien kääntämisen, GGUF-mallin lataamisen Hugging Facesta, komentorivitestien suorittamisen, OpenAI-yhteensopivan paikallisen päättelypalvelimen käynnistämisen sekä vuorovaikutuksen Python-asiakasohjelmalla, joka tukee suoratoistoa, monivaiheista keskustelua ja koodin tuottamista. Valinnaisia ominaisuuksia, kuten pitkä konteksti, spekulatiivinen dekoodaus ja näköominaisuudet, käsitellään myös.
Ohjeessa kuvataan 1-bittisen Bonsai-27B-mallin käyttöönotto, joka käyttää Q1_0_g128 GGUF-kvantisointimuotoa, PrismML-haarukan avulla llama.cpp:stä. Se alkaa tarkistamalla näytönohjaimen, asentamalla riippuvuudet, kääntämällä CUDA-tuetut päätelmäbinäärit ja lataamalla pakatur mallipainot Hugging Face Hubista. Mallia testataan llama-cli:llä, minkä jälkeen käynnistetään OpenAI-yhteensopiva paikallinen päättelypalvelin. Python-asiakasohjelma on annettu vuorovaikutusta varten palvelimen kanssa, ja se tukee tavallisia täydennyksiä, suoratoistoa, monivuoroisia keskusteluja ja koodin tuottamista. Valinnaisia asetuksia ovat pitkä konteksti -päättely, 4-bittinen KV-välimuisti, spekulatiivinen dekoodaus DSpark-drafterilla ja näkökyvyn tuki. Ohjeessa mainitaan myös ternäärisen muunnelman saatavuus korkeamman laadun takaamiseksi.
Lähde: MarkTechPost — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset