Ant Bailing julkaisee uuden hybridipäättelymallin Ling-3.0-Flash
Ant Bailing on virallisesti julkaissut uuden natiivin hybridipäättelymallinsa Ling-3.0-Flash, jossa on yhteensä 124 miljardia parametria, joista vain 5,1 miljardia aktivoituu laskentakertaa kohti. Se vastaa tai ylittää 2-3 kertaa suuremmat mallit päättelyssä, ohjeiden noudattamisessa ja pitkän kontekstin tehtävissä tarjoten parempaa tehokkuutta. Malli on saatavilla OpenRouterissa rajoitetun ilmaisviikon ajan ennen avoimen lähdekoodin julkaisua.
Heinäkuun 24. päivänä Ant Bailing julkaisi Ling-3.0-Flash-mallin, jossa on yhteensä 124B parametria ja 5,1B aktivoituu joka askeleella. Se saavuttaa suorituskyvyn, joka on verrattavissa 2–3 kertaa suurempiin malleihin, samalla kun laskentakustannukset pienenevät. Malli on suunniteltu agenttisovelluksiin, ja siinä on yli 10 000 todellista vuorovaikutusympäristöä sekä parannettu itsekorjaus- ja pitkän aikavälin suunnittelukyky. Malli käyttää hybridihuomioarkkitehtuuria, jossa KDA-lineaarisen huomion ja MLA-kerrosten suhde on 5:1, ja Lightning Attention on päivitetty KDA:ksi tilan seurannan parantamiseksi. Asiantuntijaaktivointi tokenia kohti on vähennetty 1/32:sta 1/64:ään, mikä tehostaa toimintaa. Tekniset parannukset sisältävät klusteritason välimuistin, joka vähentää ensimmäisen tokenin viivettä 60–80 prosenttia, sekä moniagenttiyhteistyökehyksen vakauden takaamiseksi.
Lähde: QbitAI 量子位 —
Alkuperäinen
