Ant Bailing Releases New Hybrid Reasoning Model Ling-3.0-Flash
Ant Bailing (a Chinese company) has introduced a new model, Ling-3.0-Flash, with 124 billion total parameters and 5.1 billion active parameters. The model is already available on OpenRouter, free for one week, and will then be open-sourced. It achieves results comparable to models two to three times larger, thanks to a new hybrid attention architecture.
Pada 24 Juli, Ant Bailing (蚂蚁百灵) secara resmi merilis model penalaran hibrida asli generasi baru, Ling-3.0-Flash. Total parameter model mencapai 124 miliar, dengan 5,1 miliar parameter yang aktif dalam satu perhitungan. Dengan pengurangan volume yang signifikan dan biaya komputasi yang lebih rendah, model ini dalam indikator kunci seperti penalaran dasar, kepatuhan terhadap instruksi, dan pemrosesan teks panjang, setara atau melampaui model industri terkemuka dengan parameter 2-3 kali lebih besar, menunjukkan 'rasio kecerdasan terhadap efisiensi' dan kepraktisan yang lebih tinggi. Diketahui, model ini sudah tersedia di OpenRouter, gratis selama seminggu, dan akan sepenuhnya dibuka setelahnya. Versi ini memberikan perhatian khusus pada penyesuaian mendalam untuk skenario aplikasi agen. Model ini memperluas lingkungan pembelajaran dengan lebih dari 10.000 interaksi nyata dan mengoptimalkan mekanisme koreksi diri serta perencanaan jangka panjang untuk tugas kompleks. Dalam skenario seperti penulisan kode, dekomposisi tugas kompleks, dan analisis mendalam informasi multi-sumber, model ini menunjukkan peningkatan kemampuan penyelesaian tugas otonom, mengatasi masalah 'penyimpangan' atau interupsi model tradisional dalam tugas besar. Kunci dari 'volume kecil dan kecerdasan tinggi' terletak pada desain ulang arsitektur komputasi dasar. Ling-3.0-Flash meninggalkan penambahan parameter sederhana, pada tahap prapelatihan menggunakan arsitektur perhatian hibrida, mengganti perhatian linear KDA dan MLA dengan rasio 5:1. Selain itu, model ini memperbarui Lightning Attention generasi sebelumnya menjadi KDA (Kimi Delta Attention), memperkenalkan gerbang diagonal granularitas halus dalam pembaruan status Aturan Delta, memungkinkan memori yang lebih tepat dari informasi kunci saat memproses dokumen panjang dan basis kode. Bersamaan, model ini lebih lanjut memampatkan rasio aktivasi pakar per token dari 1/32 menjadi 1/64, memberikan 'leverage efisiensi' yang lebih tinggi. Untuk operasi AI-agen yang lebih cepat dan stabil, Ant Bailing juga menyediakan arsitektur rekayasa dan kolaborasi yang sesuai. Dalam kecepatan respons, dengan diperkenalkannya caching hierarkis kluster, komputasi berulang dalam dialog panjang dan interaksi multi-ronde dapat dihindari, mengurangi latensi token pertama pada input panjang sebesar 60-80%. Dalam stabilitas tugas, arsitektur interaksi multi-agen yang diperbarui memungkinkan agen yang berbeda bekerja bersama dan saling memeriksa, secara efektif mengurangi risiko kesalahan model tunggal.
Sumber: QbitAI 量子位 —
asli
