Riset 🇺🇸 27.07.2026 12:03

Makalah Riset LLM: Daftar 2026 (Januari hingga Mei)

NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MistralMistral BaiduBaidu CohereCohere Technology Innovation InstituteTechnology Innovation Institute MiniMaxMiniMax
Sebastian Raschka menyusun daftar kurasi makalah riset LLM yang ia tandai dari Januari hingga Mei 2026, mencakup arsitektur, pelatihan efisien, penalaran, agen, dan lainnya. Daftar tersebut mencakup arsitektur hibrida (Nemotron 3, Mamba-3), model penalaran, dan infrastruktur penyajian praktis.
Sebastian Raschka memiliki kebiasaan menyimpan daftar terus-menerus dari makalah penelitian yang ingin ia baca atau kutip. Untuk paruh pertama tahun 2026, ia menyusun daftar kurasi makalah yang ditandai dari Januari hingga Mei. Daftar ini tidak lengkap, tetapi mencerminkan minatnya pada model penalaran, pembelajaran penguatan, inferensi yang efisien, kerangka kerja agen, penggunaan alat, konteks panjang, model bahasa difusi, dan infrastruktur penyajian yang praktis. Kategori-kategori yang tercakup meliputi Arsitektur dan Desain Model, Pelatihan dan Penskalakan yang Efisien, Efisiensi Inferensi dan Cache KV, Perhatian Jarang dan Konteks Panjang, Penalaran dan Komputasi Waktu Uji, Pembelajaran Penguatan dan RLVR, Sistem Agen dan Penggunaan Alat, Agen Pengkodean dan Rekayasa Perangkat Lunak, Model Bahasa Difusi, serta Evaluasi Model dan Tolok Ukur. Makalah yang menonjol termasuk Nemotron 3 Super, yang menggunakan arsitektur hybrid Mamba-Transformer untuk efisiensi, dan Mamba-3 serta Gated DeltaNet-2 sebagai alternatif untuk perhatian. Raschka menekankan bahwa efisiensi konteks panjang penting karena model bahasa besar (LLM) digunakan dalam sistem agen seperti OpenClaw. Ia juga mencatat tren arsitektur hybrid dengan perhatian bergantian dan lapisan alternatif, seperti yang terlihat pada Qwen3.6 dengan lapisan Gated DeltaNet.
Sumber: Sebastian Raschka — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru