Halusinasi LLM: Bagaimana Model AI Menciptakan Paket yang Tidak Ada
OpenAI
Meta
DeepSeek
Mistral
Sebuah studi baru mengungkapkan bahwa model bahasa besar sering berhalusinasi nama paket, menimbulkan risiko serangan rantai pasokan. Para peneliti menguji 16 model, menghasilkan 576.000 sampel kode, dan menemukan bahwa rata-rata 19,7% rekomendasi paket bersifat fiktif. Mereka juga mengusulkan strategi mitigasi.
Studi 'We Have a Package for You!' menganalisis halusinasi paket oleh model bahasa besar (LLM) yang menghasilkan kode. Para peneliti menguji 16 model, termasuk GPT-3.5, GPT-4, GPT-4 Turbo, CodeLlama, DeepSeek Coder, dan lainnya, dengan menghasilkan 576.000 sampel kode untuk Python dan JavaScript. Mereka menemukan bahwa 440.445 rekomendasi (19,7%) adalah halusinasi, dengan model komersial berhalusinasi setidaknya 5,2% dan model terbuka 21,7%. Model lebih cenderung berhalusinasi pada topik terkini, dan suhu yang lebih rendah mengurangi tetapi tidak menghilangkan risiko. Studi ini juga menemukan bahwa model sering mengulang halusinasi mereka sendiri, dan bahwa sebagian besar nama yang berhalusinasi bukanlah salah ketik sederhana dari paket asli. Penelitian ini memenangkan Penghargaan Makalah Terhormat di USENIX Security 2025.
Sumber: Habr — хаб ИИ —
asli
