LLM Halüsinasyonları: Yapay Zeka Modelleri Var Olmayan Paketleri Nasıl Uyduruyor
OpenAI
Meta
DeepSeek
Mistral
Yeni bir çalışma, büyük dil modellerinin sıklıkla paket adları konusunda halüsinasyon gördüğünü ve bunun tedarik zinciri saldırı riski oluşturduğunu ortaya koyuyor. Araştırmacılar 16 modeli test ederek 576 bin kod örneği üretti ve paket önerilerinin ortalama yüzde 19,7'sinin hayali olduğunu buldu. Ayrıca hafifletme stratejileri de öneriyorlar.
'Sizin İçin Bir Paketimiz Var!' başlıklı çalışma, kod üreten büyük dil modellerindeki paket halüsinasyonlarını analiz etti. Araştırmacılar, GPT-3.5, GPT-4, GPT-4 Turbo, CodeLlama, DeepSeek Coder ve diğerleri dahil olmak üzere 16 modeli test ederek Python ve JavaScript için 576.000 kod örneği üretti. Önerilerin 440.445'inin (%19,7) halüsinasyon olduğunu, ticari modellerin en az %5,2, açık modellerin ise %21,7 oranında halüsinasyon gördüğünü tespit ettiler. Modellerin güncel konularda halüsinasyon görme olasılığının daha yüksek olduğu ve düşük sıcaklık değerinin riski azalttığı ancak tamamen ortadan kaldırmadığı görüldü. Çalışma ayrıca modellerin kendi halüsinasyonlarını sıklıkla tekrarladığını ve halüsinasyonlu isimlerin çoğunun gerçek paketlerin basit yazım hataları olmadığını ortaya koydu. Araştırma, USENIX Security 2025'te Seçkin Makale Ödülü kazandı.
Kaynak: Habr — хаб ИИ —
orijinal
