Yapay zeka psikologlarını yaltaklanma ve halüsinasyondan nasıl koruruz: güvenlik önlemlerinin mühendislik dökümü
Makale, genel amaçlı büyük dil modellerinin (LLM'ler), yaltaklanma, halüsinasyon ve kriz körlüğü nedeniyle ruh sağlığı rollerinde neden tehlikeli olduğunu inceliyor. Güvenlik çerçevesini (feragatnameler, kriz protokolleri, doğrulanmış ölçekler gibi çevresel güvenlik önlemleri) ayrıştırıyor ve ikinci bir yapay zeka denetleyicisi ile akademik denetçinin her yanıtı kontrol ettiği çoklu etmen mimarisini (örneğin Vera) vurguluyor. Buradaki ödünleşim, içerik düzeyinde inceleme için daha yüksek maliyet ve gecikme süresidir ve yazar güvenlik ile maliyet arasındaki dengenin nerede olması gerektiğini soruyor.
Character.AI
Habr — хаб ИИ29.07 · 16:01
