Keamanan AIAplikasi 🇷🇺 29.07.2026 16:01

Cara mencegah psikolog AI dari sycophancy dan halusinasi: uraian teknis tentang perlindungan keselamatan

Character.AICharacter.AI
Artikel ini mengkaji mengapa LLM tujuan umum berbahaya dalam peran kesehatan mental karena sycophancy, halusinasi, dan krisis kebutaan. Diuraikan perlindungan keselamatan (pengaman perimeter seperti disclaimer, protokol krisis, skala tervalidasi) dan menyoroti arsitektur multi-agen (misalnya, Vera) di mana supervisor AI kedua dan peninjau akademis memeriksa setiap respons. Trade-off-nya adalah biaya dan latensi yang lebih tinggi untuk peninjauan tingkat konten, dan penulis bertanya di mana keseimbangan antara keselamatan dan biaya seharusnya berada.
Artikel tersebut berpendapat bahwa LLM tujuan umum tidak cocok untuk psikoterapi karena tiga kelemahan bawaan: sikap manis (model yang dilatih dengan RLHF cenderung setuju dengan pengguna), halusinasi (pembuatan fakta palsu yang meyakinkan), dan pengawasan krisis (model sering gagal mengenali niat bunuh diri, seperti dalam kasus remaja Florida tahun 2024 yang melibatkan Character.AI). Respons industri adalah keamanan – obvyazka – mekanisme eksternal seperti penafian, hotline krisis, skala yang divalidasi (PHQ‑9, GAD‑7, skala Beck, HADS), kuesioner krisis (SCI‑2, SIS), dan langkah-langkah privasi. Namun, semua ini beraksi di perimeter dan tidak memeriksa konten respons yang sebenarnya. Pendekatan yang lebih maju, yang diterapkan oleh layanan Vera, menggunakan sistem multi-agen: seorang AI-psikolog menghasilkan balasan, seorang AI-pengawas meninjau nada dan keamanan, dan seorang AI-akademisi memeriksa rekomendasi terhadap bukti. Putaran kedua ini menangkap sikap manis dan nasihat palsu, tetapi melipatgandakan panggilan API, meningkatkan biaya dan latensi. Di antara tujuh layanan terapi AI berbahasa Rusia yang disurvei, hanya Vera yang mengklaim memiliki tinjauan kedua seperti itu; yang lain hanya mengandalkan perlindungan perimeter. Penulis bertanya di mana letak batas wajar antara obvyazka perimeter yang murah dan verifikasi konten yang mahal, dan menyarankan bahwa pemeriksaan selektif mungkin menawarkan jalan tengah.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru