Cara mencegah psikolog AI dari sycophancy dan halusinasi: uraian teknis tentang perlindungan keselamatan
Artikel ini mengkaji mengapa LLM tujuan umum berbahaya dalam peran kesehatan mental karena sycophancy, halusinasi, dan krisis kebutaan. Diuraikan perlindungan keselamatan (pengaman perimeter seperti disclaimer, protokol krisis, skala tervalidasi) dan menyoroti arsitektur multi-agen (misalnya, Vera) di mana supervisor AI kedua dan peninjau akademis memeriksa setiap respons. Trade-off-nya adalah biaya dan latensi yang lebih tinggi untuk peninjauan tingkat konten, dan penulis bertanya di mana keseimbangan antara keselamatan dan biaya seharusnya berada.
Character.AI
Habr — хаб ИИ29.07 · 16:01
