Hoe AI-psychologen te beschermen tegen vleierij en hallucinaties: een technische uiteenzetting van veiligheidsmechanismen
Het artikel onderzoekt waarom algemene LLM's gevaarlijk zijn in de rol van psycholoog vanwege vleierij, hallucinaties en crisisblindheid. Het bespreekt de veiligheids-‘obvyazka’ (randbeveiliging zoals disclaimers, crisisprotocollen, gevalideerde schalen) en belicht een multi-agentarchitectuur (bijv. Vera) waarbij een tweede AI-supervisor en een academische beoordelaar elke reactie controleren. De afweging is hogere kosten en latentie voor beoordeling op inhoudsniveau, en de auteur vraagt waar de balans tussen veiligheid en kosten moet liggen.
Character.AI
Habr — хаб ИИ29.07 · 16:01
