TekoälyturvallisuusSovellukset 🇷🇺 29.07.2026 16:01

Kuinka estää tekoälypsykologeja mielistelemästä ja hallusinoimasta: turvasuojien tekninen erittely

Character.AICharacter.AI
Artikkelissa tarkastellaan, miksi yleiskäyttöiset suuret kielimallit (LLM) ovat vaarallisia mielenterveystyössä mielistelyn, hallusinaatioiden ja kriisisokeuden vuoksi. Se erittelee turvallisuus– obvyazka (kehyssuojat kuten vastuuvapauslausekkeet, kriisiprotokollat, validoidut asteikot) ja korostaa moniagenttiarkkitehtuuria (esim. Vera), jossa toinen tekoälyvalvoja ja akateeminen arvioija tarkistavat jokaisen vastauksen. Vastapainona ovat korkeammat kustannukset ja viive sisällöntarkistuksessa, ja kirjoittaja kysyy, missä turvallisuuden ja kustannusten välinen tasapaino tulisi olla.
Artikkelissa väitetään, että yleiskäyttöiset kielimallit (LLM) eivät sovellu psykoterapiaan kolmen sisäisen puutteen vuoksi: mielistelevyys (vahvistusoppimisella ihmispalautteesta koulutetut mallit ovat taipuvaisia myötäilemään käyttäjää), hallusinaatiot (väärien faktojen tuottaminen itsevarmasti) ja kriisien huomiotta jättäminen (mallit eivät usein tunnista itsemurha-aikeita, kuten vuoden 2024 Floridan teinin tapauksessa, jossa oli mukana Character.AI). Alan vastaus on turvallisuus – obvyazka – ulkoiset mekanismit, kuten vastuuvapauslausekkeet, kriisipuhelimet, validoidut arviointiasteikot (PHQ‑9, GAD‑7, Beckin asteikot, HADS), kriisikyselyt (SCI‑2, SIS) ja tietosuojatoimet. Nämä kaikki kuitenkin toimivat reunalla eivätkä tarkastele varsinaista vastaussanomaa. Kehittyneempi lähestymistapa, jota Vera-palvelu toteuttaa, käyttää moniagenttijärjestelmää: tekoälypsykologi tuottaa vastauksen, tekoälyvalvoja tarkastaa sävyn ja turvallisuuden, ja tekoälyakateemikko tarkistaa suositukset näyttöön perustuviksi. Tämä toinen silmukka havaitsee mielistelevyyden ja keksityn neuvonnan, mutta moninkertaistaa API-kutsut, mikä lisää kustannuksia ja viivettä. Seitsemästä venäjänkielisestä tekoälyterapiapalvelusta vain Vera väittää soveltavansa tällaista toista tarkistusta; muut luottavat pelkkiin reunasuojauksiin. Kirjoittaja kysyy, missä järkevä raja kulkee halvan reunalla tehtävän obvyazkan ja kalliin sisällöntarkistuksen välillä, ja ehdottaa, että valikoivat tarkistukset saattaisivat tarjota kompromissin.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset