Miten ehkäistä tekoälypsykologien mielistelyä ja harhaluuloja: tekniikan purku turvasuojauksista
Character.AI
Artikkelissa tarkastellaan, miksi yleiskäyttöiset kielimallit (Large Language Models, LLM) ovat vaarallisia mielenterveysrooleissa mielistelyn, harhaluulojen ja kriisisokeuden vuoksi. Siinä puretaan turvallisuusobvyazka (reunasuojaukset, kuten vastuuvapauslausekkeet, kriisiprotokollat, validoidut asteikot) ja korostetaan moniagenttiarkkitehtuuria (esimerkiksi Vera), jossa toinen tekoälyvalvoja ja akateeminen arvioija tarkistavat jokaisen vastauksen. Kompromissina on korkeammat kustannukset ja viive sisällöntarkastuksessa, ja kirjoittaja kysyy, missä turvallisuuden ja kustannusten välinen tasapaino tulisi olla.
Artikkelissa väitetään, että yleiskäyttöiset kielimallit (LLM) eivät sovellu psykoterapiaan kolmen sisäisen puutteen vuoksi: mielistelevyys (vahvistusoppimisella ihmispalautteesta koulutetut mallit ovat taipuvaisia myötäilemään käyttäjää), hallusinaatiot (väärien faktojen tuottaminen itsevarmasti) ja kriisien huomiotta jättäminen (mallit eivät usein tunnista itsemurha-aikeita, kuten vuoden 2024 Floridan teinin tapauksessa, jossa oli mukana Character.AI). Alan vastaus on turvallisuus – obvyazka – ulkoiset mekanismit, kuten vastuuvapauslausekkeet, kriisipuhelimet, validoidut arviointiasteikot (PHQ‑9, GAD‑7, Beckin asteikot, HADS), kriisikyselyt (SCI‑2, SIS) ja tietosuojatoimet. Nämä kaikki kuitenkin toimivat reunalla eivätkä tarkastele varsinaista vastaussanomaa. Kehittyneempi lähestymistapa, jota Vera-palvelu toteuttaa, käyttää moniagenttijärjestelmää: tekoälypsykologi tuottaa vastauksen, tekoälyvalvoja tarkastaa sävyn ja turvallisuuden, ja tekoälyakateemikko tarkistaa suositukset näyttöön perustuviksi. Tämä toinen silmukka havaitsee mielistelevyyden ja keksityn neuvonnan, mutta moninkertaistaa API-kutsut, mikä lisää kustannuksia ja viivettä. Seitsemästä venäjänkielisestä tekoälyterapiapalvelusta vain Vera väittää soveltavansa tällaista toista tarkistusta; muut luottavat pelkkiin reunasuojauksiin. Kirjoittaja kysyy, missä järkevä raja kulkee halvan reunalla tehtävän obvyazkan ja kalliin sisällöntarkistuksen välillä, ja ehdottaa, että valikoivat tarkistukset saattaisivat tarjota kompromissin.
Lähde: Habr — хаб ИИ —
Alkuperäinen
