Goedkoop te genereren, duur om te verifiëren: de verborgen kosten van AI-output
DeepMind
Google/DeepMind
Anthropic
OpenAI
DeepSeek
Het artikel onderzoekt de asymmetrie die AI introduceert: terwijl het genereren van concepten en antwoorden nu goedkoop is, blijft het verifiëren van hun nauwkeurigheid moeilijk en kostbaar. Het benadrukt onderzoek dat aantoont dat zelfs individueel ware feiten kunnen combineren tot onjuiste conclusies, en dat verificatietools, zowel menselijk als geautomatiseerd, aanzienlijke beperkingen hebben.
Het artikel bespreekt de uitdaging van het verifiëren van door AI gegenereerde inhoud, waarbij de nadruk ligt op de asymmetrie tussen lage generatiekosten en hoge verificatiekosten. Onderzoekers van de Nationale Taiwan Universiteit ontdekten dat taalmodellen verifieerbare feiten over verschillende mensen kunnen combineren tot één biografie van een niet-bestaand persoon; standaard feitelijkheidsmetingen misten dit, en na correctie voor entiteitsambiguïteit daalden de scores voor vier open modellen met meer dan 10%. Een studie genaamd 'Verify with Caution' testte vijf feitelijkheidsmetingen op elf datasets en vond inconsistenties en fouten, vooral wanneer de ondersteunende tekst ver van de bewering af stond. In menselijke experimenten versnelde AI-assistentie de verificatie, maar leidde tot overmatig vertrouwen wanneer het model overtuigende maar foutieve uitleg gaf; het tonen van voor- en nadelen verminderde dit, maar bood geen significant voordeel ten opzichte van zoeken. Het artikel vergelijkt verificatie over domeinen: code heeft compilers en tests, wiskunde gebruikt formele bewijsverificatie (bijvoorbeeld AlphaProof en AlphaGeometry 2 losten vier problemen op tijdens de Internationale Wiskunde Olympiade 2024), maar analyses en strategie zijn moeilijker te verifiëren. Suggesties zijn onder andere om eerst bronnen te presenteren, zoals in 'Attribute First, then Generate', en het gebruik van procesbeloningen (ThinkPRM) om redeneerstappen te controleren. Het artikel vermeldt ook de risicogebaseerde benadering van NIST en de Europese AI-wet, die meer documentatie en toezicht vereisen voor systemen met een hoog risico.
Bron: Habr — хаб ИИ —
origineel
