AI-ontwikkelaars kopen tweedehands boeken in bulk voor training en vernietigen ze daarna
Anthropic
Google/DeepMind
AI-ontwikkelaars kopen via tussenpersonen miljoenen tweedehands boeken op om hoogwaardige trainingsdatasets te creëren, en vermijden zo de lage kwaliteit van door AI gegenereerde webinhoud. Bedrijven zoals Anthropic hebben miljoenen uitgegeven aan het digitaliseren van boeken, die vervolgens worden vernietigd. Dit roept ethische vragen op over het verlies van zeldzame edities en de beperkte toegang tot gescande gegevens.
AI-ontwikkelaars kopen via tussenpersonen miljoenen tweedehands boeken om hoogwaardige trainingsdatasets voor hun modellen te maken, waarbij ze de vloed van laagwaardige AI-gegenereerde content op internet vermijden. Anthropic gaf enkele miljoenen dollars uit om grote aantallen gedrukte boeken te digitaliseren voor het trainen van Claude en vernietigde vervolgens de boeken, die het had gekocht van Better World Books. Een rechtbank oordeelde dat het gebruik eerlijk was, maar Anthropic riskeert een mogelijke boete van 1,5 miljard dollar vanwege een bibliotheek met 7 miljoen illegaal verkregen e-books; een soortgelijke rechtszaak werd aangespannen tegen Google vanwege trainingsdata op onrechtmatig verkregen boekkopieën voor Gemini. De ISBNdb-database, die 111 miljoen gecatalogiseerde boeken bevat, biedt nu groothandelsaankoopdiensten aan voor AI-ontwikkelaars, met bestellingen variërend van duizenden tot een miljoen exemplaren per transactie. Tom Harvey, die aan Project Panama bij Anthropic werkte, bevestigde dat digitalisering zowel niet-destructieve als destructieve scansmethoden gebruikt, waarbij de laatste goedkoper en sneller is maar miljoenen boeken vernietigt. Deze praktijk roept ethische vragen op over het verwijderen van waardevolle of zeldzame boeken uit de roulatie en het beperken van openbare toegang tot gescande content.
Bron: 3DNews —
origineel
