Desenvolvedores de IA Compram Livros Usados em Massa para Treinamento e os Destroem
Anthropic
Google/DeepMind
Desenvolvedores de IA estão comprando milhões de livros usados por meio de intermediários para criar conjuntos de dados de treinamento de alta qualidade, evitando conteúdo web gerado por IA de baixa qualidade. Empresas como a Anthropic gastaram milhões digitalizando livros e depois os destruindo, levantando preocupações éticas sobre a perda de edições raras e o acesso restrito aos dados digitalizados.
Desenvolvedores de IA estão comprando milhões de livros usados por meio de intermediários para construir conjuntos de dados de treinamento de alta qualidade para seus modelos, evitando a enxurrada de conteúdo gerado por IA de baixa qualidade na internet. A Anthropic gastou vários milhões de dólares digitalizando um grande número de livros impressos para treinar o Claude e, em seguida, destruiu os livros, tendo-os comprado da Better World Books. Um tribunal considerou o uso justo, mas a Anthropic enfrenta uma multa potencial de US$ 1,5 bilhão devido a uma biblioteca de 7 milhões de e-books pirateados; um processo semelhante foi movido contra o Google pelo treinamento do Gemini em cópias de livros obtidas ilegalmente. O banco de dados ISBNdb, que contém 111 milhões de livros catalogados, agora oferece serviços de compra no atacado para desenvolvedores de IA, com pedidos que variam de milhares a um milhão de cópias por transação. Tom Harvey, que trabalhou no Projeto Panamá na Anthropic, confirmou que a digitalização utiliza métodos de escaneamento não destrutivos e destrutivos, sendo este último mais barato e rápido, mas destruindo milhões de livros. Essa prática levanta preocupações éticas sobre a remoção de livros valiosos ou raros de circulação e a restrição do acesso público ao conteúdo digitalizado.
Fonte: 3DNews —
original
