Nhà phát triển AI mua sách cũ số lượng lớn để huấn luyện, sau đó tiêu hủy chúng
Anthropic
Google/DeepMind
Các nhà phát triển AI đang mua hàng triệu cuốn sách cũ thông qua trung gian để tạo tập dữ liệu huấn luyện chất lượng cao, tránh nội dung web do AI tạo ra kém chất lượng. Các công ty như Anthropic đã chi hàng triệu đô la để số hóa sách và sau đó tiêu hủy chúng, gây ra lo ngại về đạo đức liên quan đến mất mát các bản in hiếm và hạn chế truy cập vào dữ liệu đã quét.
Các nhà phát triển AI đang mua hàng triệu cuốn sách cũ thông qua trung gian để xây dựng tập dữ liệu huấn luyện chất lượng cao cho mô hình của họ, tránh lượng nội dung tràn lan chất lượng thấp do AI tạo ra trên internet. Anthropic đã chi vài triệu đô la để số hóa số lượng lớn sách in nhằm huấn luyện Claude, sau đó tiêu hủy số sách này, được mua từ Better World Books. Một tòa án đã phán quyết việc sử dụng là hợp lý, nhưng Anthropic có thể đối mặt với khoản tiền phạt lên tới 1,5 tỷ đô la liên quan đến thư viện 7 triệu cuốn sách điện tử bị sao chép trái phép; một vụ kiện tương tự đã được đệ trình chống lại Google về việc huấn luyện Gemini trên các bản sao sách thu được bất hợp pháp. Cơ sở dữ liệu ISBNdb, chứa 111 triệu cuốn sách đã được phân loại, hiện cung cấp dịch vụ mua buôn cho các nhà phát triển AI, với các đơn hàng từ hàng nghìn đến một triệu bản mỗi giao dịch. Tom Harvey, người từng làm việc trong Dự án Panama tại Anthropic, xác nhận rằng việc số hóa sử dụng cả phương pháp quét không phá hủy và phá hủy, trong đó phương pháp sau rẻ hơn và nhanh hơn nhưng hủy hoại hàng triệu cuốn sách. Thực tiễn này đặt ra các vấn đề đạo đức về việc loại bỏ sách quý hiếm hoặc có giá trị khỏi lưu thông và hạn chế quyền truy cập công cộng vào nội dung đã số hóa.
Nguồn: 3DNews —
bản gốc
