مطورو الذكاء الاصطناعي يشترون الكتب المستعملة بكميات كبيرة لتدريب النماذج ثم يتلفونها
Anthropic
Google/DeepMind
يقوم مطورو الذكاء الاصطناعي بشراء ملايين الكتب المستعملة عبر وسطاء لإنشاء مجموعات بيانات تدريبية عالية الجودة، متجنبين بذلك المحتوى الرديء المولد بالذكاء الاصطناعي على الويب. وقد أنفقت شركات مثل Anthropic ملايين الدولارات على رقمنة الكتب ثم إتلافها، مما يثير مخاوف أخلاقية حول فقدان النسخ النادرة وتقييد الوصول إلى البيانات الممسوحة ضوئياً.
يطور مطورو الذكاء الاصطناعي مجموعات بيانات تدريب عالية الجودة عبر شراء ملايين الكتب المستعملة من خلال وسطاء، متجنبين بذلك الفيض الهائل من المحتوى الرديء المُنشأ بواسطة الذكاء الاصطناعي على الإنترنت. أنفقت شركة Anthropic عدة ملايين من الدولارات على رقمنة أعداد كبيرة من الكتب المطبوعة لتدريب نموذج كلود (Claude)، ثم أتلفت الكتب بعد شرائها من شركة Better World Books. قضت محكمة بأن هذا الاستخدام عادل، لكن أنثروبيك تواجه غرامة محتملة تبلغ 1.5 مليار دولار بسبب مكتبة تضم 7 ملايين كتاب إلكتروني مقرصَن؛ كما رُفعت دعوى قضائية مماثلة ضد جوجل بشأن تدريب نموذج جيميني (Gemini) على نسخ كتب تم الحصول عليها بطريقة غير قانونية. تقدم قاعدة بيانات ISBNdb، التي تضم 111 مليون كتاب مُفهرس، الآن خدمات شراء بالجملة لمطوري الذكاء الاصطناعي، وتتراوح الطلبات من آلاف إلى مليون نسخة لكل صفقة. أكد توم هارفي، الذي عمل على مشروع بنما (Project Panama) في أنثروبيك، أن عملية الرقمنة تستخدم طرق المسح غير المُدمِّر والمسح المُدمِّر، حيث تكون الأخيرة أرخص وأسرع ولكنها تُتلِف ملايين الكتب. تثير هذه الممارسة مخاوف أخلاقية بشأن إزالة الكتب القيمة أو النادرة من التداول وتقييد وصول الجمهور إلى المحتوى الممسوح ضوئياً.
المصدر: 3DNews —
الأصلي
