ستاتيستا: نحو ربع مصادر لاما للذكاء الاصطناعي جاءت من الكتب
Meta
وفقًا لتحليل ستاتيستا، حوالي 25% من البيانات التي دُرِّب عليها نموذج اللغة ميتا لاما جاءت من الكتب. وهذا مماثل لحصة المصادر من الإنترنت، بما في ذلك الأخبار ومواقع التواصل الاجتماعي ونصوص أخرى.
شركة التحليلات Statista نشرت تقييماً لمصادر البيانات المستخدمة في تدريب نموذج اللغة Llama من شركة Meta. وفقاً لبيانات Statista، نحو ربع (حوالي 25%) من جميع المواد النصية المستخدمة كانت من الكتب. هذا المؤشر مماثل لحجم البيانات المستخرجة من الإنترنت، بما في ذلك الأخبار ووسائل التواصل الاجتماعي وغيرها من الموارد عبر الإنترنت. يعتمد التقييم على تحليل البيانات المفتوحة حول مجموعات التدريب التي نشرتها Meta. نسبة الكتب تبرز أهمية المطبوعات كمصدر للمعرفة لنماذج اللغة الكبيرة الحديثة.
المصدر: Meta AI (GNews) —
الأصلي
