جوجل تقدم TabFM: نموذج أساسي للبيانات الجدولية مع التعلم بدون تدريب مسبق
Google/DeepMind
كشفت جوجل للأبحاث عن TabFM، وهو نموذج أساسي للبيانات الجدولية يستخدم التعلم السياقي بدون تدريب مسبق لأداء مهام التصنيف والانحدار دون تدريب يدوي أو هندسة ميزات. تم تدريب النموذج بالكامل على مئات الملايين من مجموعات البيانات الاصطناعية التي تم إنشاؤها عبر نماذج سببية هيكلية، ويتفوق على الخوارزميات التقليدية مثل XGBoost في معيار TabArena. سيتم دمج TabFM في Google BigQuery، مما يسمح للمستخدمين بتشغيل التنبؤات بأمر SQL بسيط.
قدمت Google Research نموذج TabFM، وهو نموذج أساسي جديد مصمم خصيصًا لتصنيف البيانات الجدولية والانحدار. يستخدم النموذج نهج التعلم في السياق (in-context learning أو ICL)، حيث يعامل مجموعة البيانات بأكملها كموجه موحد لتفسير العلاقات بين الأعمدة والصفوف في وقت الاستدلال، مما يلغي الحاجة إلى ضبط المعلمات الفائقة وهندسة الميزات. يدمج TabFM نقاط القوة من الهياكل مثل TabPFN وTabICL في تصميم هجين جديد للتعامل مع الطبيعة ثنائية الأبعاد وغير المرتبة للجداول. تم تدريبه بالكامل على مئات الملايين من مجموعات البيانات الاصطناعية المولدة باستخدام نماذج سببية هيكلية (structural causal models أو SCMs)، مما يجعل TabFM يعمم جيدًا على بيانات العالم الحقيقي غير المرئية. عند تقييمه على معيار TabArena عبر 38 مجموعة بيانات تصنيف و13 مجموعة بيانات انحدار، تفوق باستمرار على الخوارزميات الخاضعة للإشراف المضبوطة بشدة مثل XGBoost. سيتم دمج TabFM في Google BigQuery، مما يتيح للمستخدمين إجراء انحدار وتصنيف متقدمين باستخدام أمر SQL بسيط هو AI.PREDICT.
المصدر: Google Research —
الأصلي
