استيراد الذكاء الاصطناعي 461: 'المحاذاة ليست على المسار الصحيح'؛ فرونتير كود؛ و متدربو أبحاث اصطناعيون
Cognition
Alibaba/Qwen
Anthropic
OpenAI
باحثون من معهد أمن الذكاء الاصطناعي في المملكة المتحدة ومنظمة تيمايوس يطلقون منظمة سيكونت غير الربحية، التي تهدف إلى تطوير تقنيات محاذاة مبدئية للذكاء الاصطناعي الخارق، بجمع ما بين 100 إلى 150 مليون دولار أميركي مبدئيًا. شركة كوجنيشن تطلق فرونتير كود، وهو معيار برمجة صعب حيث سجل كلود أوبوس 4.8 درجة 13.4% على المستوى الأصعب. شركة شاومي تنشر تفاصيل عن نموذج ميمو-في2.5-برو-ألترا سبيد، وهو نموذج ذو تريليون معلمة يحقق 1000 رمز في الثانية عبر التصميم المشترك والقياس الكمي. معيار جديد، إيه إي آر آي-بنش، يقيم أنظمة الذكاء الاصطناعي في مهام بحثية على مستوى المبتدئين.
تم تشكيل منظمة بحثية غير ربحية جديدة تُدعى "سيكونت" (Sequent) من قبل باحثين من المعهد البريطاني لأمن الذكاء الاصطناعي وشركة "تيمايوس" (Timaeus) الناشئة في نظرية المحاذاة، وذلك لتطوير تقنيات محاذاة لأنظمة الذكاء الاصطناعي فائقة الذكاء. تهدف "سيكونت" إلى جمع ما بين 100 إلى 150 مليون دولار أمريكي في البداية، والنمو ليصل عدد موظفيها إلى 40-80 موظفًا، مع اتباع اتجاهات بحثية متنوعة تشمل الإشراف القابل للتوسع، ونظرية التعلم، والحجج الاستدلالية، ونظرية الألعاب، والشخصيات، لتحقيق ثقة مبدئية في المحاذاة. أصدرت شركة "كوجنيشن" (Cognition)، الشركة المطورة لـ"ديفين" (Devin)، معيارًا للبرمجة يُدعى "فرونتير كود" (FrontierCode)، يحتوي على 150 مهمة في ثلاث فئات صعوبة (الماسية، الرئيسية، الموسعة)، ويقيس جودة الكود، وقابلية الدمج، والامتثال لمعايير قاعدة الكود؛ وقد حقق نموذج "كلود أوبوس 4.8" (Claude Opus 4.8) نسبة 13.4% فقط في الفئة الماسية، مما يشير إلى وجود مجال كبير للتحسين. أطلقت شركة "شياومي" (Xiaomi) نموذجًا لغويًا ضخمًا يُدعى "مي مو - في 2.5 - برو - ألترا سبيد" (MiMo-V2.5-Pro-UltraSpeed) يحتوي على تريليون معلمة، ويحقق استدلالًا بمعدل 1000 رمز في الثانية على عقدة سلعية مكونة من 8 وحدات معالجة رسومية (GPUs) باستخدام تقنية التكميم FP4، وفك الترميز التخميني عبر نظام "دي فلاش" (DFlash)، وبرنامج "تايل آر تي" (TileRT) من شركة "تايل إيه آي" (Tile AI) الناشئة. طور باحثون من جامعة شيان جياوتونغ وجامعة شيديآن معايير "إيه إيه آر آر" (AARR) التي تبدأ بـ"إيه إيه آر آر آي-بنش" (AARRI-Bench)، لتقييم أنظمة الذكاء الاصطناعي في مهام البحث على مستوى المبتدئين؛ وقد سجل أفضل نظام أداء، وهو "كلود-أوبوس-4.7" (Claude-Opus-4.7) مع "ميني-سو-إيج" (Mini-Swe-Age)، نسبة 42.13% في سيناريو العلوم.
المصدر: Import AI —
الأصلي
