استيراد الذكاء الاصطناعي 461: 'المحاذاة ليست على المسار الصحيح'؛ فرونتير كود؛ ومتدربون علميون اصطناعيون

CognitionCognition Alibaba/QwenAlibaba/Qwen AnthropicAnthropic OpenAIOpenAI
أسس باحثون من UK AISI وTimaeus المنظمة غير الربحية Sequent لتطوير أساليب المحاذاة لضمان سلامة الأنظمة فائقة الذكاء. أصدرت Cognition معيار FrontierCode لتقييم جودة الكود، حيث سجل أفضل نموذج، Claude Opus 4.8، 13.4% فقط في أصعب مستوى. كما تم تقديم مجموعة بيانات ChinaHeritaQA لتقييم المعرفة الثقافية لنماذج الرؤية اللغوية حول مواقع التراث العالمي لليونسكو في الصين ونموذج Xiaomi MiMo-V2.5-Pro-UltraSpeed بسرعة توليد تبلغ 1000 رمز في الثانية.
Бывшие сотрудники отдела выравнивания UK AI Security Institute и стартапа Timaeus объединились для создания некоммерческой организации Sequent, которая займётся разработкой техник выравнивания, дающих высокую уверенность в безопасности сверхразумного ИИ. Sequent планирует привлечь $100–150 млн начального финансирования и нанять 40–80 сотрудников, делая ставку на портфель исследовательских направлений: масштабируемый надзор, теория обучения, эвристические аргументы, теория игр и персоны. Cognition, создатель Devin, представила бенчмарк FrontierCode из 150 задач по написанию кода, разделённых на три уровня сложности. Лучший результат на уровне Diamond показал Claude Opus 4.8 — 13.4%, что подтверждает сложность бенчмарка. На китайском рынке Xiaomi анонсировала модель MiMo-V2.5-Pro-UltraSpeed с 1 трлн параметров и скоростью генерации 1000 токенов/с за счёт совместной оптимизации архитектуры и софта, включая FP4-квантование и спекулятивное декодирование DFlash. Исследователи из нескольких университетов создали ChinaHeritaQA — мультимодальный бенчмарк из 2279 изображений 51 объекта Всемирного наследия ЮНЕСКО в Китае и 14 133 вопросов. Лучшая открытая модель Qwen-VL-8B-Instruct показала 81% точности, превзойдя человеческие 67%. Кроме того, исследователи из Сианьского университета Цзяотун и Университета Сяньдянь разработали бенчмарки AARR, оценивающие способность ИИ-агентов выполнять задачи, типичные для научного стажёра; лучшим агентом стал Claude-Opus-4.7 с Mini-Swe-Age.
المصدر: Import AI — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة