Yapay Zeka GüvenliğiAraştırma 🇺🇸 27.07.2026 21:04

Import AI 461: 'Hizalama yolunda değil'; FrontierCode; ve sentetik araştırma stajyerleri

CognitionCognition Alibaba/QwenAlibaba/Qwen AnthropicAnthropic OpenAIOpenAI
İngiltere Yapay Zeka Güvenlik Enstitüsü ve Timaeus'tan araştırmacılar, süper zeki yapay zeka için ilkeli hizalama teknikleri geliştirmeyi amaçlayan ve başlangıçta 100-150 milyon dolar toplayan Sequent adlı bir kar amacı gütmeyen kuruluş başlattı. Cognition, Claude Opus 4.8'in en zor kademede %13,4 puan aldığı zorlu bir kodlama kıyaslaması olan FrontierCode'u yayınladı. Xiaomi, birlikte tasarım ve niceleme yoluyla saniyede 1000 token hıza ulaşan 1 trilyon parametreli bir model olan MiMo-V2.5-Pro-UltraSpeed hakkında ayrıntıları yayınladı. Yeni bir kıyaslama olan AARRI-Bench, yapay zeka sistemlerini giriş seviyesi araştırma görevlerinde değerlendiriyor.
Sequent adında yeni bir kâr amacı gütmeyen araştırma kuruluşu, Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü ve hizalama teorisi girişimi Timaeus'tan araştırmacılar tarafından, süper zeki yapay zeka sistemleri için hizalama teknikleri geliştirmek amacıyla kuruldu. Sequent, başlangıçta 100-150 milyon dolar toplamayı ve 40-80 çalışana ulaşmayı hedefliyor; ölçeklenebilir gözetim, öğrenme teorisi, buluşsal argümanlar, oyun teorisi ve kişilikler gibi çeşitli araştırma yönelimlerini izleyerek hizalamada ilkeli bir güven elde etmeyi amaçlıyor. Devin'in arkasındaki şirket olan Cognition, üç zorluk kademesinde (Diamond, Main, Extended) 150 görev içeren ve kod kalitesi, birleştirilebilirlik ve kod tabanı standartlarına uyumu ölçen bir kodlama kıyaslaması olan FrontierCode'u yayınladı; Claude Opus 4.8, Diamond kademesinde yalnızca %13.4 başarı elde ederek önemli bir iyileştirme alanı olduğunu gösterdi. Xiaomi, FP4 niceleme, DFlash aracılığıyla spekülatif kod çözme ve girişim Tile AI'dan TileRT yazılımını kullanarak 8 GPU'lu bir emtia düğümünde saniyede 1000 token çıkarım hızına ulaşan 1 trilyon parametreli bir büyük dil modeli olan MiMo-V2.5-Pro-UltraSpeed'i tanıttı. Xi'an Jiaotong Üniversitesi ve Xidian Üniversitesi'nden araştırmacılar, yapay zeka sistemlerini giriş seviyesi araştırma görevlerinde değerlendirmek için AARR (Act As a Real Researcher - Gerçek Araştırmacı Gibi Davran) kıyaslamalarını, AARRI-Bench ile başlayarak geliştirdi; en iyi performans gösteren sistem olan Claude-Opus-4.7 ve Mini-Swe-Age, Bilim senaryosunda %42.13 puan aldı.
Kaynak: Import AI — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler