Import AI 461: 'Alignment is not on track'; FrontierCode; dan intern riset sintetis
Cognition
Alibaba/Qwen
Anthropic
OpenAI
Peneliti dari UK AI Security Institute dan Timaeus meluncurkan Sequent, sebuah organisasi nirlaba yang bertujuan mengembangkan teknik alignment yang berprinsip untuk AI supercerdas, dengan penggalangan dana awal $100-150 juta. Cognition merilis FrontierCode, benchmark coding sulit di mana Claude Opus 4.8 memperoleh skor 13.4% pada tingkat tersulit. Xiaomi mempublikasikan detail MiMo-V2.5-Pro-UltraSpeed, model 1 triliun parameter yang mencapai 1000 token per detik melalui co-design dan kuantisasi. Benchmark baru, AARRI-Bench, mengevaluasi sistem AI pada tugas penelitian tingkat pemula.
Sebuah organisasi riset nirlaba baru bernama Sequent telah dibentuk oleh para peneliti dari UK AI Security Institute dan perusahaan rintisan teori alignment Timaeus untuk mengembangkan teknik alignment bagi sistem AI supercerdas. Sequent bertujuan menggalang dana awal sebesar $100-150 juta dan tumbuh menjadi 40-80 karyawan, mengejar berbagai arah penelitian termasuk pengawasan yang dapat diskalakan, teori pembelajaran, argumen heuristik, teori permainan, dan persona untuk mencapai keyakinan berprinsip dalam alignment. Cognition, perusahaan di balik Devin, merilis FrontierCode, sebuah tolok ukur coding dengan 150 tugas dalam tiga tingkat kesulitan (Diamond, Main, Extended) yang mengukur kualitas kode, kemampuan penggabungan, dan kepatuhan terhadap standar basis kode; Claude Opus 4.8 hanya mencapai 13,4% pada tingkat Diamond, menunjukkan ruang perbaikan yang substansial. Xiaomi memperkenalkan MiMo-V2.5-Pro-UltraSpeed, sebuah model bahasa besar dengan 1 triliun parameter yang mencapai inferensi 1000 token per detik pada node komoditas 8-GPU menggunakan kuantisasi FP4, decoding spekulatif melalui DFlash, dan perangkat lunak TileRT dari perusahaan rintisan Tile AI. Para peneliti dari Xi'an Jiaotong University dan Xidian University mengembangkan tolok ukur AARR (Act As a Real Researcher), dimulai dengan AARRI-Bench, untuk mengevaluasi sistem AI pada tugas penelitian tingkat pemula; sistem dengan kinerja terbaik, Claude-Opus-4.7 dengan Mini-Swe-Age, mencapai skor 42,13% pada skenario Science.
Sumber: Import AI —
asli
