Import AI 461: 「アライメントは軌道に乗っていない」;FrontierCode;そして合成研究インターン
Cognition
Alibaba/Qwen
Anthropic
OpenAI
英国AIセキュリティ研究所とTimaeusの研究者らが、超知能AI向けの原理に基づいたアライメント技術を開発する非営利団体Sequentを立ち上げ、当初1億~1.5億ドルを調達。Cognition社はハードなコーディングベンチマークFrontierCodeを公開し、Claude Opus 4.8が最難関層で13.4%のスコアを達成。Xiaomi社は共設計と量子化により毎秒1000トークンを実現する1兆パラメータモデルMiMo-V2.5-Pro-UltraSpeedの詳細を公開。新しいベンチマークAARRI-Benchは、エントリーレベルの研究タスクにおけるAIシステムの評価を行う。
英国AIセキュリティ研究所とアライメント理論のスタートアップTimaeusの研究者らが、超知能AIシステムのためのアライメント技術を開発することを目的とする新しい非営利研究組織「Sequent」を設立しました。Sequentは当初1億〜1億5000万ドルの資金調達を目指し、40〜80人の従業員規模に成長する計画です。スケーラブルな監督、学習理論、ヒューリスティックな議論、ゲーム理論、ペルソナなど、多様な研究方向を追求し、アライメントに対する原理的な確信を得ることを目指しています。Devinの開発元であるCognitionは、コーディングベンチマーク「FrontierCode」をリリースしました。これは150のタスクを3つの難易度層(ダイヤモンド、メイン、拡張)に分け、コード品質、マージ可能性、コードベース標準への準拠を測定するもので、Claude Opus 4.8はダイヤモンド層でわずか13.4%のスコアにとどまり、大きな改善余地があることを示しています。Xiaomiは、1兆パラメータの大規模言語モデル「MiMo-V2.5-Pro-UltraSpeed」を発表しました。このモデルは、FP4量子化、DFlashによる投機的復号、スタートアップTile AIのTileRTソフトウェアを用いて、8GPUの汎用ノード上で毎秒1000トークンの推論を実現します。西安交通大学と西安電子科技大学の研究者らは、AIシステムの初級研究タスクにおける性能を評価するためのベンチマーク群「AARR(Act As a Real Researcher)」を開発し、まず「AARRI-Bench」を公開しました。最高性能のシステムはClaude-Opus-4.7とMini-Swe-Ageの組み合わせで、サイエンスシナリオで42.13%のスコアを達成しました。
出典: Import AI —
原文
