AI Import 461:'对齐未走上正轨';FrontierCode;以及合成科学实习生
来自英国AISI和Timaeus的研究人员创立了非营利组织Sequent,旨在开发确保超级智能系统安全的对齐方法。Cognition发布了用于评估代码质量的FrontierCode基准,其中最佳模型Claude Opus 4.8在最高难度级别上仅获得13.4%的得分。此外,还介绍了用于评估关于中国联合国教科文组织世界遗产地文化知识的VLM数据集ChinaHeritaQA,以及生成速度达每秒1000个token的小米MiMo-V2.5-Pro-UltraSpeed模型。
Cognition
Alibaba/Qwen
Anthropic
OpenAI
Import AI27.07 · 21:04
