Import AI 461:“对齐并未走上正轨”;FrontierCode;以及合成研究实习生
Cognition
Alibaba/Qwen
Anthropic
OpenAI
英国AI安全研究所和Timaeus的研究人员发起Sequent,一个旨在为超级智能AI开发原则性对齐技术的非营利组织,初步筹集1亿至1.5亿美元。Cognition发布了FrontierCode,一个高难度编程基准,其中Claude Opus 4.8在最难级别上得分13.4%。小米公布了MiMo-V2.5-Pro-UltraSpeed的细节,这是一个1万亿参数模型,通过协同设计和量化实现了每秒1000个token的推理速度。新的基准AARRI-Bench评估AI系统在入门级研究任务上的表现。
一家名为Sequent的新型非盈利研究组织由英国AI安全研究所和一致性理论初创公司Timaeus的研究人员共同成立,旨在开发用于超级智能AI系统的一致性技术。Sequent计划初步筹集1亿至1.5亿美元,并扩展至40至80名员工,探索包括可扩展监督、学习理论、启发式论证、博弈论和角色形象在内的多元化研究方向,以实现对一致性的有原则的信心。Devin的开发商Cognition发布了FrontierCode,一个包含150个任务的编码基准测试,分为三个难度等级(Diamond、Main、Extended),衡量代码质量、可合并性以及对代码库标准的遵循程度;Claude Opus 4.8在Diamond等级上仅达到13.4%,表明仍有很大提升空间。小米推出了MiMo-V2.5-Pro-UltraSpeed,这是一个拥有1万亿参数的大型语言模型,在配备8个GPU的普通节点上使用FP4量化、通过DFlash进行的投机性解码以及来自初创公司Tile AI的TileRT软件,实现了每秒1000个token的推理速度。来自西安交通大学和西安电子科技大学的研究人员开发了AARR(Act As a Real Researcher,像真正的研究员一样)基准测试,从AARRI-Bench开始,用于评估AI系统在入门级研究任务上的表现;表现最好的系统是搭载了Mini-Swe-Age的Claude-Opus-4.7,在科学类场景中得分为42.13%。
来源: Import AI —
原文
