AI Import 461: 'Alignment Not on Right Track'; FrontierCode; and Synthetic Science Interns
Cognition
Alibaba/Qwen
Anthropic
OpenAI
Researchers from UK AISI and Timaeus founded the non-profit organization Sequent to develop alignment methods ensuring the safety of superintelligent systems. Cognition released the FrontierCode benchmark for evaluating code quality, where the best model, Claude Opus 4.8, scored only 13.4% on the hardest level. Also presented are the ChinaHeritaQA dataset for evaluating VLM cultural knowledge about Chinese UNESCO sites and the Xiaomi MiMo-V2.5-Pro-UltraSpeed model with a generation speed of 1000 tokens per second.
Бывшие сотрудники отдела выравнивания UK AI Safety Institute и стартапа Timaeus объединились для создания некоммерческой организации Sequent, которая займётся разработкой техник выравнивания, дающих высокую уверенность в безопасности сверхразумного ИИ. Sequent планирует привлечь $100–150 млн начального финансирования и нанять 40–80 сотрудников, делая ставку на портфель исследовательских направлений: масштабируемый надзор, теория обучения, эвристические аргументы, теория игр и персоны. Cognition, создатель Devin, представила бенчмарк FrontierCode из 150 задач по написанию кода, разделённых на три уровня сложности. Лучший результат на уровне Diamond показал Claude Opus 4.8 — 13.4%, что подтверждает сложность бенчмарка. На китайском рынке Xiaomi анонсировала модель MiMo-V2.5-Pro-UltraSpeed с 1 трлн параметров и скоростью генерации 1000 токенов/с за счёт совместной оптимизации архитектуры и софта, включая FP4-квантование и спекулятивное декодирование DFlash. Исследователи из нескольких университетов создали ChinaHeritaQA — мультимодальный бенчмарк из 2279 изображений 51 объекта Всемирного наследия ЮНЕСКО в Китае и 14 133 вопросов. Лучшая открытая модель Qwen-VL-8B-Instruct показала 81% точности, превзойдя человеческие 67%. Кроме того, исследователи из Сианьского университета Цзяотун и Университета Сяньдянь разработали бенчмарки AARR, оценивающие способность ИИ-агентов выполнять задачи, типичные для научного стажёра; лучшим агентом стал Claude-Opus-4.7 с Mini-Swe-Age.
Nguồn: Import AI —
bản gốc
