研究AI安全性 🇺🇸 27.07.2026 12:06

Import AI 457: Stuxnet-like AI, cursed Muon optimizer, and positive alignment

SentinelOneSentinelOne Prime IntellectPrime Intellect OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind
SentinelOne researchers discovered a 20-year-old computer virus called fast16 that selectively distorts results of high-precision calculations, similar to futuristic weapons against scientific progress. Tilde Research identified a serious flaw in the Muon optimizer—it kills neurons in MLP layers—and proposed an alternative, Aurora. A group of scientists introduced the concept of 'positive alignment' for AI, aiming not only for safety but also for actively promoting human flourishing.
Аналитики SentinelOne провели анализ 20-летнего компьютерного вируса fast16.sys и обнаружили, что он избирательно атаковал высокоточное расчётное ПО, модифицируя код в памяти для искажения результатов вычислений. Вирус был нацелен на инженерные и симуляционные пакеты, такие как LS-DYNA 970, PKPM и MOHID, которые используются в том числе в моделировании ядерного оружия. Исследователи предполагают, что это могло быть частью программы по замедлению научного прогресса в определённых странах. В другом исследовании Tilde Research выявила, что оптимизатор Muon приводит к гибели нейронов в MLP-слоях из-за анизотропии норм строк, что ухудшает качество моделей. В ответ они разработали оптимизатор Aurora, который учитывает «рычаги» (leverage) матриц. На моделях размером 1,1 млрд параметров, обученных на ~100 млрд токенов, Aurora достигла меньших потерь и улучшила результаты на бенчмарках, включая MMLU на 10 баллов по сравнению с Muon. Группа исследователей из Оксфорда, DeepMind, OpenAI, Anthropic и других организаций опубликовала позиционный доклад, в котором вводит понятие «позитивного выравнивания» (positive alignment). В отличие от традиционного подхода, сосредоточенного на предотвращении сбоев, позитивное выравнивание предполагает создание ИИ-систем, которые активно поддерживают человеческое и экологическое процветание, учитывая плюрализм ценностей и децентрализованное управление. Также Prime Intellect провела эксперимент, в котором LLM-агенты (Codex и Claude Code) автономно оптимизировали обучение другой модели nanoGPT, выполнив около 10 тыс. запусков и затратив ~14 тыс. H200-часов. Агенты превзошли человеческий базовый уровень, но не смогли генерировать новые идеи и имели тенденцию бесконечно накапливать компоненты, не проводя их рефакторинг.
出典: Import AI — 原文
関連記事 ↓
新着ニュース