연구AI 안전 🇺🇸 27.07.2026 12:06

Import AI 457: AI 버전의 스턱스넷; 저주받은 무온 옵티마이저; 긍정적 정렬

SentinelOneSentinelOne Prime IntellectPrime Intellect OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind
이번 Import AI 호에서는 세 가지 이야기를 다룹니다: 정밀 계산을 방해하는 고대 컴퓨터 바이러스 'fast16' (초지능의 비확산 전술을 연상시킴); MLP 레이어의 뉴런을 죽일 수 있는 Muon 옵티마이저의 발견과 이를 대체하는 Aurora의 개발; 그리고 AI가 안전을 넘어 인간의 번영을 지원하도록 '긍정적 정렬'을 주장하는 포지션 페이퍼입니다.
Import AI 457는 토목 공학 및 물리학 같은 분야에서 고정밀 계산 소프트웨어를 선택적으로 표적으로 삼아 체계적인 오류를 유발하는 20년 이상 된 바이러스인 fast16.sys에 대한 조사로 시작됩니다. SentinelOne의 연구원들은 이 바이러스가 LS-DYNA 970, PKPM, MOHID의 시뮬레이션을 조작하는 데 사용되었으며, 이란이 핵무기 프로그램과 연관되어 있다는 사실을 발견했습니다. 이 기사는 초지능이 경쟁 AI의 개발을 방해할 수 있는 방식과 유사점을 제시합니다. 다음으로, Tilde Research는 Muon 최적화 도구를 조사하여 MLP 계층에서 뉴런 사멸을 유발하며, 학습률 웜업 기간 동안 뉴런의 4분의 1 이상이 죽는 것을 발견했습니다. 그들은 레버리지를 고려한 최적화 도구인 Aurora를 개발했으며, 이는 약 1천억 개의 토큰으로 훈련된 11억 개 파라미터 트랜스포머에서 Muon 및 NorMuon보다 성능이 뛰어나 더 낮은 손실과 10점의 MMLU 향상을 달성했습니다. 이는 연구원 알렉산더 도리아가 독립적으로 검증했습니다. 마지막으로, 옥스퍼드, 딥마인드, 오픈AI, 앤트로픽 등 소속 연구자 그룹이 '긍정적 정렬'에 관한 논문을 발표했으며, 안전이 확보된 후에는 AI가 다양하고 사용자 주도적인 방식으로 인간과 생태계의 번영을 적극적으로 지원해야 한다고 주장했습니다. 그들은 현재의 안전 접근 방식이 평범하고 아첨하는 시스템과 숨겨진 가치 체계로 이어질 수 있다고 비판하고, 도덕적 다원주의를 수용하기 위해 분산된 거버넌스를 옹호합니다.
출처: Import AI — 원문
관련 게시물 ↓
새로운 뉴스