AI 안전연구 🇺🇸 27.07.2026 21:04

Import AI 461: '얼라인먼트는 순조롭지 않다'; FrontierCode; 그리고 합성 연구 인턴

CognitionCognition Alibaba/QwenAlibaba/Qwen AnthropicAnthropic OpenAIOpenAI
영국 AI 보안 연구소(UK AI Security Institute)와 Timaeus의 연구자들이 슈퍼 지능 AI를 위한 원칙적인 얼라인먼트 기술을 개발하는 비영리 단체 Sequent를 설립하며, 초기 1억~1억 5천만 달러를 모금합니다. Cognition은 하드 코딩 벤치마크 FrontierCode를 출시했으며, Claude Opus 4.8은 가장 어려운 등급에서 13.4%를 기록했습니다. Xiaomi는 공동 설계와 양자화를 통해 초당 1000 토큰을 달성하는 1조 개 파라미터 모델 MiMo-V2.5-Pro-UltraSpeed에 대한 세부 정보를 공개했습니다. 새로운 벤치마크 AARRI-Bench는 AI 시스템을 초급 수준의 연구 작업에서 평가합니다.
영국 AI 안전 연구소(UK AI Security Institute)와 정렬 이론 스타트업 티마우스(Timaeus)의 연구진이 초지능 AI 시스템을 위한 정렬 기술을 개발하기 위해 새로운 비영리 연구 조직인 시퀀트(Sequent)를 설립했습니다. 시퀀트는 초기 1억~1억 5천만 달러를 모금하고 직원 수를 40~80명으로 늘리는 것을 목표로 하며, 확장 가능한 감독, 학습 이론, 발견적 논증, 게임 이론, 페르소나 등 다양한 연구 방향을 추구하여 정렬에 대한 원칙적 확신을 얻고자 합니다. 데빈(Devin)의 개발사 코그니션(Cognition)은 3단계 난이도(다이아몬드, 메인, 확장)에 걸쳐 150개의 과제로 구성된 코딩 벤치마크 프론티어코드(FrontierCode)를 출시했습니다. 이 벤치마크는 코드 품질, 병합 가능성, 코드베이스 표준 준수 여부를 측정하며, 클로드 오퍼스 4.8(Claude Opus 4.8)은 다이아몬드 등급에서 13.4%의 정확도만 달성하여 상당한 개선 여지가 있음을 보여줍니다. 샤오미(Xiaomi)는 1조 개의 파라미터를 가진 대규모 언어 모델(LLM)인 미모 V2.5 프로 울트라스피드(MiMo-V2.5-Pro-UltraSpeed)를 발표했습니다. 이 모델은 FP4 양자화, DFlash를 통한 추측 디코딩, 스타트업 타일 AI(Tile AI)의 타일RT(TileRT) 소프트웨어를 사용하여 8-GPU 상용 노드에서 초당 1000개의 토큰 추론을 달성합니다. 시안 교통대학(Xi'an Jiaotong University)과 시뎬 대학(Xidian University)의 연구진은 AI 시스템의 입문 수준 연구 과제를 평가하기 위해 AARR(Act As a Real Researcher) 벤치마크, 그 첫 번째로 AARRI-벤치(AARRI-Bench)를 개발했습니다. 가장 성능이 좋은 시스템인 미니-스웨이지(Mini-Swe-Age)를 사용한 클로드 오퍼스 4.7(Claude-Opus-4.7)은 과학 시나리오에서 42.13%의 점수를 기록했습니다.
출처: Import AI — 원문
관련 게시물 ↓
새로운 뉴스