Nghiên cứuAn toàn AI 🇺🇸 27.07.2026 12:06

Import AI 457: Phiên bản AI của Stuxnet; trình tối ưu hóa Muon bị nguyền rủa; và sự căn chỉnh tích cực

SentinelOneSentinelOne Prime IntellectPrime Intellect OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind
Số này của Import AI đề cập đến ba câu chuyện: một loại virus máy tính cổ 'fast16' phá hoại các phép tính chính xác cao, gợi nhớ đến chiến thuật không phổ biến vũ khí của siêu trí tuệ; phát hiện rằng trình tối ưu hóa Muon có thể tiêu diệt các nơ-ron trong lớp MLP, dẫn đến việc phát triển một giải pháp thay thế mang tên Aurora; và một bài báo quan điểm ủng hộ 'sự căn chỉnh tích cực' để đảm bảo AI hỗ trợ sự phát triển của con người ngoài vấn đề an toàn đơn thuần.
Số 457 của Import AI mở đầu với cuộc điều tra về một loại virus hơn 20 năm tuổi có tên fast16.sys, loại virus này nhắm mục tiêu có chọn lọc vào các phần mềm tính toán có độ chính xác cao trong các lĩnh vực như kỹ thuật xây dựng và vật lý, đưa ra các lỗi hệ thống. Các nhà nghiên cứu tại SentinelOne phát hiện ra rằng nó được sử dụng để can thiệp vào các mô phỏng từ LS-DYNA 970, PKPM và MOHID, và có liên quan đến các chương trình vũ khí hạt nhân của Iran. Bài báo rút ra những điểm tương đồng với cách mà một siêu trí tuệ có thể cản trở sự phát triển AI của đối thủ. Tiếp theo, Tilde Research đã nghiên cứu về trình tối ưu hóa Muon và phát hiện ra rằng nó gây ra hiện tượng chết tế bào thần kinh trong các lớp MLP, với hơn một phần tư số tế bào thần kinh chết trong quá trình khởi động tốc độ học (learning rate warmup). Họ đã phát triển Aurora, một trình tối ưu hóa nhận biết đòn bẩy (leverage-aware optimizer), vượt trội hơn so với Muon và NorMuon trên các mô hình transformer có 1,1 tỷ tham số được huấn luyện trên khoảng 100 tỷ token, đạt được độ mất mát (loss) thấp hơn và cải thiện 10 điểm trên MMLU. Kết quả này đã được nhà nghiên cứu Alexander Doria xác nhận độc lập. Cuối cùng, một nhóm từ Oxford, DeepMind, OpenAI, Anthropic và các tổ chức khác đã công bố một bài báo về 'căn chỉnh tích cực' (positive alignment), lập luận rằng sau khi đạt được an toàn, AI nên chủ động hỗ trợ sự thịnh vượng của con người và hệ sinh thái theo cách đa nguyên và do người dùng định hướng. Họ chỉ trích các phương pháp an toàn hiện tại vì có thể dẫn đến các hệ thống tầm thường, xu nịnh và các hệ thống giá trị ẩn, đồng thời ủng hộ quản trị phi tập trung để dung hòa chủ nghĩa đa nguyên đạo đức.
Nguồn: Import AI — bản gốc
Bài viết liên quan trước đây ↓
Tin mới