An toàn AINghiên cứu 🇺🇸 27.07.2026 21:04

Import AI 461: 'Căn chỉnh không đúng hướng'; FrontierCode; và thực tập sinh nghiên cứu tổng hợp

CognitionCognition Alibaba/QwenAlibaba/Qwen AnthropicAnthropic OpenAIOpenAI
Các nhà nghiên cứu từ Viện An ninh AI Vương quốc Anh và Timaeus ra mắt Sequent, một tổ chức phi lợi nhuận nhằm phát triển các kỹ thuật căn chỉnh có nguyên tắc cho AI siêu thông minh, huy động 100-150 triệu đô la Mỹ ban đầu. Cognition phát hành FrontierCode, một chuẩn đánh giá lập trình khó, nơi Claude Opus 4.8 đạt 13,4% ở bậc khó nhất. Xiaomi công bố chi tiết về MiMo-V2.5-Pro-UltraSpeed, một mô hình 1 nghìn tỷ tham số đạt 1000 token mỗi giây nhờ đồng thiết kế và lượng tử hóa. Một chuẩn đánh giá mới, AARRI-Bench, đánh giá các hệ thống AI trên các nhiệm vụ nghiên cứu cấp độ đầu vào.
Một tổ chức nghiên cứu phi lợi nhuận mới có tên Sequent đã được thành lập bởi các nhà nghiên cứu từ Viện An ninh AI của Vương quốc Anh và công ty khởi nghiệp lý thuyết căn chỉnh Timaeus nhằm phát triển các kỹ thuật căn chỉnh cho hệ thống AI siêu thông minh. Sequent đặt mục tiêu huy động 100-150 triệu đô la ban đầu và phát triển lên 40-80 nhân viên, theo đuổi nhiều hướng nghiên cứu khác nhau bao gồm giám sát mở rộng, lý thuyết học tập, lập luận heuristic, lý thuyết trò chơi và tính cách để đạt được niềm tin có nguyên tắc vào sự căn chỉnh. Cognition, công ty đứng sau Devin, đã phát hành FrontierCode, một chuẩn đánh giá lập trình với 150 nhiệm vụ ở ba cấp độ khó (Diamond, Main, Extended) đo lường chất lượng mã, khả năng hợp nhất và tuân thủ các tiêu chuẩn cơ sở mã; Claude Opus 4.8 chỉ đạt 13,4% ở cấp độ Diamond, cho thấy còn nhiều dư địa cải thiện. Xiaomi đã giới thiệu MiMo-V2.5-Pro-UltraSpeed, một mô hình ngôn ngữ lớn có 1 nghìn tỷ tham số đạt tốc độ suy luận 1000 token mỗi giây trên một nút 8 GPU thương mại bằng cách sử dụng lượng tử hóa FP4, giải mã suy đoán qua DFlash và phần mềm TileRT từ công ty khởi nghiệp Tile AI. Các nhà nghiên cứu từ Đại học Giao thông Tây An và Đại học Tây Điện đã phát triển chuẩn đánh giá AARR (Act As a Real Researcher), bắt đầu với AARRI-Bench, để đánh giá các hệ thống AI về các nhiệm vụ nghiên cứu ở cấp độ mới vào nghề; hệ thống hoạt động tốt nhất, Claude-Opus-4.7 với Mini-Swe-Age, đạt điểm 42,13% trong kịch bản Khoa học (Science).
Nguồn: Import AI — bản gốc
Bài viết liên quan trước đây ↓
Tin mới