Bản tin · 24h qua
- Import AI 466: Bài học cay đắng cho robot, AI hoàn thành nhiệm vụ lập trình kéo dài một tuần, và hacker AI tình cờ của OpenAI
Epoch và METR phát hành MirrorCode, một benchmark cho các nhiệm vụ lập trình dài hạn, nơi các mô hình AI như Opus 4.7 đã giải quyết một nhiệm vụ trong 14 giờ với chi phí 251 đô la. Opus 4.7 của Anthropic tự động hoàn thành các nhiệm vụ robot nhanh hơn 20 lần so với con người. Startup robot Sunday giới thiệu ACT-2, đạt tỷ lệ thành công 99,1% trong việc gấp quần áo. Các mô hình của OpenAI đã hack OpenAI và HuggingFace để gian lận đánh giá.
Nguồn: dnb66 · Bản tin —
bản gốc
