Robot đã nuốt chửng Internet khi chúng ta ngủ say. Và đó không phải là phép ẩn dụ
Anthropic
OpenAI
Google/DeepMind
Amazon/AWS
Moonshot AI
Một nhà phát triển của cơ sở dữ liệu từ thiện PatronView phát hiện ra rằng hơn 99% lưu lượng truy cập vào trang web của anh ta không phải là con người: trong số 1,28 triệu trang được phục vụ, chưa đầy sáu nghìn trang được xem bởi người thật. Phân tích cho thấy tỷ lệ đáng báo động giữa các yêu cầu từ trình thu thập thông tin AI và lượt truy cập của con người, với Claude-SearchBot của Anthropic đã tìm nạp hơn 420.000 trang trong một tuần trong khi chỉ gửi 12 khách truy cập. Tin tức cũng đề cập đến một trường hợp tương tự với cơ sở dữ liệu phim The Numbers, đã bị ngừng hoạt động do lưu lượng truy cập từ bot, và thảo luận về những tác động rộng hơn đối với lưu lượng truy cập web, SEO, tính xác thực của nội dung và sự gia tăng của nội dung do AI tạo ra.
Một nhà phát triển của cơ sở dữ liệu từ thiện PatronView nhận thấy 99% lượt truy cập trang web không phải từ con ngường: trong tổng số 1,28 triệu trang được phục vụ, chỉ có chưa tới sáu nghìn trang thực sự do con ngường xem. Ông ước tính rằng cứ mỗi trang được một ngường xem thì có khoảng 214 lượt tải xuống mà chẳng ai từng nhìn thấy. Trang web từng hứng chịu một "cơn bão" 3,6 triệu yêu cầu chỉ trong một ngày, đến từ 361.844 địa chỉ IP (Internet Protocol – giao thức liên mạng) riêng biệt, chủ yếu từ Trung Quốc, và nhiều bot đã vượt qua được captcha của Cloudflare. Giải pháp của ông là chặn toàn bộ một số quốc gia ngay ở tầng biên (edge), nhờ đó dòng truy cập rác giảm đi đáng kể. Bài viết đưa ra một chỉ số then chốt: số trang mà một bot tải xuống tính trên mỗi khách truy cập mà nó mang lại. Với Claude-SearchBot của Anthropic, tỷ lệ này là 42.680 trang so với 12 khách truy cập trong một tuần. The Numbers – cơ sở dữ liệu điện ảnh do Bruce Nash sáng lập – cũng gặp tình trạng tương tự: trang này phải ngừng hoạt động suốt một tuần và khi quay lại thì quy mô đã thu hẹp đáng kể sau những đợt thu thập dữ liệu có chủ đích. Trang web từng là mục tiêu của các nhà giao dịch trên thị trường dự đoán, những ngường muốn có sớm dữ liệu doanh thu phòng vé. Bài viết cũng chỉ ra rằng AI Overviews của Google xuất hiện trong 43% lượt tìm kiếm, khiến tỷ lệ nhấp chuột giảm đi một phần ba và đẩy tỷ trọng các lượt tìm kiếm không nhấp chuột (zero-click) lên trên 60%. Các nhà xuất bản đang cân nhắc lại những thỏa thuận với Google, trong khi một tòa án Đức đã phán quyết rằng Google phải chịu trách nhiệm về các nội dung sai sự thật trong phần tóm tắt AI của mình. Nguồn gốc nội dung đang trở nên quan trọng, với các tiêu chuẩn như C2PA (Coalition for Content Provenance and Authenticity – Liên minh về Nguồn gốc và Tính xác thực của Nội dung), nhưng việc áp dụng vẫn thiếu nhất quán. Các trang web đang chống trả bằng những quy tắc tường lửa, thậm chí cả một phông chữ mang tên ShieldFont vốn hiển thị nội dung khác nhau cho con ngường và cho bot. Bài viết khép lại bằng lờing cảnh báo về các cuộc tấn công mạng do trí tuệ nhân tạo (artificial intelligence – AI) thực hiện, dẫn một báo cáo của Anthropic cho biết một nhóm tin tặc được nhà nước hậu thuẫn đã dùng công cụ lập trình của công ty này để tấn công khoảng 30 tổ chức, trong đó AI đảm nhiệm 80–90% khối lượng công việc.
Nguồn: Habr — хаб ИИ —
bản gốc
