Phần cứng & Suy luậnỨng dụng 🇺🇸 31.07.2026 02:03

Silk: Nhu cầu suy luận AI đòi hỏi hạ tầng dữ liệu khác biệt về cơ bản

NVIDIANVIDIA SilkSilk
Khi các tác tử AI chuyển từ chatbot sang quy trình làm việc tự động nhiều bước, khối lượng công việc suy luận đang làm quá tải kho lưu trữ đám mây truyền thống (AWS EBS) với độ đồng thời cực cao, các đợt tăng đột biến khi đọc và độ trễ đuôi. Silk ủng hộ việc lưu trữ được xác định bằng phần mềm, tách hiệu suất khỏi dung lượng để xử lý các nhu cầu này mà không phụ thuộc vào các bản sao đọc dễ hỏng hoặc cấp phát quá mức.
Giám đốc điều hành của Nvidia, Jensen Huang, đã tuyên bố kỷ nguyên 'nhà máy AI', nhưng Silk cảnh báo rằng việc chuyển từ chatbot sang các tác nhân AI tự trị tạo ra vấn đề dữ liệu lớn. Hành vi suy luận giống như OLTP++ (xử lý giao dịch trực tuyến nâng cao) với mức đồng thời chưa từng có, các đột biến đọc và mẫu truy cập không thể đoán trước, nhanh chóng làm cạn kiệt tín chỉ burst của AWS EBS (lưu trữ khối đàn hồi Amazon) và gây ra các đột biến độ trễ từ 1 ms lên hơn 100 ms. Tắc nghẽn lưu trữ, chứ không phải tính toán, trở thành điểm lỗi nghiêm trọng. Silk trình bày một nghiên cứu điển hình về 'FinRetail', nơi trợ lý mua sắm dựa trên RAG (tăng cường truy xuất kết hợp sinh) đã gây ra một 'thảm họa thành công' bằng cách làm quá tải lớp lưu trữ, đánh sập toàn bộ trang web. Giải pháp, theo Silk, là một lớp trừu tượng lưu trữ được xác định bằng phần mềm, tách biệt hiệu suất ứng dụng khỏi các giới hạn lưu trữ gốc của AWS, cung cấp độ trễ p99 (phân vị thứ 99) dưới mili giây ổn định ngay cả dưới tải hỗn hợp. Kiến trúc chủ động-chủ động đối xứng của Silk và bộ nhớ đệm phân tán có thể cung cấp thông lượng I/O (đầu vào/đầu ra) 20 GiB/s, loại bỏ nhu cầu về các bản sao đọc mong manh hoặc cấp phát quá mức tính toán EC2 (Điện toán đám mây đàn hồi).
Nguồn: The Register AI/ML — bản gốc
Bài viết liên quan trước đây ↓
Tin mới