Silk: Nhu cầu suy luận AI đòi hỏi hạ tầng dữ liệu hoàn toàn khác
NVIDIA
Silk
Khi các tác nhân AI chuyển từ chatbot sang quy trình làm việc đa bước tự động, khối lượng công việc suy luận đang làm quá tải hạ tầng lưu trữ đám mây truyền thống (AWS EBS) với độ đồng thời cao, các đột biến đọc và độ trễ cuối. Silk ủng hộ lưu trữ được xác định bằng phần mềm, tách hiệu suất khỏi dung lượng để xử lý các yêu cầu này mà không cần dựa vào các bản sao đọc dễ vỡ hoặc cung cấp quá mức.
Giám đốc điều hành của Nvidia, Jensen Huang, đã tuyên bố kỷ nguyên 'nhà máy AI', nhưng Silk cảnh báo rằng việc chuyển từ chatbot sang các tác nhân AI tự trị tạo ra vấn đề dữ liệu lớn. Hành vi suy luận giống như OLTP++ (xử lý giao dịch trực tuyến nâng cao) với mức đồng thời chưa từng có, các đột biến đọc và mẫu truy cập không thể đoán trước, nhanh chóng làm cạn kiệt tín chỉ burst của AWS EBS (lưu trữ khối đàn hồi Amazon) và gây ra các đột biến độ trễ từ 1 ms lên hơn 100 ms. Tắc nghẽn lưu trữ, chứ không phải tính toán, trở thành điểm lỗi nghiêm trọng. Silk trình bày một nghiên cứu điển hình về 'FinRetail', nơi trợ lý mua sắm dựa trên RAG (tăng cường truy xuất kết hợp sinh) đã gây ra một 'thảm họa thành công' bằng cách làm quá tải lớp lưu trữ, đánh sập toàn bộ trang web. Giải pháp, theo Silk, là một lớp trừu tượng lưu trữ được xác định bằng phần mềm, tách biệt hiệu suất ứng dụng khỏi các giới hạn lưu trữ gốc của AWS, cung cấp độ trễ p99 (phân vị thứ 99) dưới mili giây ổn định ngay cả dưới tải hỗn hợp. Kiến trúc chủ động-chủ động đối xứng của Silk và bộ nhớ đệm phân tán có thể cung cấp thông lượng I/O (đầu vào/đầu ra) 20 GiB/s, loại bỏ nhu cầu về các bản sao đọc mong manh hoặc cấp phát quá mức tính toán EC2 (Điện toán đám mây đàn hồi).
Nguồn: The Register AI/ML —
bản gốc
