Perangkat Keras & InferensiAplikasi 🇺🇸 31.07.2026 02:03

Silk: Infrastruktur Data yang Berbeda Secara Fundamental Dibutuhkan untuk Inferensi AI

NVIDIANVIDIA SilkSilk
Seiring agen AI beralih dari chatbot ke alur kerja multi-langkah yang otonom, beban kerja inferensi membebani penyimpanan cloud tradisional (AWS EBS) dengan konkurensi ekstrem, lonjakan pembacaan, dan latensi ekor. Silk menganjurkan penyimpanan yang ditentukan perangkat lunak (software-defined) yang memisahkan kinerja dari kapasitas untuk menangani tuntutan ini tanpa bergantung pada replika baca yang rentan atau penyediaan berlebihan.
CEO Nvidia, Jensen Huang, mendeklarasikan era 'pabrik AI', tetapi Silk memperingatkan bahwa pergeseran dari chatbot ke agen AI otonom menciptakan masalah data yang besar. Inferensi berperilaku seperti OLTP++ dengan konkurensi yang belum pernah terjadi sebelumnya, lonjakan baca, dan pola akses yang tidak terduga, dengan cepat menghabiskan kredit burst AWS EBS dan menyebabkan lonjakan latensi dari 1 ms menjadi lebih dari 100 ms. Hambatan penyimpanan, bukan komputasi, menjadi titik kegagalan kritis. Silk menyajikan studi kasus 'FinRetail' di mana asisten belanja berbasis RAG menyebabkan 'bencana kesuksesan' dengan membebani lapisan penyimpanan hingga menghancurkan seluruh situs. Solusinya, menurut Silk, adalah abstraksi penyimpanan yang didefinisikan oleh perangkat lunak yang memisahkan kinerja aplikasi dari batasan penyimpanan asli AWS, memberikan latensi p99 sub-milidetik yang konsisten bahkan di bawah beban campuran. Arsitektur aktif-aktif simetris dan caching terdistribusi Silk dapat memberikan throughput I/O 20 GiB/dtk, menghilangkan kebutuhan akan replika baca yang rapuh atau kelebihan provisi komputasi EC2.
Sumber: The Register AI/ML — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru