Phần cứng & Suy luậnNghiên cứu 🇨🇳 07.08.2026 07:02

Ổ SSD AI: Sự chuyển dịch mô hình lưu trữ trong suy luận mô hình ngôn ngữ lớn (LLM)

Moonshot AIMoonshot AI NVIDIANVIDIA HuaweiHuawei Maxio TechMaxio Tech
Hạ tầng AI đang vượt ra ngoài sức mạnh tính toán thô, với trạng thái suy luận trở thành tài nguyên hạng nhất. Các hệ thống như Mooncake của Moonshot AI và nền tảng CMX của NVIDIA đang tích hợp lưu trữ vào đường dẫn dữ liệu thời gian thực để tạo token. Sự chuyển dịch này thúc đẩy sự xuất hiện của các ổ SSD chuyên dụng cho AI, được thiết kế để có độ trễ thấp, độ bền cao và quản lý dữ liệu thông minh.
Cuộc đua hạ tầng AI đang chuyển dịch từ việc chỉ đếm số lượng GPU và sức mạnh tính toán thô sang một cách tiếp cận toàn diện hơn, trong đó compute (tính toán), network (mạng), memory (bộ nhớ) và storage (lưu trữ) phải phối hợp với nhau theo từng token. Xu hướng này xuất phát từ sự phát triển của các mô hình ngữ cảnh dài (long-context), khả năng suy luận phức tạp và các hệ thống đa tác nhân (multi-agent systems), đòi hỏi việc quản lý hiệu quả KV Cache (bộ nhớ đệm key-value) và trọng số chuyên gia trong kiến trúc Mixture of Experts (MoE - hỗn hợp chuyên gia). Hai tín hiệu tiêu biểu cho xu hướng này là Mooncake của Moonshot AI và CMX của NVIDIA. Mooncake là một kiến trúc phân tách (disaggregated architecture) lấy KV Cache làm trung tâm, tổ chức các tài nguyên nhàn rỗi như CPU, DRAM, SSD và NIC (card mạng) thành một pool bộ nhớ đệm phân tán, giúp cải thiện năng lực xử lý yêu cầu thực tế từ 59% đến 498% trong các bài kiểm thử. Trong khi đó, nền tảng CMX Context Memory Storage Platform (Nền tảng Lưu trữ Bộ nhớ Ngữ cảnh) của NVIDIA bổ sung một lớp 'G3.5' nằm giữa HBM (bộ nhớ băng thông cao) và hệ thống lưu trữ dùng chung, cung cấp bộ nhớ ngữ cảnh dùng chung ở quy mô petabyte (PB) trong một pod GPU, có tiềm năng cải thiện thông lượng token bền vững và hiệu suất năng lượng lên tới 5 lần. Những hệ thống này cho thấy trạng thái suy luận (inference state) đang trở thành một tài nguyên then chốt, và storage giờ đây phải tham gia vào quá trình định vị, di chuyển và tái sử dụng dữ liệu. Từ đó, một thế hệ SSD dành cho AI (AI SSD) đang xuất hiện, chia thành hai nhóm chính: SSD doanh nghiệp được tăng cường AI (ví dụ như InnoGrit Dongting-N3X, Huawei OceanDisk LC 560) và AI SSD tham gia trực tiếp vào quá trình suy luận. Ba hướng đi đáng chú ý cho nhóm thứ hai là aiDAPTIV của Phison (sử dụng SSD đệm chuyên dụng cùng middleware - phần mềm trung gian), SPU+iSA của Longsys (tận dụng trí thông minh xử lý ngay tại tầng lưu trữ), và giải pháp phối hợp đa tầng của Infplane-Maxio. Cuộc cạnh tranh trong lĩnh vực AI SSD cuối cùng sẽ xoay quanh toàn bộ đường đi của dữ liệu (data path), đòi hỏi sự phối hợp chặt chẽ giữa vật liệu NAND, FTL (lớp chuyển đổi flash), firmware, driver, middleware và các framework suy luận. AI SSD sẽ không thay thế HBM, VRAM hay DRAM, mà thay vào đó sẽ hình thành một hệ thống phân cấp lưu trữ (storage hierarchy) chi tiết hơn, trong đó dữ liệu được đặt vào các vị trí phù hợp dựa trên mức độ 'nóng' (nhiệt độ truy cập), còn việc di chuyển dữ liệu sẽ được quản lý bởi cả phần mềm lẫn phần cứng.
Nguồn: QbitAI 量子位 — bản gốc
Bài viết liên quan trước đây ↓
Tin mới