HBM chưa đủ, SSD AI sẵn sàng bùng nổ tăng trưởng
Moonshot AI
NVIDIA
Huawei
Maxio Tech
Khi suy luận mô hình ngôn ngữ lớn chạm trần dung lượng và I/O, SSD đang chuyển từ lưu trữ tĩnh sang đường dẫn dữ liệu thời gian thực của suy luận, trở thành tầng lưu trữ chính thức sau HBM, VRAM và DRAM. Ngành đang chứng kiến hai hướng chính: SSD doanh nghiệp tăng cường tải AI và SSD tham gia suy luận trực tiếp lên lịch dữ liệu, với các công ty như Phison, Longsys và liên minh Maxio-Infplane dẫn đầu.
Suy luận mô hình ngôn ngữ lớn (Large Language Model - LLM) đang chạm phải hai rào cản: dung lượng và nhập/xuất (I/O). Số lượng tham số mô hình không ngừng tăng, trong khi ngữ cảnh dài, hội thoại đa lượt và các tác vụ tác tử (agent) làm phình to KV Cache; các mô hình hỗn hợp chuyên gia (Mixture of Experts - MoE) giảm số tham số hoạt động trong mỗi phép tính nhưng lại đòi hỏi lưu trữ trọng số chuyên gia vượt xa dung lượng VRAM (Video Random Access Memory - bộ nhớ truy cập ngẫu nhiên video) hay DRAM (Dynamic Random Access Memory - bộ nhớ truy cập ngẫu nhiên động). Tại các trung tâm dữ liệu đám mây, HBM (High Bandwidth Memory - bộ nhớ băng thông cao) đắt đỏ bị trọng số và KV Cache chiếm dụng, khiến mức độ tận dụng GPU (Graphics Processing Unit - bộ xử lý đồ họa) bị giới hạn; còn ở thiết bị biên và thiết bị đầu cuối, DRAM hạn chế hoặc bộ nhớ thống nhất khiến kích thước mô hình bị bóp nghẹt. Khi bộ nhớ khó một mình gánh vác tải suy luận, SSD (Solid State Drive - ổ thể rắn) đang bước vào đường truyền dữ liệu suy luận thờigian thực, trở thành một tầng lưu trữ chính thức sau HBM, VRAM và DRAM. Sự chuyển dịch này thể hiện rõ trong hạ tầng suy luận: Mooncake của Moonshot AI dùng kiến trúc tách rờilấy KV Cache làm trung tâm, gộp CPU (Central Processing Unit - bộ xử lý trung tâm), DRAM và SSD thành bộ nhớ đệm phân tán, với Mooncake Store hỗ trợ bộ nhớ đệm đa cấp bằng DRAM và SSD/NVMe (Non-Volatile Memory Express); năm 2026, NVIDIA giới thiệu nền tảng lưu trữ bộ nhớ ngữ cảnh CMX trong hạ tầng Vera Rubin, bổ sung tầng flash kết nối Ethernet cho KV Cache, với BlueField-4 quản lý các SSD NVMe. Tuy nhiên, SSD truyền thống không phù hợp với các tác vụ suy luận bền bỉ: chúng được thiết kế cho lưu trữ tệp và khối, chú trọng băng thông tuần tự, IOPS (Input/Output Operations Per Second - số thao tác nhập/xuất mỗi giây) ngẫu nhiên và độ tin cậy, trong khi suy luận LLM đòi hỏi cung cấp dữ liệu với ràng buộc thờigian nghiêm ngặt. KV Cache được ghi trong giai đoạn prefill rồi được đọc lặp đi lặp lại; MoE cần trọng số chuyên gia cụ thể trước mỗi phép tính của từng tầng; chỉ một lần đọc trễ cũng có thể làm GPU, NPU (Neural Processing Unit - bộ xử lý thần kinh) hoặc CPU đình trệ. IOPS đỉnh ở độ sâu hàng đợi cao không tương đương với độ trễ ổn định khi truy cập mịn ở hàng đợi thấp. NAND Flash đọc theo trang (page) và xóa theo khối (block), cùng với FTL (Flash Translation Layer - lớp chuyển đổi flash) gây khuếch đại ghi và độ trễ đuôi; việc ghi KV Cache liên tục tạo áp lực lớn lên độ bền của flash. Bố cục LBA (Logical Block Addressing - địa chỉ hóa khối logic) truyền thống bỏ qua mối quan hệ ngữ nghĩa giữa các tầng, các chuyên gia và các khối KV, khiến dữ liệu liên quan bị rải rác và ngăn cản việc đọc song song một cách dự đoán được. Hệ thống tệp, thiết bị khối và ngăn xếp phần mềm NVMe cộng thêm độ trễ. Nếu thiếu bố cục địa chỉ, phân vùng bộ nhớ đệm, lập lịch ưu tiên, tải trước bất đồng bộ và quản lý vòng đờitheo đúng trình tự thực thi của mô hình, SSD không thể tham gia ổn định vào quá trình sinh token như DRAM hay VRAM. Trên thị trường hiện có hai loại 'SSD AI': thứ nhất là SSD doanh nghiệp tăng cường cho tải AI, như dòng Dongting N3X của InnoGrit, dùng XL-Flash và NAND SLC (Single-Level Cell - ô nhớ đơn cấp) để đạt độ trễ thấp và độ bền cao, nhắm đến giảm tải (offload) KV Cache và dữ liệu tạm có độ đồng thờicao, tuyên bố độ trễ chỉ bằng một phần ba, thông lượng ghi gấp ba lần và DWPD (Drive Writes Per Day - số lần ghi toàn bộ ổ mỗi ngày) cao gấp 17-33 lần so với SSD TLC (Triple-Level Cell - ô nhớ ba cấp); dòng OceanDisk của Huawei gồm EX 560 cho hiệu năng ghi ngẫu nhiên cao, SP 560 cho hiệu năng cân bằng, và LC 560 với dung lượng lên tới 245TB cho dữ liệu huấn luyện và cơ sở dữ liệu vector, cùng phần mềm điều khiển DiskBooster cho phép phân tầng với HBM và DDR (Double Data Rate - tốc độ dữ liệu gấp đôi). Thứ hai là SSD AI tham gia suy luận, nhằm thay đổi logic vận hành của SSD, tạo ra hệ thống phân cấp ảo hóa giữa NAND và DRAM/VRAM thông qua bộ điều khiển, firmware và middleware. aiDAPTIV của Phison dùng SSD đệm và middleware để truyền trực tuyến trọng số mô hình giữa VRAM và SSD, mở rộng kích thước mô hình mà không cần thêm GPU, đồng thờigiữ lại KV Cache để tái sử dụng, với độ bền lên tới 100 DWPD. WM8500 SPU của Longsys tích hợp nén, đệm và lập lịch dữ liệu, với phần mềm iSA đưa ra quyết định phân tầng và tải trước, sử dụng tiến trình 5nm, nén không mất dữ liệu, HLC và lập lịch NAND lai. Liên minh Maxio-Infplane (Maxio Tech và Infplane) kết hợp các công nghệ chip suy luận của Infplane như bộ nhớ đệm đa cấp và tải trước với chuyên môn về NAND và bộ điều khiển SSD của Maxio, nhắm đến các chuyên gia MoE, KV Cache và độ chính xác số học, hướng tới khả năng tương thích mà không cần sửa đổi tệp mô hình hay framework, đồng thờimở rộng kiểm chứng trên PC AI, máy trạm và thiết bị biên. Các hướng đi này khác nhau về phạm vi kỹ thuật: có hướng tập trung tăng cường I/O, có hướng tham gia lập lịch thờigian chạy. Cuộc cạnh tranh trong ngành mới chỉ bắt đầu, với những sản phẩm đã được kiểm chứng và các nỗ lực thương mại hóa; tương lai có thể không phải là thay thế HBM, VRAM hay DRAM, mà là tái phân tầng dung lượng, hiệu năng và chi phí, biến SSD thành biến số then chốt trong nền kinh tế token.
Nguồn: InfoQ 中国 —
bản gốc
