Những cạm bẫy tiềm ẩn của hạ tầng AI: Điều khách hàng học được sau sáu tháng vận hành (và cách chúng tôi xử lý trong tổ hợp phần cứng - phần mềm của mình)
NVIDIA
Một kiến trúc sư từ đội ngũ Scala^r (thuộc Tập đoàn Rubytech) mô tả những vấn đề điển hình mà khách hàng gặp phải khi xây dựng hạ tầng AI của riêng họ, như các vấn đề tích hợp, lựa chọn GPU, tắc nghẽn mạng, nguồn điện và làm mát, cùng chứng nhận. Bài viết giải thích cách tổ hợp phần cứng - phần mềm (PAK) Scala^r MII có sẵn của họ tránh được những vấn đề này bằng cách cung cấp một ngăn xếp đã được kiểm thử, mạng được tối ưu hóa, và các cải tiến về bộ lập lịch.
Bài viết của Alexey, kiến trúc sư tại Scala^r (thuộc Tập đoàn Rubytech), thảo luận về những thách thức mà khách hàng gặp phải khi tự xây dựng hạ tầng AI của họ. Những cạm bẫy chính bao gồm: các thành phần hoạt động riêng lẻ nhưng lại hỏng khi hoạt động cùng nhau dưới tải; chọn GPU sai (thường là H100 khi không cần thiết); cấu hình mạng sai làm giảm hiệu suất (ví dụ: trộn lẫn lưu lượng RDMA với lưu lượng sao lưu); thiếu khả năng chịu lỗi trong cụm Kubernetes; đánh giá thấp yêu cầu về nguồn điện và làm mát; và quy trình chứng nhận kéo dài cho các ngành được quản lý chặt chẽ. Để giải quyết những vấn đề này, Scala^r cung cấp tổ hợp phần cứng-phần mềm 'Scala^r MII', cung cấp sự kết hợp đã được kiểm tra trước của phần cứng, hệ điều hành, Kubernetes, bộ GPU và bộ mạng, giảm thời gian triển khai xuống còn 1–2 tuần và tăng hiệu suất lên 200–300% so với tự lắp ráp. Tổ hợp này hỗ trợ nhiều nền tảng GPU (NVIDIA và các giải pháp thay thế của Trung Quốc) và bao gồm các tính năng như tách biệt lưu lượng vật lý, mạng MLAG, bộ lập lịch tùy chỉnh với nhận biết cấu trúc liên kết GPU, nguồn điện dự phòng và chứng chỉ FSTEC. Bài viết cũng nêu bật ba tình huống: huấn luyện, tinh chỉnh và suy luận, nơi PAK mang lại lợi ích hiệu suất đáng kể.
Nguồn: Habr — хаб ИИ —
bản gốc
