Kiến trúc PDD phá vỡ rào cản suy luận không đồng nhất giữa các cụm: Giảm 51,5% độ trễ token đầu tiên, giảm 37,5% chi phí
Infinigence
InfiniteG (Infinigence) công bố PDD, một kiến trúc suy luận không đồng nhất ba lớp giữa các cụm, giảm 51,5% độ trễ token đầu tiên và 37,5% chi phí mỗi token. Bằng cách chèn một phiên bản RelayDecode cục bộ (RLD) để che giấu độ trễ truyền KV Cache qua WAN, PDD cho phép sử dụng hiệu quả các cụm đồng nhất phân tán cho suy luận mô hình ngôn ngữ lớn (LLM).
Tại WAIC 2026, InfiniteG đã trình bày PDD (Prefill-RelayDecode-MainDecode), một kiến trúc suy luận mới phân tách quy trình PD truyền thống thành ba giai đoạn. Ý tưởng chính là khối lượng công việc của agent có tỷ lệ hit cache rất lệch (70-80% yêu cầu có tỷ lệ hit >95%), khiến chỉ một số ít yêu cầu có tỷ lệ hit thấp phải chịu độ trễ truyền KV Cache qua WAN Ethernet. PDD chèn một instance RelayDecode (RLD) trong cùng cụm với Prefill, instance này nhận KV Cache qua RDMA nhanh và bắt đầu giải mã ngay lập tức, che giấu độ trễ truyền Ethernet chậm đến instance MainDecode (MD) từ xa. Khi MD nhận được đầy đủ KV Cache, cơ chế bàn giao chỉ chuyển các token ID nhỏ (vài KB) sang MD để tính toán lại cục bộ, tránh việc truyền KV lớn. Trong các thử nghiệm trên DeepSeek-V4-pro với các vết agent thực tế, PDD đã giảm P90 TTFT từ 18,3 giây xuống 9,8 giây (giảm 46%) và P99 từ 29,7 giây xuống 14,4 giây, trong khi RLD chỉ xử lý 6,2% lượng token sinh ra. Tổng chi phí hạ tầng giảm 3,5-7,1% trong khi thông lượng hiệu dụng (RPS goodput) tăng 27,8%, mang lại cải thiện 37,5% về tỷ lệ lợi ích-chi phí. Công trình này cho phép suy luận không đồng nhất trên các cụm đồng nhất liên kết qua WAN chi phí thấp, tối đa hóa việc sử dụng các tài nguyên tính toán phân tán.
Nguồn: QbitAI 量子位 —
bản gốc
