Kiến trúc PDD phá vỡ rào cản suy luận không đồng nhất giữa các cụm: Giảm 51,5% độ trễ token đầu tiên, giảm 37,5% chi phí
InfiniteG (Infinigence) công bố PDD, một kiến trúc suy luận không đồng nhất ba lớp giữa các cụm, giảm 51,5% độ trễ token đầu tiên và 37,5% chi phí mỗi token. Bằng cách chèn một phiên bản RelayDecode cục bộ (RLD) để che giấu độ trễ truyền KV Cache qua WAN, PDD cho phép sử dụng hiệu quả các cụm đồng nhất phân tán cho suy luận mô hình ngôn ngữ lớn (LLM).
Infinigence
QbitAI 量子位30.07 · 11:02
