Infinigence

Tin tức, mô hình và bản phát hành AI mới nhất từ Infinigence. ['DeepSeek-V4-pro']

Mô hình 🇨🇳

Kiến trúc PDD phá vỡ rào cản suy luận không đồng nhất giữa các cụm: Giảm 51,5% độ trễ token đầu tiên, giảm 37,5% chi phí

InfiniteG (Infinigence) công bố PDD, một kiến trúc suy luận không đồng nhất ba lớp giữa các cụm, giảm 51,5% độ trễ token đầu tiên và 37,5% chi phí mỗi token. Bằng cách chèn một phiên bản RelayDecode cục bộ (RLD) để che giấu độ trễ truyền KV Cache qua WAN, PDD cho phép sử dụng hiệu quả các cụm đồng nhất phân tán cho suy luận mô hình ngôn ngữ lớn (LLM).

InfinigenceInfinigence
QbitAI 量子位30.07 · 11:02
Tin mới