Архитектура PDD преодолевает барьер гетерогенных инференсов между кластерами: снижение задержки первого токена на 51,5% и затрат на 37,5%
Компания InfiniteG (Infinigence) представила PDD — трехуровневую архитектуру гетерогенного инференса между кластерами, которая снижает задержку первого токена на 51,5% и стоимость одного токена на 37,5%. За счет вставки локального экземпляра RelayDecode (RLD) для маскировки задержек передачи KV Cache через глобальную сеть (Wide Area Network, WAN), PDD обеспечивает эффективное использование распределенных однородных кластеров для инференса больших языковых моделей (Large Language Models, LLM).
Infinigence
QbitAI 量子位30.07 · 11:02
