Архитектура PDD преодолевает барьер гетерогенных инференсов между кластерами: снижение задержки первого токена на 51,5% и затрат на 37,5%
Infinigence
Компания InfiniteG (Infinigence) представила PDD — трехуровневую архитектуру гетерогенного инференса между кластерами, которая снижает задержку первого токена на 51,5% и стоимость одного токена на 37,5%. За счет вставки локального экземпляра RelayDecode (RLD) для маскировки задержек передачи KV Cache через глобальную сеть (Wide Area Network, WAN), PDD обеспечивает эффективное использование распределенных однородных кластеров для инференса больших языковых моделей (Large Language Models, LLM).
На WAIC 2026 компания InfiniteG представила PDD (Prefill-RelayDecode-MainDecode) — новую архитектуру инференса, которая разбивает традиционное разделение на PD на три этапа. Ключевая идея заключается в том, что в агентских рабочих нагрузках наблюдается крайне несбалансированная частота попаданий в кэш (для 70–80% запросов показатель >95%), из-за чего лишь небольшое количество запросов с низкой
Показать ещё ↓
Источник: QbitAI 量子位 —
оригинал
