La arquitectura PDD rompe la barrera de inferencia heterogénea entre clústeres: reduce un 51.5% la latencia del primer token y un 37.5% el costo
Infinigence
InfiniteG (Infinigence) presentó PDD, una arquitectura de inferencia heterogénea entre clústeres de tres capas que reduce la latencia del primer token en un 51.5% y el costo por token en un 37.5%. Al insertar una instancia local de RelayDecode (RLD) para ocultar los retrasos de transferencia de caché KV en redes de área extensa (WAN), PDD permite la utilización eficiente de clústeres homogéneos dispersos para la inferencia de modelos de lenguaje grandes (LLM).
En la WAIC 2026, InfiniteG presentó PDD (Prefill-RelayDecode-MainDecode), una novedosa arquitectura de inferencia que descompone la separación tradicional PD en tres etapas. La idea clave es que las cargas de trabajo de agentes tienen tasas de acierto de caché muy sesgadas (el 70-80% de las solicitudes tienen una tasa de acierto >95%), lo que provoca que solo unas pocas solicitudes con baja tasa de acierto sufran largos retrasos en la transferencia de KV Cache a través de Ethernet WAN. PDD inserta una instancia RelayDecode (RLD) en el mismo clúster que Prefill, la cual recibe el KV Cache mediante RDMA rápida y comienza a decodificar de inmediato, enmascarando la lenta transferencia Ethernet hacia la instancia MainDecode (MD) remota. Una vez que MD recibe el KV Cache completo, un mecanismo de transferencia solo envía pequeños identificadores de tokens (pocos KB) a MD para su recomputación local, evitando grandes transferencias de KV. En pruebas con DeepSeek-V4-pro y trazas reales de agentes, PDD redujo el P90 de TTFT de 18.3 s a 9.8 s (un 46% menos), el P99 de 29.7 s a 14.4 s, mientras que RLD manejó solo el 6.2% de la generación de tokens. El costo total de infraestructura disminuyó entre un 3.5% y un 7.1%, mientras que el rendimiento efectivo (goodput de solicitudes por segundo) aumentó un 27.8%, lo que resultó en una mejora del 37.5% en la relación costo-beneficio. El trabajo permite la inferencia heterogénea a través de clústeres homogéneos vinculados por WAN de bajo costo, maximizando la utilización de recursos computacionales dispersos.
Fuente: QbitAI 量子位 —
original
