Infinigence

Últimas noticias, modelos y lanzamientos de IA de Infinigence. ['DeepSeek-V4-pro']

Modelos 🇨🇳

La arquitectura PDD rompe la barrera de inferencia heterogénea entre clústeres: reduce un 51.5% la latencia del primer token y un 37.5% el costo

InfiniteG (Infinigence) presentó PDD, una arquitectura de inferencia heterogénea entre clústeres de tres capas que reduce la latencia del primer token en un 51.5% y el costo por token en un 37.5%. Al insertar una instancia local de RelayDecode (RLD) para ocultar los retrasos de transferencia de caché KV en redes de área extensa (WAN), PDD permite la utilización eficiente de clústeres homogéneos dispersos para la inferencia de modelos de lenguaje grandes (LLM).

InfinigenceInfinigence
QbitAI 量子位30.07 · 11:02
Noticias frescas