Groq duplica el rendimiento de inferencia de Llama-2 70B en 3 semanas
Meta
Groq
La empresa Groq ha anunciado un aumento del doble en el rendimiento de inferencia para el modelo Llama-2 70B en solo tres semanas. La mejora se logró mediante la optimización del hardware y el software. Ahora el sistema procesa más de 1250 tokens por segundo por hilo.
Groq, una empresa especializada en hardware y software de inferencia de IA, ha anunciado que ha duplicado el rendimiento de inferencia del modelo de lenguaje grande Llama-2 70B de Meta en solo tres semanas. Esta mejora significativa del rendimiento se logró únicamente mediante optimizaciones de software, sin realizar cambios en el hardware subyacente. La compañía afirma que estas mejoras demuestran el potencial de su pila de software para aumentar la eficiencia de la inferencia de modelos de IA. Este desarrollo es especialmente relevante para aplicaciones que requieren procesamiento de alta velocidad de modelos de IA grandes.
Fuente: Meta AI (GNews) —
original
