Groq verdoppelt die Inferenzleistung von Llama-2 70B in drei Wochen
Meta
Groq
Das Unternehmen Groq hat eine Verdopplung der Inferenzleistung für das Modell Llama-2 70B in nur drei Wochen angekündigt. Die Verbesserung wurde durch die Optimierung von Hardware und Software erreicht. Das System verarbeitet nun mehr als 1250 Tokens pro Sekunde pro Thread.
Groq, ein Unternehmen, das sich auf Hardware und Software für KI-Inferenz spezialisiert hat, hat bekannt gegeben, dass es die Inferenzleistung von Metas Llama-2-70B-Sprachmodell innerhalb von nur drei Wochen verdoppelt hat. Dieser erhebliche Leistungsschub wurde allein durch Software-Optimierungen erreicht, ohne Änderungen an der zugrunde liegenden Hardware. Das Unternehmen erklärt, dass diese Verbesserungen das Potenzial seines Software-Stacks zeigen, die Effizienz der Inferenz von KI-Modellen zu steigern. Diese Entwicklung ist besonders relevant für Anwendungen, die eine Hochgeschwindigkeitsverarbeitung großer KI-Modelle erfordern.
Quelle: Meta AI (GNews) —
Original
