Groq удваивает производительность инференса Llama-2 70B за 3 недели
Компания Groq объявила о двукратном увеличении производительности инференса для модели Llama-2 70B всего за три недели. Улучшение достигнуто за счет оптимизации аппаратного и программного обеспечения. Теперь система обрабатывает более 1250 токенов в секунду на один поток.
Groq, компания, специализирующаяся на аппаратном и программном обеспечении для вывода моделей искусственного интеллекта, объявила, что за три недели удвоила производительность вывода большой языковой модели Llama-2 70B от Meta. Этот значительный прирост производительности был достигнут исключительно за счет оптимизации программного обеспечения, без каких-либо изменений в базовом аппаратном
Показать ещё ↓
Источник: Meta AI (GNews) —
оригинал
