Groq удваивает производительность инференса Llama-2 70B за 3 недели
Meta
Groq
Компания Groq объявила о двукратном увеличении производительности инференса для модели Llama-2 70B всего за три недели. Улучшение достигнуто за счет оптимизации аппаратного и программного обеспечения. Теперь система обрабатывает более 1250 токенов в секунду на один поток.
Groq сообщила, что ей удалось вдвое увеличить производительность инференса большой языковой модели Llama-2 70B всего за три недели. Улучшение стало результатом оптимизации как аппаратного обеспечения (тензорных процессоров Groq), так и программного стека. Теперь система способна обрабатывать более 1250 токенов в секунду на один поток, что значительно превосходит предыдущие показатели. Это достижение подчеркивает эффективность архитектуры Groq и возможности быстрой оптимизации.
- Сокращения
- LLM = Large Language Model — Большая языковая модель
Source: Meta AI (GNews) —
original
