варьируется от 1 рубля до 20 726 рублей в зависимости от модели и нагрузки. Автор сравнивает различные GPU по цене за гигабайт видеопамяти, отмечая, что RTX 3090 значительно дешевле за гигабайт, и обсуждает сборки с несколькими GPU, которые часто неэффективны из-за узких мест PCIe. Ключевые измерения производительности в llama.cpp показывают скорость генерации токенов от 61 до 234 токенов в секунду для разных моделей, в то время как vLLM с непрерывным пакетированием на одной 5090 может достигать примерно 4570 токенов в секунду в сумме на сотни одновременных запросов. Несмотря на это, точка безубыточности по сравнению с семью API-сервисами высока и часто превышает реалистичное ежемесячное использование токенов, что приводит автора к выводу, что API обычно более рентабельны для большинства команд.