до 90 000 токенов на вызов. Затраты значительно варьируются в зависимости от модели: для Anthropic Sonnet 4.6 такая же рабочая нагрузка обошлась бы в 4770 долларов США при реалистичном показателе попаданий в кэш 92%, в то время как DeepSeek V4 Pro стоил всего 66,17 доллара США, что в 72 раза дешевле. Этот разрыв объясняется использованием в DeepSeek многоголового скрытого внимания (Multi-Head Latent Attention, MLA), которое сжимает KV-кэш на 93,3%, позволяя чтение из кэша практически бесплатно и сохранение кэша в течение нескольких дней на обычных твердотельных накопителях через 3FS, тогда как Anthropic, OpenAI и Google используют GQA/MHA с кэшем, который истекает в течение часа из-за ограничений HBM. В статье также упоминаются инциденты в Uber, Microsoft, Amazon, Pinterest и одном неназванном предприятии, показывающие неконтролируемые расходы из-за бесконтрольного использования агентов, и утверждается, что архитектурный выбор DeepSeek делает управление экономически целесообразным, в отличие от более дорогих альтернатив, которые вынуждают команды сокращать меры безопасности.