AgentesModelos 🇷🇺 05.08.2026 13:03

Agente por um Dólar: A Economia da Combinação Hermes Agent + DeepSeek V4 Flash

DeepSeekDeepSeek
Uma captura de tela viral afirmou que centenas de milhões de tokens foram processados por pouco mais de um dólar usando o Hermes Agent de código aberto no DeepSeek V4 Flash. Esta notícia explica os mecanismos por trás desses custos tão baixos, focando no cache automático de prefixos, e descreve o que quebra o cache e as afirmações do fornecedor.
No início de agosto, uma captura de tela circulou no X mostrando um painel com centenas de milhões de tokens processados e uma conta de pouco mais de um dólar, supostamente pelo uso do Hermes Agent aberto no modelo DeepSeek V4 Flash. O Hermes Agent, desenvolvido pela Nous Research sob a licença MIT, funciona com qualquer endpoint compatível com OpenAI e apresenta um loop de aprendizado fechado, salvando habilidades aprendidas em arquivos markdown. O DeepSeek V4 Flash, em beta público desde 31 de julho, usa a mesma arquitetura da prévia de abril, mas com capacidades agênticas melhoradas após ajuste fino. A principal economia de custo não vem da baixa taxa base, mas do cache automático de prefixo: prefixos de prompt repetidos são cobrados a uma taxa dezenas de vezes menor. O loop agêntico se encaixa quase perfeitamente nessa mecânica, pois cada chamada reenvia o mesmo prompt de sistema e histórico com apenas algumas linhas novas anexadas. No entanto, a economia se perde se elementos no cabeçalho do prompt mudarem, como carimbos de data/hora, identificadores de sessão ou listas de ferramentas reordenadas dinamicamente. A fornecedora afirma que o modelo menor supera o modelo de prévia maior em benchmarks agênticos, mas recomenda usar o V4-Pro para raciocínio pesado. Sobretaxas de pico são anunciadas, mas ainda não ativas, e o roteamento híbrido com escalada para o Pro redefine o cache. O artigo fornece taxas de preço, lista quebras de cache comuns e aconselha sobre planejamento e considerações operacionais, como limites de taxa e perímetro de segurança.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas