Por qué las redes neuronales consumen tokens: qué ocurre en chats largos y cómo reducir costos
Anthropic
SYNTX.AI
Los chats largos de IA con ventanas de contexto enormes aumentan los costos de tokens y pueden degradar el rendimiento del modelo. Un usuario de Reddit informó haber gastado más de mil millones de tokens de entrada con Claude, mientras que otro acumuló unos 6000 dólares en un agente de IA desatendido. Estudios como 'Context Rot' muestran que el rendimiento cae a medida que crece el contexto, y los expertos recomiendan dividir tareas, compactar el historial y usar caché de prompts para economizar.
El artículo analiza por qué los modelos de IA consumen tokens de manera excesiva en conversaciones largas y cómo reducir los costos. Cita anécdotas de Reddit: un usuario agotó 1156 millones de tokens de entrada con Claude, y otro olvidó detener un agente de Claude Code que revisaba pull requests cada 30 minutos durante 26 horas, totalizando 46 ejecuciones y costando aproximadamente 6000 dólares. La razón técnica del alto costo es que cada nueva solicitud incluye todo el contexto acumulado, que puede llegar a 800 mil tokens. Anthropic advierte en su documentación que los costos aumentan con el tamaño del contexto y recomienda borrar el historial o usar compactación. Investigaciones de Chroma ('Context Rot') y un estudio de 2026 ('Diagnosing and Mitigating Context Rot') muestran que el rendimiento se degrada con entradas más largas, incluso antes del límite de la ventana de contexto, especialmente con información distractora. El almacenamiento en caché de mensajes solo reduce los costos para prefijos repetidos, no los problemas del contexto innecesario. En el caso de los agentes de IA, los costos están ocultos porque realizan muchas operaciones de herramientas de forma autónoma. Los consejos prácticos incluyen dividir tareas independientes, usar /clear y /compact en Claude Code, proporcionar solo las secciones relevantes de los documentos, almacenar en caché instrucciones estables, y elegir el nivel de modelo adecuado (Sonnet para codificación, Opus para razonamiento complejo, Haiku para tareas simples de subagentes). El autor también promociona LLM Studio de SYNTX.AI, que ofrece más de 100 modelos de IA y la capacidad de cambiar de modelo dentro de un diálogo, con el código de promoción CTRLAI para un 20% de descuento. El artículo concluye que la ingeniería de indicaciones ahora debe incluir descartar información innecesaria.
Fuente: Habr — хаб ИИ —
original
