Skip to main content
O Cost Tracking do ChatCLI monitora o consumo de tokens e estima custos em tempo real durante suas sessões, com dados reais de uso da API quando disponíveis. Você pode acompanhar quanto cada conversa esta custando, ver custos por modelo/provedor e configurar limites de orcamento.

Comando /cost

O comando /cost exibe um resumo completo do consumo de tokens e custos estimados da sessão atual:
Quando o provedor retorna dados reais de uso de tokens (Usage.IsReal = true), os custos sao calculados com precisao. Para provedores que não retornam uso real, o ChatCLI estima tokens a partir do tamanho do texto.

Token Tracking por Modo

O ChatCLI rastreia tokens em todos os modos de interação:
No modo chat, o tracking conta:
  • Tokens do system prompt (bootstrap + memória + contextos)
  • Tokens de cada mensagem do usuário
  • Tokens de cada resposta do assistente
  • Economia de cache (quando aplicavel)

Tabela de Precos

O ChatCLI conhece os precos dos modelos mais comuns para calcular estimativas:

Anthropic

OpenAI

Modelos GPT também mostram usage no envelope do chat, com as mesmas setinhas N↑ M↓ que o fluxo Claude usa desde o lançamento. O ChatCLI envia stream_options: {include_usage: true} em streaming Chat Completions e parseia o evento response.completed na Responses API, então contagens input/output (e cache-hit) aparecem no envelope independente do provider. Cached tokens reportados em prompt_tokens_details.cached_tokens (Chat Completions) / input_tokens_details.cached_tokens (Responses) mapeiam para CacheReadInputTokens, o mesmo campo do prompt caching Anthropic. Reasoning tokens (o-series / GPT-5) ficam em um campo informativo separado ReasoningTokens — já estão contabilizados em CompletionTokens e cobrados como output.

Google

ZAI (Zhipu AI)

MiniMax

Moonshot (Kimi)

O cost tracker do ChatCLI bilha o preço de cache miss (0.95/Minput)parasemanterconservador.Ocachehit(0.95/M input) para se manter conservador. O cache-hit (0.16/M) é uma economia automática da API — quando o mesmo prefixo é reusado dentro da janela do provider — e não é contabilizado em runtime.

DeepSeek

OpenRouter

Os precos sao atualizados periodicamente nas releases do ChatCLI. Para modelos não listados ou provedores custom (via OpenAI-compatible), o custo aparece como “N/A”. O OpenRouter disponibiliza precos via API — o ChatCLI usa o ConfigMap de precos para estimar custos dos modelos mais populares.

Exibicao Visual

O ChatCLI usa indicadores visuais para facilitar o acompanhamento:

Formato de Tokens

Tokens são exibidos com sufixos K/M para facilitar a leitura:

Progress Bar de Contexto

Quando o contexto se aproxima do limite do modelo, uma barra de progresso indica a utilizacao:
Quando o uso de contexto ultrapassa 80%, o ChatCLI sugere automaticamente executar /compact para liberar espaco e reduzir custos.

Economia com Cache

O ChatCLI otimiza custos usando cache de prompt quando o provedor suporta:

Tokens de Cache (Anthropic)

O ChatCLI rastreia tokens de cache específicos da Anthropic: O custo de cache read e tipicamente 10% do custo de input normal, resultando em economia significativa em conversas longas com system prompts grandes.
A economia de cache e calculada com base na diferença entre o preço de input normal e o preço de cache read. Veja Bootstrap e Memória para detalhes sobre a otimização de contexto.

Dados Reais de API

O CostTracker suporta duas fontes de dados: Quando o provedor retorna dados reais (HasRealData = true), o tracking usa contagens exatas de tokens. Isso e suportado por 13+ provedores incluindo Anthropic, OpenAI, ZAI, MiniMax, DeepSeek e OpenRouter.

Custo por Modelo

Em sessões com múltiplos modelos (ex: fallback chain), o /cost mostra breakdown por modelo:

Persistencia de Sessão

Os dados de custo sao persistidos em disco para que possam ser consultados após o termino da sessão:
O arquivo contem o snapshot completo (SessionCostData) com uso por modelo, custos e timestamps.

Orcamento de Sessão

Configure um limite de gastos por sessão para evitar custos inesperados:

Niveis de Orcamento

Quando o orcamento e excedido, o ChatCLI exibe um aviso mas não interrompe a sessão automaticamente. O usuário pode decidir continuar ou encerrar.

Próximos Passos

Controle de Conversa

Use /compact para reduzir tokens e custos.

Modo One-Shot

Monitore custos em pipelines automatizados.

Resultados de Tools

Orcamento de tool results que impacta uso de tokens.

Recuperação de Contexto

Estrategias automáticas quando o contexto transborda.