Comando /cost
O comando/cost exibe um resumo completo do consumo de tokens e custos estimados da sessão atual:
Quando o provedor retorna dados reais de uso de tokens (
Usage.IsReal = true), os custos sao calculados com precisao. Para provedores que não retornam uso real, o ChatCLI estima tokens a partir do tamanho do texto.Token Tracking por Modo
O ChatCLI rastreia tokens em todos os modos de interação:- Chat Mode
- Agent Mode
- Coder Mode
No modo chat, o tracking conta:
- Tokens do system prompt (bootstrap + memória + contextos)
- Tokens de cada mensagem do usuário
- Tokens de cada resposta do assistente
- Economia de cache (quando aplicavel)
Tabela de Precos
O ChatCLI conhece os precos dos modelos mais comuns para calcular estimativas:Anthropic
OpenAI
Modelos GPT também mostram usage no envelope do chat, com as mesmas setinhas
N↑ M↓ que o fluxo Claude usa desde o lançamento. O ChatCLI envia stream_options: {include_usage: true} em streaming Chat Completions e parseia o evento response.completed na Responses API, então contagens input/output (e cache-hit) aparecem no envelope independente do provider. Cached tokens reportados em prompt_tokens_details.cached_tokens (Chat Completions) / input_tokens_details.cached_tokens (Responses) mapeiam para CacheReadInputTokens, o mesmo campo do prompt caching Anthropic. Reasoning tokens (o-series / GPT-5) ficam em um campo informativo separado ReasoningTokens — já estão contabilizados em CompletionTokens e cobrados como output.ZAI (Zhipu AI)
MiniMax
Moonshot (Kimi)
O cost tracker do ChatCLI bilha o preço de cache miss (0.16/M) é uma economia automática da API — quando o mesmo prefixo é reusado dentro da janela do provider — e não é contabilizado em runtime.
DeepSeek
OpenRouter
Exibicao Visual
O ChatCLI usa indicadores visuais para facilitar o acompanhamento:Formato de Tokens
Tokens são exibidos com sufixos K/M para facilitar a leitura:Progress Bar de Contexto
Quando o contexto se aproxima do limite do modelo, uma barra de progresso indica a utilizacao:Economia com Cache
O ChatCLI otimiza custos usando cache de prompt quando o provedor suporta:Tokens de Cache (Anthropic)
O ChatCLI rastreia tokens de cache específicos da Anthropic:
O custo de cache read e tipicamente 10% do custo de input normal, resultando em economia significativa em conversas longas com system prompts grandes.
A economia de cache e calculada com base na diferença entre o preço de input normal e o preço de cache read. Veja Bootstrap e Memória para detalhes sobre a otimização de contexto.
Dados Reais de API
O CostTracker suporta duas fontes de dados:
Quando o provedor retorna dados reais (
HasRealData = true), o tracking usa contagens exatas de tokens. Isso e suportado por 13+ provedores incluindo Anthropic, OpenAI, ZAI, MiniMax, DeepSeek e OpenRouter.
Custo por Modelo
Em sessões com múltiplos modelos (ex: fallback chain), o/cost mostra breakdown por modelo:
Persistencia de Sessão
Os dados de custo sao persistidos em disco para que possam ser consultados após o termino da sessão:SessionCostData) com uso por modelo, custos e timestamps.
Orcamento de Sessão
Configure um limite de gastos por sessão para evitar custos inesperados:Niveis de Orcamento
Próximos Passos
Controle de Conversa
Use /compact para reduzir tokens e custos.
Modo One-Shot
Monitore custos em pipelines automatizados.
Resultados de Tools
Orcamento de tool results que impacta uso de tokens.
Recuperação de Contexto
Estrategias automáticas quando o contexto transborda.