> ## Documentation Index
> Fetch the complete documentation index at: https://chatcli.edilsonfreitas.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Modelos de IA Suportados

> Referência completa dos modelos de IA suportados nativamente pelo ChatCLI em cada provedor, com capacidades, limites de output e detalhes de API.

O **ChatCLI** suporta uma ampla gama de modelos dos principais provedores de IA. Troque de modelo a qualquer momento com `/switch --model <nome>`.

**Legenda de capacidades:**

* 👁 **Vision** — aceita imagens como entrada
* 🔧 **Tools** — uso nativo de ferramentas (function calling)
* 📋 **JSON Mode** — saída JSON estruturada garantida
* 💻 **Code Exec** — execução de código nativa no provedor

Todos os provedores suportam **streaming** via SSE (Server-Sent Events). O ChatCLI habilita streaming automaticamente.

***

<Tabs>
  <Tab title="OpenAI">
    Modelos ideais para geração de código e raciocínio complexo. Suportam tanto a **Chat Completions API** quanto a **Responses API**.

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `gpt-6.1-sol` | `gpt-6-1-sol`, `gpt-6.1` | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools (Responses API), 📋 JSON Mode |
    | `gpt-6-astra` | `gpt-6` | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-6-sol` | — | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-6-luna` | — | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-5.6-sol` | `gpt-5.6` | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-5.6-terra` | — | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-5.6-luna` | — | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-5.5` | — | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-5.5-pro` | — | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-5.4` | `gpt-5.4-pro` | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-5.4-mini` | `gpt-5.4-nano` | 400K tokens | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-5.3-codex` | — | 400K tokens | 128K tokens | 🔧 Tools, 📋 JSON Mode |
    | `gpt-5.2` | `gpt-5.2-pro` | 400K tokens | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-5` | `gpt-5.1`, `gpt-5-mini`, `gpt-5-nano`, `gpt-5-pro` | 400K tokens | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `o3` / `o3-mini` / `o4-mini` | — | 200K tokens | 100K tokens | 🔧 Tools, 📋 JSON Mode, 🧠 Reasoning |
    | `gpt-4.1` | `gpt-4.1-mini`, `gpt-4.1-nano` | **1,05M tokens** | 32K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |
    | `gpt-4o` | `gpt-4o-mini` | 128K tokens | 16K tokens | 👁 Vision, 🔧 Tools, 📋 JSON Mode |

    <Info>
      O **GPT-6.1 Sol** (`gpt-6.1-sol`, GA em 29/set/2026): contexto de 1.050.000 tokens, 128K de output, knowledge cutoff em 30/abr/2026. US$ 2/10 por MTok, cached input US$ 0,10 (5% do input), cache write US\$ 2,50. O `reasoning_effort` aceita `low`, `medium` (default), `high`, `xhigh` e `max` — não existe `none`/`minimal`. Tool calling exige a **Responses API** (a Chat Completions serve o modelo sem tools). Não existe 6.1 Astra/Terra/Luna, e a variante `-pro` existe só no OpenRouter (fora do catálogo). Também no **Copilot** (`gpt-6.1-sol`), **OpenRouter** (`openai/gpt-6.1-sol`), **Bedrock** (`global.openai.gpt-6.1-sol`) e **Devin** (`gpt-6.1-sol`). O alias puro `gpt-6` continua resolvendo para `gpt-6-astra`. Os hints de effort (`low`/`medium`/`high`) agora chegam a toda a família GPT-6.
    </Info>

    <Info>
      O **GPT-5.6** (GA em 9 de julho de 2026) chega em três tiers nomeados: **Sol** (flagship), **Terra** (equilibrado para o dia a dia) e **Luna** (rápido e econômico) — US$ 4/20, US$ 2/12 e US$ 0,20/1,20 por MTok respectivamente (o Sol caiu de US$ 5/30 para US\$ 4/20 em 21/ago/2026 — preço promocional válido pelo menos até 21/nov/2026). Os três funcionam com **API key** e com **OAuth do ChatGPT** (`/auth login openai-codex`); no backend Codex o ChatCLI envia automaticamente os headers de identificação de cliente exigidos (sem eles o backend retorna 404 para o Luna).
    </Info>

    <Note>
      **Specs re-verificadas em set/2026:** o `gpt-5.4` roda o mesmo perfil 1,05M / 128K do 5.5/5.6 (o alias `gpt-5.4-pro` é Responses-only, $30/$180); `gpt-5.4-mini`/`-nano` viraram uma entrada própria de 400K / 128K; `gpt-5.3-codex` (Responses-only) e `gpt-5.2` (+ `gpt-5.2-pro`, Responses-only, $21/$168) são 400K / 128K. Os aliases `gpt-5.3`, `gpt-5.3-mini`, `gpt-5.3-nano`, `gpt-5.2-mini` e `gpt-5.2-nano` foram removidos — esses modelos não existem na API — assim como o `gpt-5.3-codex-spark` (exclusivo do app Codex, nunca foi um id da plataforma). **Desligamentos anunciados pela OpenAI:** `o3-mini`, `o4-mini` e `gpt-4.1-nano` em 23/out/2026; os snapshots `gpt-5`, `gpt-5-mini`, `gpt-5-nano`, `gpt-5-pro` e `o3` em 11/dez/2026; `gpt-5.3-codex`, `gpt-5.4-nano` e `gpt-5.1` em 1/abr/2027.
    </Note>

    <Info>
      O roteamento entre **Chat Completions** e **Responses API** é automático por modelo via catálogo (`gpt-5.x`, `gpt-4.1` e a série o preferem Responses; `gpt-4o` permanece na Chat Completions). Force Responses para todos os modelos com `OPENAI_USE_RESPONSES=true`. Sessões OAuth sempre usam a Responses API. Streaming habilitado para todos os modelos.
    </Info>
  </Tab>

  <Tab title="Anthropic (Claude)">
    Grandes janelas de contexto e excelente capacidade de seguir instruções complexas. Todos os modelos suportam streaming via SSE.

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `claude-fable-5-1` | `fable-5-1`, `claude-fable-5.1`, `fable-5.1`, `fable` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking (sempre ativo), ✉️ Mid-conv system |
    | `claude-fable-5` (legado) | `fable-5` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking, ✉️ Mid-conv system |
    | `claude-opus-5-5` | `opus-5-5`, `claude-opus-5.5`, `opus-5.5` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking (always on), ⚡ Fast mode, ✉️ Mid-conv system |
    | `claude-sonnet-5-5` | `sonnet-5-5`, `claude-sonnet-5.5`, `sonnet-5.5`, `claude-5.5-sonnet` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking (sempre ativo), ✉️ Mid-conv system |
    | `claude-haiku-5-5` | `haiku-5-5`, `claude-haiku-5.5`, `haiku-5.5` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking, ✉️ Mid-conv system |
    | `claude-opus-5` | `opus-5`, `claude-5-opus` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking |
    | `claude-sonnet-5` | `sonnet-5`, `claude-5-sonnet` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking |
    | `claude-opus-4-8` | `opus-4-8` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking, ⚡ Fast mode, ✉️ Mid-conv system, 💾 Cache mín. 1K |
    | `claude-opus-4-7` | `opus-4-7` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking |
    | `claude-opus-4-6` | `opus-4-6` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools |
    | `claude-sonnet-4-6` | `claude-4-6-sonnet`, `sonnet-4-6` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools |
    | `claude-haiku-4-5-20251001` | `claude-haiku-4-5`, `haiku-4-5` | 200K tokens | 64K tokens | 👁 Vision, 🔧 Tools |
    | `claude-opus-4-5` | `opus-4-5` | 200K tokens | 64K tokens | 👁 Vision, 🔧 Tools |
    | `claude-sonnet-4-5` (descontinuado, aposenta em 30/nov/2026) | `claude-4-5-sonnet`, `sonnet-4-5` | 200K tokens | 64K tokens | 👁 Vision, 🔧 Tools |

    <Info>
      **Claude Fable 5.1** (`claude-fable-5-1`, lançado em 1/set/2026) é o modelo mais capaz da Anthropic — sucessor do Fable 5 no **tier acima do Opus**: 1M de contexto, 128K de output, $10/$50 por MTok, com \*\*cache reads a $0,25/MTok** (2,5% do input em vez dos 10% habituais — o Fable 5 continua em $1). O thinking é **sempre ativo** (adaptive): `thinking:{type:"disabled"}` ou `budget_tokens` explícitos retornam 400 — o ChatCLI omite o campo a menos que o effort routing dispare. Três breaking changes em relação ao Fable 5: `tool_choice` forçado (`any`/`tool`) retorna 400 (o ChatCLI só envia `auto`), blocos de thinking ficam vinculados ao modelo que os produziu (outros modelos os descartam) e editar turnos anteriores invalida os blocos de thinking. Sem fast mode, sem Priority Tier; exige retenção de dados de 30 dias. Atalho: `/model fable` — o alias `fable` puro agora aponta pro 5.1, enquanto `fable-5` fica pinado no Fable 5 (legado, ainda servido). Também no **Bedrock** como `anthropic.claude-fable-5-1` e no **OpenRouter** como `anthropic/claude-fable-5.1`.

      **Claude Fable 5** (`claude-fable-5`) agora é legado, mas continua servido. Mesma superfície de API do Opus 4.7/4.8 (adaptive thinking only, sem `temperature`/`top_p`/`top_k`) com uma restrição extra: `thinking:{type:"disabled"}` explícito retorna 400 — o campo deve ser **omitido** para rodar sem thinking (o client do ChatCLI já faz isso). Também disponível no **Bedrock** como `anthropic.claude-fable-5` (ID dateless — a nova geração não tem IDs ARN-versionados).

      **Claude Sonnet 5** (`claude-sonnet-5`) é o sucessor do tier Sonnet (a Anthropic pulou 4.7/4.8 no Sonnet): 1M de contexto, 128K de output, adaptive thinking, **$2/$10 por MTok** — o preço de lançamento virou o preço de lista permanente (a Anthropic cancelou o aumento para $3/$15 previsto para 1/set/2026). O Sonnet 5 **não** suporta task budgets — o ChatCLI deixou de anunciar essa capability nele. No **Bedrock** é servido exclusivamente pelo endpoint Messages (`anthropic.claude-sonnet-5`) — o ChatCLI roteia automaticamente; veja a aba AWS Bedrock.

      **Claude Opus 5** (`claude-opus-5`, jul/2026) sucede o Opus 4.8 para coding agêntico complexo e trabalho enterprise: 1M de contexto, 128K de output, adaptive thinking (`effort` default `high` no servidor), $5/$25 por MTok — o mesmo preço do Opus 4.5-4.8. Atalho: `/model opus-5`. No **Bedrock** é servido pelo endpoint Messages (`anthropic.claude-opus-5`), roteado automaticamente como o Sonnet 5; no **OpenRouter** o slug é `anthropic/claude-opus-5`.

      **Claude Opus 5.5** (`claude-opus-5-5`, 22/set/2026) sucede o Opus 5 na linha Opus por um preço **menor**: **$4/$20 por MTok**, cache read $0,20 (5% do input), fast mode $8/\$40. 1M de contexto, 128K de output, thinking sempre ligado (adaptive — `disabled`/`budget_tokens` dão 400), `effort` default `medium` no servidor (um nível abaixo do Opus 5), `tool_choice` forçado dá 400. Roda classificadores cyber **e** bio, mais `reasoning_extraction`: uma recusa chega como HTTP 200 com `stop_reason: refusal` e o ChatCLI mostra a categoria e o modelo recomendado (ver [roteamento](/pt/agents/model-routing#quando-o-provider-recusa-um-turno)). Atalho: `/model opus-5.5`. Pela superfície OAuth do Claude Code exige o release **2.1.280+** — o ChatCLI apresenta 2.1.293 e aprende do erro `claude_code_version_too_old` se a API pedir mais novo. No **Bedrock** é `anthropic.claude-opus-5-5` (endpoint Messages, profiles `global.`/`us.`/`eu.`/`au.`); no **OpenRouter** o slug é `anthropic/claude-opus-5.5`; no **Copilot** `claude-opus-5.5`.

      **Claude Sonnet 5.5** (`claude-sonnet-5-5`, 28/set/2026) sucede o Sonnet 5 pelo mesmo **$2/$10 por MTok**, com cache read a $0,10 (5% do input, como no Opus 5.5) e cache write a $2,50 (5m) / \$4 (1h). 1M de contexto, 128K de output (300K na Batch API com o beta `output-300k`). O adaptive thinking vem ligado por padrão e **não pode ser desligado** (`thinking` disabled / `budget_tokens` dão 400); o `effort` vai de `low` a `max`, default `high`. `tool_choice` forçado (`any`/`tool`) dá 400 (o ChatCLI só envia `auto`), e o texto que o modelo escreve entre tool calls volta como blocos de thinking (ocultos por padrão). Suporta task budgets e mensagens system no meio da conversa; sem fast mode. Atalho: `/model sonnet-5.5`. Pela superfície OAuth do Claude Code exige o release **2.1.284+**. No **Bedrock** é `global.anthropic.claude-sonnet-5-5` (servido pelo `bedrock-runtime`, não pelo Mantle); no **OpenRouter** `anthropic/claude-sonnet-5.5`; no **Copilot** `claude-sonnet-5.5`.

      **Claude Haiku 5.5** (`claude-haiku-5-5`, 7/out/2026): 1M de contexto, 128K de output, preço por **tamanho do prompt** — $0,10/$0,50 por MTok (cache read $0,01, 10%) até 100K tokens de prompt; acima de 100K **todas as linhas cobram 5×** ($0,50/$2,50, cache read $0,05), e o cost tracker do ChatCLI aplica esse tier por chamada. O adaptive thinking vem ligado por padrão e só pode ser desligado com effort `high` ou abaixo; o `effort` default é `medium`. `tool_choice` forçado é aceito. Usa um tokenizer mais novo (\~30% mais tokens que o Haiku 4.5 para o mesmo texto). Suporta task budgets e mensagens system no meio da conversa. Atalho: `/model haiku-5.5`. Pela superfície OAuth do Claude Code exige o release **2.1.293+**. No **Bedrock** é `global.anthropic.claude-haiku-5-5`; no **OpenRouter** `anthropic/claude-haiku-5.5`; no **Copilot** `claude-haiku-5.5`.

      `claude-opus-4-8` e `claude-opus-4-7` vêm com **1M de contexto nativo** (sem flag extra). O `claude-opus-4-6` pode usar **1M de contexto** configurando `ANTHROPIC_1MTOKENS_SONNET=true`. O `claude-sonnet-4-6` agora permite **128K de output** na Claude API (era 64K antes de mar/2026; no Bedrock o teto continua 64K). Modelos diferentes podem usar headers `anthropic-version` distintos, gerenciados automaticamente pelo catálogo.
    </Info>

    <Note>
      **Aposentados na Claude API (removidos do catálogo, set/2026):** Opus 4.1 (5/ago/2026), Opus 4 e Sonnet 4 (15/jun/2026) e toda a linha Claude 3.x (Sonnet 3.7, Sonnet 3.5, Haiku 3.5, Opus 3, Haiku 3). Requests com esses ids falham no servidor, então os aliases (`opus-4-1`, `opus-4`, `sonnet-4`, `claude-3-7-sonnet`, …) não resolvem mais. Nunca existiu um Sonnet 4.7 — a Anthropic foi do Sonnet 4.6 direto pro Sonnet 5, e o placeholder `sonnet-4-7` foi removido. O Bedrock tem ciclo de vida próprio (veja a aba AWS Bedrock).

      **Descontinuado:** o Sonnet 4.5 (`claude-sonnet-4-5`) foi descontinuado na Claude API em 30/set/2026 e aposenta em 30/nov/2026 — o substituto é o `claude-sonnet-5-5`.

      **Ordem do catálogo**: os entries são declarados newest-first no registry. O resolvedor de aliases casa por prefixo na ordem do registry, então um entry mais antigo cujo alias é prefixo de um id mais novo (`fable-5` ⊂ `fable-5-1`, `opus-4-5` ⊂ `opus-4-5-…`) precisa vir depois do mais novo — senão `fable-5-1` resolveria silenciosamente pro Fable 5 (preço de cache errado, capability flags erradas). Se você adicionar uma nova geração de Claude, mantenha essa ordem newest-first.
    </Note>

    ### Claude Opus 4.8 — o que mudou

    Lançado em **28 de maio de 2026**. Mesmo perfil 1M / 128K do Opus 4.7, mas com quatro novas capabilities de lançamento que o catálogo rastreia como feature flags:

    | Capability | O que significa |
    | :- | :- |
    | `adaptive_thinking` | Único modo de thinking aceito por 4.7+. O ChatCLI envia `thinking:{type:"adaptive"}` quando uma skill traz um hint `effort:` — o modelo decide turno-a-turno se reasoning é necessário. Mandar `budget_tokens` retorna HTTP 400. |
    | `fast_mode` | Research-preview com output \~2.5× mais rápido (premium pricing). Opt-in via `ANTHROPIC_SPEED=fast`. |
    | `mid_conversation_system` | Servidor aceita `role:"system"` depois do primeiro turno de user sem invalidar cache. O builder de mensagens do ChatCLI já repassa blocos system estruturados intactos. |
    | `low_cache_minimum` | Tamanho mínimo de prompt cacheável cai para **1.024 tokens** (era maior em 4.7). Prompts que não qualificavam em 4.7 agora criam entradas de cache sem mudança de código. |

    Skill `effort: medium|high|max` continua funcionando — em Opus 4.7+, Sonnet 5, Sonnet 5.5, Haiku 5.5, Opus 5, Opus 5.5 e Fable 5/5.1 mapeia para adaptive thinking automaticamente; em 4.x mais antigos (4.5/4.6) faz fallback para budgeted extended thinking (`thinking:{type:"enabled", budget_tokens:N}`).
  </Tab>

  <Tab title="AWS Bedrock (catálogo completo)">
    Catálogo completo do AWS Bedrock — Anthropic, OpenAI, Llama, Nova, Mistral, Cohere, AI21, DeepSeek, Moonshot Kimi, MiniMax, Qwen, Z.AI/GLM, Gemma, Nemotron, TwelveLabs e qualquer provider que a AWS adicionar. A autenticação usa a credentials chain padrão do SDK AWS (IAM role, `~/.aws/credentials`, env vars) — nenhuma API key dos providers originais é necessária.

    <Warning>
      Modelos modernos (Claude 4.x/4.5/4.6 e equivalentes em outros providers) **não aceitam invocação on-demand direta** pelo ID base — requerem um **inference profile ID** (prefixos `global.`, `us.`, `eu.`, `apac.`). O ChatCLI **filtra automaticamente** IDs base não-invokáveis do `/switch --model`, então só aparece o que funciona. Veja [AWS Bedrock](/pt/providers/bedrock) para detalhes.
    </Warning>

    <Note>
      **Nova geração = IDs dateless.** Fable 5.1, Fable 5, Opus 5.5, Sonnet 5.5, Haiku 5.5, Opus 5, Sonnet 5, Opus 4.8 e Opus 4.7 **não têm IDs ARN-versionados** no Bedrock — os IDs são `anthropic.claude-fable-5-1`, `anthropic.claude-fable-5`, `anthropic.claude-opus-5-5`, `global.anthropic.claude-sonnet-5-5`, `global.anthropic.claude-haiku-5-5`, `anthropic.claude-opus-5`, `anthropic.claude-sonnet-5`, `anthropic.claude-opus-4-8` e `anthropic.claude-opus-4-7`. Opus 4.8/4.7 são invocados pelo inference profile `global.` (o ID puro não é invocável on-demand no `InvokeModel`). Os IDs datados antigos (ex.: `global.anthropic.claude-opus-4-8-20260528-v1:0`) continuam resolvendo como aliases. **Opus 5.5, Opus 5, Sonnet 5, Fable 5 e Fable 5.1 são servidos pelo endpoint Messages** (`bedrock-mantle.{região}.api.aws/anthropic/v1/messages`) — o ChatCLI detecta e roteia automaticamente (SigV4 `bedrock-mantle` ou `AWS_BEARER_TOKEN_BEDROCK`) e, se a chamada Mantle falhar, refaz a mesma requisição pelo runtime InvokeModel legado sob o inference profile `global.`; veja [AWS Bedrock](/pt/providers/bedrock).

      **Sonnet 5.5 e Haiku 5.5 são a exceção:** **não** são Mantle-only — o `bedrock-runtime` os serve (Messages, Converse e InvokeModel). Não há opção in-region, então o ID canônico é o inference profile `global.` (`global.anthropic.claude-sonnet-5-5`, `global.anthropic.claude-haiku-5-5`); IDs first-party puros são promovidos automaticamente.
    </Note>

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `anthropic.claude-fable-5-1` | `bedrock-fable-5-1`, `global.anthropic.claude-fable-5-1`, `us.anthropic.claude-fable-5-1`, `claude-fable-5-1`, `fable-5-1` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking (endpoint Messages, retenção 30 dias) |
    | `anthropic.claude-fable-5` | `bedrock-fable-5`, `claude-fable-5`, `fable-5` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking (endpoint Messages, retenção 30 dias) |
    | `anthropic.claude-opus-5-5` | `bedrock-opus-5-5`, `global./us./eu./au.anthropic.claude-opus-5-5`, `claude-opus-5-5`, `opus-5.5` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking (endpoint Messages) |
    | `anthropic.claude-opus-5` | `bedrock-opus-5`, `claude-opus-5`, `opus-5` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking (endpoint Messages) |
    | `global.anthropic.claude-sonnet-5-5` | `anthropic.claude-sonnet-5-5`, `us./eu.anthropic.claude-sonnet-5-5`, `claude-sonnet-5-5`, `sonnet-5.5` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking (bedrock-runtime) |
    | `global.anthropic.claude-haiku-5-5` | `us./eu./au./jp.anthropic.claude-haiku-5-5`, `claude-haiku-5-5`, `haiku-5.5` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking (bedrock-runtime) |
    | `anthropic.claude-sonnet-5` | `bedrock-sonnet-5`, `claude-sonnet-5`, `sonnet-5` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking (endpoint Messages) |
    | `global.anthropic.claude-opus-4-8` | `bedrock-opus-4-8`, `claude-opus-4-8` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking, 💾 Cache mín. 1K |
    | `global.anthropic.claude-opus-4-7` | `bedrock-opus-4-7`, `claude-opus-4-7` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 🧠 Adaptive thinking |
    | `global.anthropic.claude-sonnet-4-6` | `bedrock-sonnet-4-6`, `claude-sonnet-4-6` | **1M tokens** | 64K tokens (card AWS) | 👁 Vision, 🔧 Tools |
    | `global.anthropic.claude-opus-4-6-v1` | `bedrock-opus-4-6`, `claude-opus-4-6` | **1M tokens** | 128K tokens | 👁 Vision, 🔧 Tools |
    | `global.anthropic.claude-haiku-4-5-20251001-v1:0` | `bedrock-haiku-4-5`, `claude-haiku-4-5` | 200K tokens | 64K tokens | 👁 Vision, 🔧 Tools |
    | `global.anthropic.claude-sonnet-4-5-20250929-v1:0` | `bedrock-sonnet-4-5`, `claude-sonnet-4-5` | 200K tokens | 64K tokens | 👁 Vision, 🔧 Tools |
    | `us.anthropic.claude-sonnet-4-5-20250929-v1:0` | `bedrock-sonnet-4-5-us` | 200K tokens | 64K tokens | 👁 Vision, 🔧 Tools |
    | `global.anthropic.claude-opus-4-5-20251101-v1:0` | `bedrock-opus-4-5`, `claude-opus-4-5`, `global.anthropic.claude-opus-4-5-20251001-v1:0` (grafia antiga, só alias) | 200K tokens | 64K tokens | 👁 Vision, 🔧 Tools |
    | `global.anthropic.claude-sonnet-4-20250514-v1:0` (Legacy, EOL 14/out/2026) | `bedrock-sonnet-4`, `claude-sonnet-4` | 200K tokens | 64K tokens | 👁 Vision, 🔧 Tools |
    | `us.anthropic.claude-sonnet-4-20250514-v1:0` (Legacy, EOL 14/out/2026) | `bedrock-sonnet-4-us` | 200K tokens | 64K tokens | 👁 Vision, 🔧 Tools |
    | `eu.anthropic.claude-sonnet-4-20250514-v1:0` (Legacy, EOL 14/out/2026) | `bedrock-sonnet-4-eu` | 200K tokens | 64K tokens | 👁 Vision, 🔧 Tools |
    | `us.anthropic.claude-opus-4-1-20250805-v1:0` (Legacy, extended access desde 8/out/2026, EOL 8/jan/2027) | `bedrock-opus-4-1`, `claude-opus-4-1` | 200K tokens | 32K tokens | 👁 Vision, 🔧 Tools |

    <Note>
      **Aposentados no Bedrock e removidos do catálogo (set/2026):** Opus 4 (`us.anthropic.claude-opus-4-20250514-v1:0`), Sonnet 3.7 (`us./eu.anthropic.claude-3-7-sonnet-20250219-v1:0`), Sonnet 3.5 v1/v2, Haiku 3.5, Opus 3 e Haiku 3 (`anthropic.claude-3-haiku-20240307-v1:0`, EOL 10/set/2026). O placeholder `global.anthropic.claude-sonnet-4-7-20260401-v1:0` nunca existiu na AWS e foi removido. Sonnet 4 e Opus 4.1 estão **Legacy**, mas continuam invocáveis até as datas de EOL acima; o Opus 4.1 entrou no período de extended access, com preço mais alto, em 8/out/2026. A data real do snapshot do Opus 4.5 é `20251101` — a grafia `20251001` anterior nunca existiu na AWS e fica só como alias.
    </Note>

    **OpenAI GPT-5.6 (frontier, jul/2026)** — Sol, Terra e Luna no Bedrock. Eles falam Converse, Responses e Chat Completions, mas **não `InvokeModel`**, então o catálogo os marca com `bedrock_converse_only` e o ChatCLI os roteia pela **Converse API** automaticamente (sem env var — só o prefixo `openai.` os mandaria pelo caminho `InvokeModel` do GPT-OSS). Servidos só via inference profiles: Sol via `us.`/`global.`, Terra/Luna via `us.`/`in.`/`global.`. Preços no endpoint global: Sol $4/$20, Terra $2/$12, Luna $0,20/$1,20 por MTok. O **GPT-6.1 Sol** (`global.openai.gpt-6.1-sol`, profile `us.`) segue o mesmo caminho Converse: 1M de contexto, 131.072 de output máximo, $2/$10 por MTok (cache write $2,50, cache read $0,10).

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `global.openai.gpt-6.1-sol` | `us.openai.gpt-6.1-sol` | **1M tokens** | 131.072 tokens | 👁 Vision, 🔧 Tools, 📋 JSON (só Converse) |
    | `global.openai.gpt-6-astra` | `bedrock-gpt-6-astra`, `openai.gpt-6-astra`, `us.openai.gpt-6-astra` | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON (só Converse) |
    | `global.openai.gpt-6-sol` | `bedrock-gpt-6-sol`, `openai.gpt-6-sol`, `us.openai.gpt-6-sol` | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON (só Converse) |
    | `global.openai.gpt-6-luna` | `bedrock-gpt-6-luna`, `openai.gpt-6-luna`, `us.openai.gpt-6-luna` | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON (só Converse) |
    | `global.openai.gpt-5.6-sol` | `bedrock-gpt-5.6-sol`, `openai.gpt-5.6-sol`, `us.openai.gpt-5.6-sol` | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON (só Converse) |
    | `global.openai.gpt-5.6-terra` | `bedrock-gpt-5.6-terra`, `openai.gpt-5.6-terra`, `us.openai.gpt-5.6-terra`, `in.openai.gpt-5.6-terra` | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON (só Converse) |
    | `global.openai.gpt-5.6-luna` | `bedrock-gpt-5.6-luna`, `openai.gpt-5.6-luna`, `us.openai.gpt-5.6-luna`, `in.openai.gpt-5.6-luna` | **1,05M tokens** | 128K tokens | 👁 Vision, 🔧 Tools, 📋 JSON (só Converse) |

    **OpenAI GPT-OSS (open-weights)** — modelos OpenAI hospedados no Bedrock. Usam schema OpenAI Chat Completions (auto-detectado pelo prefixo `openai.*`, ou forçado via `BEDROCK_PROVIDER=openai`).

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `openai.gpt-oss-120b-1:0` | `bedrock-gpt-oss-120b`, `gpt-oss-120b` | 128K tokens | 16K tokens | 🔧 Tools, 📋 JSON |
    | `openai.gpt-oss-20b-1:0` | `bedrock-gpt-oss-20b`, `gpt-oss-20b` | 128K tokens | 16K tokens | 🔧 Tools, 📋 JSON |

    **xAI Grok e Amazon Nova 2 (entradas estáticas)** — o Grok 4.6 chegou ao Bedrock em 18/ago/2026 (Converse, só profiles `us.`/`global.`, $2/$6 por MTok no endpoint global), seguido pelo **Grok 4.7** (`global.xai.grok-4.7`, profile `us.`, 500K de contexto, $2/$6 por MTok, cached input \$0,50). O Nova 2 Lite sucede o Nova Premier (Legacy desde 13/mar/2026, EOL 14/set/2026 — removido do catálogo): 1M de contexto, 64K de output, servido **apenas** via inference profiles (`us.`/`eu.`/`jp.`/`global.` — não existe id bare in-region). Nova 2 Pro/Omni não estão no Bedrock.

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `global.xai.grok-4.7` | `us.xai.grok-4.7` | 500K tokens | — | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `global.xai.grok-4.6` | `bedrock-grok-4.6`, `xai.grok-4.6`, `us.xai.grok-4.6` | 500K tokens | — | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `global.amazon.nova-2-lite-v1:0` | `nova-2-lite`, `amazon.nova-2-lite-v1:0`, `us./eu./jp.amazon.nova-2-lite-v1:0` | **1M tokens** | 64K tokens | 👁 Vision, 🔧 Tools, 📋 JSON |

    **Moonshot Kimi K3 e Z.AI GLM-5.3 (entradas estáticas)** — o Kimi K3 é servido pelos profiles `us.`/`in.` (1M de contexto, entrada de imagem, $3/$15 por MTok, cache read \$0,30); o GLM-5.3 pelo profile `us.` (1M de contexto, 128K de output, só texto — o card da AWS não publica preço, então o cost tracker do ChatCLI usa o preço de lista da Z.AI).

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `global.moonshotai.kimi-k3` | `us./in.moonshotai.kimi-k3` | **1M tokens** | 131K tokens | 👁 Vision, 🔧 Tools |
    | `global.zai.glm-5.3` | `us.zai.glm-5.3` | **1M tokens** | 128K tokens | 🔧 Tools |

    **Outros providers via Converse API** — além das entradas estáticas acima, Llama, Nova, Mistral, Cohere, AI21, DeepSeek, Moonshot Kimi, MiniMax, Qwen, Z.AI/GLM, Gemma, Nemotron, TwelveLabs etc. **não estão hardcoded no catálogo** — eles aparecem dinamicamente no `/switch --model` conforme sua conta AWS tem acesso. O ChatCLI roteia esses modelos pela **Converse API** da AWS (schema unificado), então adicionar provider novo não exige release.

    Exemplos de IDs vistos no ListFoundationModels (a lista real depende da sua conta + região):

    | Provider | Exemplo de Model ID |
    | :- | :- |
    | Moonshot AI | `moonshotai.kimi-k2.6`, `moonshotai.kimi-k2-thinking` |
    | MiniMax | `minimax.m-2-5`, `minimax.m-2` |
    | Z.AI | `zai.glm-4-7`, `zai.glm-4-7-flash` |
    | Qwen | `qwen.qwen3-32b`, `qwen.qwen3-coder-480b` |
    | Meta Llama | `meta.llama3-70b-instruct-v1:0`, `us.meta.llama3-1-70b-...` |
    | Amazon Nova | `amazon.nova-pro-v1:0`, `amazon.nova-lite-v1:0`, `global.amazon.nova-2-lite-v1:0` |
    | Mistral | `mistral.mistral-large-2407-v1:0` |
    | DeepSeek | `us.deepseek.r1-v1:0` |
    | Google | `google.gemma-3-27b-pt` |
    | NVIDIA | `nvidia.nemotron-nano-9b-v2` |
    | TwelveLabs | `twelvelabs.pegasus-v1.2` |

    <Info>
      A lista dinâmica (`/switch --model`) combina `bedrock:ListFoundationModels` (com filtro `ByOutputModality: TEXT` + `InferenceTypesSupported: ON_DEMAND`) e `bedrock:ListInferenceProfiles` com o catálogo estático acima. **Sem allowlist** — qualquer provider Bedrock que sua conta tem acesso aparece automaticamente. Use o comando para ver o que sua conta AWS realmente pode invocar na região configurada.
    </Info>

    **Embeddings via Bedrock** — `amazon.titan-embed-text-v2:0` (default, 1024-dim, configurável 256/512/1024), `amazon.titan-embed-text-v1` (1536-dim), Cohere `cohere.embed-english-v3` / `cohere.embed-multilingual-v3` (1024-dim), `cohere.embed-v4:0` (1536-dim default, contexto 128K, também via profiles `us.`/`eu.`/`global.`) e `amazon.nova-2-multimodal-embeddings-v1:0` (Nova MME, 3072-dim default, configurável 256/384/1024/3072). Ative com `CHATCLI_EMBED_PROVIDER=bedrock`. Veja [RAG + HyDE](/pt/agents/harness/rag-hyde).
  </Tab>

  <Tab title="Google (Gemini)">
    Capacidades multimodais avançadas e janelas de contexto massivas. Suportam streaming via SSE.

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `gemini-3.8-flash` | `gemini-3.8-flash-latest` | 1M tokens | 65K tokens | 👁 Vision, 🔧 Tools, 📋 JSON, 💻 Code Exec |
    | `gemini-3.7-flash` | `gemini-3.7-flash-latest` | 1M tokens | 65K tokens | 👁 Vision, 🔧 Tools, 📋 JSON, 💻 Code Exec |
    | `gemini-3.6-flash` | `gemini-3.6-flash-latest` | 1M tokens | 65K tokens | 👁 Vision, 🔧 Tools, 📋 JSON, 💻 Code Exec |
    | `gemini-3.5-flash` | `gemini-3.5-flash-latest` | 1M tokens | 65K tokens | 👁 Vision, 🔧 Tools, 📋 JSON, 💻 Code Exec |
    | `gemini-3.5-flash-lite` | — | 1M tokens | 65K tokens | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `gemini-3.1-pro-preview` | `gemini-3.1-pro` | 1M tokens | 65K tokens | 👁 Vision, 🔧 Tools, 📋 JSON, 💻 Code Exec |
    | `gemini-3.1-flash-lite` | — | 1M tokens | 65K tokens | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `gemini-3-flash-preview` | — | 1M tokens | 65K tokens | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `gemini-2.5-pro` | `gemini-2.5-pro-latest` | 1M tokens | 65K tokens | 👁 Vision, 🔧 Tools, 📋 JSON, 💻 Code Exec |
    | `gemini-2.5-flash` | — | 1M tokens | 65K tokens | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `gemini-2.5-flash-lite` | — | 1M tokens | 65K tokens | 👁 Vision, 🔧 Tools, 📋 JSON |

    <Info>
      Toda a geração Gemini 3.x compartilha a janela de entrada de 1.048.576 tokens com teto de saída de 65.536 tokens (`gemini-3.8-flash`, GA em 02/set/2026, é o workhorse atual; `gemini-3.7-flash` continua servido). `gemini-3.1-pro` sem `-preview` é **apenas um alias**, não um código de modelo real. O Gemini 2.5 Flash Lite também suporta **Multimodal Live** para interações em tempo real; modelos com JSON Mode podem retornar saída estruturada via `response_mime_type`.
    </Info>

    <Note>
      **Desligados pelo Google e removidos do catálogo:** `gemini-2.0-flash` e `gemini-2.0-flash-lite` (1/jun/2026), e `gemini-3` / `gemini-3-pro` / `gemini-3-pro-preview` (9/mar/2026 — use `gemini-3.1-pro-preview`). Próximo agendado: `gemini-3.1-flash-lite` aposenta em 7/mai/2027 — migre para `gemini-3.5-flash-lite`. O preço introdutório do 3.7/3.6 Flash ($0,75/$3,75) dobra em 1/jan/2027.
    </Note>
  </Tab>

  <Tab title="xAI (Grok)">
    Integração de informações em tempo real e grandes janelas de contexto. Suportam streaming.

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `grok-4.7` | `grok-4.7-latest` | 500K tokens | — | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `grok-4.6` | `grok-4.6-latest` | 500K tokens | — | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `grok-4.5` | `grok-4.5-latest`, `grok-build-latest` | 500K tokens | — | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `grok-4.3` | `grok-4.3-latest` | 1M tokens | — | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `grok-4.20-0309-reasoning` | `grok-4.20-reasoning`, `grok-4.20` | 1M tokens | — | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `grok-4.20-0309-non-reasoning` | `grok-4.20-non-reasoning` | 1M tokens | — | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `grok-4.20-multi-agent-0309` | `grok-4.20-multi-agent` | 1M tokens | — | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `grok-build-0.1` | `grok-build`, `grok-code-fast-1` | 256K tokens | — | 👁 Vision, 🔧 Tools, 📋 JSON |

    <Note>
      Os modelos Grok usam a API compatível com OpenAI. A xAI não publica teto de output por modelo, então os limites são gerenciados pelo provedor. `grok-4.7` (21/set/2026) é o flagship atual — 500K de contexto, effort `low|medium|high|xhigh`, mesmo tier $2/$6 do 4.6 (cached input \$0,50; quando o prompt chega a 200K a xAI cobra 2× no input e no output, e o cost tracker do ChatCLI aplica isso por chamada). `grok-4.6` continua servido. A variante `grok-4.7-fast` é só Cursor/Grok Build, não está na API pública e por isso não está no catálogo. O default do provider (`XAI_MODEL`) agora é `grok-4.3`.

      **Aposentados pela xAI em 15/mai/2026 e removidos do catálogo:** `grok-4-fast` (+ `grok-4-fast-reasoning*`, `grok-4-0709`), `grok-4-1` (+ `grok-4-1-fast*`), `grok-3` e `grok-3-mini`. A API mantém esses slugs vivos, mas **os redireciona para `grok-4.3`** e cobra as tarifas do grok-4.3 — configs pinadas continuam funcionando, e o cost tracker do ChatCLI precifica de acordo. `grok-code-fast-1` virou alias de `grok-build-0.1`. O preço de cached input também é rastreado: $0,50/MTok no grok-4.7/4.6, $0,30 no grok-4.5, \$0,20 no tier 4.3/4.20.
    </Note>
  </Tab>

  <Tab title="GitHub Copilot">
    Use modelos da plataforma Copilot com sua assinatura (Individual, Business, Enterprise). Autentique via `/auth login github-copilot`.

    A tabela abaixo mostra os modelos registrados no catálogo estático. Com a **listagem dinâmica**, o ChatCLI consulta a API do Copilot e descobre automaticamente todos os modelos disponíveis para sua conta.

    | Modelo (ID) | Contexto |
    | :- | :- |
    | `gpt-6.1-sol` | 1M tokens |
    | `gpt-6-astra` | 1M tokens |
    | `gpt-6-sol` | 1M tokens |
    | `gpt-6-luna` | 1M tokens |
    | `claude-sonnet-5.5` | 1M tokens |
    | `claude-haiku-5.5` | 1M tokens |
    | `claude-opus-5.5` | 1M tokens |
    | `gpt-4o` | 128K tokens |
    | `gpt-4o-mini` | 128K tokens |
    | *+ modelos dinâmicos* | *via API* |

    <Info>
      Os modelos disponíveis variam conforme o plano e a região. Use `/switch --model` para ver a lista completa obtida diretamente da API do Copilot.
    </Info>

    <Note>
      **Aposentados pelo GitHub e removidos do catálogo estático:** `claude-sonnet-4` (1/mai/2026) e `gemini-2.0-flash` (23/out/2025). O GitHub também agendou a aposentadoria de GPT-5.5, GPT-5.4, GPT-5.4 mini, GPT-5 mini, Gemini 3.7 Flash e Grok 4.5 para 19/out/2026.
    </Note>
  </Tab>

  <Tab title="ZAI (Zhipu AI)">
    Modelos da Zhipu AI (z.ai) com excelente custo-benefício. API compatível com OpenAI.

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `glm-5.3` | `glm-5-3` | **1M tokens** | 128K tokens | 🔧 Tools, 📋 JSON |
    | `glm-5.3-flashx` | `glm-5-3-flashx` | **1M tokens** | 128K tokens | 🔧 Tools, 👁 Vision, 📋 JSON |
    | `glm-5.3-flash` | `glm-5-3-flash` | **1M tokens** | 128K tokens | 🔧 Tools, 👁 Vision, 📋 JSON |
    | `glm-5.2` | `glm-5-2` | **1M tokens** | 128K tokens | 🔧 Tools, 📋 JSON |
    | `glm-5.1` | `glm-5-1` | 200K tokens | 128K tokens | 🔧 Tools, 👁 Vision |
    | `glm-5-turbo` | `glm5-turbo` | 200K tokens | 128K tokens | 🔧 Tools, 👁 Vision |
    | `glm-5` | — | 200K tokens | 128K tokens | 🔧 Tools, 👁 Vision |
    | `glm-4.7` | — | 200K tokens | 128K tokens | 🔧 Tools |
    | `glm-4.6` | `glm-4-6` | 200K tokens | 128K tokens | 🔧 Tools |
    | `glm-4.5` | — | 128K tokens | 96K tokens | 🔧 Tools |
    | `glm-4.5-flash` | `glm-4-flash` | 128K tokens | 16K tokens | 🔧 Tools |
    | `glm-5v-turbo` | — | 128K tokens | 16K tokens | 🔧 Tools, 👁 Vision |
    | `glm-4.5v` | `glm-4-5v` | 128K tokens | 16K tokens | 👁 Vision |

    <Note>
      **GLM-5.3** (lançado em 18/ago/2026) é o flagship open-weight da Zhipu: mesmo modelo base do GLM-5.2 com post-training escalado, focado em coding e tarefas agênticas longas — **1M tokens de contexto**, 128K de output, reasoning sempre ativo, function calling e structured output (entrada só texto). O **GLM-5.3-Flash** (26/ago/2026) é o irmão multimodal nativo sob licença MIT: 1M de contexto, 128K de output, entrada de imagem/vídeo/arquivo. Preços de lista: GLM-5.3 $1.40/$4.40, GLM-5.3-Flash $0.15/$0.50, GLM-5.3-FlashX (18/set/2026, tier de alta velocidade da Flash) $0.37/$1.25 por MTok (GLM-5: $1.00/$3.20) — o cost tracker do ChatCLI usa esses valores, e agora também precifica a linha GLM-4.x por tier (4.7 $0.60/$2.20, 4.7-flashx $0.07/$0.40, 4.7-flash grátis, 4.5-air $0.20/$1.10, 4.5-airx $1.10/$4.50, 4.5-x $2.20/$8.90, 4.5v $0.60/$1.80, 4.5-flash grátis) em vez do antigo fallback flat de \$0.50. O modelo default do provider continua `glm-5`; use `/switch --model glm-5.3` para trocar. O `codegeex-4` foi removido — não é mais servido pela API internacional da Z.AI.
    </Note>

    <Info>
      A API da ZAI é compatível com o formato OpenAI. O endpoint de listagem de modelos (`/models`) filtra automaticamente os modelos glm-*, codegeex*, cogview\* e charglm\*. Assinantes do **GLM Coding Plan** podem definir `ZAI_USE_CODING_PLAN=true` para usar o endpoint da assinatura (`/api/coding/paas/v4`) com a mesma key — o uso debita do plano em vez dos créditos pay-as-you-go e o `/cost` reporta \$0.
    </Info>

    <Note>
      **Autenticação JWT automática:** Chaves no formato `id.secret` ativam automaticamente a rotação de tokens JWT (HMAC-SHA256), cacheados por 30 minutos. Chaves sem "." funcionam como Bearer tokens tradicionais. Sem configuração adicional necessária.
    </Note>
  </Tab>

  <Tab title="MiniMax">
    Modelos da MiniMax com grandes janelas de contexto e alto throughput. API compatível com OpenAI.

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `MiniMax-M3` | `minimax-m3`, `m3` | **1M tokens** | 131K tokens | 🔧 Tools, 👁 Vision |
    | `MiniMax-M2.7` | — | 204K tokens | 131K tokens | 🔧 Tools, 👁 Vision |
    | `MiniMax-M2.7-highspeed` | — | 204K tokens | — | 🔧 Tools, 👁 Vision |
    | `MiniMax-M2.5` | — | 196K tokens | 65K tokens | 🔧 Tools, 👁 Vision |
    | `MiniMax-M2.5-highspeed` | — | 196K tokens | — | 🔧 Tools, 👁 Vision |
    | `MiniMax-Text-01` | — | 128K tokens | 2K tokens | 📋 JSON Mode |

    <Warning>
      Os IDs dos modelos MiniMax são **case-sensitive**! Use exatamente `MiniMax-M2.7`, não `minimax-m2.7`.
    </Warning>

    <Note>
      **Endpoint Anthropic-compatível:** Defina `MINIMAX_API_COMPAT=anthropic` para usar o endpoint `https://api.minimax.io/anthropic/v1/messages` com formato Anthropic Messages. O tool use nativo é desabilitado neste modo (fallback para XML). A listagem de modelos continua usando o endpoint nativo.
    </Note>
  </Tab>

  <Tab title="Moonshot (Kimi)">
    Família Kimi da Moonshot AI — o flagship K3 (jul/2026) é um MoE de 2.8T parâmetros / 104B ativos, janela de 1M tokens via Kimi Delta Attention e input multimodal; o K2.6 (1T/32B, 256K) segue totalmente suportado, com vision encoder MoonViT nativo e modo "thinking" explícito em toda a linha. API OpenAI-compatible em `https://api.moonshot.ai/v1/chat/completions`.

    | Modelo (ID) | Aliases | Contexto | Max Output | Capacidades |
    | :- | :- | :- | :- | :- |
    | `kimi-k3` | `kimi-k-3`, `k3`, `k-3` | 1M tokens | 131K tokens | 🔧 Tools, 👁 Vision, 🧠 Thinking, 📋 JSON Mode |
    | `kimi-k2.7-code` | `kimi-k2.7`, `k2.7` | 256K tokens | 32K tokens | 🔧 Tools, 🧠 Thinking, 📋 JSON Mode |
    | `kimi-k2.7-code-highspeed` | `kimi-k2-7-code-highspeed` | 256K tokens | 32K tokens | 🔧 Tools, 🧠 Thinking, 📋 JSON Mode |
    | `kimi-k2.6` | `kimi-k2-6`, `k2.6`, `k2-6` | 256K tokens | 131K tokens | 🔧 Tools, 👁 Vision, 🧠 Thinking, 📋 JSON Mode |

    <Note>
      **Modo thinking:** Defina `MOONSHOT_THINKING=enabled|disabled|auto` para alternar entre Thinking (reasoning explícito, padrão em K3/K2.6) e Instant (resposta direta, mais barata). O default `auto` deixa o modelo escolher; modelos sem capability `thinking` ignoram a flag.
    </Note>

    <Tip>
      **Preço público (ago/2026):** kimi-k3 cobra $3.00/M tokens de entrada (cache miss; cache hit $0.30/M) e $15.00/M de saída. kimi-k2.7-code e kimi-k2.6 cobram $0.95/M de entrada (cache miss) e $4.00/M de saída; kimi-k2.7-code-highspeed cobra 2× isso ($1.90/\$8.00). Cache-hit em entrada é mais barato em todos, e o cost tracker do ChatCLI precifica a fatia cacheada na taxa de cada modelo (10% do input no K3, 20% no K2.7 Code, \~17% no K2.6). **Aposentados pela Moonshot e removidos do catálogo** (a API agora retorna 404 para eles): `kimi-k2.5` e a série `moonshot-v1-128k/32k/8k` (31/ago/2026), `kimi-k2-turbo-preview` (25/mai/2026), `kimi-latest` (28/jan/2026) e `kimi-thinking-preview` (11/nov/2025). O alvo de migração para todos é o `kimi-k3`; o default do provider continua `kimi-k2.6`.
    </Tip>
  </Tab>

  <Tab title="StackSpot">
    Aceita todos os modelos compatíveis na plataforma StackSpotAI, selecionados junto à criação do Agent.
  </Tab>

  <Tab title="Devin CLI (Cognition)">
    Servidos através do wrapper do Devin CLI local — o ChatCLI mantém toda a conversa e o harness; o Devin é só o transporte. Ver [Provider Devin](/pt/providers/devin-provider). Os slugs de família usam **pontos** (`claude-sonnet-4.6`, não `4-6`); ids de variante mantêm a grafia do CLI (`claude-opus-5-high`, `swe-1-6-fast`). O `/switch --model` lista o que **a sua conta** consegue invocar via `devin models list --format json` (tag `[api]`); a tabela abaixo é o fallback estático.

    | Família | Modelos |
    | :- | :- |
    | Anthropic | `claude-fable-5.1` · `claude-fable-5` · `claude-opus-5.5` · `claude-opus-5` · `claude-sonnet-5` · `claude-opus-4.8` / `4.7` / `4.6` / `4.5` · `claude-sonnet-4.6` / `4.5` / `4` · `claude-haiku-4.5` |
    | OpenAI | `gpt-6.1-sol` · `gpt-6-astra` / `-sol` / `-luna` · `gpt-5.6-sol` / `-terra` / `-luna` · `gpt-5.5` · `gpt-5.4` / `-mini` · `gpt-5.3-codex` · `gpt-5.2` · `gpt-5.1` · `gpt-4.1` |
    | Google | `gemini-3.8-flash` · `gemini-3.7-flash` · `gemini-3.6-flash` · `gemini-3.5-flash` · `gemini-3.1-pro` · `gemini-3-flash` |
    | xAI | `grok-4.6` · `grok-4.5` |
    | Outros | `glm-5.3` / `5.2` · `kimi-k3` / `k2.7` / `k2.6` · `deepseek-v4-pro` / `v4-flash` |
    | Cognition (SWE) | `swe-1.7-lightning` · `swe-1.7` · `swe-1.6-fast` · `swe-1.6` |

    <Info>
      A autenticação pertence ao binário (`devin auth login`, SSO corporativo) — sem key no ChatCLI. Modelo default: `claude-sonnet-4.6` (`DEVIN_MODEL`). O CLI não reporta uso de tokens, então o cost tracking mostra zero — o custo vive na assinatura Cognition.
    </Info>
  </Tab>

  <Tab title="Ollama (Local)">
    Suporta qualquer modelo local via Ollama. Configure no `.env`:

    ```env theme={"system"}
    OLLAMA_ENABLED=true
    OLLAMA_MODEL="llama3"
    ```

    Ou troque interativamente: `/switch --model llama3`

    Use `ollama pull <modelo>` para baixar novos modelos.
  </Tab>

  <Tab title="OpenRouter">
    Gateway multi-provedor que dá acesso a **200+ modelos** de OpenAI, Anthropic, Google, Meta, Mistral, DeepSeek e outros através de uma única API key. API compatível com OpenAI em `https://openrouter.ai/api/v1/chat/completions`.

    Os modelos usam o formato `provedor/nome-do-modelo`:

    | Modelo (ID) | Provedor Original | Capacidades |
    | :- | :- | :- |
    | `openai/gpt-6.1-sol` | OpenAI | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `openai/gpt-6-astra` | OpenAI | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `openai/gpt-6-sol` | OpenAI | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `openai/gpt-6-luna` | OpenAI | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `openai/gpt-4o` | OpenAI | 👁 Vision, 🔧 Tools |
    | `openai/gpt-4o-mini` | OpenAI | 👁 Vision, 🔧 Tools |
    | `anthropic/claude-opus-5.5` | Anthropic | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `anthropic/claude-opus-5` | Anthropic | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `anthropic/claude-sonnet-5.5` | Anthropic | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `anthropic/claude-haiku-5.5` | Anthropic | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `anthropic/claude-sonnet-5` | Anthropic | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `anthropic/claude-fable-5.1` | Anthropic | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `anthropic/claude-fable-5` | Anthropic | 👁 Vision, 🔧 Tools, 📋 JSON |
    | `anthropic/claude-sonnet-4` | Anthropic | 👁 Vision, 🔧 Tools |
    | `anthropic/claude-opus-4` | Anthropic | 👁 Vision, 🔧 Tools |
    | `google/gemini-2.5-pro` | Google | 👁 Vision, 🔧 Tools |
    | `google/gemini-2.5-flash` | Google | 🔧 Tools |
    | `meta-llama/llama-4-maverick` | Meta | 🔧 Tools |
    | `deepseek/deepseek-r1` | DeepSeek | 🔧 Tools |
    | `mistralai/mistral-large` | Mistral | 🔧 Tools |

    <Info>
      A tabela acima mostra apenas os modelos mais populares. O OpenRouter oferece **200+ modelos** que são descobertos dinamicamente via o endpoint `/api/v1/models`. Use `/switch --model` para ver a lista completa.
    </Info>

    <Tip>
      O OpenRouter possui **roteamento de fallback nativo**: configure `OPENROUTER_FALLBACK_MODELS` com uma lista de modelos alternativos separados por vírgula. Se o modelo principal falhar, o OpenRouter tenta automaticamente os modelos da lista — complementar ao fallback de provedores do ChatCLI.
    </Tip>
  </Tab>
</Tabs>

***

## Como funciona a seleção de modelo

O ChatCLI determina qual modelo usar com a seguinte prioridade (do mais alto para o mais baixo):

1. **Flag `--model`** na linha de comando: `chatcli --model gpt-5.4`
2. **Comando `/switch`** durante a sessão: `/switch --model claude-sonnet-4-6`
3. **Variável de ambiente `MODEL`**: define o modelo padrão
4. **Variável de ambiente `LLM_PROVIDER`**: determina o provedor (openai, anthropic, google, xai, openrouter, etc.)
5. **Modelo padrão do provedor**: cada provedor tem um modelo padrão definido no catálogo

```bash theme={"system"}
# Exemplo: definir provedor e modelo via .env
LLM_PROVIDER=CLAUDEAI
ANTHROPIC_MODEL=claude-sonnet-5-5
```

## Aliases de modelos

Cada modelo possui **aliases** que facilitam a digitação. O ChatCLI resolve aliases automaticamente para o ID canônico do modelo. Por exemplo:

| Alias digitado | Modelo resolvido |
| :- | :- |
| `claude-4-5-sonnet` | `claude-sonnet-4-5` |
| `sonnet-4-5` | `claude-sonnet-4-5` |
| `opus-4-6` | `claude-opus-4-6` |
| `opus-4-7` | `claude-opus-4-7` |
| `opus-4-8` | `claude-opus-4-8` |
| `sonnet-5-5` / `sonnet-5.5` | `claude-sonnet-5-5` |
| `haiku-5-5` / `haiku-5.5` | `claude-haiku-5-5` |
| `sonnet-5` | `claude-sonnet-5` |
| `opus-5-5` / `opus-5.5` | `claude-opus-5-5` |
| `opus-5` | `claude-opus-5` |
| `fable` | `claude-fable-5-1` (acompanha o Fable mais novo) |
| `fable-5-1` / `fable-5.1` | `claude-fable-5-1` |
| `fable-5` | `claude-fable-5` (pinado) |
| `glm-5-3` | `glm-5.3` |
| `glm-5-3-flashx` | `glm-5.3-flashx` |
| `glm-5-3-flash` | `glm-5.3-flash` |
| `glm-5-2` | `glm-5.2` |
| `gpt-6.1` / `gpt-6-1-sol` | `gpt-6.1-sol` |
| `gpt-6` | `gpt-6-astra` (flagship da família) |
| `gpt-5.6` | `gpt-5.6-sol` (flagship da família) |
| `gpt-5.4-pro` | `gpt-5.4` (tier Responses-only) |
| `gpt-5-mini` | `gpt-5` (variante mini) |
| `gemini-3.1-pro` | `gemini-3.1-pro-preview` |
| `grok-code-fast-1` | `grok-build-0.1` |
| `grok-build-latest` | `grok-4.5` |

Aliases são definidos no catálogo de modelos e aceitos em todos os contextos: `--model`, `/switch`, e variável `MODEL`.

## Sistema de catálogo

Os modelos são registrados no pacote `llm/catalog` com metadados completos. O ChatCLI usa o catálogo para determinar automaticamente:

* **Versão da API** — qual endpoint e versão de protocolo usar para cada modelo
* **Max tokens** — limites de contexto e output para gerenciar prompts e respostas
* **Capacidades** — quais funcionalidades estão disponíveis (vision, tools, JSON mode, etc.)
* **Headers específicos** — por exemplo, o header `anthropic-version` varia conforme o modelo

Isso significa que ao trocar de modelo, o ChatCLI ajusta automaticamente todos os parâmetros de requisição sem necessidade de configuração manual.

## Listagem dinâmica de modelos

O ChatCLI busca os modelos disponíveis **diretamente da API de cada provedor**, usando o token ou API key configurada. Isso garante que você veja exatamente os modelos que sua conta tem acesso — incluindo modelos novos que ainda não estão no catálogo estático.

### Como funciona

1. Ao iniciar o ChatCLI ou trocar de provedor (via `/switch`, `/auth login`, etc.), uma busca em background consulta o endpoint de modelos do provedor ativo
2. Os modelos descobertos são cacheados para uso no **autocomplete** do comando `/switch --model`
3. Cada sugestão indica a origem: **`[API]`** (dinâmico) ou **`[catalog]`** (estático)

### Endpoints por provedor

| Provedor | Endpoint | Auth |
| :- | :- | :- |
| OpenAI | `GET /v1/models` | API Key ou OAuth |
| Anthropic | `GET /v1/models` | API Key ou OAuth |
| Google AI | `GET /v1beta/models` | API Key |
| xAI | `GET /v1/models` | API Key |
| ZAI (Zhipu AI) | `GET /models` | API Key (Bearer) |
| MiniMax | `GET /models` | API Key (Bearer) |
| Moonshot (Kimi) | `GET /v1/models` | API Key (Bearer) |
| GitHub Copilot | `GET /models` | OAuth (Device Flow) |
| OpenRouter | `GET /api/v1/models` | API Key |
| Ollama | `GET /api/tags` | Sem auth (local) |
| StackSpot | — | Não suportado (modelo fixo por agent) |

### Autocomplete inteligente

Ao digitar `/switch --model` e pressionar **Tab**, o ChatCLI sugere os modelos disponíveis:

```
> /switch --model [Tab]
  gpt-4o             GPT-4o (Copilot) [API]
  claude-sonnet-5.5  Claude Sonnet 5.5 (Copilot) [API]
  o4-mini            o4-mini (Copilot) [API]
```

Se a API não estiver acessível, o fallback é o catálogo estático:

```
> /switch --model [Tab]
  gpt-4o           GPT-4o (Copilot) [catalog]
  gpt-4o-mini      GPT-4o mini (Copilot) [catalog]
```

<Tip>
  Ao dar **Enter** com `/switch --model` sem valor, o ChatCLI lista todos os modelos disponíveis com indicação de origem (API ou catalog).
</Tip>

### OAuth e listagem dinâmica

A listagem funciona tanto com **API key** quanto com **OAuth**:

* **Anthropic OAuth**: usa `?beta=true` e headers Chrome-like, com decompressão gzip automática
* **OpenAI OAuth**: consulta o backend do ChatGPT (`/backend-api/models`) em vez do endpoint padrão
* **GitHub Copilot OAuth**: usa o Device Flow token para consultar `api.githubcopilot.com/models`

Após um `/auth login`, o cache de modelos é atualizado automaticamente para refletir o novo provedor.

## Versionamento da API Anthropic

Modelos Claude podem usar diferentes valores de `anthropic-version` no header da API. O catálogo gerencia isso automaticamente:

* Modelos mais recentes (claude-fable-5-1, claude-fable-5, claude-opus-5-5, claude-sonnet-5-5, claude-haiku-5-5, claude-opus-5, claude-sonnet-5, claude-opus-4-8, claude-opus-4-7, claude-sonnet-4-6) usam a versão mais atual da API
* Toda entrada atual do catálogo usa a versão default; os modelos Claude 3.x aposentados que usavam headers antigos não estão mais registrados
* O ChatCLI envia o header correto para cada modelo sem necessidade de intervenção do usuário


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.