Referência de Níveis de Esforço e Opções de Exibição de Pensamento
Uma tabela de referência rápida para cada nível de esforço e modo de exibição de pensamento, e como combiná-los em uma única solicitação.
Busque em todas as páginas da documentação
Uma tabela de referência rápida para cada nível de esforço e modo de exibição de pensamento, e como combiná-los em uma única solicitação.
| Nível | Velocidade relativa | Custo relativo | Profundidade do raciocínio | Adequação Típica |
|---|---|---|---|---|
low | Mais rápido | Mais baixo | Mínimo | Classificação, extração, buscas curtas |
medium | Equilibrado | Moderado | Padrão | Respostas gerais de assistente, sumarização |
high | Mais lento | Mais alto | Profundo | Revisão de código, planejamento multi-etapas |
max | Mais lento | Mais alto | Máximo | Análise crítica de segurança, depuração complexa |
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=1024,
output_config={"effort": "high"},
messages=[{"role": "user", "content": "..."}],
)| Modo de exibição | O que retorna | Quando usar |
|---|---|---|
| Resumido | Uma versão condensada do conteúdo do bloco thinking | Depuração, justificativa opcional para o usuário, logs de auditoria |
| Omitido | Nenhum conteúdo do bloco thinking retornado, mesmo que o raciocínio tenha ocorrido internamente | Caminhos de UI de produção onde o raciocínio bruto nunca deve chegar ao cliente |
O modo de exibição é uma configuração de apresentação sobre o raciocínio que já ocorreu, não altera o nível de esforço ou a profundidade do raciocínio em si.
| Esforço | Exibição | Resultado |
|---|---|---|
low | Omitido | Mais rápido, mais barato, nenhum rastreamento de raciocínio retornado, melhor padrão para tarefas simples de alto volume |
medium | Resumido | Custo equilibrado com uma justificativa condensada disponível para depuração |
high | Resumido | Raciocínio profundo com um rastreamento legível, bom para ferramentas de revisão de código |
max | Omitido | Profundidade máxima de raciocínio interno, mas o cliente vê apenas a resposta final, útil quando o raciocínio é sensível ou verboso, mas a qualidade da resposta ainda importa |
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=2048,
thinking={"type": "adaptive"},
output_config={"effort": "max"},
messages=[{"role": "user", "content": "..."}],
)| Modelo | Padrão de pensamento adaptativo | Observações |
|---|---|---|
| Claude Fable 5 | Sempre ativo | Modelo de ponta, 1M de contexto, saída máxima de 128K |
| Claude Opus 4.8 | Configurável | Modelo de raciocínio principal, 1M de contexto |
| Claude Sonnet 5 | Configurável | Modelo de propósito geral padrão |
| Claude Haiku 4.5 | Configurável | Mais rápido e mais barato, 200K de contexto, combina bem com esforço low |
low, exibição omitida.medium, exibição resumida apenas para registro interno.high, exibição resumida mostrada aos desenvolvedores.max, exibição resumida mantida em um log de auditoria, mesmo que omitida da resposta do usuário final.Não. O esforço (output_config.effort) controla a profundidade do raciocínio e o custo. A exibição de pensamento controla se esse raciocínio é retornado resumido ou omitido. Eles são independentes e podem ser combinados.
low, medium, high, max, do mais rápido e barato ao mais completo e caro.
Não. O raciocínio ainda pode ocorrer internamente no nível de esforço que você definir, a exibição omitida apenas significa que esse rastreamento de raciocínio não é retornado na resposta.
Uma versão condensada do raciocínio do modelo, mais curta que o rastreamento interno completo, mas ainda útil para depuração ou divulgação opcional.
Esforço low, tipicamente emparelhado com exibição omitida, já que tarefas de classificação raramente se beneficiam de raciocínio visível profundo e o volume torna o custo a principal preocupação.
Não, eles são independentes. Você pode executar esforço max com exibição omitida quando quiser a profundidade máxima de raciocínio internamente, mas não quiser expor ou armazenar o rastreamento bruto.
O Claude Fable 5 é executado com pensamento adaptativo sempre ativo por padrão, mas o parâmetro de esforço ainda se aplica da mesma forma que com outros modelos para limitar a profundidade do raciocínio e o custo.
É um padrão razoável durante o desenvolvimento. Para produção, avalie o tamanho extra da resposta e qualquer sensibilidade do conteúdo do raciocínio antes de decidir manter a exibição resumida ativa.
Sim. output_config.effort e thinking são definidos independentemente em cada chamada messages.create, então você pode variar um sem tocar no outro.
A solicitação usa o comportamento de raciocínio padrão do modelo. Para controle explícito e previsível de custo e latência, defina output_config.effort deliberadamente em vez de depender dos padrões.
Não, os quatro níveis abordados aqui (low, medium, high, max) são o conjunto padrão. O controle granular além desses quatro é alcançado roteando diferentes tipos de solicitação para níveis diferentes, não um quinto nível.
Versões da Stack: Escrito contra a linha de modelos Claude atual em ~junho de 2026 - Claude Fable 5, Claude Opus 4.8, Claude Sonnet 5 (o padrão) e Claude Haiku 4.5 - e o SDK oficial
anthropicpara Python (última versão 0.x). Nomes de modelos, versões de SDK e preços mudam rapidamente - verifique os detalhes atuais em platform.claude.com/docs antes de confiar neles.
Revisado por Chris St. John·Última atualização: 16 de jul. de 2026