Pensamento Estendido e o Parâmetro de Esforço Explicados
Quando você faz uma pergunta difícil para Claude, há um trabalho acontecendo antes que a resposta final apareça.
Busque em todas as páginas da documentação
Quando você faz uma pergunta difícil para Claude, há um trabalho acontecendo antes que a resposta final apareça.
O pensamento estendido é o recurso que permite que você veja esse trabalho.
Em vez de uma única resposta opaca, Claude pode emitir um bloco de conteúdo thinking separado que contém seu raciocínio, seguido pelo bloco de conteúdo da resposta final.
O parâmetro de esforço é um controle relacionado, mas distinto.
Ele não decide se o raciocínio é visível.
Ele decide quanto raciocínio Claude realiza em primeiro lugar, trocando a minúcia pelo custo e pela velocidade.
Entender a diferença entre esses dois controles e como eles interagem com o modelo subjacente é a base para todo o resto nesta seção.
thinking, e o parâmetro de esforço controla quanto raciocínio Claude gasta antes de responder.Pensamento estendido é um modo onde Claude produz um bloco de conteúdo thinking antes de sua resposta normal.
Esse bloco contém o raciocínio intermediário do modelo: os passos que ele percorreu para chegar à sua conclusão.
Isso é diferente de um modelo simplesmente escrever uma resposta mais longa.
O conteúdo de pensamento é estruturalmente separado da resposta final, então sua aplicação pode escolher exibi-lo, resumi-lo ou ocultá-lo.
Você ativa o pensamento estendido passando um objeto de configuração thinking em sua solicitação.
A forma base para este site é {"type": "adaptive"}, que habilita o pensamento adaptativo.
Pensamento adaptativo significa que o próprio Claude decide quanto raciocínio uma determinada tarefa justifica, em vez de você especificar um orçamento fixo de tokens antecipadamente.
Uma pergunta factual de uma linha recebe pouco ou nenhum raciocínio visível.
Um quebra-cabeça de lógica de múltiplos passos recebe muito mais.
Pense nisso como uma pessoa respondendo a uma pergunta em uma reunião.
Para "quanto é 12 mais 30", ela responde instantaneamente, sem precisar de rascunho.
Para "devemos migrar este serviço antes ou depois da paralisação de feriado", ela pausa, pondera os prós e contras e pensa em voz alta antes de responder.
O pensamento adaptativo dá a Claude a mesma liberdade, automaticamente, por solicitação.
Claude Fable 5, o modelo de ponta na linha atual, opera com pensamento adaptativo sempre ativo por padrão, refletindo o quão central esse comportamento é para sua operação.
O pensamento estendido e o parâmetro de esforço operam em camadas diferentes da solicitação.
A configuração thinking responde à pergunta "o raciocínio deve ser visível e Claude deve decidir sua própria profundidade?". O parâmetro de esforço, geralmente definido em output_config.effort (ou um campo equivalente dependendo da versão do SDK), responde a uma pergunta separada: "quanto esforço de raciocínio Claude deve aplicar no geral, independentemente de ser exibido?". O esforço é classificado em níveis, comumente low, medium, high e max.
Em low, Claude favorece velocidade e economia, fazendo o mínimo de raciocínio necessário para produzir uma resposta razoável.
Em max, Claude gasta significativamente mais computação trabalhando em casos extremos, interpretações alternativas e etapas de verificação antes de se comprometer com uma resposta final.
Essas duas configurações se compõem.
Você pode ter pensamento adaptativo habilitado com um teto de esforço low, caso em que Claude ainda decide por tarefa se raciocina ou não, mas é limitado em quão profundo ele vai, mesmo em tarefas difíceis.
Você também pode ter pensamento adaptativo com esforço max, o que dá a Claude a maior liberdade para raciocinar extensivamente em problemas que exigem isso.
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=2048,
thinking={"type": "adaptive"},
output_config={"effort": "high"},
messages=[{"role": "user", "content": "Planeje uma estratégia de rollback faseada."}],
)O modelo mental importante: thinking governa a presença e a adaptabilidade do raciocínio, effort governa sua profundidade e teto de custo.
Eles não são a mesma alavanca, e confundi-los leva a decisões de ajuste confusas, como assumir que você precisa de esforço max apenas para ver um bloco thinking de qualquer maneira.
Uma preocupação relacionada, mas separada, é a exibição de pensamento, que determina o que sua aplicação realmente recebe de volta: uma versão resumida do raciocínio, ou nada, mesmo quando o raciocínio ocorreu internamente.
A exibição é uma configuração de apresentação, não uma configuração de profundidade de raciocínio, e é abordada integralmente na página referência de níveis de esforço e exibição de pensamento.
Em sistemas de produção, o parâmetro de esforço é geralmente a primeira coisa que você ajusta assim que tem uma integração funcionando, pois é a alavanca mais direta na economia unitária.
Um endpoint de triagem de tickets de suporte que responde a milhares de solicitações de classificação simples por dia tem necessidades muito diferentes de um assistente de revisão de código que trabalha em um diff grande.
O primeiro deseja esforço low ou medium para manter a latência e o custo previsíveis em escala.
O último se beneficia de esforço high ou max, porque um caso extremo perdido em uma revisão de código é mais caro do que o raciocínio extra gasto para encontrá-lo.
O ajuste de esforço também interage com a escolha do modelo.
Claude Opus 4.8, o modelo de raciocínio carro-chefe, e Claude Sonnet 5, o modelo geral padrão, ambos suportam o parâmetro de esforço, mas sua capacidade de raciocínio base difere, então o mesmo nível de esforço não produz profundidade idêntica entre os modelos.
Claude Haiku 4.5 é otimizado para velocidade e custo, e geralmente é emparelhado com níveis de esforço mais baixos para cargas de trabalho de alta taxa de transferência e sensíveis à latência, onde o raciocínio extensivo não é o gargalo.
| Abordagem | Força | Fraqueza | Melhor Ajuste |
|---|---|---|---|
| Baixo esforço, pensamento adaptativo desativado | Mais rápido, mais barato, latência mais previsível | Perde nuances em entradas genuinamente difíceis | Classificação simples de alto volume, formatação, extração |
| Pensamento adaptativo, esforço baixo a médio | Claude decide quando o raciocínio vale a pena, custo limitado | Sub-raciocínio ocasional em tarefas de dificuldade limítrofe | Cargas de trabalho gerais de chat e assistente |
| Pensamento adaptativo, esforço alto a máximo | Raciocínio mais profundo em problemas genuinamente difíceis | Maior custo e latência por solicitação | Revisão de código, planejamento de múltiplos passos, tarefas com muita matemática ou críticas de segurança |
Um padrão de arquitetura comum é rotear solicitações para diferentes níveis de esforço com base em um classificador upstream barato, ou permitir que o chamador passe o esforço como um parâmetro no momento da solicitação para que as equipes de produto possam ajustá-lo sem reimplantar.
Como o conteúdo de pensamento é um bloco de conteúdo distinto, aplicações que registram ou auditam o comportamento do modelo podem retê-lo separadamente da resposta voltada para o usuário, o que é útil para depurar por que Claude chegou a uma determinada conclusão sem expor esse raciocínio aos usuários finais.
thinking governa se e como adaptativamente Claude raciocina, effort governa quão profundo esse raciocínio vai e quanto custa.thinking e pelas configurações de exibição, não pelo nível de esforço; baixo esforço ainda pode produzir um traço de raciocínio visível, apenas mais superficial.max não justifica o custo marginal sobre high.Não. Uma resposta mais longa é apenas mais texto de resposta final. Pensamento estendido é um bloco de conteúdo separado contendo o raciocínio intermediário do modelo, produzido antes que a resposta final seja escrita.
thinking) controla se o raciocínio ocorre e quão adaptativamente sua profundidade é escolhida.output_config.effort ou similar) define o teto para a profundidade de raciocínio e o custo permitido, independentemente da adaptabilidade.low, medium, high e max, ordenados do mais rápido e barato ao mais completo e caro.
Não. Claude Fable 5 opera com pensamento adaptativo sempre ativo por padrão, então ele raciocina de forma adaptativa sem que você precise configurar thinking sozinho.
Não necessariamente. O esforço max aumenta a latência e o custo, e para tarefas que não exigem raciocínio profundo, o ganho de qualidade sobre high ou medium é frequentemente marginal, então é melhor reservá-lo para problemas genuinamente difíceis.
Sim. O esforço controla a profundidade do raciocínio e o teto de custo, não se o bloco de pensamento está presente. Uma solicitação de baixo esforço ainda pode apresentar um traço de raciocínio mais superficial.
Não. A exibição de pensamento controla se o raciocínio que sua solicitação produziu é retornado para você de forma resumida ou omitido, enquanto o esforço controla quanto raciocínio foi feito em primeiro lugar. São configurações separadas que podem ser combinadas.
Tarefas de alta taxa de transferência e sensíveis à latência, como classificação simples, extração curta ou formatação, onde o raciocínio profundo adiciona custo sem melhorar significativamente o resultado.
Não. A capacidade de raciocínio base difere por modelo (Fable 5, Opus 4.8, Sonnet 5, Haiku 4.5), então o mesmo nível de esforço não produz profundidade de raciocínio idêntica entre os modelos.
Versões da Stack: Escrito contra a linha de modelos Claude atual em ~junho de 2026 - Claude Fable 5, Claude Opus 4.8, Claude Sonnet 5 (o padrão) e Claude Haiku 4.5 - e o SDK oficial
anthropicpara Python (última versão 0.x). Nomes de modelos, versões de SDK e preços mudam rapidamente - verifique os detalhes atuais em platform.claude.com/docs antes de confiar neles.
Revisado por Chris St. John·Última atualização: 16 de jul. de 2026