Pensamento Estendido, Esforço e Melhores Práticas Multimodais
Práticas numeradas para obter resultados confiáveis e eficientes em termos de custo a partir do pensamento estendido, do parâmetro de esforço e da entrada multimodal.
Busque em todas as páginas da documentação
Práticas numeradas para obter resultados confiáveis e eficientes em termos de custo a partir do pensamento estendido, do parâmetro de esforço e da entrada multimodal.
thinking={"type": "adaptive"} em vez de adivinhar um orçamento fixo de raciocínio. O pensamento adaptativo permite que o Claude calibre a profundidade por solicitação, evitando tanto o sub-raciocínio em tarefas difíceis quanto o desperdício de raciocínio em tarefas fáceis.thinking ausente como esperado, não como um erro. Prompts simples geralmente não produzem raciocínio visível sob pensamento adaptativo; investigue apenas se um prompt genuinamente complexo não retornar nenhum.response.content iterando e verificando block.type, nunca por índice fixo. O bloco thinking, quando presente, pode ocupar o índice 0, deslocando a posição do bloco text.max_tokens generosamente para prompts que provavelmente acionarão raciocínio profundo. Tokens de raciocínio e tokens de resposta compartilham o mesmo orçamento de saída, e um bloco thinking truncado pode cortar a resposta final.thinking separadamente da resposta voltada para o usuário. Isso suporta a depuração e a auditoria do raciocínio sem confundi-lo com a resposta que seus usuários veem.low, respostas gerais de assistente se encaixam em medium, revisão de código e planejamento se encaixam em high, análise crítica de segurança se encaixa em max.high e max podem desacelerar significativamente um endpoint voltado para o usuário; meça antes de se comprometer.low, medium, high, max) antes de enviar a solicitação. Capturar um erro de digitação como "med" no ponto de chamada é mais barato do que depurar um erro opaco da API mais tarde.max para chamadas genuinamente de alto risco. Aplicá-lo amplamente "por segurança" infla o custo e a latência em toda a aplicação sem um benefício de qualidade correspondente em tarefas rotineiras.thinking anteriores antes de anexá-los ao histórico de uma conversa com vários turnos. Reenviar blocos de raciocínio brutos como texto simples do assistente incha o uso de tokens em uma conversa longa.media_type do formato real do arquivo, nunca o codifique ou adivinhe. Um media_type incompatível pode causar um erro na solicitação ou uma leitura incorreta da imagem.base64.standard_b64encode(...).decode("utf-8") antes de atribuir a data. A API espera uma string base64, não bytes brutos ou um caminho de arquivo.file_id de forma durável, não apenas em uma variável local. Persistir file_id ao lado do seu próprio identificador de documento evita uploads redundantes entre execuções de processo.file_id referenciado expirou ou é inválido. As políticas de retenção variam por conta; capture o erro e faça o upload novamente se o arquivo de origem ainda estiver disponível.messages, não todo o seu histórico de sessão local. A API sabe apenas o que está na lista messages da solicitação atual; mantenha um histórico mais completo localmente para registro sem reenviar tudo.purpose explicitamente em cada chamada de upload da API de Arquivos. Omitir ou definir incorretamente pode tornar o arquivo carregado inutilizável em um bloco de conteúdo de documento posteriormente.Mapear o nível de esforço ao tipo de tarefa (prática B.1) geralmente tem o maior impacto no custo, pois é a alavanca mais direta na profundidade do raciocínio por solicitação em toda a sua aplicação.
Para a maioria das cargas de trabalho, sim, ele permite que o Claude calibre a profundidade do raciocínio por solicitação em vez de você adivinhar uma configuração fixa. A exceção são tarefas extremamente simples e de alto volume, onde o overhead de até mesmo verificar um bloco de pensamento não vale a pena.
Ocasionalmente, para públicos de ferramentas especializadas, como desenvolvedores revisando a saída de revisão de código, mas sempre deve ser uma opção explícita, não a superfície de resposta padrão.
A incompatibilidade do media_type com o formato real do arquivo, ou o envio de bytes brutos não codificados em vez de uma string base64, ambos cobertos na prática D.
Assim que você esperar referenciar a mesma imagem ou documento em mais de uma solicitação. Análise única é boa inline; qualquer coisa reutilizada se beneficia do modelo de upload único da API de Arquivos.
Comece classificando os riscos e a complexidade da tarefa, depois avalie a latência e o custo em alguns níveis candidatos em relação ao tráfego real antes de fixar um padrão.
Os mecanismos se aplicam da mesma forma, mas a capacidade de raciocínio base difere por modelo (Fable 5, Opus 4.8, Sonnet 5, Haiku 4.5), portanto, o mesmo nível de esforço não produzirá profundidade ou custo idênticos entre os modelos.
Um valor inválido como "med" em vez de "medium" caso contrário, aparece como um erro opaco da API no fundo de um caminho de solicitação, em vez de uma falha de validação clara no ponto de chamada.
Não, é principalmente uma decisão de UX e sensibilidade de dados. O esforço é a alavanca de custo; a exibição controla qual conteúdo de raciocínio, se houver, chega ao cliente ou é registrado.
Você perde a referência assim que o processo que a mantém em memória termina, forçando um re-upload redundante na próxima vez que o documento for necessário, derrotando a eficiência que a API de Arquivos fornece.
Não, inclua apenas os turnos anteriores relevantes para a pergunta atual. Mantenha um histórico local mais completo para seu próprio acompanhamento sem reenviar toda a sessão em cada chamada.
Sim, se o esforço high já produz qualidade adequada para essa categoria de tarefa, max adiciona custo e latência sem um benefício proporcional. Reserve-o para os casos genuinamente de maior risco identificados por meio de avaliação.
Versões da Stack: Escrito contra a linha de modelos Claude atual em aproximadamente junho de 2026 - Claude Fable 5, Claude Opus 4.8, Claude Sonnet 5 (o padrão) e Claude Haiku 4.5 - e o SDK oficial
anthropicPython (última versão 0.x). Nomes de modelos, versões de SDK e preços mudam rapidamente - verifique os detalhes atuais em platform.claude.com/docs antes de confiar neles.
Revisado por Chris St. John·Última atualização: 16 de jul. de 2026