Boas Práticas de Observabilidade
Instrumentar bem uma aplicação Claude significa que um pico de custo, uma regressão de latência ou uma regressão de cache aparecem em um dashboard ou em uma página dentro de uma hora, não na fatura do próximo mês.
Busque em todas as páginas da documentação
Instrumentar bem uma aplicação Claude significa que um pico de custo, uma regressão de latência ou uma regressão de cache aparecem em um dashboard ou em uma página dentro de uma hora, não na fatura do próximo mês.
Esta lista de verificação consolida as práticas abordadas nesta seção em regras contra as quais você pode verificar sua própria instrumentação.
logging.Logger, não print. A saída estruturada através de um framework de logging real integra-se com filtragem de nível de log e a maioria dos agentes de agregação de logs prontos para uso.status permite que uma única consulta cubra ambos os resultados em vez de manter logs de erro separados.cache_read_input_tokens e campos semelhantes com getattr(..., None), pois eles só são preenchidos quando o cache de prompt é aplicado.gen_ai.* nos spans. A nomenclatura consistente mantém os rastros consultáveis da mesma forma, independentemente de qual serviço ou provedor de modelo os produziu.record_exception. Um span sem um status de erro explícito ainda pode ser renderizado como bem-sucedido em alguns visualizadores de rastros.Logging estruturado (seção A): um esquema consistente que captura prompt, resposta, tokens, modelo, latência e ID de solicitação para cada chamada. Custa pouco para adicionar, e todas as outras práticas nesta lista (rastreamento, dashboards, alertas) dependem desses dados existirem em um formato consultável.
Não necessariamente. O rastreamento vale o seu custo quando você tem um loop de agente de várias etapas onde a ordem e a aninhamento das chamadas importam. Uma integração de chamada única pode depender apenas de logging estruturado até que isso mude.
Um loop de agente descontrolado é um bug de confiabilidade que, por acaso, aparece primeiro como uma anomalia de gastos. Tratar o custo como um sinal de engenharia de primeira classe, ao lado de latência e taxa de erros, detecta esse bug no mesmo dia em vez de no final de um ciclo de faturamento.
Cada serviço que adota o rastreamento independentemente tende a inventar seus próprios nomes de span e chaves de atributo. Uma vez que isso acontece, consultas de rastros entre serviços e dashboards compartilhados param de funcionar, e corrigi-lo mais tarde requer uma migração em vez de uma decisão única.
Não. Execute a avaliação de alerta em um cronograma, separado do caminho da solicitação, seja como um cron job ou um monitor avaliado pelo seu backend de métricas. Colocar a lógica de alerta inline adiciona latência e um novo modo de falha ao código que já está atendendo aos usuários.
Um limite fixo que se ajusta ao seu tráfego hoje se torna muito sensível ou muito tarde para detectar um pico real à medida que o uso cresce. Uma linha de base móvel (uma mediana de janelas recentes) se adapta automaticamente, mantendo o alerta significativo sem retuning manual.
Escreva o ADR documentando nomes de spans, atributos e política de amostragem antes que esse segundo serviço envie sua instrumentação, não depois. Este é o ponto em que a inconsistência começa a se compor, e é muito mais barato prevenir do que migrar dela mais tarde.
Em baixo volume de tráfego, sim, pois o custo e o ruído são negligenciáveis. À medida que o tráfego cresce, a maioria das equipes muda para uma taxa de amostragem menor para spans bem-sucedidos de rotina, mantendo spans de erro e outliers de custo com amostragem total, o que o ADR deve documentar explicitamente.
Se você não consegue responder "quanto custou essa chamada específica, quanto tempo levou e o que ela retornou" apenas com seus logs, sem reexecutar a solicitação, o esquema está incompleto. Os campos na seção A (prompt, resposta, modelo, tokens, latência, ID da solicitação) são o mínimo que torna essa pergunta respondível.
Compare o timestamp de início da anomalia com o seu log de implantação para a mesma janela e verifique a página de status da Anthropic para descartar uma causa do lado do provedor. Esta é a primeira etapa da lista de verificação de correlação de implantação vinculada abaixo, e ela resolve a maioria dos incidentes mais rapidamente do que começar do zero.
Com suas outras métricas de infraestrutura. Um dashboard dedicado apenas para LLM tende a ser verificado raramente, enquanto os gastos ao lado de gráficos de latência e taxa de erros que sua equipe já monitora diariamente são notados no dia em que algo dá errado.
Versões da Stack: Escrito contra a linha de modelos Claude atual em ~junho de 2026 - Claude Fable 5, Claude Opus 4.8, Claude Sonnet 5 (o padrão), e Claude Haiku 4.5 - e o SDK oficial
anthropicPython (última versão 0.x). Nomes de modelos, preços e versões de SDK mudam rapidamente - verifique os detalhes atuais em platform.claude.com/docs antes de confiar neles.
Revisado por Chris St. John·Última atualização: 13 de jul. de 2026