Pensamiento Extendido, Esfuerzo y Mejores Prácticas Multimodales
Prácticas numeradas para obtener resultados fiables y eficientes en cuanto a costes del pensamiento extendido, el parámetro de esfuerzo y la entrada multimodal.
Busca en todas las páginas de la documentación
Prácticas numeradas para obtener resultados fiables y eficientes en cuanto a costes del pensamiento extendido, el parámetro de esfuerzo y la entrada multimodal.
thinking={"type": "adaptive"} en lugar de adivinar un presupuesto de razonamiento fijo. El pensamiento adaptativo permite a Claude calibrar la profundidad por solicitud, evitando tanto el sub-razonamiento en tareas difíciles como el desperdicio de razonamiento en tareas fáciles.thinking ausente como esperado, no como un error. Las indicaciones simples a menudo no producen ningún razonamiento visible bajo el pensamiento adaptativo; solo investiga si una indicación genuinamente compleja no devuelve ninguno.response.content iterando y comprobando block.type, nunca por índice fijo. El bloque thinking, cuando está presente, puede ocupar el índice 0, desplazando la posición del bloque text.max_tokens generosamente para indicaciones que probablemente activen un razonamiento profundo. Los tokens de razonamiento y los tokens de respuesta comparten el mismo presupuesto de salida, y un bloque thinking truncado puede cortar la respuesta final.thinking por separado de la respuesta visible para el usuario. Esto permite la depuración y auditoría del razonamiento sin confundirlo con la respuesta que ven tus usuarios.low, las respuestas generales del asistente se ajustan a medium, la revisión de código y la planificación se ajustan a high, y el análisis crítico para la seguridad se ajusta a max.high y max pueden ralentizar significativamente un punto final visible para el usuario; mide antes de comprometerte.low, medium, high, max) antes de enviar la solicitud. Capturar un error tipográfico como "med" en el punto de llamada es más barato que depurar un error opaco de la API más tarde.max para llamadas genuinamente de alto riesgo. Aplicarlo de forma generalizada "por seguridad" infla el coste y la latencia en toda la aplicación sin un beneficio de calidad correspondiente en tareas rutinarias.thinking anteriores antes de añadirlos al historial de una conversación de varios turnos. Reenviar bloques de razonamiento sin procesar como texto plano del asistente hincha el uso de tokens en una conversación larga.media_type del formato de archivo real, nunca lo codifiques o adivines. Un media_type incorrecto puede causar un error en la solicitud o una lectura errónea de la imagen.base64.standard_b64encode(...).decode("utf-8") antes de asignarlos a data. La API espera una cadena base64, no bytes sin procesar ni una ruta de archivo.file_id de forma duradera, no solo en una variable local. Conservar file_id junto con tu propio identificador de documento evita cargas redundantes entre ejecuciones de procesos.file_id referenciado haya caducado o sea inválido. Las políticas de retención varían según la cuenta; captura el error y vuelve a subir si el archivo de origen sigue disponible.messages de una solicitud de seguimiento, no todo el historial de tu sesión local. La API solo sabe lo que hay en la lista messages de la solicitud actual; mantén un historial más completo localmente para registrar sin reenviar todo.purpose explícitamente en cada llamada de carga de la API de Archivos. Omitirlo o configurarlo incorrectamente puede hacer que el archivo cargado no sea utilizable en un bloque de contenido de documento más tarde.Mapear el nivel de esfuerzo al tipo de tarea (práctica B.1) suele tener el mayor impacto en el coste, ya que es la palanca más directa sobre la profundidad del razonamiento por solicitud en toda tu aplicación.
Para la mayoría de las cargas de trabajo, sí, permite a Claude calibrar la profundidad del razonamiento por solicitud en lugar de que tú adivines una configuración fija. La excepción son las tareas extremadamente simples y de alto volumen donde la sobrecarga de incluso comprobar un bloque de pensamiento no vale la pena.
Ocasionalmente, para audiencias de herramientas especializadas como desarrolladores que revisan resultados de revisión de código, pero siempre debe ser una opción explícita, no la superficie de respuesta predeterminada.
No coincidir el media_type con el formato de archivo real, o enviar bytes sin codificar sin procesar en lugar de una cadena base64, ambos cubiertos en la práctica D.
Tan pronto como esperes referenciar la misma imagen o documento en más de una solicitud. El análisis único está bien en línea; cualquier cosa reutilizada se beneficia del modelo de carga única de la API de Archivos.
Empieza por clasificar las apuestas y la complejidad de la tarea, luego evalúa la latencia y el coste en un par de niveles candidatos frente al tráfico real antes de fijar un valor predeterminado.
La mecánica se aplica de la misma manera, pero la capacidad de razonamiento base difiere según el modelo (Fable 5, Opus 4.8, Sonnet 5, Haiku 4.5), por lo que el mismo nivel de esfuerzo no producirá una profundidad o coste idénticos entre modelos.
Un valor inválido como "med" en lugar de "medium" se presenta de otra manera como un error opaco de la API en una ruta de solicitud profunda, en lugar de un fallo de validación claro en el punto de llamada.
No, es principalmente una decisión de UX y de sensibilidad de datos. El esfuerzo es la palanca de costes; la visualización rige qué contenido de razonamiento, si lo hay, llega al cliente o se registra.
Pierdes la referencia una vez que el proceso que la tiene en memoria termina, lo que obliga a una nueva carga redundante la próxima vez que se necesite el documento, lo que anula la eficiencia que proporciona la API de Archivos.
No, solo incluye los turnos anteriores relevantes para la pregunta actual. Mantén un historial local más completo para tu propio seguimiento sin reenviar toda la sesión en cada llamada.
Sí, si el esfuerzo high ya produce una calidad adecuada para esa categoría de tarea, max añade coste y latencia sin un beneficio proporcional. Resérvalo para los casos genuinamente de mayor riesgo identificados a través de la evaluación.
Versiones de la pila: Escrito contra la línea de modelos Claude actual a partir de ~junio de 2026 - Claude Fable 5, Claude Opus 4.8, Claude Sonnet 5 (el predeterminado) y Claude Haiku 4.5 - y el SDK oficial de Python
anthropic(última versión 0.x). Los nombres de los modelos, las versiones del SDK y los precios cambian rápidamente; verifica los detalles actuales en platform.claude.com/docs antes de confiar en ellos.
Revisado por Chris St. John·Última actualización: 16 jul 2026