Pensamiento Extendido y el Parámetro de Esfuerzo Explicados
Cuando le haces una pregunta difícil a Claude, hay un trabajo que ocurre antes de que aparezca la respuesta final.
Busca en todas las páginas de la documentación
Cuando le haces una pregunta difícil a Claude, hay un trabajo que ocurre antes de que aparezca la respuesta final.
El pensamiento extendido es la característica que te permite ver ese trabajo.
En lugar de una única respuesta opaca, Claude puede emitir un bloque de contenido thinking separado que contiene su razonamiento, seguido del bloque de contenido de la respuesta final.
El parámetro de esfuerzo es un control relacionado pero distinto.
No decide si el razonamiento es visible.
Decide cuánto razonamiento realiza Claude en primer lugar, intercambiando exhaustividad contra costo y velocidad.
Comprender la diferencia entre estas dos perillas, y cómo interactúan con el modelo subyacente, es la base para todo lo demás en esta sección.
thinking, y el parámetro de esfuerzo controla cuánto razonamiento gasta Claude antes de responder.El pensamiento extendido es un modo en el que Claude produce un bloque de contenido thinking antes de su respuesta normal.
Ese bloque contiene el razonamiento intermedio del modelo: los pasos que siguió para llegar a su conclusión.
Esto es diferente de un modelo que simplemente escribe una respuesta más larga.
El contenido del pensamiento está estructuralmente separado de la respuesta final, por lo que tu aplicación puede optar por mostrarlo, resumirlo u ocultarlo.
Activas el pensamiento extendido pasando un objeto de configuración thinking en tu solicitud.
La forma base para este sitio es {"type": "adaptive"}, que habilita el pensamiento adaptativo.
El pensamiento adaptativo significa que Claude decide cuánto razonamiento justifica una tarea dada, en lugar de que tú especifiques un presupuesto fijo de tokens por adelantado.
Una pregunta fáctica de una línea recibe poco o ningún razonamiento visible.
Un rompecabezas de lógica de varios pasos recibe mucho más.
Piensa en ello como una persona a la que se le hace una pregunta en una reunión.
Para "¿cuánto es 12 más 30?", responden instantáneamente, sin necesidad de cálculos.
Para "¿deberíamos migrar este servicio antes o después de la congelación de vacaciones?", hacen una pausa, sopesan los pros y los contras, y piensan en voz alta antes de responder.
El pensamiento adaptativo le da a Claude la misma libertad, automáticamente, por solicitud.
Claude Fable 5, el modelo de nivel superior en la línea actual, se ejecuta con pensamiento adaptativo siempre activo por defecto, lo que refleja cuán central es este comportamiento en su funcionamiento.
El pensamiento extendido y el parámetro de esfuerzo operan en diferentes capas de la solicitud.
La configuración thinking responde a la pregunta "¿debe ser visible el razonamiento y debe Claude decidir su propia profundidad?". El parámetro de esfuerzo, típicamente configurado en output_config.effort (o un campo equivalente según la versión del SDK), responde a una pregunta separada: "cuánto esfuerzo de razonamiento debe aplicar Claude en general, independientemente de si se muestra". El esfuerzo se gradúa en niveles, comúnmente low, medium, high y max.
En low, Claude favorece la velocidad y la economía, haciendo el mínimo razonamiento necesario para producir una respuesta razonable.
En max, Claude gasta significativamente más computación trabajando en casos extremos, interpretaciones alternativas y pasos de verificación antes de comprometerse con una respuesta final.
Estas dos configuraciones se componen.
Puedes tener el pensamiento adaptativo habilitado con un techo de esfuerzo low, en cuyo caso Claude aún decide por tarea si razonar o no, pero está limitado en cuán profundo llega incluso en tareas difíciles.
También puedes tener pensamiento adaptativo con esfuerzo max, lo que le da a Claude la mayor libertad para razonar extensamente en problemas que lo requieren.
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=2048,
thinking={"type": "adaptive"},
output_config={"effort": "high"},
messages=[{"role": "user", "content": "Plan a phased rollback strategy."}],
)El modelo mental importante: thinking rige la presencia y adaptabilidad del razonamiento, effort rige su profundidad y techo de costo.
No son la misma palanca, y confundirlos lleva a decisiones de ajuste confusas, como asumir que necesitas esfuerzo max solo para ver un bloque thinking en absoluto.
Una preocupación relacionada pero separada es la visualización del pensamiento, que determina lo que tu aplicación realmente recibe de vuelta: una versión resumida del razonamiento, o nada en absoluto, incluso cuando el razonamiento ocurrió internamente.
La visualización es una configuración de presentación, no una configuración de profundidad de razonamiento, y se cubre en su totalidad en la página de referencia de niveles de esfuerzo y opciones de visualización del pensamiento.
En sistemas de producción, el parámetro de esfuerzo es usualmente lo primero que ajustas una vez que tienes una integración funcional, porque es la palanca más directa sobre la economía unitaria.
Un punto final de triaje de tickets de soporte que responde miles de solicitudes de clasificación simples por día tiene necesidades muy diferentes a las de un asistente de revisión de código que trabaja en un diff grande.
El primero quiere esfuerzo low o medium para mantener la latencia y el costo predecibles a escala.
El segundo se beneficia de esfuerzo high o max, porque un caso extremo omitido en una revisión de código es más costoso que el razonamiento adicional gastado en encontrarlo.
El ajuste de esfuerzo también interactúa con la elección del modelo.
Claude Opus 4.8, el modelo insignia de razonamiento, y Claude Sonnet 5, el modelo general por defecto, ambos soportan el parámetro de esfuerzo, pero su capacidad de razonamiento base difiere, por lo que el mismo nivel de esfuerzo no produce una profundidad de razonamiento idéntica entre modelos.
Claude Haiku 4.5 está optimizado para velocidad y costo, y típicamente se empareja con niveles de esfuerzo más bajos para cargas de trabajo de alto rendimiento y sensibles a la latencia donde el razonamiento extensivo no es el cuello de botella.
| Enfoque | Fortaleza | Debilidad | Mejor Ajuste |
|---|---|---|---|
| Esfuerzo bajo, pensamiento adaptativo desactivado | Más rápido, más barato, latencia más predecible | Omite matices en entradas genuinamente difíciles | Clasificación simple de alto volumen, formato, extracción |
| Pensamiento adaptativo, esfuerzo bajo a medio | Claude decide cuándo el razonamiento vale la pena, costo limitado | Ocasional sub-razonamiento en tareas límite-difíciles | Cargas de trabajo generales de chat y asistente |
| Pensamiento adaptativo, esfuerzo alto a máximo | Razonamiento más profundo en problemas genuinamente difíciles | Mayor costo y latencia por solicitud | Revisión de código, planificación de varios pasos, tareas intensivas en matemáticas o de seguridad crítica |
Un patrón de arquitectura común es enrutar solicitudes a diferentes niveles de esfuerzo basándose en un clasificador externo económico, o permitir que el llamador pase el esfuerzo como un parámetro en tiempo de solicitud para que los equipos de producto puedan ajustarlo sin volver a desplegar.
Debido a que el contenido de pensamiento es un bloque de contenido distinto, las aplicaciones que registran o auditan el comportamiento del modelo pueden retenerlo por separado de la respuesta visible para el usuario, lo cual es útil para depurar por qué Claude llegó a una conclusión particular sin exponer ese razonamiento a los usuarios finales.
thinking rige si y cómo se adapta el razonamiento de Claude, effort rige cuán profundo va ese razonamiento y cuánto cuesta.thinking y las opciones de visualización, no por el nivel de esfuerzo; el esfuerzo bajo aún puede producir un rastro de razonamiento visible, aunque menos profundo.max no justifica el costo marginal sobre high.No. Una respuesta más larga es solo más texto de respuesta final. El pensamiento extendido es un bloque de contenido separado que contiene el razonamiento intermedio del modelo, producido antes de que se escriba la respuesta final.
thinking) controla si ocurre el razonamiento y cuán adaptativamente se elige su profundidad.output_config.effort o similar) establece el techo de cuánta profundidad de razonamiento y costo se permite, independientemente de la adaptabilidad.low, medium, high y max, ordenados desde el más rápido y económico hasta el más exhaustivo y costoso.
No. Claude Fable 5 se ejecuta con pensamiento adaptativo siempre activo por defecto, por lo que razona de forma adaptativa sin que necesites configurar thinking tú mismo.
No necesariamente. El esfuerzo max aumenta la latencia y el costo, y para tareas que no requieren un razonamiento profundo, la ganancia de calidad sobre high o medium es a menudo marginal, por lo que se reserva mejor para problemas genuinamente difíciles.
Sí. El esfuerzo controla la profundidad del razonamiento y el techo de costo, no si el bloque de pensamiento está presente. Una solicitud de bajo esfuerzo aún puede mostrar un rastro de razonamiento menos profundo.
No. La visualización del pensamiento controla si el razonamiento que tu solicitud produjo se te devuelve resumido u omitido, mientras que el esfuerzo controla cuánto razonamiento se realizó en primer lugar. Son configuraciones separadas que se pueden combinar.
Tareas de alto volumen y sensibles a la latencia como clasificación simple, extracción corta o formato, donde el razonamiento profundo agrega costo sin mejorar significativamente el resultado.
No. La capacidad de razonamiento base difiere según el modelo (Fable 5, Opus 4.8, Sonnet 5, Haiku 4.5), por lo que el mismo nivel de esfuerzo no produce una profundidad de razonamiento idéntica entre modelos.
Versiones de Stack: Escrito contra la línea de modelos de Claude actual a partir de ~junio de 2026 - Claude Fable 5, Claude Opus 4.8, Claude Sonnet 5 (el predeterminado), y Claude Haiku 4.5 - y el SDK oficial de Python
anthropic(última versión 0.x). Los nombres de los modelos, las versiones del SDK y los precios cambian rápidamente; verifica los detalles actuales en platform.claude.com/docs antes de confiar en ellos.
Revisado por Chris St. John·Última actualización: 16 jul 2026