Tuning how much inference-time reasoning a model spends per request (extended thinking / reasoning tokens) as a deliberate cost-quality dial instead of a fixed default.