Trigger when selecting evaluation metrics for Agent reliability vs. capability assessment. Pass@k measures capability ceiling ("can it do it?"), Pass^k measures stability ("is it reliable?"). Do NOT trigger for general accuracy metrics or classification tasks. Key signal: "Is our Agent reliable e...