Design and run AI reliability evaluations across prompts, models, tools, agents, RAG, vector search, observability, cost, latency, safety, security boundaries, and release thresholds.