Plan and review GPU/scientific-compute optimization across PyTorch, CUDA-aware batching, memory pressure, mixed precision, profiling, and reproducibility. Use when workflows are slow, GPU-bound, memory-bound, or need scalable training/inference plans.