Monitor FlagScale distributed training jobs. Check training health, detect anomalies (NaN loss, OOM, NCCL timeout, hangs), parse training metrics (loss, grad norm, throughput), and provide periodic status reports. Supports single-node and multi-node monitoring.