Prepare training data for FlagScale (Megatron backend). Covers two pipelines — (A) text-only via preprocess_data.py (.bin+.idx), and (B) multimodal via Megatron-Energon (WebDataset .tar + TaskEncoder). Includes tokenizer setup, data validation, Energon dataset config, custom TaskEncoder patterns, and multi-dataset blending.