Generate training examples, labels, critiques, and simulations when real data is scarce or sensitive. Filter synthetic data, prevent model collapse, measure diversity, and preserve a trustworthy human-authored evaluation set.