Build text-to-image systems with text encoders, latent representations, denoisers, schedulers, and guidance. Evaluate prompt adherence, composition, visual quality, diversity, and common anatomical or textual failures.