Run compact generative models on phones, browsers, vehicles, and edge devices. Use compression, hardware-aware runtimes, local retrieval, and privacy-preserving designs while working within memory, power, and latency limits.