Use sparse expert routing to increase model capacity without activating every parameter for every token. Examine load balancing, routing stability, communication costs, and mixture-of-experts serving.