You can route tokens to variable numbers of experts based on per-token confidence signals from the router itself, improving efficiency and performance without adding parameters or complexity.
This paper proposes CARE, a smarter way to route tokens through expert networks in fine-tuned language models. Instead of sending every token to the same fixed number of experts, CARE uses the model's own uncertainty signals to decide how many experts each token needs—easy tokens get fewer experts, hard tokens get more.