Separating different stages of model inference onto different GPU pools to optimize resource utilization.