Optimal Resource Efficiency with Fairness in Heterogeneous GPU Clusters
Zizhao Mo, Huanle Xu, Wing Cheong Lau · 2024
Ensuring the highest training throughput to maximize resource efficiency, while maintaining fairness among users, is critical for deep learning (DL) training in heterogeneous GPU clusters. However, current DL schedulers provide only limited fairness properties and suboptimal training throughput, impeding tenants from effectively leveraging heterogeneous resources. The underlying design challenge stems from inherent conflicts between efficiency and fairness properties.