← Papers

A Hybrid Tensor-Expert-Data Parallelism Approach to Optimize Mixture-of-Experts Training

ACM:3577193.3593704 · 2 repos reference this paper in their README