← Papers

LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism

ACM:3694715.3695948 · 1 repo reference this paper in their README