google/vit-base-patch16-224beansgeminitorch in condaconda install pytorch==2.2.2 torchvision==0.17.2 torchaudio==2.2.2 pytorch-cuda=11.8 -c pytorch -c nvidia
gccconda install -c conda-forge gcc=9.5.0 gxx=9.5.0
ColossalAI from scratchcd ColossalAI
CUDA_EXT=1 pip install .
cd ..
torch_extensions cacherm -r ~/.cache/colossalai/torch_extensions/
pip install -r requirements.txt
output.txt)sh run_demo.sh > output.txt 2>&1
output.txtsh run_benchmark.sh > benchmark_output.txt 2>&1
benchmark_output.txtrun_demo.sh| Epoch | Avg Loss | Accuracy |
|---|---|---|
| 1 | 1.1380 | 0.8828 |
| 2 | 0.2651 | 0.9844 |
| 3 | 0.1170 | 0.9922 |
run_benchmark.shbatch_size = 8| Plugin | Throughput | Maximum Memory Usage per GPU |
|---|---|---|
| torch_ddp | 120.5087 | 1.75 GB |
| torch_ddp_fp16 | 146.9361 | 1.75 GB |
| low_level_zero | 90.8185 | 696.72 MB |
| gemini | 92.5829 | 331.88 MB |
| hybrid_parallel | 72.6727 | 417.03 MB |
batch_size = 32| Plugin | Throughput | Maximum Memory Usage per GPU |
|---|---|---|
| torch_ddp | 191.3859 | 2.13 GB |
| torch_ddp_fp16 | 463.2753 | 2.05 GB |
| low_level_zero | 300.5291 | 890.97 MB |
| gemini | 385.2396 | 523.21 MB |
| hybrid_parallel | 99.5983 | 431.50 MB |
2 commits
Python
94.4%
HTML
2.0%
C++
1.6%
Cuda
1.1%
google/vit-base-patch16-224beansgeminitorch in condaconda install pytorch==2.2.2 torchvision==0.17.2 torchaudio==2.2.2 pytorch-cuda=11.8 -c pytorch -c nvidia
gccconda install -c conda-forge gcc=9.5.0 gxx=9.5.0
ColossalAI from scratchcd ColossalAI
CUDA_EXT=1 pip install .
cd ..
torch_extensions cacherm -r ~/.cache/colossalai/torch_extensions/
pip install -r requirements.txt
output.txt)sh run_demo.sh > output.txt 2>&1
output.txtsh run_benchmark.sh > benchmark_output.txt 2>&1
benchmark_output.txtrun_demo.sh| Epoch | Avg Loss | Accuracy |
|---|---|---|
| 1 | 1.1380 | 0.8828 |
| 2 | 0.2651 | 0.9844 |
| 3 | 0.1170 | 0.9922 |
run_benchmark.shbatch_size = 8| Plugin | Throughput | Maximum Memory Usage per GPU |
|---|---|---|
| torch_ddp | 120.5087 | 1.75 GB |
| torch_ddp_fp16 | 146.9361 | 1.75 GB |
| low_level_zero | 90.8185 | 696.72 MB |
| gemini | 92.5829 | 331.88 MB |
| hybrid_parallel | 72.6727 | 417.03 MB |
batch_size = 32| Plugin | Throughput | Maximum Memory Usage per GPU |
|---|---|---|
| torch_ddp | 191.3859 | 2.13 GB |
| torch_ddp_fp16 | 463.2753 | 2.05 GB |
| low_level_zero | 300.5291 | 890.97 MB |
| gemini | 385.2396 | 523.21 MB |
| hybrid_parallel | 99.5983 | 431.50 MB |
2 commits
Python
94.4%
HTML
2.0%
C++
1.6%
Cuda
1.1%