accelerate launch pretrain.py recipes/qwen2.5.yaml --model_name_or_path=Qwen/Qwen2.5-14B-Instruct --output_dir=qwen2.5-14b-pretrain \
--train_group_size=4 --num_train_epochs=1 --eval_strategy=steps --save_strategy=steps --eval_steps=500
for f in $(seq 0 2); do accelerate launch train.py recipes/qwen2.5.yaml --resume_from_checkpoint=qwen2.5-14b-pretrain/ --model_name_or_path=Qwen/Qwen2.5-14B-Instruct --output_dir=qwen2.5-14b-v1-fold"$f" --fold=$f --per_device_train_batch_size=32 --gradient_accumulation_steps=2; done
for f in $(seq 0 2); do accelerate launch hf_infer.py recipes/qwen2.5.yaml --model_name_or_path=../Qwen2.5-14B-Instruct-bnb-4bit --load_in_4bit=true --resume_from_checkpoint=qwen2.5-14b-v0-fold"$f" --eval_data_file=data/eval"$f".csv --torch_dtype=float16
for f in $(seq 0 2); do accelerate launch hf_infer.py recipes/qwen2.5.yaml --resume_from_checkpoint=qwen2.5-7b-v8-fold"$f" --eval_data_file=data/eval"$f".csv --torch_dtype=float16; done
43 commits
1 commits
Python
100.0%
accelerate launch pretrain.py recipes/qwen2.5.yaml --model_name_or_path=Qwen/Qwen2.5-14B-Instruct --output_dir=qwen2.5-14b-pretrain \
--train_group_size=4 --num_train_epochs=1 --eval_strategy=steps --save_strategy=steps --eval_steps=500
for f in $(seq 0 2); do accelerate launch train.py recipes/qwen2.5.yaml --resume_from_checkpoint=qwen2.5-14b-pretrain/ --model_name_or_path=Qwen/Qwen2.5-14B-Instruct --output_dir=qwen2.5-14b-v1-fold"$f" --fold=$f --per_device_train_batch_size=32 --gradient_accumulation_steps=2; done
for f in $(seq 0 2); do accelerate launch hf_infer.py recipes/qwen2.5.yaml --model_name_or_path=../Qwen2.5-14B-Instruct-bnb-4bit --load_in_4bit=true --resume_from_checkpoint=qwen2.5-14b-v0-fold"$f" --eval_data_file=data/eval"$f".csv --torch_dtype=float16
for f in $(seq 0 2); do accelerate launch hf_infer.py recipes/qwen2.5.yaml --resume_from_checkpoint=qwen2.5-7b-v8-fold"$f" --eval_data_file=data/eval"$f".csv --torch_dtype=float16; done
43 commits
1 commits
Python
100.0%