lejelly/model_merging

0

stars

25

commits

Python

primary language

Apr 6, 2026

updated

README

DARE: Drop And RE-scale

Model(for now)

You can add models in merge_llms_instruct_math_code.py and inference_llms_instruct_math_code.

BASE MODEL

Llama 2 base

Llama 3 base

FINE-TUNED MODEL

Llama 2 base

Llama 3 base

Quick start

huggingface-cli login

Single model inference

Fill in [MODEL NAME] .

w/o DARE (drop rate 0.0)

python inference_llms_instruct_math_code.py --dataset_name gsm8k --finetuned_model_name [MODEL NAME] --tensor_parallel_size 1 --weight_mask_rate 0.0

Drop Only (drop rate 0.9)

python inference_llms_instruct_math_code.py --dataset_name gsm8k --finetuned_model_name [MODEL NAME] --tensor_parallel_size 1 --weight_mask_rate 0.9

Magnitude-Based Pruning (drop rate 0.9)

python inference_llms_instruct_math_code.py --dataset_name gsm8k --finetuned_model_name [MODEL NAME] --tensor_parallel_size 1 --weight_mask_rate 0.9 --mask_strategy magnitude

Masking Fine-Tuned Parameters (drop rate 0.9)

python inference_llms_instruct_math_code.py --dataset_name gsm8k --finetuned_model_name [MODEL NAME] --tensor_parallel_size 1 --weight_mask_rate 0.9 --use_weight_rescale --weight_format finetuned_weight

DARE (drop rate 0.9 and Re-scale)

python inference_llms_instruct_math_code.py --dataset_name gsm8k --finetuned_model_name [MODEL NAME] --tensor_parallel_size 1 --weight_mask_rate 0.9 --use_weight_rescale

Merging model inference

Fill in [MODEL NAME1] and [MODEL NAME2] .

Avg Merging

python merge_llms_instruct_math_code.py --[MODEL NAME1] --[MODEL NAME2] --merging_method_name average_merging --tensor_parallel_size 1

Task Arithmetic

python merge_llms_instruct_math_code.py --[MODEL NAME1] --[MODEL NAME2] --merging_method_name task_arithmetic --scaling_coefficient 1.0 --tensor_parallel_size 1

AvgMerging and DARE (drop rate 0.9 and Re-scale)

python merge_llms_instruct_math_code.py --[MODEL NAME1] --[MODEL NAME2] --merging_method_name mask_merging --use_weight_rescale --weight_mask_rate 0.9 --mask_apply_method average_merging --tensor_parallel_size 1

Contributors

lejelly

23 commits

eltociear

1 commits

yule-BUAA

1 commits

lejelly/model_merging

0

stars

25

commits

Python

primary language

Apr 6, 2026

updated

README

DARE: Drop And RE-scale

Model(for now)

You can add models in merge_llms_instruct_math_code.py and inference_llms_instruct_math_code.

BASE MODEL

Llama 2 base

Llama 3 base

FINE-TUNED MODEL

Llama 2 base

Llama 3 base

Quick start

huggingface-cli login

Single model inference

Fill in [MODEL NAME] .

w/o DARE (drop rate 0.0)

python inference_llms_instruct_math_code.py --dataset_name gsm8k --finetuned_model_name [MODEL NAME] --tensor_parallel_size 1 --weight_mask_rate 0.0

Drop Only (drop rate 0.9)

python inference_llms_instruct_math_code.py --dataset_name gsm8k --finetuned_model_name [MODEL NAME] --tensor_parallel_size 1 --weight_mask_rate 0.9

Magnitude-Based Pruning (drop rate 0.9)

python inference_llms_instruct_math_code.py --dataset_name gsm8k --finetuned_model_name [MODEL NAME] --tensor_parallel_size 1 --weight_mask_rate 0.9 --mask_strategy magnitude

Masking Fine-Tuned Parameters (drop rate 0.9)

python inference_llms_instruct_math_code.py --dataset_name gsm8k --finetuned_model_name [MODEL NAME] --tensor_parallel_size 1 --weight_mask_rate 0.9 --use_weight_rescale --weight_format finetuned_weight

DARE (drop rate 0.9 and Re-scale)

python inference_llms_instruct_math_code.py --dataset_name gsm8k --finetuned_model_name [MODEL NAME] --tensor_parallel_size 1 --weight_mask_rate 0.9 --use_weight_rescale

Merging model inference

Fill in [MODEL NAME1] and [MODEL NAME2] .

Avg Merging

python merge_llms_instruct_math_code.py --[MODEL NAME1] --[MODEL NAME2] --merging_method_name average_merging --tensor_parallel_size 1

Task Arithmetic

python merge_llms_instruct_math_code.py --[MODEL NAME1] --[MODEL NAME2] --merging_method_name task_arithmetic --scaling_coefficient 1.0 --tensor_parallel_size 1

AvgMerging and DARE (drop rate 0.9 and Re-scale)

python merge_llms_instruct_math_code.py --[MODEL NAME1] --[MODEL NAME2] --merging_method_name mask_merging --use_weight_rescale --weight_mask_rate 0.9 --mask_apply_method average_merging --tensor_parallel_size 1

Contributors

lejelly

23 commits

eltociear

1 commits

yule-BUAA

1 commits

Languages

Python

99.9%