8 repos
xinlai/Qwen2-57B-A14B-SFT-Step-DPO
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
1
3 commits
xinlai/Qwen2-7B-SFT-Step-DPO
0
xinlai/DeepSeekMath-RL-Step-DPO
2
4 commits
xinlai/Qwen2-72B-Instruct-Step-DPO
xinlai/Qwen1.5-32B-SFT-Step-DPO
xinlai/Llama-3-70B-SFT-Step-DPO
xinlai/Math-Step-DPO-10K
58
7 commits
PraveenSH/dpo-arithmo-mistral-7B
Fine-tuning LLM with DPO and LoRA to improve the mathematical reasoning capabilities