0
stars
2
commits
1
linked in READMEs
Jun 26, 2024
updated
2 commits
xinlai/Qwen2-72B-SFT
xinlai/Qwen2-7B-SFT
xinlai/Qwen2-72B-SFT-Step-DPO
xinlai/Qwen1.5-32B-SFT
xinlai/Qwen2-7B-Instruct-Step-DPO
3
binxia/llmga-Qwen2-1.5B-full-finetune
binxia/llmga-Qwen2-0.5B-full-finetune
binxia/llmga-Qwen2-7B-full-finetune
dvlab-research/Step-DPO
Implementation for "Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs"
397