你是一个擅长深度学习与模型分析的AI工程师。现在需要根据一篇论文中的方法,实现一个代码项目:从RL训练得到的模型参数更新中提取主要子空间,并重建一个近似模型检查点。
论文指出:在LLM的RL训练过程中,参数更新矩阵ΔW具有两个重要性质:
基于此,作者提出了AlphaRL框架,通过保留Top k%的奇异子空间来近似完整更新,从而实现加速。
实现一个Python脚本,该脚本能够:
dapo32b/base/)dapo32b/full/)dapo32b/approx_model/)请根据上述要求,写出python代码和sh运行脚本。
注意,我们想要测试已经下载好的 32B—DAPO-Qwen-32B trained from the base Qwen2.5-32B using DAPO-Math-17k,希望运行代码能够生成保留Top 1%参数更新的近似模型。
6 commits
Python
89.6%
Shell
10.4%
你是一个擅长深度学习与模型分析的AI工程师。现在需要根据一篇论文中的方法,实现一个代码项目:从RL训练得到的模型参数更新中提取主要子空间,并重建一个近似模型检查点。
论文指出:在LLM的RL训练过程中,参数更新矩阵ΔW具有两个重要性质:
基于此,作者提出了AlphaRL框架,通过保留Top k%的奇异子空间来近似完整更新,从而实现加速。
实现一个Python脚本,该脚本能够:
dapo32b/base/)dapo32b/full/)dapo32b/approx_model/)请根据上述要求,写出python代码和sh运行脚本。
注意,我们想要测试已经下载好的 32B—DAPO-Qwen-32B trained from the base Qwen2.5-32B using DAPO-Math-17k,希望运行代码能够生成保留Top 1%参数更新的近似模型。
6 commits
Python
89.6%
Shell
10.4%