hyperfang2018/test-rlif-v1

0

stars

1

commits

Python

primary language

Dec 26, 2025

updated

README

🧪 Test-RLIF: LLM Reasoning & RL Experimentation Hub

Test-RLIF 是一个专注于大语言模型(LLM)推理能力增强强化学习(RL)算法研究的实验性仓库。

本项目集成了多种前沿的 RL 算法框架(如 TTRL, EMPO, RENT),旨在提供一个统一的平台,对比分析不同训练策略(PPO, Entropy Minimization, Test-Time Scaling)对模型数学推理能力(如 AIME, MATH500)的影响。


🚀 核心算法模块 (Core Modules)

我们集成了以下前沿研究项目,方便进行横向对比:

项目目录全称 / 论文标题核心理念框架支持
TTRL/Test-Time Reinforcement Learning测试时强化学习
在推理阶段动态优化策略,无需昂贵的预训练调整。
VERL
EMPO/Unsupervised Reasoning Incentivization无监督推理激励
主张"正确的问题是答案的一半",通过无监督信号引导推理。
TRL, VERL
Intuitor/Learning to Reason without External Rewards内源性直觉推理
旨在摆脱对外部 Reward Model 的依赖,培养模型的数学直觉。
Open-R1, VERL
rent-rl/RL via Entropy Minimization熵最小化 RL
基于 VERL 框架的 PPO 改进版,通过熵控制优化探索策略。
VERL

🛠️ 分析工具箱 (Analysis Toolkit)

为了更科学地评估模型性能,我们在 entropy_metrics/ 目录下开发了一套专业的评估工具:

  • 📊 Pass@k & Bootstrap 分析 (pass@k.py)

    • 不仅计算标准的 pass@k,还引入了 Bootstrap 重采样方法。
    • 提供 95% 置信区间 (Confidence Intervals),帮助判断模型性能提升是否具有统计显著性(避免随机噪声干扰)。
    • 支持 vLLM 高并发推理。
  • 📈 可视化绘图 (plot_pass_k_comparison_v2.py)

    • 自动生成带有误差棒(Error Bars)的柱状图。
    • 清晰展示不同 Checkpoint(如 Epoch 3 vs 4 vs 5)的性能演变。
  • 🤖 批量测试流程 (run_test_batch.sh)

    • 一键运行多模型评估,支持自定义 Prompt 模板(兼容 Chat Template)。

📝 快速开始 (Quick Start)

1. 训练&评估

MyRLIF文件夹内有对应训练脚本,支持Qwen2.5-Math-1.5B/7B在AIME24、AMC、Math500上一键训练,根目录运行可参照my-train.sh。

使用我们封装好的脚本对模型进行 AIME 数据集评估:

# 评估模型并计算 Pass@k + Bootstrap 此时
python entropy_metrics/pass@k.py \
    --model_path /path/to/your/model \
    --data_path datasets/aime25/aime25.parquet \
    --n_bootstrap 1000

2. 查看报告

运行后会在模型目录下生成 aime25_@k_metrics.json,包含详细的统计数据。

💡 实验配置说明 (Experimental Setup)

关于 MyRLIF 与结果目录

  • MyRLIF: 请特别关注本系列模型的评估。
  • 结果存储: 所有测试结果默认存放于 test_res_qwen 目录下。

Prompt 策略定义 (Prompt Styles)

pass@k.py 中,我们定义了三种 Prompt 模式,分别对应不同的实验需求:

  1. wprompt (With Prompt / Suffix)

    • 说明: 在问题后追加推理引导后缀(常用于 MyRLIF/TTRL)。
    • 格式:
      prompt = (
          f"{problem} \n\n",
          "Please reason step by step, and put your final answer within \\boxed{}",
      )
      
  2. woprompt (Without Prompt / Raw)

    • 说明: 仅包含问题本身,无额外修饰。
    • 格式: prompt = problem
  3. Original (原始 / Default)

    • 说明: 如果未指定特定模式(即“都没加”的情况),则使用原始的长前缀 Prompt。
    • 格式:
      prompt = (
          "Please solve the following math problem. ",
          "Think step by step and then give the final answer at the end.\n",
          "Please wrap the final answer in \\boxed{}.\n",
          f"Problem: {problem}。\n",
      )
      

Contributors

hyperfang2018

1 commits

hyperfang2018/test-rlif-v1

0

stars

1

commits

Python

primary language

Dec 26, 2025

updated

README

🧪 Test-RLIF: LLM Reasoning & RL Experimentation Hub

Test-RLIF 是一个专注于大语言模型(LLM)推理能力增强强化学习(RL)算法研究的实验性仓库。

本项目集成了多种前沿的 RL 算法框架(如 TTRL, EMPO, RENT),旨在提供一个统一的平台,对比分析不同训练策略(PPO, Entropy Minimization, Test-Time Scaling)对模型数学推理能力(如 AIME, MATH500)的影响。


🚀 核心算法模块 (Core Modules)

我们集成了以下前沿研究项目,方便进行横向对比:

项目目录全称 / 论文标题核心理念框架支持
TTRL/Test-Time Reinforcement Learning测试时强化学习
在推理阶段动态优化策略,无需昂贵的预训练调整。
VERL
EMPO/Unsupervised Reasoning Incentivization无监督推理激励
主张"正确的问题是答案的一半",通过无监督信号引导推理。
TRL, VERL
Intuitor/Learning to Reason without External Rewards内源性直觉推理
旨在摆脱对外部 Reward Model 的依赖,培养模型的数学直觉。
Open-R1, VERL
rent-rl/RL via Entropy Minimization熵最小化 RL
基于 VERL 框架的 PPO 改进版,通过熵控制优化探索策略。
VERL

🛠️ 分析工具箱 (Analysis Toolkit)

为了更科学地评估模型性能,我们在 entropy_metrics/ 目录下开发了一套专业的评估工具:

  • 📊 Pass@k & Bootstrap 分析 (pass@k.py)

    • 不仅计算标准的 pass@k,还引入了 Bootstrap 重采样方法。
    • 提供 95% 置信区间 (Confidence Intervals),帮助判断模型性能提升是否具有统计显著性(避免随机噪声干扰)。
    • 支持 vLLM 高并发推理。
  • 📈 可视化绘图 (plot_pass_k_comparison_v2.py)

    • 自动生成带有误差棒(Error Bars)的柱状图。
    • 清晰展示不同 Checkpoint(如 Epoch 3 vs 4 vs 5)的性能演变。
  • 🤖 批量测试流程 (run_test_batch.sh)

    • 一键运行多模型评估,支持自定义 Prompt 模板(兼容 Chat Template)。

📝 快速开始 (Quick Start)

1. 训练&评估

MyRLIF文件夹内有对应训练脚本,支持Qwen2.5-Math-1.5B/7B在AIME24、AMC、Math500上一键训练,根目录运行可参照my-train.sh。

使用我们封装好的脚本对模型进行 AIME 数据集评估:

# 评估模型并计算 Pass@k + Bootstrap 此时
python entropy_metrics/pass@k.py \
    --model_path /path/to/your/model \
    --data_path datasets/aime25/aime25.parquet \
    --n_bootstrap 1000

2. 查看报告

运行后会在模型目录下生成 aime25_@k_metrics.json,包含详细的统计数据。

💡 实验配置说明 (Experimental Setup)

关于 MyRLIF 与结果目录

  • MyRLIF: 请特别关注本系列模型的评估。
  • 结果存储: 所有测试结果默认存放于 test_res_qwen 目录下。

Prompt 策略定义 (Prompt Styles)

pass@k.py 中,我们定义了三种 Prompt 模式,分别对应不同的实验需求:

  1. wprompt (With Prompt / Suffix)

    • 说明: 在问题后追加推理引导后缀(常用于 MyRLIF/TTRL)。
    • 格式:
      prompt = (
          f"{problem} \n\n",
          "Please reason step by step, and put your final answer within \\boxed{}",
      )
      
  2. woprompt (Without Prompt / Raw)

    • 说明: 仅包含问题本身,无额外修饰。
    • 格式: prompt = problem
  3. Original (原始 / Default)

    • 说明: 如果未指定特定模式(即“都没加”的情况),则使用原始的长前缀 Prompt。
    • 格式:
      prompt = (
          "Please solve the following math problem. ",
          "Think step by step and then give the final answer at the end.\n",
          "Please wrap the final answer in \\boxed{}.\n",
          f"Problem: {problem}。\n",
      )
      

Contributors

hyperfang2018

1 commits

Languages

Python

82.2%

Jupyter Notebook

9.1%

Shell

8.4%