mzhaoshuai/Llama-3.3-70B-Inst-awq_ultrafeedback_1in3

Dataset

0

stars

6

commits

1

linked in READMEs

Oct 16, 2025

updated

alignment
bertscore
confidence-alignment
llm-alignment
preference-alignment
reinforcement-learning-from-human-feedback
rlhf
safety-alignment
Browse cluster: LLM Reward Modeling & RLHF

README

Generated Reference Answers for Language Model Alignment

This dataset contains responses generated for the research presented in the paper Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data.

The paper introduces RefAlign, a versatile REINFORCE-style alignment algorithm that utilizes language generation evaluation metrics, such as BERTScore, between sampled generations and reference answers as surrogate rewards. This approach enables various alignment scenarios, including safety, confidence, and general preference alignment, without relying on binary human preference data or explicit reward models.

Code: https://github.com/mzhaoshuai/RefAlign

This repository contains responses generated by casperhansen/llama-3.3-70b-instruct-awq given the prompts from HuggingFaceH4/ultrafeedback_binarized.

During generation, we use three random seeds (13, 21, 42) to generate three responses and use the model itself to choose the best response.

Contributors

mzhaoshuai

5 commits

nielsr

1 commits

mzhaoshuai/Llama-3.3-70B-Inst-awq_ultrafeedback_1in3

Dataset

0

stars

6

commits

1

linked in READMEs

Oct 16, 2025

updated

alignment
bertscore
confidence-alignment
llm-alignment
preference-alignment
reinforcement-learning-from-human-feedback
rlhf
safety-alignment
Browse cluster: LLM Reward Modeling & RLHF

README

Generated Reference Answers for Language Model Alignment

This dataset contains responses generated for the research presented in the paper Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data.

The paper introduces RefAlign, a versatile REINFORCE-style alignment algorithm that utilizes language generation evaluation metrics, such as BERTScore, between sampled generations and reference answers as surrogate rewards. This approach enables various alignment scenarios, including safety, confidence, and general preference alignment, without relying on binary human preference data or explicit reward models.

Code: https://github.com/mzhaoshuai/RefAlign

This repository contains responses generated by casperhansen/llama-3.3-70b-instruct-awq given the prompts from HuggingFaceH4/ultrafeedback_binarized.

During generation, we use three random seeds (13, 21, 42) to generate three responses and use the model itself to choose the best response.

Contributors

mzhaoshuai

5 commits

nielsr

1 commits