icip-cas/Verifier-Engineering

Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering

63

28 commits

updated Dec 5, 2024

See the code

README

Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering

Overview

This is a collection of papers and other resources for verifier engineering, which corresponds to the paper Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering. We will update the paper content and this repo regularly, and we very much welcome suggestions of any kind.

[!NOTE]
🌟 Feel free to submit pull requests to share your work and insights from the perspective of verifier engineering - your contributions are always welcome!

Overview of Common Verifiers

Verifier TypeVerification FormVerify GranularityVerifier SourceExtra Training
Golden AnnotationBinary/TextThought Step/Full TrajectoryProgram BasedNo
Rule-basedBinary/TextThought Step/Full TrajectoryProgram BasedNo
Code InterpreterBinary/Score/TextToken/Thought Step/Full TrajectoryProgram BasedNo
ORMBinary/Score/Rank/TextFull TrajectoryModel BasedYes
Language ModelBinary/Score/Rank/TextThought Step/Full TrajectoryModel BasedYes
ToolBinary/Score/Rank/TextToken/Thought Step/Full TrajectoryProgram BasedNo
Search EngineTextThought Step/Full TrajectoryProgram BasedNo
PRMScoreToken/Thought StepModel BasedYes
Knowledge GraphTextThought Step/Full TrajectoryProgram BasedNo

A Verifier Engineering Perspective on Post-training Methods

SearchVerifyFeedbackTask
STar
RFT
WizardMath
LinearGolden AnnotationImitation LearningMath
CAGLinearGolden AnnotationImitation LearningRAG
Self-InstructLinearRule-basedImitation LearningGeneral
Code Alpaca
WizardCoder
LinearRule-basedImitation LearningCode
ILF-CodeLinearCode interpreter
Human
Imitation LearningCode
RAFT
RRHF
LinearORMImitation LearningGeneral
SSOLinearRule-basedPreference LearningAlignment
CodeUltraFeedbackLinearLanguage ModelPreference LearningCode
Self-RewardingLinearLanguage ModelPreference LearningAlignment
StructRAGLinearLanguage ModelPreference LearningRAG
MCTS-DPOTreeLanguage ModelPreference LearningMath
Chain of Preference OptimizationTreeLanguage ModelPreference LearningReasoning
LLAMA-BERRYTreeORMPreference LearningReasoning
Math-ShepherdLinearGolden Annotation
Rule-based
Reinforcement LearningMath
RLTF
PPOCoder
LinearCode InterpreterReinforcement LearningCode
RLAIFLinearLanguage ModelReinforcement LearningGeneral
SIRLCLinearLanguage ModelReinforcement LearningReasoning
RLFHLinearLanguage ModelReinforcement LearningKnowledge
RLHFLinearORMReinforcement LearningAlignment
QuarkLinearToolReinforcement LearningAlignment
RLVRLinearBinary VerifierReinforcement LearningGeneral
ReST-MCTSTreeLanguage ModelReinforcement LearningMath
CRITICLinearCode Interpreter
Tool
Search Engine
Verifier-AwareMath
Code
Knowledge
General
Self-DebugLinearCode InterpreterVerifier-AwareCode
Self-RefineLinearLanguage ModelVerifier-AwareAlignment
ReActLinearSearch EngineVerifier-AwareKnowledge
Constrative DecodingLinearLanguage ModelVerifier-GuidedGeneral
Chain-of-VerificationLinearLanguage ModelVerifier-GuidedKnowledge
Inverse Value LearningLinearLanguage ModelVerifier-GuidedGeneral
PRMLinearPRMVerifier-GuidedMath
KGRLinearKnowledge GraphVerifier-GuidedKnowledge
UoTTreeLanguage ModelVerifier-GuidedGeneral
ToTTreeLanguage ModelVerifier-GuidedReasoning

Citation

If you find our repo useful in your research, please consider citing:

@article{VerifierEngineering,
    title={Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering},
    author={Xinyan Guan, Yanjiang Liu, Xinyu Lu, Boxi Cao, Ben He, Xianpei Han, Le Sun, Jie Lou, Bowen Yu, Yaojie Lu, Hongyu Lin},
    journal={arXiv preprint arXiv:2411.11504},
    url={https://arxiv.org/abs/2411.11504}
    year={2024}
}

Star History

Star History Chart

Contributors

gxy-gxy

26 commits

luxinyu1

1 commits

zui-jiang

1 commits

icip-cas/Verifier-Engineering

Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering

63

28 commits

updated Dec 5, 2024

See the code

README

Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering

Overview

This is a collection of papers and other resources for verifier engineering, which corresponds to the paper Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering. We will update the paper content and this repo regularly, and we very much welcome suggestions of any kind.

[!NOTE]
🌟 Feel free to submit pull requests to share your work and insights from the perspective of verifier engineering - your contributions are always welcome!

Overview of Common Verifiers

Verifier TypeVerification FormVerify GranularityVerifier SourceExtra Training
Golden AnnotationBinary/TextThought Step/Full TrajectoryProgram BasedNo
Rule-basedBinary/TextThought Step/Full TrajectoryProgram BasedNo
Code InterpreterBinary/Score/TextToken/Thought Step/Full TrajectoryProgram BasedNo
ORMBinary/Score/Rank/TextFull TrajectoryModel BasedYes
Language ModelBinary/Score/Rank/TextThought Step/Full TrajectoryModel BasedYes
ToolBinary/Score/Rank/TextToken/Thought Step/Full TrajectoryProgram BasedNo
Search EngineTextThought Step/Full TrajectoryProgram BasedNo
PRMScoreToken/Thought StepModel BasedYes
Knowledge GraphTextThought Step/Full TrajectoryProgram BasedNo

A Verifier Engineering Perspective on Post-training Methods

SearchVerifyFeedbackTask
STar
RFT
WizardMath
LinearGolden AnnotationImitation LearningMath
CAGLinearGolden AnnotationImitation LearningRAG
Self-InstructLinearRule-basedImitation LearningGeneral
Code Alpaca
WizardCoder
LinearRule-basedImitation LearningCode
ILF-CodeLinearCode interpreter
Human
Imitation LearningCode
RAFT
RRHF
LinearORMImitation LearningGeneral
SSOLinearRule-basedPreference LearningAlignment
CodeUltraFeedbackLinearLanguage ModelPreference LearningCode
Self-RewardingLinearLanguage ModelPreference LearningAlignment
StructRAGLinearLanguage ModelPreference LearningRAG
MCTS-DPOTreeLanguage ModelPreference LearningMath
Chain of Preference OptimizationTreeLanguage ModelPreference LearningReasoning
LLAMA-BERRYTreeORMPreference LearningReasoning
Math-ShepherdLinearGolden Annotation
Rule-based
Reinforcement LearningMath
RLTF
PPOCoder
LinearCode InterpreterReinforcement LearningCode
RLAIFLinearLanguage ModelReinforcement LearningGeneral
SIRLCLinearLanguage ModelReinforcement LearningReasoning
RLFHLinearLanguage ModelReinforcement LearningKnowledge
RLHFLinearORMReinforcement LearningAlignment
QuarkLinearToolReinforcement LearningAlignment
RLVRLinearBinary VerifierReinforcement LearningGeneral
ReST-MCTSTreeLanguage ModelReinforcement LearningMath
CRITICLinearCode Interpreter
Tool
Search Engine
Verifier-AwareMath
Code
Knowledge
General
Self-DebugLinearCode InterpreterVerifier-AwareCode
Self-RefineLinearLanguage ModelVerifier-AwareAlignment
ReActLinearSearch EngineVerifier-AwareKnowledge
Constrative DecodingLinearLanguage ModelVerifier-GuidedGeneral
Chain-of-VerificationLinearLanguage ModelVerifier-GuidedKnowledge
Inverse Value LearningLinearLanguage ModelVerifier-GuidedGeneral
PRMLinearPRMVerifier-GuidedMath
KGRLinearKnowledge GraphVerifier-GuidedKnowledge
UoTTreeLanguage ModelVerifier-GuidedGeneral
ToTTreeLanguage ModelVerifier-GuidedReasoning

Citation

If you find our repo useful in your research, please consider citing:

@article{VerifierEngineering,
    title={Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering},
    author={Xinyan Guan, Yanjiang Liu, Xinyu Lu, Boxi Cao, Ben He, Xianpei Han, Le Sun, Jie Lou, Bowen Yu, Yaojie Lu, Hongyu Lin},
    journal={arXiv preprint arXiv:2411.11504},
    url={https://arxiv.org/abs/2411.11504}
    year={2024}
}

Star History

Star History Chart

Contributors

gxy-gxy

26 commits

luxinyu1

1 commits

zui-jiang

1 commits