My reading notes on LLM/VLM research — post-training, pretraining, agents, multimodal, interpretability, architecture, and more.
0
1 commits
updated Nov 15, 2025
这是一个精心整理的关于大语言模型(LLM)、强化学习(RL)和智能体系统的论文合集。
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (2018)
Improving Language Understanding by Generative Pre-Training (GPT-1) (2018)
Language Models are Unsupervised Multitask Learners (GPT-2) (2019)
Language Models are Few-Shot Learners (GPT-3) (2020)
PaLM: Scaling Language Modeling with Pathways (2022)
UL2: Unifying Language Learning Paradigms (2022)
Qwen3 Technical Report (2025)
DeepSeek-V3 Technical Report (2024)
DeepSeek-OCR: Contexts Optical Compression (2025)
RoFormer: Enhanced Transformer with Rotary Position Embedding (2021)
Kimi Linear: An Expressive, Efficient Attention Architecture (2025)
Proximal Policy Optimization Algorithms (PPO) (2017)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model (DPO) (2023)
Group Sequence Policy Optimization (GSPO) (2025)
Group-in-Group Policy Optimization for LLM Agent Training (GiGPO) (2025)
Learning to summarize from human feedback (2020)
Training language models to follow instructions with human feedback (InstructGPT) (2022)
HybridFlow: A Flexible and Efficient RLHF Framework (2024)
DAPO: An Open-Source LLM Reinforcement Learning System at Scale (2025)
A Survey of Reinforcement Learning for Large Reasoning Models (2025)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey (2025)
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (2022)
Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning (2023)
Chain of Thought Empowers Transformers to Solve Inherently Serial Problems (2024)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (2025)
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (2024)
A Survey on Large Language Model based Autonomous Agents (2023)
Cognitive Architectures for Language Agents (2023)
A Comprehensive Survey of Self-Evolving AI Agents (2025)
Executable Code Actions Elicit Better LLM Agents (CodeAct) (2024)
MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines (2025)
Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation (2025)
Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling (2025)
Alita: Generalist Agent Enabling Scalable Agentic Reasoning (2025)
Building Effective AI Agents (2024)
How we built our multi-agent research system (OpenAI AgentKit) (2024-2025)
ToolRL: Reward is All Tool Learning Needs (2025)
ToRL: Scaling Tool-Integrated RL (2025)
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs (2025)
VeriTool: Towards Holistic Agentic Reinforcement Learning with Tool Use (2025)
ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving (2024)
PAL: Program-aided Language Models (2022)
A Survey on LLM-based Code Generation for Low-Resource and Domain-Specific Programming Languages (2024)
A Comparative Study of DSL Code Generation: Fine-Tuning vs. Optimized RAG (2024)
GenCoG: A DSL-Based Approach to Generating Computation Graphs for TVM Testing (2023)
Aligning Requirement for Large Language Model's Code Generation (2025)
Guiding LLM-based Smart Contract Generation with Finite State Machine (2025)
Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems (2025)
ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization (2025)
A Survey of Context Engineering for Large Language Models (2025)
Context Engineering 2.0: The Context of Context Engineering (2025)
Deep Research: A Survey of Autonomous Research Agents (2025)
A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications (2025)
Reinforcement Learning Foundations for Deep Research Systems: A Survey (2025)
A Comprehensive Survey on Reinforcement Learning-based Agentic Search (2025)
R1-Searcher: Incentivizing the Search Capability in LLMs via RL (2025)
Search-R1: Training LLMs to Reason and Leverage Search Engines with RL (2025)
WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines (2025)
WebSailor-V2: Bridging the Chasm to Proprietary Agents (2025)
Tongyi DeepResearch: A New Era of Open-Source AI Researchers (2025)
A Survey of Text-to-SQL in the Era of LLMs (2024)
Text-to-Pipeline: Bridging Natural Language and Data Preparation Pipelines (2025)
StateFlow: Enhancing LLM Task-Solving through State-Driven Workflows (2024)
AutoFlow: Automated Workflow Generation for LLM Agents (2024)
An Agentic Flow for Finite State Machine Extraction using Prompt Chaining (2025)
QLoRA: Efficient Finetuning of Quantized LLMs (2023)
Muon is Scalable for LLM Training (2025)
详细的论文阅读笔记请参见 notes 目录。
欢迎提交PR添加新的论文或改进现有笔记!
MIT License
最后更新: 2025-11-15
1 commits
My reading notes on LLM/VLM research — post-training, pretraining, agents, multimodal, interpretability, architecture, and more.
0
1 commits
updated Nov 15, 2025
这是一个精心整理的关于大语言模型(LLM)、强化学习(RL)和智能体系统的论文合集。
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (2018)
Improving Language Understanding by Generative Pre-Training (GPT-1) (2018)
Language Models are Unsupervised Multitask Learners (GPT-2) (2019)
Language Models are Few-Shot Learners (GPT-3) (2020)
PaLM: Scaling Language Modeling with Pathways (2022)
UL2: Unifying Language Learning Paradigms (2022)
Qwen3 Technical Report (2025)
DeepSeek-V3 Technical Report (2024)
DeepSeek-OCR: Contexts Optical Compression (2025)
RoFormer: Enhanced Transformer with Rotary Position Embedding (2021)
Kimi Linear: An Expressive, Efficient Attention Architecture (2025)
Proximal Policy Optimization Algorithms (PPO) (2017)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model (DPO) (2023)
Group Sequence Policy Optimization (GSPO) (2025)
Group-in-Group Policy Optimization for LLM Agent Training (GiGPO) (2025)
Learning to summarize from human feedback (2020)
Training language models to follow instructions with human feedback (InstructGPT) (2022)
HybridFlow: A Flexible and Efficient RLHF Framework (2024)
DAPO: An Open-Source LLM Reinforcement Learning System at Scale (2025)
A Survey of Reinforcement Learning for Large Reasoning Models (2025)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey (2025)
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (2022)
Plan-and-Solve Prompting: Improving Zero-Shot Chain-of-Thought Reasoning (2023)
Chain of Thought Empowers Transformers to Solve Inherently Serial Problems (2024)
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (2025)
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (2024)
A Survey on Large Language Model based Autonomous Agents (2023)
Cognitive Architectures for Language Agents (2023)
A Comprehensive Survey of Self-Evolving AI Agents (2025)
Executable Code Actions Elicit Better LLM Agents (CodeAct) (2024)
MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines (2025)
Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation (2025)
Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling (2025)
Alita: Generalist Agent Enabling Scalable Agentic Reasoning (2025)
Building Effective AI Agents (2024)
How we built our multi-agent research system (OpenAI AgentKit) (2024-2025)
ToolRL: Reward is All Tool Learning Needs (2025)
ToRL: Scaling Tool-Integrated RL (2025)
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs (2025)
VeriTool: Towards Holistic Agentic Reinforcement Learning with Tool Use (2025)
ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving (2024)
PAL: Program-aided Language Models (2022)
A Survey on LLM-based Code Generation for Low-Resource and Domain-Specific Programming Languages (2024)
A Comparative Study of DSL Code Generation: Fine-Tuning vs. Optimized RAG (2024)
GenCoG: A DSL-Based Approach to Generating Computation Graphs for TVM Testing (2023)
Aligning Requirement for Large Language Model's Code Generation (2025)
Guiding LLM-based Smart Contract Generation with Finite State Machine (2025)
Towards Agentic RAG with Deep Reasoning: A Survey of RAG-Reasoning Systems (2025)
ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization (2025)
A Survey of Context Engineering for Large Language Models (2025)
Context Engineering 2.0: The Context of Context Engineering (2025)
Deep Research: A Survey of Autonomous Research Agents (2025)
A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications (2025)
Reinforcement Learning Foundations for Deep Research Systems: A Survey (2025)
A Comprehensive Survey on Reinforcement Learning-based Agentic Search (2025)
R1-Searcher: Incentivizing the Search Capability in LLMs via RL (2025)
Search-R1: Training LLMs to Reason and Leverage Search Engines with RL (2025)
WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines (2025)
WebSailor-V2: Bridging the Chasm to Proprietary Agents (2025)
Tongyi DeepResearch: A New Era of Open-Source AI Researchers (2025)
A Survey of Text-to-SQL in the Era of LLMs (2024)
Text-to-Pipeline: Bridging Natural Language and Data Preparation Pipelines (2025)
StateFlow: Enhancing LLM Task-Solving through State-Driven Workflows (2024)
AutoFlow: Automated Workflow Generation for LLM Agents (2024)
An Agentic Flow for Finite State Machine Extraction using Prompt Chaining (2025)
QLoRA: Efficient Finetuning of Quantized LLMs (2023)
Muon is Scalable for LLM Training (2025)
详细的论文阅读笔记请参见 notes 目录。
欢迎提交PR添加新的论文或改进现有笔记!
MIT License
最后更新: 2025-11-15
1 commits