本仓库记录关于LLM (large language models)和Multimodal LLM的文章。看过的文章会至少用一句话概括内容,有些还会有notes。只有标题的就是还没看过的,只是先存档到这里。
有关OOD generalization的paper list请移步(OOD list 已停止维护):link
⭐ 表示文章较多;🔥表示当前主要关注并更新
1.Mind with Eyes: from Language Reasoning to Multimodal Reasoning [paper] 多模态推理综述
Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination (Arxiv Nov 2024) [paper] 对于VQA任务,提出thinking-before-looking范式,先利用一个LLM根据文本问题生成一堆更细致的问题,然后将这些问题和图片一起输给MLLM让其生成推理步骤。最终将原始问题、图片、推理步骤一起输给MLLM让其生成答案。
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models (NeurIPS 2024) [paper] 让模型生成代码来调用工具根据现有的视觉输入产生新的视觉图像来作为推理的辅助,可以提升在各种视觉相关任务上的能力。
Task Navigator: Decomposing Complex Tasks for Multimodal Large Language Models (CVPR 2024) [paper] 工程文章,借助LLM根据历史子问题和模型回答,迭代产生多个子问题,提升MLLM完成复杂视觉理解任务的能力。提出了VersaChallenge benchmark,包括常识推理、物理关系推理、未来预测等。
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities (CVPR 2024) [paper] 构建数据集,训了一个spatial-VLM用以解决空间任务
【📊dataset】SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models (NeurIPS 2024) [paper] 构建空间位置关系数据集,添加了一个深度图->语言模块,来增强几何推理
Multimodal Chain-of-Thought Reasoning in Language Models (TMLR 2024) [paper] 两阶段训练,第一阶段接受文本和视觉的融合特征输出一个rationale(推理过程的文本描述),第二阶段将生成的rationale和原始文本结合,再与视觉特征融合重新输入模型产生预测。
Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination (Arxiv Nov 2024) [paper] 对于VQA任务,提出thinking-before-looking范式,先利用一个LLM根据文本问题生成一堆更细致的问题,然后将这些问题和图片一起输给MLLM让其生成推理步骤。最终将原始问题、图片、推理步骤一起输给MLLM让其生成答案。
Link-Context Learning for Multimodal LLMs (CVPR 2024) [paper] 提出一种新的fine-tune MLLM的方法:让context和query具有一定的causal联系,发现能提升模型通过context学习新概念的能力
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models (NeurIPS 2024) [paper] 先构建一个优质的ICL数据集,然后将该数据集中的image-text对视作token,用CLIP抽取特征作为token embedding,训练一个很小的Transformer(lever-LM)来在该数据集上进行next-token prediction(序列是从query到context这样倒着来的)。测试时,最后给定测试样本,拿lever-LM从该预先挑选好的数据集中预测后续的example来构成context。
Natural Language Inference Improves Compositionality in Vision-Language Models (ICLR 2025 Ratings 8866) [paper] prompt工程。任务是判断caption和图片相不相符。做法是让LLM生成与原始caption相符、不相符的yes or no问题,然后根据VLM在相符/不相符/原始问题上的logit来做出最终判断。
Interleaved-Modal Chain-of-Thought (Arxiv 2024.11) [paper] 在每一个reasoning step选出attention最高的visual tokens,保持原图的顺序插入到视觉和文本输入之后、文本rationale开始之前的位置,之后再据此生成rationale。按此方法迭代生成多个reasoning step,然后再在其后生成最终答案。
Progressive Multimodal Reasoning via Active Retrieval (Arxiv 2024.12) [[paper]](Progressive Multimodal Reasoning via Active Retrieval) 提出了一个从外部知识库中根据当前推理步搜索相关知识,并通过MCTS来构建CoT的框架,并提出了在生成的CoT数据上进行PRM的方法。推理时根据PRM的打分,选取得分topk高的推理路径。
Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search (Arxiv 2024.12) [[paper]](Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search) [code] 用MCTS构建CoT,其中每一步打分利用多个模型;同时构建反思链,做法是构建一个“低得分节点-反思prompt-高得分节点”的思维链。然后用生成的总共260K数据进行fine-tune。
Perception Tokens Enhance Visual Reasoning in Multimodal Language Models (Arxiv 2024.12) [paper] 针对相对深度估计问题或计数问题,将深度图或bounding box转换为MLLM能处理的token来提供更精细的视觉信息,并加入到CoT中,来fine-tune MLLM。
MR-MLLM: Mutual Reinforcement of Multimodal Comprehension and Vision Perception (Arxiv 2024.06) [paper]
【📊dataset】Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning (NeurIPS 2024 DB track) [paper] 造了一个数据集Visual CoT,包含推理关键视觉区域的bounding box的坐标。提出的方法:训练MLLM在推理时输出bounding box。
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM (MM 2024) [paper] 纯prompt engineering文章。为了增强perception,提示MLLM根据问题找出具体该看什么图片细节,然后问一个MLLM让它专门去看,最后再综合它的输出来做最终回答
Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks (Arxiv 2024.10) [paper] 给MLLM提供Self-correction Prompt,然后选出改对的和改错的样本分别作为正负样本进行DPO。
Beyond Embeddings: The Promise of Visual Table in Visual Reasoning (EMNLP 2024) [paper] 训练一个visual table generator,来产生对图片的详细描述。训练generator的方法:prompt GPT4V来生成visual table。总共从COCO找了61K数据。三阶段训练:1)caption数据上训练connector 2)在GPT生成的instruction tunning数据集上训练connector和LLM 3)在vis table数据上训练LLM。
From the Least to the Most: Building a Plug-and-Play Visual Reasoner via Data Synthesis (EMNLP 2024) [paper] 先用grounding DINO检测图中物体获得一系列节点(单物体/多物体/整张图),让GPT4根据这些节点反推每一步回答什么样的子问题、怎样调用工具,才能从前一步的图片节点得到下一步的图片节点。最后让GPT4把子图、GPT4生成的子问题和工具调用参数合成一个推理链。让gpt4生成10k这样的数据用来训练llama3-8b做提提问题和合成的任务。之后让这个sft之后的llama3-8b生成50k推理链,用来sft一个llava-1.5-7b作为reasoner,其具备提出子问题和调用工具的能力。
【🔍Survey】Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers (Arxiv 2025.06) [paper]
【📚Dataset】Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning (Arxiv 2025.07) [paper]
【💡Understanding】Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought (Arxiv 2025.05) [paper] 理解不同类型的visual thought(pure-text、edited-image、generated-image等)的性能、适用场景、内在机制
【🔍Survey】Explain Before You Answer: A Survey on Compositional Visual Reasoning (Arxiv 2025.08) [paper]
【⚖Benchmark】TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning [paper] 构建了一些强烈依赖于工具调用才能做对的任务。一些takeaway:1)在一些复杂任务(比如给出拼图顺序,fig 5)上,单纯的perception(o3展现出的”understanding the images as a whole”)没用,必须得借助code。2)在rotationOCR任务上,单纯增加text-based COT的数据进行SFT几乎没有提升
【💡Understanding】Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization [paper] insight:(至少在迷宫、Vstar、HRBench上)SFT时学习使用crop工具并不是泛化最好的推理模式。TWI SFT可能导致过拟合。
L-CoT (纯文本cot), G-CoT (输出bbox文字的cot,但不重新插入图片), V-CoT (插入crop图片的cot)SFT后的RL性能上限接近(RL训练了1000步,远大于大部分文章的setting),只是收敛速度上V-CoT>G-CoT>L-CoT;
②“最小”CoT上做SFT,再RL,泛化能力最强(迷宫size泛化、Vstar → Vstar/HRBench),显著优于V-CoT+RL。“最小“CoT是指只包含答案的cot。
【🔧SFT】CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning (ICLR 2025) [paper] 让GPT4生成针对多模态问题的工具调用链,然后将其转为多轮的VQA链,每轮包含子图片、子问题和答案,用这些数据对MLLM做SFT
【🔧SFT+🚀RL】Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning (Arxiv 2025.05) [paper] 两阶段训练,第一阶段通过SFT让MLLM初步具备输出bounding box的能力(训练数据构建:自带visual cues的数据集,或者是gpt4o生成);第二阶段curiosity-driven RL,强制模型用bounding box辅助推理的比例不能低于某个阈值
【🔧SFT】Don't Look Only Once: Towards Multimodal Interactive Reasoning with Selective Visual Revisitation (Arxiv 2025.05) [paper] 训一个linear head,输出input token positions的概率分布。最终输出的logit包含原始词汇空间和图片的position空间。训练数据构建方法:取QvQ的文本推理链,用Gemini提取视觉query,输给Qwen用relative attn机制(ICLR25那篇)获取bounding box
【🔧SFT+🚀RL】Chain-of-Focus: Adaptive Visual Search and Zooming for Multimodal Reasoning via RL (Arxiv 2025.05) [paper] SFT+RL两阶段训练。SFT数据构造过程:让gpt4.1生成问题和回答,回答正确性由qwen-vl-72b校对;让qwen-vl-72b判断问题是否可以回答还是需要更高的分辨率(zoom-in);gpt4.1作为agent,调用detection、bbox adjusting、mm understanding等工具完成问题(工具其实就是qwen-vl-max),中间依靠ds-v3作为verifier进行反馈。
【🔧SFT】Thinking with Generated Images (Arxiv 2025.05) [paper] 主要目标是更好地生成。构建SFT数据:包含反思和设定中间目标。
【🚀RL】Visual Planning: Let's Think Only with Images (Arxiv 2025.05) [paper] 主要解决grid-based navigation问题。纯视觉CoT.
【🚀RL】GRIT: Teaching MLLMs to Think with Images (Arxiv 2025.05) [paper] 不需要SFT或bbox标注。只需要20个训练数据。reward包括:1)format:包括think、bbox(有bbox就给分)、rethink;2)counting:bbox数量和gt数量一致就给分;3)acc:gpt-4o + BELU-1相似度给分;当输出了bbox,并不需要把crop下来的小图作为新的image输入,而是直接让模型依据bounding box进行推理(后续实验发现输出bbox能提升对image的attention)
【🔧SFT+🚀RL】Grounded Reinforcement Learning for Visual Reasoning (Arxiv 2025.05) [paper] 方法:1)构建SFT data:用qwen2.5-VL-72B做MCTS,要求每一步都输出grounding的坐标,选出答案正确的路径和corrected路径用于SFT;2)SFT+RL,RL reward中包含format reward,要求按照think-tool call-observation-answer的顺序输出
ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding (ICML 2025) [paper]
【🔧SFT+🚀RL】MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning (Arxiv 2025.06) [paper] 亮点:interleaved CoT当中的visual cues是token,而不是bbox,这样crop比较灵活。数据:构建了一个数学数据集(需要借助gpt4o),每一步有token-level的图像区域标注;训练:text-sft,interleaved-sft,interleaved-RL
【❄Training-free】PyVision: Agentic Vision with Dynamic Tooling (Arxiv 2025.07) [paper] prompt engineering,让advanced closed-source MLLM获得“合成新工具”的能力
【🔧SFT+🚀RL】Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens (Arxiv 2025.07) [paper] 让模型生成latent token辅助推理。两阶段SFT+RL。SFT阶段一对齐MLLM生成的latent和gt helper image;SFT阶段二将生成的latent作为input,进行SFT。RL为GRPO,loss只加在text上(因为生成的latent
【🔧SFT+🚀RL】OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning (Arxiv 2025.08) [paper] 合成了工具调用的CoT。SFT+GRPO。
【🚀RL】Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback (Arxiv 2025.07) [paper] 应用场景很局限,解决的是image-to-code任务(从chart或webpage生成图片)。提了一个仅需要图片数据的RL框架:让模型调用工具渲染图片,然后比较渲染出来的图片和原始图片的相似度作为reward。
【🔧SFT+🚀RL】Thyme: Think Beyond Images (Arxiv 2025.08) [paper] SFT+RL训练模型生成code来操作图片进行推理的能力。构建了SFT和RL数据集。提出了一种dynamic temperature的策略:生成代码时temperature=0,生成文本推理时temperature=1.0
**【🔧SFT+🚀RL】Reinforced Visual Perception with Tools ** (Arxiv 2025.09) [paper]
【🔧SFT+🚀RL】Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search (Arxiv 2025.09) [paper] 构建了一个多轮visual search的SFT数据集。针对RL rollout时回复过长导致超出context从而无法判断对错的问题,提出将这部分回复mask掉,不计算reward。
【🔧SFT+🚀RL】DeepeyesV2: Toward Agentic Multimodal Model (Arxiv 2025.11) [paper] 比较接近真正agent MLLM的形态,能产生code调用工具并联网搜索。
【🔧SFT+🚀RL】V-Thinker: Interactive Thinking with Images [paper] (Arxiv 2025.11) 生成code编辑图片。设计了一种数据生成策略,借助GPT5,从一个知识集和和一个工具集和出发,让GPT5生成问题以及cot的同时不断对它们进行扩充。cot中包含代码以及渲染出的图片(V-Interaction-400K)。perception SFT + cold start SFT + GRPO RL。
【🔧SFT】DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning (Arxiv 2025.09, ICLR26 withdrawn) [paper] 给MLLM加了一个image embedding editing模块,输入为原始图片emb和模型自己生成的action embedding,输出为编辑后的图片(但是没给可视化)。监督信号为code渲染出的中间步图片。还构建了一个用code渲染图片的cot数据集。
【🔧SFT】Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch (Arxiv 2025.12) [paper] 能think with images和web search的agent MLLM。数据构建流程是关键。纯SFT训练。
【🔧SFT+🚀RL】Thinking with Programming Vision: Towards a Unified View for Thinking with Images (Arxiv 2025.12) [paper] 在构造数据时,通过对原图做增强扰动来保证工具调用的必要性。RL时候通过给问题预先标注好标准工具的元数据,实现了dense reward:奖励使用预先定义的工具、crop的IoU、以及对使用超出定义的有用工具的奖励。同时还使用了多种惩罚reward以避免reward hacking等行为。
【🚀RL】Thinking with Images via Self-Calling Agent (Arxiv 2025.12) [paper]
【🚀RL】Figure It Out: Improve the Frontier of Reasoning with Active Visual Thinking [paper] 提出FIGR。RL中用了一个adaptive reward:当问题依赖辅助图片时用了工具做对给1.0,不依赖时用了工具给0.2,否则0。测的是纯文本数学任务(AIME、AMC)等。让qwen3-vl-32b用code渲染图像,能超过qwen3-32b-thinking。
【🔧SFT+🚀RL】SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning (Arxiv 2025.12) [paper]
CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning (Arxiv 2025.12) [paper] SFT数据:简单样本鼓励直接输出答案;RL reward设计:鼓励在动态选出的难样本上用tool,否则不鼓励tool;惩罚code执行失败
HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling (Arxiv 2025.10) [paper]
CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization (CVPR 2026 Oral) [paper] 也发现了DeepEyes、PixelReasoner等模型会依赖错误的工具调用得高分。提出了过程监督RL,来解决工具调用的faithfulness的问题:用qwen2.5-VL-32B做judge,给出原始问题和工具返回结果,让judge回答“does this piece of evidence help with this question?”。一些insight:
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm (Arxiv 2025.11) [paper] 发现在视觉中心任务上,视频生成模型(sora2)性能逼近顶尖闭源vlm(gpt5、gemini2.5pro等)。但在文本中心任务上性能差距较大。可以通过Self-consistency和ICL来提升sora做推理任务的能力。
- Video models are zero-shot learners and reasoners - Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm - Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark - TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models - Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks - MMGR: Multi-Modal Generative Reasoning - RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence - V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models - Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning
Explore Spurious Correlations at the Concept Level in Language Models for Text Classification (Arxiv Jan 2024) [paper] 发现了LLM在文本分类中会依赖的concept-label spurious correlation,提出使用ChatGPT来扩充数据来消除虚假关联。
Positional Information Matters for Invariant In-Context Learning: A Case Study of Simple Function Classes (ongoing work) [[paper]](Positional Information Matters for Invariant In-Context Learning: A Case Study of Simple Function Classes) 发现模型对于demonstration的permutation invariance或许是ICL OOD的关键。提出使用相同的positional encoding来提升ICL OOD性能。
Simple synthetic data reduces sycophancy in large language models (Arxiv Feb 2024) [paper] LLMs会迎合提问者的观点而罔顾事实。提出合成一些用户的观点和正确性无关的新prompt,然后在这些数据上fine-tune来解决sycophancy问题。
Understanding In-Context Learning in Transformers and LLMs by Learning to Learn Discrete Functions (ICLR 2024 Oral) [paper] 探究transformer在一系列离散任务上的能力。特别地,发现经过预训练的模型相比随机初始化的模型获得了更强的最近邻、disjunction和conjunction的能力。
Batch-ICL: Effective, Efficient, and Order-Agnostic In-Context Learning (Arxiv Jan 2024) 发现使用batch ICL,将N个example设置为N个one-shot inference,再把每个inference得到的token做平均,替换到query sample做aggregation最终再预测能带来提升。一个奇特的发现是做aggregation时从某一层往后做性能会突增,在那之前性能接近零。对此解释是transformer的低层是在学语义信息。
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models (Arxiv Feb 2024) [paper] 评估模型的改变它们的原始输出并遵循和一开始相违背的指令的能力。主要观察:1)大部分模型都会倾向于遵守它们的预训练知识 2)模型很难根据人类后续的反馈泛化到新的问题 3)所有模型都会逐步忘记人类反馈并落回到它们的内部知识里 4)模型是不是第一时间遵守了人类的反馈,对于后续的行为起到关键作用
Function Vectors in Large Language Models (ICLR 2024) [paper] 发现context prompt的最后一个token的隐层表示encode了这个任务的信息,称为function vector(FV)。将其加到zero-shot的prompt上,发现有显著提升。5
A Data Generation Perspective to the Mechanism of In-Context Learning (Arxiv Feb 2024) [paper] 有关task recognition和task learning的综述
Identifying and Analyzing Task-Encoding Tokens in Large Language Models (Arxiv Feb 2024) [paper] 探究了context中的template词("data:","answer:")/stopword(标点、连词等无意义词)/content对performance的意义。结果发现template词对ICL性能提升最有用,content反而没什么用;还探究了template词的什么特征使得它有别于context中的其他成分,结果发现template词本身的语义、其重复性、其分隔x和y的格式作用这三者都对ICL性能有显著的作用。
Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language Models (Arxiv Feb 2024) [paper] 发现,问题中的错误前提而导致的回答中的幻觉是由于模型中特定的head的激活所引起的。提出了一种强行消除这些head对于问题中的错误前提对应的token的attention的方法。
In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space Steering (Arxiv Feb 2024) [paper] 提出用context的第L层表示构造一个表征任务信息的vector(ICV),然后再加到query时的第L层所有token的表示上。
The mechanistic basis of data dependence and abrupt learning in an in-context classification task (ICLR 2024 Oral) [paper] 有关transformer 的IWL(in-weights learning)和ICL学习过程的实验性分析。在一个两层toy transformer中揭示了induction head学习机制。
Understanding In-context Learning From Repetitions (ICLR 2024) [paper] 揭示了context中重复出现的pattern会导致模型更倾向于输出这个pattern的现象。
In-context Learning Learns Label Relationships but is not Conventional Learning (ICLR 2024) [paper] 以更大的模型和更长的context重新审视以往的ICL讨论,并得出了以下三个结论:1)ICL会学x-y映射,正确的label是有用的,且模型越大这一效应越明显 2)ICL能学预训练时没见过的新任务 3)即使context很长,ICL也不能彻底覆盖预训练获得的preference 4)LLM更关注更靠近query的example
How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric Learning (Arxiv Feb 2024) [paper] 在简单的word classification任务上,首先按照类似Function Vector的做法,提取出对输出正确预测贡献最大的head。然后分析这些head并发现了如下机制:label的V encode了label的特征,label的K encode了demonstration的特征;last token的Q encode了query的特征;last token query和正确label的K的attention score比其他head的显著大;last token Q与在context中出现更多的label/更靠近query的label的K的attention score更大。
Locating Factual Knowledge in Large Language Models: Exploring the Residual Stream and Analyzing Subvalues in Vocabulary Space (Arxiv Jan 2024) [paper] 提出了一种定位transformer中对输出某一label贡献最大的attention或FFN layer(或其subvalue)的方法。
In-Context Learning State Vector with Inner and Momentum Optimization (NeurIPS 2024) [paper] 提了一种新的用vector压缩信息的技术(State Vector SV):是将前L层的每层的attention输出concat起来。然后提了三种技术(aggregate每一个example的SV、用momentum、分组提取SV再聚合)来进一步优化SV,取得了一些性能提升。
GNNavi: Navigating the Information Flow in Large Language Models by Graph Neural Network (Arxiv Feb 2024) [paper] 提出将GNN插在LLM的某一层后面,强行使得information flow(token representation就是node representation)是从x->y和y->:连边,然后得到的node representation输给LLM的下一层(每个token的都保留着,因为GNN的输出也是所有node的输出)。最后只在ICL数据集上微调GNN,能够实现和lora媲美的速度和更好的acc。
Decomposing Label Space, Format and Discrimination: Rethinking How LLMs Respond and Solve Tasks via In-Context Learning (Arxiv April 2024) [paper] 将ICL能力分成1)正则化输出的label space、2)正则化输出的label format,和3)提升label space/format分布内的判别能力三个方面。结论:ICL的能力主要来自前两者。同时也在实验上间接证明了ICL会倾向于预测出context和test更像的样本的label。
The Evolution of Statistical Induction Heads: In-Context Learning Markov Chains (Arxiv Feb 2024) [paper] 在预测Markov序列任务上,揭示了存在一个学习出从简单到复杂function的过程(uniform -> unigram -> bigrams (optimal))。此外,也验证了类似retrieval(n-gram),即找最相似的context token然后取它后面的token作为预测的机制
In-Context Language Learning: Architectures and Algorithms (Arxiv Jan 2024) [paper] 构造了一个模拟的language token ICL任务,给了一系列实验证据说明transformer实现了和n-gram类似的retrieval过程
Trusting Your Evidence: Hallucinate Less with Context-aware Decoding (Arxiv May 2024) [paper] 为了增强对context的关注能力,提出在推理时加权以context为条件的预测和不含context的预测:$y=\text{softmax}((1+\alpha) p_\theta(y|c,x)-\alpha p_\theta(y|x))$ 。背后的理论基础是朴素贝叶斯 [blog]
How In-Context Learning Emerges from Training on Unstructured Data: On the Role of Co-Occurrence, Positional Information, and Noise Structures (Arxiv Jun 2024) [paper] 在非ICL格式的数据上训练,探究了“国家-首都”类任务(预训练常见)和输出首字母任务(不常见),发现pattern在训练数据里的重复性和位置信息分别是这两种任务的关键。
Benefits of Transformer: In-Context Learning in Linear Regression Tasks with Unstructured Data (Arxiv Feb 2024) [paper] 分析多层、PE、multi head等模块对于提升ICL在线性回归任务上性能的作用。
Do pretrained Transformers Learn In-Context by Gradient Descent? (ICML 2024) [paper] 讨论了一下目前ICL工作的不切实际的setting,从一些实验指标上说明了ICL和GD有显著不同。
Rectifying Demonstration Shortcut in In-Context Learning (NAACL 2024) [paper] 发现context单词的字面意思会影响ICL分类的结果(一种shortcut)。提出了一种calibration的策略。
Investigating the Pre-Training Dynamics of In-Context Learning: Task Recognition vs. Task Learning (Arxiv June 2024) [paper] 训练过程中task learning和task recognition存在竞争现象
Transformers Can Perform Distributionally-robust Optimisation through In-context Learning (ICML 2024 workshop on ICL) [paper] ICL有一定的DRO的能力
How Do In-Context Examples Affect Compositional Generalization? (ACL 2024) [paper] 发现context example对于组合泛化能力影响显著。具体来说,context example和query越像、example越多样、每个样本越简单,泛化能力越好。
What Do Language Models Learn in Context? The Structured Task Hypothesis (ACL 2024) [paper] 通过实验验证了ICL能够对预训练见过的任务进行复合的假设,否定了ICL仅仅能够进行分布内任务的试别以及ICL能够泛化到某些训练时没见过的任务的假设。
What needs to go right for an induction head? A mechanistic study of in-context learning circuits and their formation (ICML 2024) [paper] 识别了transformer在解决ICL的copy-and-paste任务中存在的三种circuit
In-Context Learning of Energy Functions (ICML 2024 ICL workshop) [paper] 提出了将next-token的条件分布建模为能量函数的形式,发现transformer也能在这种形式下展现出ICL能力
From Words to Numbers: Your Large Language Model Is Secretly A Capable Regressor When Given In-Context Examples (Arxiv April 2024) [paper] 发现诸如GPT-4,Claude-3之类的LLM能够在不重新训练的情况下做linear和non-linear regression,甚至有时能超过supervised training的方法(但仅限于很大的LLM)。
Disentangling Latent Shifts of In-Context Learning Through Self-Training (Arxiv Oct 2024) [paper] 针对ICL不稳定的问题,提出为student LLM训练一个adapter用来从teacher LLM那里获取context的知识。【insight】认为之前的vector系列工作只考虑attn head,不够全面。
Learning Task Representations from In-Context Learning (ICML 2024 ICL workshop) [[paper]](Learning Task Representations from In-Context Learning) 提出learnable task vector(LTV),为所有head增加可学习的权重,然后加权组合每一个head的activation来得到每一层function vector。发现其可以增强ICL的长度泛化能力。
Task Diversity Shortens the ICL Plateau (Arxiv Oct 2024) [paper] synthetic setting,在更多的function class上训练可以加快收敛。发现A任务训练到loss正在逃离plateau的checkpoint在B任务上继续训,可以加快B的训练,说明不同任务之间有一些common structure,提供了为什么多任务训练能更快收敛的一个解释。
Many-Shot In-Context Learning (ICML 2024 ICL workshop) [paper] ICL的潜力被few-shot限制了
Out-of-distribution generalization via composition: a lens through induction heads in Transformers (Arxiv Aug 2024) [papaer] 在OOD的copy任务上,发现了OOD性能源于执行不同功能层的composition(并没有测复杂的组合泛化任务)。还发现了induction head和previous token head的各自内部的表示的相似性。
Context-Scaling versus Task-Scaling in In-Context Learning (Arxiv Oct 2024) [paper] 核心发现:kernel smoothing的特征映射是能够进行context scaling的关键
Bayesian scaling laws for in-context learning (Arxiv Oct 2024) [paper] 推导了一种基于贝叶斯的scaling law。在模拟数据集上效果比exponetial scaling law好,在真实LLM和数据集上效果还行。
Learning to grok: Emergence of in-context learning and skill composition in modular arithmetic tasks (NeurIPS 2024) [paper] 探究在modular加法问题上的ICL的OOD能力,并解释了模型组件是如何实现OOD的能力的
Improving In-Context Learning with Small Language Model Ensembles (NeurIPS 2024 Workshop on Adaptive Foundation Models) [paper] 将在下游任务上fine-tune的多个小模型预测的label和confidence与原始label组合到一起,再输给大模型来做ICL,发现可以提升性能
Algorithmic Phases of In-context Learning (ICLR 2025 Ratings 10 8 6 6) [paper] 在一个马尔可夫链上,识别了ICL的四种推理模式:unigram/bigram-inference/retrieval,这几种模式之间的切换可以解释目前的一系列ICL现象,如task diversity threshold, transient nature, task retreival/task learning, early ascent等。
Can In-context Learning Really Generalize to Out-of-distribution Tasks? (ICLR 2025) [paper] 通过一系列实验分析发现了ICL在OOD任务上只能实现从预训练任务中寻找一个最优任务来拟合下游任务。并从理论上论证了ICL的算法选择机制的存在。
How do Transformers perform In-Context Autoregressive Learning? (Arxiv Feb 2024) [paper] 在限定linear attention、diagonal weight matrix等条件下,对于序列预测任务$s_{T+1}=Ws_T$(文章考虑的$W$是酉矩阵和正交矩阵两种情况),从理论上给出了取到全局最优解时,transformer 参数所应满足的性质。
On Mesa-Optimization in Autoregressively Trained Transformers: Emergence and Capability (Arxiv May 2024) [paper] 理论证明了,不同于直接在ICL目标上进行预训练,经过自回归预训练的one-layer linear attention不能在简单如服从高斯分布的序列上实现ICL。
How Do Nonlinear Transformers Learn and Generalize in In-Context Learning? (ICML 2024) [paper] 在进行ICL预训练的情况下,给出了非线性attention的ID和OOD的泛化保证
Why Larger Language Models Do In-context Learning Differently? (ICML 2024) [paper] 本文对于更大的模型更容易在flipped label任务上失败给了理论解释:大模型更容易受到prompt中noise的影响,而小模型只会关注更重要的feature所以不容易受到noise影响,进而使pretrain feature发挥更大的作用。
Dual Operating Modes of In-Context Learning (ICML 2024) [paper] 理论setting:在混合高斯的线性回归上预训练,分析了给定test context时的后验概率,解释了task recognition和task learning:发现context较短时以task recognition(调整后验的混合高斯的各分量的权重)为主。context变长之后以task learning为主。
In-Context Learning with Transformers: Softmax Attention Adapts to Function Lipschitzness (Arxiv May 2024) [paper] softmax能adaptively学一个attention window来实现将context $y_i$ 进行插值作为预测,将分类任务中见到的retrieval机制拓展到了回归任务上。
Towards Better Understanding of In-Context Learning Ability from In-Context Uncertainty Quantification (Arxiv May 2024) [paper] 理论,多头SoftMax attention,任务是估计p(y|x)和Var(y|x),给出了分布内泛化error bound。
An Information-Theoretic Analysis of In-Context Learning (Arxiv Jan 2024) [paper] 在信息论视角下,将ICL泛化误差拆解为多项。
DAPO: An Open-Source LLM Reinforcement Learning System at Scale (Arxiv 2025.03) [paper] 对GRPO的改进
Understanding R1-Zero-Like Training: A Critical Perspective (Arxiv 2025.03) [paper] base model已经有aha moment。由于normalization,GRPO训练会倾向于输出更短的正确回答和更长的错误回答。
【🚀RL】Group-in-Group Policy Optimization for LLM Agent Training (Arxiv 2025.05) [paper] agent领域的文章。setting是每一步和环境交互之后都能立即得到环境给该step的score反馈。方法:在不额外增加GRPO rollout的情况下,合并相同的状态(对于agent领域,状态可能指所位于的网页页面,因此可以通过hash直接很快地合并),并把相同状态的下一步组成一个group进行GRPO训练。group内每个下一步的reward就是它们各自后续的的step-wise环境reward的累加。
【🚀RL】S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models (Arxiv 2025.05) [paper] 主要解决GRPO导致大量无用思考的问题。RL 时每次只生成一条链,然后随机从中间步开始,停止思考,直接给出答案。对于正确的response,退出思考的位置越晚,reward越低,从而鼓励简洁的思考。
【🚀RL】Spurious Rewards: Rethinking Training Signals in RLVR (Arxiv 2025.05) [[paper]](Spurious Rewards: Rethinking Training Signals in RLVR) 核心发现:对于qwen系列模型,使用随机/错误的reward进行RLVR也能带来显著提升;对于其他模型基本不行;原因分析(fig6、7):对于code本身很强的模型如qwen2.5-math,虚假reward能带来推理模式的转变:anguage->code,从而导致性能提升);对于code不行的如qwen2.5,wrong reward会导致language->code,从而带来提升。即,虚假reward能鼓励模型用自己擅长的方式推理从而获得提升。
【🚀RL】Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning (Arxiv 2025.06) [paper] 少量的high-entropy token上训练是获得多样的推理路径的关键,且有不错的scalability。还发现在其余大量的low-entropy token上训会导致性能下降。
【🚀RL】The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning (Arxiv 2025.06) [paper] 发现在RL中,单独抑制错误回复能在pass@k up to 256都超过base,达到或赶超GRPO;而只强化正确回复能提升pass@1,但是pass@k会降低。
【🚀RL】The Hallucination Dilemma: Factuality-Aware Reinforcement Learning for Large Reasoning Models (Arxiv 2025.05) [paper]
【Latent CoT】CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation (Arxiv 2025.05) [paper] 性能堪比正常cot的latent cot,做法是对齐teacher model(正常cot)的"The answer is:"的":"与student(latent)cot的":"的hidden states,而不对latent cot做额外的限制。
【Latent CoT】Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains (Arxiv 2025.06) [paper]
【Understanding】Part I: Tricks or Traps? A Deep Dive into RL for LLM Reasoning (Arxiv 2025.08) [paper] 在Qwen3 4B/8B、base/aligned上验证了batch/group normalization、sequence/token-level loss aggregation、clip-higher等因素在不同组合下对RL训练的dynamic和performance的影响
【Latent CoT】Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space (Arxiv 2025.05) [paper] 提出了一种training-free的soft thinking:用模型预测的next-token概率分布去加权input embedding,作为下一位置的输入(这是针对7B以上模型input embedding layer 和 lm_head的不share weight的问题:说明input embedding和last hidden state不在同一空间,像COCONUT那样直接输入回去会导致输入OOD)。性能可以超过token CoT.
【Latent CoT】LLMs are Single-threaded Reasoners: Demystifying the Working Mechanism of Soft Thinking (Arxiv 2025.08) [paper] 实验上发现soft thinking的性能、模型输出概率分布、logit lens的解码词汇都很像greedy。提出采用Gumbel-softmax,将模型原先的输出概率进行扰动,然后再soft thinking,性能就能超过vanilla cot。
【🔧SFT+🚀RL】On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting 发现SFT时模型的性能变化趋势:性能下降-性能恢复-过拟合。提出了RL和SFT同时进行的策略:1)通过一个总的、慢慢decay的weight从SFT逐步过渡到RL;2)对SFT的loss进行token-wise reweighting:模型预测概率过高和过低的都会降低weight(概率过低的会导致policy shift太严重;概率过高的会限制RL探索)
【Latent CoT】Soft Tokens, Hard Truths (Arxiv 2025.09) 用RL来训Latent thinking,不需要discrete cot监督
【Latent CoT】SIM-CoT: Supervised Implicit Chain-of-Thought (Arxiv 2025.09) 对每个latent token直接加监督:单独将第k个latent作为prefix输入进一个独立的支路(仍然是LLM作为backbone)去预测第k步的CoT文本。
【🔧SFT,实验效果显著】On the Generalization of SFT: a Reinforcement Learning Perspective with Reward Rectification [paper] 将SFT的loss写成RL的形式后,SFT可以视作:当模型输出严格=专家序列时reward才为1(奖励稀疏)、且乘以了 $\frac{1}{\pi_\theta(y^|x)}$ 因子(会导致policy当对专家action给出低概率时,policy grad被放大,作者认为这会导致过拟合)。方法:对每个token的loss乘以 $\pi_\theta(y^t|y^*{t-1},x)$
【🚀RL】Group Sequence Policy Optimization (Arxiv 2025.11) [paper] 提出GSPO:将重要性采样ratio从token-wise计算改为整个sequence的log sum exp,同一序列内所有token使用相同的权重,避免了token-wise的ratio的高方差。
【🚀RL】Soft Adaptive Policy Optimization (Arxiv 2025.11) [paper] 提出SRPO:
【Latent CoT】Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space [paper] 用self-reward作为奖励信号,在测试时通过REINFORCE算法迭代优化生成的latent,取得了相比discrete CoT的显著提升。
【🚀RL, step-wise reward】Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models (NeurIPS 2025)[paper]
【Analysis】On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models (Arxiv 2025.12) [paper] 构建合成任务训练集,探究了不同难度的数据上进行RL的影响。发现:对于OOD任务,仅有ID边缘(能答对部分)进行RL才能获得提升;当基模型没有OOD能力时,RL没用,但混入至少1%的数据时,RL就能提升OOD了;引入过程奖励能提升OOD能力。
**RLAR ** (Arxiv 2025.12) [paper]
【🚀RL, step-wise reward】Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning (Arxiv 2025.10) [paper] 提出SRL,RL rollout时让policy基于专家序列的前k-1步开始,生成下一步k,计算policy生成的第k步与专家第k步的相似度作为reward。
【🚀RL, expert hint】BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning (NeurIPS 2025) [paper] rollout时如果一个group全答错,则插入一段expert hint;插入后再rollout如果全对/全错,则缩短/增长hint。
【🚀RL, on/off-policy mixed】Learning to Reason under Off-Policy Guidance (NeurIPS 2025) [paper] 提出LUFFY,直接把专家序列混入一个rollout group中做GRPO(注意对于这部分专家序列需要把importance ratio改为 r=policy概率/专家模型概率)。问题:会倾向于快速地学习专家序列中的policy的高概率token,而忽略低概率token的学习(这部分token往往是policy不会的重要token)。为此,提出将r套一个reshape函数,增加专家序列中policy低概率token的权重。
【🚀RL, expert hint】Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models (Arxiv 2025.06) [paper] 提出Guide-GRPO,group rollout全错时用hint,hint序列上ratio分母为hint在context中的输出概率,分子是没有hint的。分子和分母都是在有hint时生成的回复上计算概率。
Benchmarking and Understanding Compositional Relational Reasoning of LLMs (AAAI 2025) [paper] 提出了GAR benchmark来测试模型的Compositional Relational Reasoning能力。发现compositional gap随着模型增大而增大。同时发现了Vicunna-33b存在一些共享的circuit能在不同任务中都发挥作用。
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach (Arxiv 2025.02) [paper] 提出一种循环结构来提升reasoning能力:类似RNN,循环结构的每一个循环块都接受原始prompt和上一个状态作为输入;循环越多性能越好。
SoftCoT: Soft Chain-of-Thought for Efficient Reasoning with LLMs (Arxiv 2025.02) [paper] 用一个小网络最后一层的隐层表示接上一个projector得到所谓的soft thoughts,将之与问题文本一同输入,后续让做文本CoT。不用像COCONUT那样fine-tune整个LLM,避免了灾难性遗忘导致的掉点。但是提升也比较有限,有点像一个简单的prompt tuning + CoT。
Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers (ICLR 2025) [paper] 提出了rStar,training-free MCTS,人工定义action space,reward是self-consistency:找另一个SLM,如果它和policy SLM的某一推理步的输出一致,那么就认为这是一个好的step(被喷可能存在consistent but wrong的情况)。性能提升巨大。
rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking (Arxiv 2025.01) [paper] self-evolution训练:每一轮让policy mode和一个本文提出的process preference model(PPM)做MCTS产生高质量推理路径,然后再用它们来训练policy model和PPM。PPM的提出是由于:很难给一个step打一个衡量好坏的分数,由此训练的PRM可能会不准。因此,提出优化正负样本偏好的方法来训练PPM。正负样本选择方法:每一步选出得分最高的action和最低的action,并强制要求它们分别导向正确和错误的答案,来作为正负样本。
【综述】Test-time Computing: from System-1 Thinking to System-2 Thinking [paper] test-time reasoning 综述
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates [paper]
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search (ICLR 2025) [paper] **核心点:**训练模型自动选择最优的推理方案。与rstar有些类似,都是将任务先从更高层次的动作空间进行规划。**方法:**将解决问题的过程分成analysis、solution、verification三个阶段,每个阶段有不同的选择,也可以选择什么都不做。给定问题-答案对,为每个问题按照success rate搜索出最优的推理方案(algo1)。选出最优方案后用gpt4o结合问题给一个对这个推理方案的解释,然后进行SFT,训练LLM预测推理方案、解释和最终答案。
Don’t Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls (Arxiv 2025.03) [paper] 发现tree search中会存在大量语义相近的节点
Better Process Supervision with Bi-directional Rewarding Signals (Arxiv 2025.03) [paper] 发现PRM在靠后的step上不准,基于terminal的MC估计在靠前的step上不准。因此设计了一个双头PRM:一个头的监督信号为从开始到第t步的推理正确与否(通过一个大模型标注得到);另一个头的监督信号是MC估计得到的。两个头分别在这两个目标上和LLM backbone一起训。
Entropy-based Exploration Conduction for Multi-step Reasoning (Arxiv 2025.03) [paper] 某一步的不确定性大,则代表问题有更多可能的解,值得进一步探索。反之则说明探索路径应该更确定。方法:计算每个推理步(一个句子)的沿着所有token的熵,以及每个token沿着词汇表的熵在整个句子的方差,根据这两个指标来决定对于某一推理步,接下来是deepen、expand还是stop。
From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models (Arxiv 2025.03) [paper] 参考o1的推理特征,定义macro-action:分析前提条件和问题/进行推理(假设生成和验证)/终止,让模型自己选这些macro-action。同时设计了一个让一个check对多种细粒度的错误类型进行分别检测。
【benchmark】Prmbench: A fine-grained and challenging benchmark for process-level reward models [paper] 将PRM对于reasoning step的评价能力划分为:评价推理过程是否冗余、推理过程是否错误、鲁棒性(是否能察觉到关键前提的丢失、陈述中的陷阱、对于多个正确的解答能否保持评价一致)。
Inference-Time Scaling for Generalist Reward Modeling [paper] 针对所有领域而不是单一领域训练scalable的reward model。方法为GRM (Generate Reward Modeling)通过大量采样critique并以此生成reward score,来实现reward model的test-time scaling。
Heimdall: test-time scaling on the generative verification (Arxiv 2025.04) [paper] 生成式的RM,用PPO训练。
Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning (Arxiv 2025.04) [paper] 完全不依赖任何RM和监督信号,只靠问题进行自监督训练。某一步的奖励信号为从该步开始的剩余步的mean log prob。
Step-by-Step Reasoning for Math Problems via Twisted Sequential Monte Carlo (ICLR 2025) [paper] 方法:如何推理:在每个推理步t,让policy model产生N个下一步。利用训练好的value function给N个步打分,然后根据打分重新sample该步(line 18),之后到t+1,再让policy model在经过resample的第t步的基础上再生成下一步;如何训练value function(一个network):loss function的优化目标为减小value function估计的分布和ground-truth分布之间的KL散度,其实让value function对于不同solution的某一步的打分接近outcome reward(每一步的监督信号相同,都是拟合outcome reward)
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (Arxiv April 2024) 提出GRPO (Group Relative Policy Optimization)
Scaling LLM Test-time Compute Optimally can be More Effective than Scaling Model Parameters [paper] 研究了两种scaling test-time compute的策略:1)基于verifier(process reward model)的;2)基于模型的self-revision的。发现了根据具体任务(不同难度)来选择最优scaling策略能在达到相同性能时相比best-of-N降低四倍计算量
Training Large Language Model to Reason in a Continuous Latent Space (COCONUT Arxiv Dec 2024, ICLR 2025 被拒,主要是因为相比于普通CoT会在GSM8K上掉点) [paper] 将reasoning step的某些中间步从word embedding 替换为该token的last hidden state。
Beyond Examples: High-level Automated Reasoning Paradigm in In-Context Learning via MCTS (Arxiv 2024.11) [paper] 用了rStar的self-consistent reward和人工定义的action space,但是加入了thought card的技术。性能和rstar差不多,但是计算代价小了很多,因为测试时不用MCTS了,只需要从seed dataset中找出card即可。
ReST-MCTS: LLM Self-Training via Process Reward Guided Tree Search* (NeurIPS 2024) [paper] 同时训练policy model和一个process reward model(一个LLM-based打分模型)。第k个推理步的process reward $v_k$的监督信号为:1)如果该步距离最终答案越近,$v_k$越大;2)如果最终答案是错的,$v_k$为0. 在用MCTS生成推理路径的过程中,也使用value model的打分指导生成,每次只探索得分最高的路径。也就是说,MCTS路径生成和模型训练是交替迭代进行的。
MCTS的过程为(原文algo2),以下过程重复T次:
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning (Arxiv 2024.05) [paper] 思想:让模型基于已有的推理链的中间步进行后续推理,降低搜索到正确答案的难度。做法:从T-1开始选择起始步进行policy gradien的计算,逐渐将起始步往前推,慢慢增大学习难度。
Calibrating Reasoning in Language Models with Internal Consistency (NeurIPS 2024) [paper] 发现模型在给出错误回答时中间各层的预测一致性较低
V-STaR: Training Verifiers for Self-Taught Reasoners (COLM 2024) [paper] 用模型生成的正确和错误回答通过DPO训练一个verifier,测试时用这个verifier来给不同回答打分
Mindstar: Enhancing math reasoning in pre-trained llms at inference time (Arxiv 2024.05) [paper] PRM+tree search。LLM as PRM, PRM的输入为当前所有推理步和下一推理步。
LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning (Arxiv 2024.11) [paper] MCTS+pair-wise preference reward model (PPRM)。一个节点是一个完整的解决方案(而不是一个推理步)。先利用现有的preference数据集(PRM800K等)训练一个PPRM(一个2B LLM),能够对两个solution输出偏好。每个节点的打分方式:局部得分(反映某节点与孩子节点的win rate)和全局得分(反映某节点在所有node里的排名)的加权平均。
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models (Arxiv2024.02) [paper] consistency的计算方法是TF (Term Frequency) - IDF (Inverse Document Frequency) vector,一种基于词频统计的文档相似度计算方法(只能反映词频上的相似度,反应不了语义相似度)
Universal Self-Consistency for Large Language Models (ICML 2024 ICL workshop) [paper] 针对self-consistency难以提取答案的问题,prompt一个gpt-3.5来从一系列回答中选取最consistent的那一个。
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing (Arxiv 2026.04)[paper] 正确样本做GRPO,错误样本做OPD。
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe (Arxiv 2026.04) [paper] OPD成功的两个前提条件:①学生与教师必须共享兼容的思维模式。②教师必须提供学生训练期间未见过的新知识,高分不等于新知识。③OPD会让student和teacher的高概率token趋于一致。优化策略:①让学生先在teacher rollout上SFT;②prompt用teacher训练时见过的格式
Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why (Arxiv 2026.05) [paper] 核心motivation:teacher在不同token上的引导作用不一样,有些只是stylistic,有些才是有利于正确推理的关键引导;从增加student回答正确的概率这一角度分析,teacher的引导可能有利/中性/有害(其实就是看teacher gradient和ideal gradient的夹角)
takeaways: ①比较稳定成立的结论:OPD主要在错误轨迹上发挥作用(与ideal gradient一致);②更强的student更适合用强teacher、summary for self-distillation;弱student更适合self-generated full correct solution + self-distillation。但这一结论并不稳定,会随数据集和模型变化。
EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation (Arxiv 2026.05) [paper] 为了解决OSPD采样不出好轨迹的问题,提出让student在50%的情况下基于privileged context采样;为了解决privileged context不是对全部token都有引导作用的问题,提出只在见到privileged context后概率增加足够大的token上做OSPD(此时student的context里还是没有privilege,只是在privilege-available的情况下采样出的轨迹上更新)。
On-Policy Distillation: Promise, Pitfalls, and Prospects (2026.06) [blog] 总结了OPD的几个问题和解决办法。问题包括:①teacher的局部监督失效(比如teacher可能既想把学生拉回teacher分布,又想continue student分布,这种混合导致监督信号不准) ②随着训练进行,student轨迹逐渐跑到了teacher熟悉的分布之外,导致监督失效 ③学生轨迹前半段有误时,OPD最多只能告诉学生后半段得重新生成,但是修正后的后半段由于没有真的生成,所以没法在后半段上提供信号
Trajectory-Refined Distillation (Arxiv 2026.06) [paper]
LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations (ICLR 2025 Ratings:8666) [paper] 用一个线性probe来根据模型中间层表示判断模型输出的正确与否。然后让LLM对同一个问题生成多个答案,并用该分类器筛选出正确概率最高的答案,发现能相比原本的答案正确率更高。
Insights into LLM Long-Context Failures: When Transformers Know but Don't Tell (EMNLP 2024 Findings) [paper] 用一个线性probe来根据模型中间层表示来直接预测问题的答案。发现probe acc比直接生成的acc好。
Does Representation Matter? Exploring Intermediate Layers in Large Language Models (NeurIPS 2024 workshop) [paper] LLM的中间层下游性能比最后一层好。探究了Prompt Entropy、Curvature等representation quality的指标和下游acc的关系。
Model Editing with Canonical Examples [paper] 提出了一个新任务:让模型学习几个特定的文本例子,以实现某些纠正,同时还不能让模型改变很多。
Evaluating Large Language Models at Evaluating Instruction Following [paper] (ICLR 2024)
Not all Layers of LLMs are Necessary during Inference (Arxiv April 2024) 训练一个对LLM中间层feature的分类器判断是否应该早停来获取早停层数,来加速LLM推理。还发现中间层预测的top prob和top prob-second top prob在各个任务上都呈现出随着层数加深而增加并逐渐稳定的趋势(但在不同任务上层数不一样)。[paper]
Demonstrating Mutual Reinforcement Effect through Information Flow (Arxiv March 2024) [paper] 研究了同时进行word分类和text分类的MRE(Mutual Reinforcement Effect)任务,也观察到了anchor那篇中的三种attention activation随layer的分布趋势。
A Theoretical Understanding of Self-Correction through In-context Alignment (Arxiv May 2024) [paper] 理论分析transformer中的各个模块在self-correction中发挥的作用
Mechanics of Next Token Prediction with Self-Attention (AISTATS 2024) [paper] 构造了一个graph来描述next token prediction任务,在简化setting下理论分析出last token更倾向于给更经常作为label的token分配更高的attention。
The pitfalls of next-token prediction (Arxiv April 2024) [paper] 指出了自回归模型的缺陷:错误滚雪球效应和在一个单一token路径上只能学出一个类似induction head的shortcut模型
A Law of Next-Token Prediction in Large Language Models (Arxiv Aug 2024) [paper]
SEMIEVOL: Semi-supervised Fine-tuning for LLM Adaptation (Arxiv Oct 2024) [paper] 提出了半监督fine-tuning框架SEMIEVOL。
LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS 将对模型权重矩阵的更新限制为低秩矩阵乘积$BA$的形式,极大减少了pre-trained model迁移到新任务的代价(不用fine-tune所有参数) [paper]
Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text (Arxiv 2026.01) [paper] 美团提出了一套从互联网原始文本合成多轮工具调用序列并定义工具的框架:
**粗筛:**从原始文本筛选出带有多步操作的;
**提取:**模型从中提取工作流和工具定义;
**序列合成:**用一个strong teacher(GLM4.6)基于工作流和工具来合成序列,每条序列为 $[s, (u_t,a_t,o_t)]$ ,$s$ 为sys prompt、 $u_t$ 为user query、 $a_t$ 为模型action、 $o_t$ 为observation
**提高序列复杂度 (见A.4): ** 通过让teacher做refinement实现。增加sys prompt中的限制条件、提高用户要求的模糊度和复杂性、提高assistant回复质量、提高环境复杂度等 。ablation显示这部分提升显著
A Subgoal-driven Framework for Improving Long-Horizon LLM Agents (Arxiv 2026.03) [paper] google的工程文章,提出MiRA-RL,针对web agent,核心技术点:
Revisiting DAgger in the Era of LLM-Agents (Arxiv 2026.05) [paper] 为了解决SFT的off policy、RLVR的sparse reward、OPD在long-horizon失效且没法提升采样成功率问题,提出让student和teacher交替产生轨迹,并逐步减少teacher占比,最后再这样的轨迹上做SFT。能在很难的SWE任务上超越GRPO、SFT、OPD
Milestone-Guided Policy Learning for Long-Horizon Language Agents (ICML 2026) [[paper]](Milestone-Guided Policy Learning for Long-Horizon Language Agents) 过程奖励:先基于规则把轨迹切分成K+1个片段(K个milestone)。然后对于属于片段k的token t,计算advantage的group为所有达到了milestone k的轨迹的第k个片段。过程reward r_t计算方法为:只要其所属的片段小于K_i(其所在轨迹达到的最后一个milestone以前)就给分(这个给分方式还是略显简单粗暴,因为不知道milestone是不是好的milestone)。
Deep Research as Rubric for Reinforcement Learning (Arxiv 2026.05) [paper] [zhihu] 针对每个问题通过deep research的方式生成高质量rubric(通过GPT5或者policy自己)。RL时ruburic给分原则:每条rubric给一部分分,全满足时reward为1。效果很好。
Memory-R2: Fair Credit Assignment for Long-Horizon Memory-Augmented LLM Agents [paper] GRPO不合适解决设计memory bank增删的场景:不同轨迹所处的memory bank状态不同,直接比较无法判断是动作不好还是memory bank不同导致的问题。做法:global reward+local reward,local reward是从同一个记忆状态出发采样不同的操作组成group算优势
Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It (Arxiv 2026.06) [paper] 做实验比较了tool-use场景RL一些trick的效果,发现如下:
The Verification Horizon: No Silver Bullet for Coding Agent Rewards (Arxiv 2026.06) [paper] qwen team,真实世界的复杂任务中agent轨迹很长且很难被准确验证做的好不好,团队更准确地何验证和奖励做了广泛的实验分析,针对不同场景,特别是现实世界中的长程复杂任务,提出了不同的奖励策略:
通用软件工程任务:SWE类,之前一般是看测试样例过不过来给奖励
前端开发任务:用LLM充当裁判存在只偏爱视觉好看而忽视功能完整性、偏好很长的代码等问题
真实世界任务:LLM将人类反馈标注为正面、中立和负面,然后用span KTO优化:正面拉进,负面推远
超长周期代码任务:agent as judge,拆需求、逐项测试、给综合打分。裁判的常见问题包括不爱写测试、只关注局部和细节、帮着改代码等。此外,规则太复杂也会导致裁判性能下降。
未来研究方向:①bug修复任务,同样是修好,也有质量差别,怎么评价;②在线用户反馈(目前大多是从历史对话里抽用户反馈,相当于离线数据);③前端任务对齐人类感受;④verifier必须和policy协同进化
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent (Arxiv 2026.06) [paper] 数据合成:self-play机制:所有domain的数据构建都可以抽象成如下的过程。从初始图出发,一个proposer随机采样图上的一条轨迹并提出一个问题,一个solver去解答,然后一个verifier去检查答案、证据、轨迹。verifier检查通过(维度包括问题可验证、答案正确、问题足够non-trivial等)轨迹会重新插入graph(包含了solver在这个过程中的一系列新操作),检查失败的则重新进行self-play。训练:SFT+GRPO训domain专家(search、science、instruction following、general tool call)。student先做所有domain的SFT,然后用专家做OPD。
53 commits
本仓库记录关于LLM (large language models)和Multimodal LLM的文章。看过的文章会至少用一句话概括内容,有些还会有notes。只有标题的就是还没看过的,只是先存档到这里。
有关OOD generalization的paper list请移步(OOD list 已停止维护):link
⭐ 表示文章较多;🔥表示当前主要关注并更新
1.Mind with Eyes: from Language Reasoning to Multimodal Reasoning [paper] 多模态推理综述
Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination (Arxiv Nov 2024) [paper] 对于VQA任务,提出thinking-before-looking范式,先利用一个LLM根据文本问题生成一堆更细致的问题,然后将这些问题和图片一起输给MLLM让其生成推理步骤。最终将原始问题、图片、推理步骤一起输给MLLM让其生成答案。
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models (NeurIPS 2024) [paper] 让模型生成代码来调用工具根据现有的视觉输入产生新的视觉图像来作为推理的辅助,可以提升在各种视觉相关任务上的能力。
Task Navigator: Decomposing Complex Tasks for Multimodal Large Language Models (CVPR 2024) [paper] 工程文章,借助LLM根据历史子问题和模型回答,迭代产生多个子问题,提升MLLM完成复杂视觉理解任务的能力。提出了VersaChallenge benchmark,包括常识推理、物理关系推理、未来预测等。
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities (CVPR 2024) [paper] 构建数据集,训了一个spatial-VLM用以解决空间任务
【📊dataset】SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models (NeurIPS 2024) [paper] 构建空间位置关系数据集,添加了一个深度图->语言模块,来增强几何推理
Multimodal Chain-of-Thought Reasoning in Language Models (TMLR 2024) [paper] 两阶段训练,第一阶段接受文本和视觉的融合特征输出一个rationale(推理过程的文本描述),第二阶段将生成的rationale和原始文本结合,再与视觉特征融合重新输入模型产生预测。
Thinking Before Looking: Improving Multimodal LLM Reasoning via Mitigating Visual Hallucination (Arxiv Nov 2024) [paper] 对于VQA任务,提出thinking-before-looking范式,先利用一个LLM根据文本问题生成一堆更细致的问题,然后将这些问题和图片一起输给MLLM让其生成推理步骤。最终将原始问题、图片、推理步骤一起输给MLLM让其生成答案。
Link-Context Learning for Multimodal LLMs (CVPR 2024) [paper] 提出一种新的fine-tune MLLM的方法:让context和query具有一定的causal联系,发现能提升模型通过context学习新概念的能力
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models (NeurIPS 2024) [paper] 先构建一个优质的ICL数据集,然后将该数据集中的image-text对视作token,用CLIP抽取特征作为token embedding,训练一个很小的Transformer(lever-LM)来在该数据集上进行next-token prediction(序列是从query到context这样倒着来的)。测试时,最后给定测试样本,拿lever-LM从该预先挑选好的数据集中预测后续的example来构成context。
Natural Language Inference Improves Compositionality in Vision-Language Models (ICLR 2025 Ratings 8866) [paper] prompt工程。任务是判断caption和图片相不相符。做法是让LLM生成与原始caption相符、不相符的yes or no问题,然后根据VLM在相符/不相符/原始问题上的logit来做出最终判断。
Interleaved-Modal Chain-of-Thought (Arxiv 2024.11) [paper] 在每一个reasoning step选出attention最高的visual tokens,保持原图的顺序插入到视觉和文本输入之后、文本rationale开始之前的位置,之后再据此生成rationale。按此方法迭代生成多个reasoning step,然后再在其后生成最终答案。
Progressive Multimodal Reasoning via Active Retrieval (Arxiv 2024.12) [[paper]](Progressive Multimodal Reasoning via Active Retrieval) 提出了一个从外部知识库中根据当前推理步搜索相关知识,并通过MCTS来构建CoT的框架,并提出了在生成的CoT数据上进行PRM的方法。推理时根据PRM的打分,选取得分topk高的推理路径。
Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search (Arxiv 2024.12) [[paper]](Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search) [code] 用MCTS构建CoT,其中每一步打分利用多个模型;同时构建反思链,做法是构建一个“低得分节点-反思prompt-高得分节点”的思维链。然后用生成的总共260K数据进行fine-tune。
Perception Tokens Enhance Visual Reasoning in Multimodal Language Models (Arxiv 2024.12) [paper] 针对相对深度估计问题或计数问题,将深度图或bounding box转换为MLLM能处理的token来提供更精细的视觉信息,并加入到CoT中,来fine-tune MLLM。
MR-MLLM: Mutual Reinforcement of Multimodal Comprehension and Vision Perception (Arxiv 2024.06) [paper]
【📊dataset】Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning (NeurIPS 2024 DB track) [paper] 造了一个数据集Visual CoT,包含推理关键视觉区域的bounding box的坐标。提出的方法:训练MLLM在推理时输出bounding box。
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM (MM 2024) [paper] 纯prompt engineering文章。为了增强perception,提示MLLM根据问题找出具体该看什么图片细节,然后问一个MLLM让它专门去看,最后再综合它的输出来做最终回答
Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks (Arxiv 2024.10) [paper] 给MLLM提供Self-correction Prompt,然后选出改对的和改错的样本分别作为正负样本进行DPO。
Beyond Embeddings: The Promise of Visual Table in Visual Reasoning (EMNLP 2024) [paper] 训练一个visual table generator,来产生对图片的详细描述。训练generator的方法:prompt GPT4V来生成visual table。总共从COCO找了61K数据。三阶段训练:1)caption数据上训练connector 2)在GPT生成的instruction tunning数据集上训练connector和LLM 3)在vis table数据上训练LLM。
From the Least to the Most: Building a Plug-and-Play Visual Reasoner via Data Synthesis (EMNLP 2024) [paper] 先用grounding DINO检测图中物体获得一系列节点(单物体/多物体/整张图),让GPT4根据这些节点反推每一步回答什么样的子问题、怎样调用工具,才能从前一步的图片节点得到下一步的图片节点。最后让GPT4把子图、GPT4生成的子问题和工具调用参数合成一个推理链。让gpt4生成10k这样的数据用来训练llama3-8b做提提问题和合成的任务。之后让这个sft之后的llama3-8b生成50k推理链,用来sft一个llava-1.5-7b作为reasoner,其具备提出子问题和调用工具的能力。
【🔍Survey】Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers (Arxiv 2025.06) [paper]
【📚Dataset】Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning (Arxiv 2025.07) [paper]
【💡Understanding】Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought (Arxiv 2025.05) [paper] 理解不同类型的visual thought(pure-text、edited-image、generated-image等)的性能、适用场景、内在机制
【🔍Survey】Explain Before You Answer: A Survey on Compositional Visual Reasoning (Arxiv 2025.08) [paper]
【⚖Benchmark】TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning [paper] 构建了一些强烈依赖于工具调用才能做对的任务。一些takeaway:1)在一些复杂任务(比如给出拼图顺序,fig 5)上,单纯的perception(o3展现出的”understanding the images as a whole”)没用,必须得借助code。2)在rotationOCR任务上,单纯增加text-based COT的数据进行SFT几乎没有提升
【💡Understanding】Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization [paper] insight:(至少在迷宫、Vstar、HRBench上)SFT时学习使用crop工具并不是泛化最好的推理模式。TWI SFT可能导致过拟合。
L-CoT (纯文本cot), G-CoT (输出bbox文字的cot,但不重新插入图片), V-CoT (插入crop图片的cot)SFT后的RL性能上限接近(RL训练了1000步,远大于大部分文章的setting),只是收敛速度上V-CoT>G-CoT>L-CoT;
②“最小”CoT上做SFT,再RL,泛化能力最强(迷宫size泛化、Vstar → Vstar/HRBench),显著优于V-CoT+RL。“最小“CoT是指只包含答案的cot。
【🔧SFT】CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning (ICLR 2025) [paper] 让GPT4生成针对多模态问题的工具调用链,然后将其转为多轮的VQA链,每轮包含子图片、子问题和答案,用这些数据对MLLM做SFT
【🔧SFT+🚀RL】Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning (Arxiv 2025.05) [paper] 两阶段训练,第一阶段通过SFT让MLLM初步具备输出bounding box的能力(训练数据构建:自带visual cues的数据集,或者是gpt4o生成);第二阶段curiosity-driven RL,强制模型用bounding box辅助推理的比例不能低于某个阈值
【🔧SFT】Don't Look Only Once: Towards Multimodal Interactive Reasoning with Selective Visual Revisitation (Arxiv 2025.05) [paper] 训一个linear head,输出input token positions的概率分布。最终输出的logit包含原始词汇空间和图片的position空间。训练数据构建方法:取QvQ的文本推理链,用Gemini提取视觉query,输给Qwen用relative attn机制(ICLR25那篇)获取bounding box
【🔧SFT+🚀RL】Chain-of-Focus: Adaptive Visual Search and Zooming for Multimodal Reasoning via RL (Arxiv 2025.05) [paper] SFT+RL两阶段训练。SFT数据构造过程:让gpt4.1生成问题和回答,回答正确性由qwen-vl-72b校对;让qwen-vl-72b判断问题是否可以回答还是需要更高的分辨率(zoom-in);gpt4.1作为agent,调用detection、bbox adjusting、mm understanding等工具完成问题(工具其实就是qwen-vl-max),中间依靠ds-v3作为verifier进行反馈。
【🔧SFT】Thinking with Generated Images (Arxiv 2025.05) [paper] 主要目标是更好地生成。构建SFT数据:包含反思和设定中间目标。
【🚀RL】Visual Planning: Let's Think Only with Images (Arxiv 2025.05) [paper] 主要解决grid-based navigation问题。纯视觉CoT.
【🚀RL】GRIT: Teaching MLLMs to Think with Images (Arxiv 2025.05) [paper] 不需要SFT或bbox标注。只需要20个训练数据。reward包括:1)format:包括think、bbox(有bbox就给分)、rethink;2)counting:bbox数量和gt数量一致就给分;3)acc:gpt-4o + BELU-1相似度给分;当输出了bbox,并不需要把crop下来的小图作为新的image输入,而是直接让模型依据bounding box进行推理(后续实验发现输出bbox能提升对image的attention)
【🔧SFT+🚀RL】Grounded Reinforcement Learning for Visual Reasoning (Arxiv 2025.05) [paper] 方法:1)构建SFT data:用qwen2.5-VL-72B做MCTS,要求每一步都输出grounding的坐标,选出答案正确的路径和corrected路径用于SFT;2)SFT+RL,RL reward中包含format reward,要求按照think-tool call-observation-answer的顺序输出
ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding (ICML 2025) [paper]
【🔧SFT+🚀RL】MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning (Arxiv 2025.06) [paper] 亮点:interleaved CoT当中的visual cues是token,而不是bbox,这样crop比较灵活。数据:构建了一个数学数据集(需要借助gpt4o),每一步有token-level的图像区域标注;训练:text-sft,interleaved-sft,interleaved-RL
【❄Training-free】PyVision: Agentic Vision with Dynamic Tooling (Arxiv 2025.07) [paper] prompt engineering,让advanced closed-source MLLM获得“合成新工具”的能力
【🔧SFT+🚀RL】Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens (Arxiv 2025.07) [paper] 让模型生成latent token辅助推理。两阶段SFT+RL。SFT阶段一对齐MLLM生成的latent和gt helper image;SFT阶段二将生成的latent作为input,进行SFT。RL为GRPO,loss只加在text上(因为生成的latent
【🔧SFT+🚀RL】OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning (Arxiv 2025.08) [paper] 合成了工具调用的CoT。SFT+GRPO。
【🚀RL】Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback (Arxiv 2025.07) [paper] 应用场景很局限,解决的是image-to-code任务(从chart或webpage生成图片)。提了一个仅需要图片数据的RL框架:让模型调用工具渲染图片,然后比较渲染出来的图片和原始图片的相似度作为reward。
【🔧SFT+🚀RL】Thyme: Think Beyond Images (Arxiv 2025.08) [paper] SFT+RL训练模型生成code来操作图片进行推理的能力。构建了SFT和RL数据集。提出了一种dynamic temperature的策略:生成代码时temperature=0,生成文本推理时temperature=1.0
**【🔧SFT+🚀RL】Reinforced Visual Perception with Tools ** (Arxiv 2025.09) [paper]
【🔧SFT+🚀RL】Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search (Arxiv 2025.09) [paper] 构建了一个多轮visual search的SFT数据集。针对RL rollout时回复过长导致超出context从而无法判断对错的问题,提出将这部分回复mask掉,不计算reward。
【🔧SFT+🚀RL】DeepeyesV2: Toward Agentic Multimodal Model (Arxiv 2025.11) [paper] 比较接近真正agent MLLM的形态,能产生code调用工具并联网搜索。
【🔧SFT+🚀RL】V-Thinker: Interactive Thinking with Images [paper] (Arxiv 2025.11) 生成code编辑图片。设计了一种数据生成策略,借助GPT5,从一个知识集和和一个工具集和出发,让GPT5生成问题以及cot的同时不断对它们进行扩充。cot中包含代码以及渲染出的图片(V-Interaction-400K)。perception SFT + cold start SFT + GRPO RL。
【🔧SFT】DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning (Arxiv 2025.09, ICLR26 withdrawn) [paper] 给MLLM加了一个image embedding editing模块,输入为原始图片emb和模型自己生成的action embedding,输出为编辑后的图片(但是没给可视化)。监督信号为code渲染出的中间步图片。还构建了一个用code渲染图片的cot数据集。
【🔧SFT】Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch (Arxiv 2025.12) [paper] 能think with images和web search的agent MLLM。数据构建流程是关键。纯SFT训练。
【🔧SFT+🚀RL】Thinking with Programming Vision: Towards a Unified View for Thinking with Images (Arxiv 2025.12) [paper] 在构造数据时,通过对原图做增强扰动来保证工具调用的必要性。RL时候通过给问题预先标注好标准工具的元数据,实现了dense reward:奖励使用预先定义的工具、crop的IoU、以及对使用超出定义的有用工具的奖励。同时还使用了多种惩罚reward以避免reward hacking等行为。
【🚀RL】Thinking with Images via Self-Calling Agent (Arxiv 2025.12) [paper]
【🚀RL】Figure It Out: Improve the Frontier of Reasoning with Active Visual Thinking [paper] 提出FIGR。RL中用了一个adaptive reward:当问题依赖辅助图片时用了工具做对给1.0,不依赖时用了工具给0.2,否则0。测的是纯文本数学任务(AIME、AMC)等。让qwen3-vl-32b用code渲染图像,能超过qwen3-32b-thinking。
【🔧SFT+🚀RL】SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning (Arxiv 2025.12) [paper]
CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning (Arxiv 2025.12) [paper] SFT数据:简单样本鼓励直接输出答案;RL reward设计:鼓励在动态选出的难样本上用tool,否则不鼓励tool;惩罚code执行失败
HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling (Arxiv 2025.10) [paper]
CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization (CVPR 2026 Oral) [paper] 也发现了DeepEyes、PixelReasoner等模型会依赖错误的工具调用得高分。提出了过程监督RL,来解决工具调用的faithfulness的问题:用qwen2.5-VL-32B做judge,给出原始问题和工具返回结果,让judge回答“does this piece of evidence help with this question?”。一些insight:
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm (Arxiv 2025.11) [paper] 发现在视觉中心任务上,视频生成模型(sora2)性能逼近顶尖闭源vlm(gpt5、gemini2.5pro等)。但在文本中心任务上性能差距较大。可以通过Self-consistency和ICL来提升sora做推理任务的能力。
- Video models are zero-shot learners and reasoners - Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm - Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark - TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models - Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks - MMGR: Multi-Modal Generative Reasoning - RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence - V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models - Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning
Explore Spurious Correlations at the Concept Level in Language Models for Text Classification (Arxiv Jan 2024) [paper] 发现了LLM在文本分类中会依赖的concept-label spurious correlation,提出使用ChatGPT来扩充数据来消除虚假关联。
Positional Information Matters for Invariant In-Context Learning: A Case Study of Simple Function Classes (ongoing work) [[paper]](Positional Information Matters for Invariant In-Context Learning: A Case Study of Simple Function Classes) 发现模型对于demonstration的permutation invariance或许是ICL OOD的关键。提出使用相同的positional encoding来提升ICL OOD性能。
Simple synthetic data reduces sycophancy in large language models (Arxiv Feb 2024) [paper] LLMs会迎合提问者的观点而罔顾事实。提出合成一些用户的观点和正确性无关的新prompt,然后在这些数据上fine-tune来解决sycophancy问题。
Understanding In-Context Learning in Transformers and LLMs by Learning to Learn Discrete Functions (ICLR 2024 Oral) [paper] 探究transformer在一系列离散任务上的能力。特别地,发现经过预训练的模型相比随机初始化的模型获得了更强的最近邻、disjunction和conjunction的能力。
Batch-ICL: Effective, Efficient, and Order-Agnostic In-Context Learning (Arxiv Jan 2024) 发现使用batch ICL,将N个example设置为N个one-shot inference,再把每个inference得到的token做平均,替换到query sample做aggregation最终再预测能带来提升。一个奇特的发现是做aggregation时从某一层往后做性能会突增,在那之前性能接近零。对此解释是transformer的低层是在学语义信息。
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models (Arxiv Feb 2024) [paper] 评估模型的改变它们的原始输出并遵循和一开始相违背的指令的能力。主要观察:1)大部分模型都会倾向于遵守它们的预训练知识 2)模型很难根据人类后续的反馈泛化到新的问题 3)所有模型都会逐步忘记人类反馈并落回到它们的内部知识里 4)模型是不是第一时间遵守了人类的反馈,对于后续的行为起到关键作用
Function Vectors in Large Language Models (ICLR 2024) [paper] 发现context prompt的最后一个token的隐层表示encode了这个任务的信息,称为function vector(FV)。将其加到zero-shot的prompt上,发现有显著提升。5
A Data Generation Perspective to the Mechanism of In-Context Learning (Arxiv Feb 2024) [paper] 有关task recognition和task learning的综述
Identifying and Analyzing Task-Encoding Tokens in Large Language Models (Arxiv Feb 2024) [paper] 探究了context中的template词("data:","answer:")/stopword(标点、连词等无意义词)/content对performance的意义。结果发现template词对ICL性能提升最有用,content反而没什么用;还探究了template词的什么特征使得它有别于context中的其他成分,结果发现template词本身的语义、其重复性、其分隔x和y的格式作用这三者都对ICL性能有显著的作用。
Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language Models (Arxiv Feb 2024) [paper] 发现,问题中的错误前提而导致的回答中的幻觉是由于模型中特定的head的激活所引起的。提出了一种强行消除这些head对于问题中的错误前提对应的token的attention的方法。
In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space Steering (Arxiv Feb 2024) [paper] 提出用context的第L层表示构造一个表征任务信息的vector(ICV),然后再加到query时的第L层所有token的表示上。
The mechanistic basis of data dependence and abrupt learning in an in-context classification task (ICLR 2024 Oral) [paper] 有关transformer 的IWL(in-weights learning)和ICL学习过程的实验性分析。在一个两层toy transformer中揭示了induction head学习机制。
Understanding In-context Learning From Repetitions (ICLR 2024) [paper] 揭示了context中重复出现的pattern会导致模型更倾向于输出这个pattern的现象。
In-context Learning Learns Label Relationships but is not Conventional Learning (ICLR 2024) [paper] 以更大的模型和更长的context重新审视以往的ICL讨论,并得出了以下三个结论:1)ICL会学x-y映射,正确的label是有用的,且模型越大这一效应越明显 2)ICL能学预训练时没见过的新任务 3)即使context很长,ICL也不能彻底覆盖预训练获得的preference 4)LLM更关注更靠近query的example
How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric Learning (Arxiv Feb 2024) [paper] 在简单的word classification任务上,首先按照类似Function Vector的做法,提取出对输出正确预测贡献最大的head。然后分析这些head并发现了如下机制:label的V encode了label的特征,label的K encode了demonstration的特征;last token的Q encode了query的特征;last token query和正确label的K的attention score比其他head的显著大;last token Q与在context中出现更多的label/更靠近query的label的K的attention score更大。
Locating Factual Knowledge in Large Language Models: Exploring the Residual Stream and Analyzing Subvalues in Vocabulary Space (Arxiv Jan 2024) [paper] 提出了一种定位transformer中对输出某一label贡献最大的attention或FFN layer(或其subvalue)的方法。
In-Context Learning State Vector with Inner and Momentum Optimization (NeurIPS 2024) [paper] 提了一种新的用vector压缩信息的技术(State Vector SV):是将前L层的每层的attention输出concat起来。然后提了三种技术(aggregate每一个example的SV、用momentum、分组提取SV再聚合)来进一步优化SV,取得了一些性能提升。
GNNavi: Navigating the Information Flow in Large Language Models by Graph Neural Network (Arxiv Feb 2024) [paper] 提出将GNN插在LLM的某一层后面,强行使得information flow(token representation就是node representation)是从x->y和y->:连边,然后得到的node representation输给LLM的下一层(每个token的都保留着,因为GNN的输出也是所有node的输出)。最后只在ICL数据集上微调GNN,能够实现和lora媲美的速度和更好的acc。
Decomposing Label Space, Format and Discrimination: Rethinking How LLMs Respond and Solve Tasks via In-Context Learning (Arxiv April 2024) [paper] 将ICL能力分成1)正则化输出的label space、2)正则化输出的label format,和3)提升label space/format分布内的判别能力三个方面。结论:ICL的能力主要来自前两者。同时也在实验上间接证明了ICL会倾向于预测出context和test更像的样本的label。
The Evolution of Statistical Induction Heads: In-Context Learning Markov Chains (Arxiv Feb 2024) [paper] 在预测Markov序列任务上,揭示了存在一个学习出从简单到复杂function的过程(uniform -> unigram -> bigrams (optimal))。此外,也验证了类似retrieval(n-gram),即找最相似的context token然后取它后面的token作为预测的机制
In-Context Language Learning: Architectures and Algorithms (Arxiv Jan 2024) [paper] 构造了一个模拟的language token ICL任务,给了一系列实验证据说明transformer实现了和n-gram类似的retrieval过程
Trusting Your Evidence: Hallucinate Less with Context-aware Decoding (Arxiv May 2024) [paper] 为了增强对context的关注能力,提出在推理时加权以context为条件的预测和不含context的预测:$y=\text{softmax}((1+\alpha) p_\theta(y|c,x)-\alpha p_\theta(y|x))$ 。背后的理论基础是朴素贝叶斯 [blog]
How In-Context Learning Emerges from Training on Unstructured Data: On the Role of Co-Occurrence, Positional Information, and Noise Structures (Arxiv Jun 2024) [paper] 在非ICL格式的数据上训练,探究了“国家-首都”类任务(预训练常见)和输出首字母任务(不常见),发现pattern在训练数据里的重复性和位置信息分别是这两种任务的关键。
Benefits of Transformer: In-Context Learning in Linear Regression Tasks with Unstructured Data (Arxiv Feb 2024) [paper] 分析多层、PE、multi head等模块对于提升ICL在线性回归任务上性能的作用。
Do pretrained Transformers Learn In-Context by Gradient Descent? (ICML 2024) [paper] 讨论了一下目前ICL工作的不切实际的setting,从一些实验指标上说明了ICL和GD有显著不同。
Rectifying Demonstration Shortcut in In-Context Learning (NAACL 2024) [paper] 发现context单词的字面意思会影响ICL分类的结果(一种shortcut)。提出了一种calibration的策略。
Investigating the Pre-Training Dynamics of In-Context Learning: Task Recognition vs. Task Learning (Arxiv June 2024) [paper] 训练过程中task learning和task recognition存在竞争现象
Transformers Can Perform Distributionally-robust Optimisation through In-context Learning (ICML 2024 workshop on ICL) [paper] ICL有一定的DRO的能力
How Do In-Context Examples Affect Compositional Generalization? (ACL 2024) [paper] 发现context example对于组合泛化能力影响显著。具体来说,context example和query越像、example越多样、每个样本越简单,泛化能力越好。
What Do Language Models Learn in Context? The Structured Task Hypothesis (ACL 2024) [paper] 通过实验验证了ICL能够对预训练见过的任务进行复合的假设,否定了ICL仅仅能够进行分布内任务的试别以及ICL能够泛化到某些训练时没见过的任务的假设。
What needs to go right for an induction head? A mechanistic study of in-context learning circuits and their formation (ICML 2024) [paper] 识别了transformer在解决ICL的copy-and-paste任务中存在的三种circuit
In-Context Learning of Energy Functions (ICML 2024 ICL workshop) [paper] 提出了将next-token的条件分布建模为能量函数的形式,发现transformer也能在这种形式下展现出ICL能力
From Words to Numbers: Your Large Language Model Is Secretly A Capable Regressor When Given In-Context Examples (Arxiv April 2024) [paper] 发现诸如GPT-4,Claude-3之类的LLM能够在不重新训练的情况下做linear和non-linear regression,甚至有时能超过supervised training的方法(但仅限于很大的LLM)。
Disentangling Latent Shifts of In-Context Learning Through Self-Training (Arxiv Oct 2024) [paper] 针对ICL不稳定的问题,提出为student LLM训练一个adapter用来从teacher LLM那里获取context的知识。【insight】认为之前的vector系列工作只考虑attn head,不够全面。
Learning Task Representations from In-Context Learning (ICML 2024 ICL workshop) [[paper]](Learning Task Representations from In-Context Learning) 提出learnable task vector(LTV),为所有head增加可学习的权重,然后加权组合每一个head的activation来得到每一层function vector。发现其可以增强ICL的长度泛化能力。
Task Diversity Shortens the ICL Plateau (Arxiv Oct 2024) [paper] synthetic setting,在更多的function class上训练可以加快收敛。发现A任务训练到loss正在逃离plateau的checkpoint在B任务上继续训,可以加快B的训练,说明不同任务之间有一些common structure,提供了为什么多任务训练能更快收敛的一个解释。
Many-Shot In-Context Learning (ICML 2024 ICL workshop) [paper] ICL的潜力被few-shot限制了
Out-of-distribution generalization via composition: a lens through induction heads in Transformers (Arxiv Aug 2024) [papaer] 在OOD的copy任务上,发现了OOD性能源于执行不同功能层的composition(并没有测复杂的组合泛化任务)。还发现了induction head和previous token head的各自内部的表示的相似性。
Context-Scaling versus Task-Scaling in In-Context Learning (Arxiv Oct 2024) [paper] 核心发现:kernel smoothing的特征映射是能够进行context scaling的关键
Bayesian scaling laws for in-context learning (Arxiv Oct 2024) [paper] 推导了一种基于贝叶斯的scaling law。在模拟数据集上效果比exponetial scaling law好,在真实LLM和数据集上效果还行。
Learning to grok: Emergence of in-context learning and skill composition in modular arithmetic tasks (NeurIPS 2024) [paper] 探究在modular加法问题上的ICL的OOD能力,并解释了模型组件是如何实现OOD的能力的
Improving In-Context Learning with Small Language Model Ensembles (NeurIPS 2024 Workshop on Adaptive Foundation Models) [paper] 将在下游任务上fine-tune的多个小模型预测的label和confidence与原始label组合到一起,再输给大模型来做ICL,发现可以提升性能
Algorithmic Phases of In-context Learning (ICLR 2025 Ratings 10 8 6 6) [paper] 在一个马尔可夫链上,识别了ICL的四种推理模式:unigram/bigram-inference/retrieval,这几种模式之间的切换可以解释目前的一系列ICL现象,如task diversity threshold, transient nature, task retreival/task learning, early ascent等。
Can In-context Learning Really Generalize to Out-of-distribution Tasks? (ICLR 2025) [paper] 通过一系列实验分析发现了ICL在OOD任务上只能实现从预训练任务中寻找一个最优任务来拟合下游任务。并从理论上论证了ICL的算法选择机制的存在。
How do Transformers perform In-Context Autoregressive Learning? (Arxiv Feb 2024) [paper] 在限定linear attention、diagonal weight matrix等条件下,对于序列预测任务$s_{T+1}=Ws_T$(文章考虑的$W$是酉矩阵和正交矩阵两种情况),从理论上给出了取到全局最优解时,transformer 参数所应满足的性质。
On Mesa-Optimization in Autoregressively Trained Transformers: Emergence and Capability (Arxiv May 2024) [paper] 理论证明了,不同于直接在ICL目标上进行预训练,经过自回归预训练的one-layer linear attention不能在简单如服从高斯分布的序列上实现ICL。
How Do Nonlinear Transformers Learn and Generalize in In-Context Learning? (ICML 2024) [paper] 在进行ICL预训练的情况下,给出了非线性attention的ID和OOD的泛化保证
Why Larger Language Models Do In-context Learning Differently? (ICML 2024) [paper] 本文对于更大的模型更容易在flipped label任务上失败给了理论解释:大模型更容易受到prompt中noise的影响,而小模型只会关注更重要的feature所以不容易受到noise影响,进而使pretrain feature发挥更大的作用。
Dual Operating Modes of In-Context Learning (ICML 2024) [paper] 理论setting:在混合高斯的线性回归上预训练,分析了给定test context时的后验概率,解释了task recognition和task learning:发现context较短时以task recognition(调整后验的混合高斯的各分量的权重)为主。context变长之后以task learning为主。
In-Context Learning with Transformers: Softmax Attention Adapts to Function Lipschitzness (Arxiv May 2024) [paper] softmax能adaptively学一个attention window来实现将context $y_i$ 进行插值作为预测,将分类任务中见到的retrieval机制拓展到了回归任务上。
Towards Better Understanding of In-Context Learning Ability from In-Context Uncertainty Quantification (Arxiv May 2024) [paper] 理论,多头SoftMax attention,任务是估计p(y|x)和Var(y|x),给出了分布内泛化error bound。
An Information-Theoretic Analysis of In-Context Learning (Arxiv Jan 2024) [paper] 在信息论视角下,将ICL泛化误差拆解为多项。
DAPO: An Open-Source LLM Reinforcement Learning System at Scale (Arxiv 2025.03) [paper] 对GRPO的改进
Understanding R1-Zero-Like Training: A Critical Perspective (Arxiv 2025.03) [paper] base model已经有aha moment。由于normalization,GRPO训练会倾向于输出更短的正确回答和更长的错误回答。
【🚀RL】Group-in-Group Policy Optimization for LLM Agent Training (Arxiv 2025.05) [paper] agent领域的文章。setting是每一步和环境交互之后都能立即得到环境给该step的score反馈。方法:在不额外增加GRPO rollout的情况下,合并相同的状态(对于agent领域,状态可能指所位于的网页页面,因此可以通过hash直接很快地合并),并把相同状态的下一步组成一个group进行GRPO训练。group内每个下一步的reward就是它们各自后续的的step-wise环境reward的累加。
【🚀RL】S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models (Arxiv 2025.05) [paper] 主要解决GRPO导致大量无用思考的问题。RL 时每次只生成一条链,然后随机从中间步开始,停止思考,直接给出答案。对于正确的response,退出思考的位置越晚,reward越低,从而鼓励简洁的思考。
【🚀RL】Spurious Rewards: Rethinking Training Signals in RLVR (Arxiv 2025.05) [[paper]](Spurious Rewards: Rethinking Training Signals in RLVR) 核心发现:对于qwen系列模型,使用随机/错误的reward进行RLVR也能带来显著提升;对于其他模型基本不行;原因分析(fig6、7):对于code本身很强的模型如qwen2.5-math,虚假reward能带来推理模式的转变:anguage->code,从而导致性能提升);对于code不行的如qwen2.5,wrong reward会导致language->code,从而带来提升。即,虚假reward能鼓励模型用自己擅长的方式推理从而获得提升。
【🚀RL】Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning (Arxiv 2025.06) [paper] 少量的high-entropy token上训练是获得多样的推理路径的关键,且有不错的scalability。还发现在其余大量的low-entropy token上训会导致性能下降。
【🚀RL】The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning (Arxiv 2025.06) [paper] 发现在RL中,单独抑制错误回复能在pass@k up to 256都超过base,达到或赶超GRPO;而只强化正确回复能提升pass@1,但是pass@k会降低。
【🚀RL】The Hallucination Dilemma: Factuality-Aware Reinforcement Learning for Large Reasoning Models (Arxiv 2025.05) [paper]
【Latent CoT】CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation (Arxiv 2025.05) [paper] 性能堪比正常cot的latent cot,做法是对齐teacher model(正常cot)的"The answer is:"的":"与student(latent)cot的":"的hidden states,而不对latent cot做额外的限制。
【Latent CoT】Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains (Arxiv 2025.06) [paper]
【Understanding】Part I: Tricks or Traps? A Deep Dive into RL for LLM Reasoning (Arxiv 2025.08) [paper] 在Qwen3 4B/8B、base/aligned上验证了batch/group normalization、sequence/token-level loss aggregation、clip-higher等因素在不同组合下对RL训练的dynamic和performance的影响
【Latent CoT】Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space (Arxiv 2025.05) [paper] 提出了一种training-free的soft thinking:用模型预测的next-token概率分布去加权input embedding,作为下一位置的输入(这是针对7B以上模型input embedding layer 和 lm_head的不share weight的问题:说明input embedding和last hidden state不在同一空间,像COCONUT那样直接输入回去会导致输入OOD)。性能可以超过token CoT.
【Latent CoT】LLMs are Single-threaded Reasoners: Demystifying the Working Mechanism of Soft Thinking (Arxiv 2025.08) [paper] 实验上发现soft thinking的性能、模型输出概率分布、logit lens的解码词汇都很像greedy。提出采用Gumbel-softmax,将模型原先的输出概率进行扰动,然后再soft thinking,性能就能超过vanilla cot。
【🔧SFT+🚀RL】On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting 发现SFT时模型的性能变化趋势:性能下降-性能恢复-过拟合。提出了RL和SFT同时进行的策略:1)通过一个总的、慢慢decay的weight从SFT逐步过渡到RL;2)对SFT的loss进行token-wise reweighting:模型预测概率过高和过低的都会降低weight(概率过低的会导致policy shift太严重;概率过高的会限制RL探索)
【Latent CoT】Soft Tokens, Hard Truths (Arxiv 2025.09) 用RL来训Latent thinking,不需要discrete cot监督
【Latent CoT】SIM-CoT: Supervised Implicit Chain-of-Thought (Arxiv 2025.09) 对每个latent token直接加监督:单独将第k个latent作为prefix输入进一个独立的支路(仍然是LLM作为backbone)去预测第k步的CoT文本。
【🔧SFT,实验效果显著】On the Generalization of SFT: a Reinforcement Learning Perspective with Reward Rectification [paper] 将SFT的loss写成RL的形式后,SFT可以视作:当模型输出严格=专家序列时reward才为1(奖励稀疏)、且乘以了 $\frac{1}{\pi_\theta(y^|x)}$ 因子(会导致policy当对专家action给出低概率时,policy grad被放大,作者认为这会导致过拟合)。方法:对每个token的loss乘以 $\pi_\theta(y^t|y^*{t-1},x)$
【🚀RL】Group Sequence Policy Optimization (Arxiv 2025.11) [paper] 提出GSPO:将重要性采样ratio从token-wise计算改为整个sequence的log sum exp,同一序列内所有token使用相同的权重,避免了token-wise的ratio的高方差。
【🚀RL】Soft Adaptive Policy Optimization (Arxiv 2025.11) [paper] 提出SRPO:
【Latent CoT】Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space [paper] 用self-reward作为奖励信号,在测试时通过REINFORCE算法迭代优化生成的latent,取得了相比discrete CoT的显著提升。
【🚀RL, step-wise reward】Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models (NeurIPS 2025)[paper]
【Analysis】On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models (Arxiv 2025.12) [paper] 构建合成任务训练集,探究了不同难度的数据上进行RL的影响。发现:对于OOD任务,仅有ID边缘(能答对部分)进行RL才能获得提升;当基模型没有OOD能力时,RL没用,但混入至少1%的数据时,RL就能提升OOD了;引入过程奖励能提升OOD能力。
**RLAR ** (Arxiv 2025.12) [paper]
【🚀RL, step-wise reward】Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning (Arxiv 2025.10) [paper] 提出SRL,RL rollout时让policy基于专家序列的前k-1步开始,生成下一步k,计算policy生成的第k步与专家第k步的相似度作为reward。
【🚀RL, expert hint】BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning (NeurIPS 2025) [paper] rollout时如果一个group全答错,则插入一段expert hint;插入后再rollout如果全对/全错,则缩短/增长hint。
【🚀RL, on/off-policy mixed】Learning to Reason under Off-Policy Guidance (NeurIPS 2025) [paper] 提出LUFFY,直接把专家序列混入一个rollout group中做GRPO(注意对于这部分专家序列需要把importance ratio改为 r=policy概率/专家模型概率)。问题:会倾向于快速地学习专家序列中的policy的高概率token,而忽略低概率token的学习(这部分token往往是policy不会的重要token)。为此,提出将r套一个reshape函数,增加专家序列中policy低概率token的权重。
【🚀RL, expert hint】Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models (Arxiv 2025.06) [paper] 提出Guide-GRPO,group rollout全错时用hint,hint序列上ratio分母为hint在context中的输出概率,分子是没有hint的。分子和分母都是在有hint时生成的回复上计算概率。
Benchmarking and Understanding Compositional Relational Reasoning of LLMs (AAAI 2025) [paper] 提出了GAR benchmark来测试模型的Compositional Relational Reasoning能力。发现compositional gap随着模型增大而增大。同时发现了Vicunna-33b存在一些共享的circuit能在不同任务中都发挥作用。
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach (Arxiv 2025.02) [paper] 提出一种循环结构来提升reasoning能力:类似RNN,循环结构的每一个循环块都接受原始prompt和上一个状态作为输入;循环越多性能越好。
SoftCoT: Soft Chain-of-Thought for Efficient Reasoning with LLMs (Arxiv 2025.02) [paper] 用一个小网络最后一层的隐层表示接上一个projector得到所谓的soft thoughts,将之与问题文本一同输入,后续让做文本CoT。不用像COCONUT那样fine-tune整个LLM,避免了灾难性遗忘导致的掉点。但是提升也比较有限,有点像一个简单的prompt tuning + CoT。
Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers (ICLR 2025) [paper] 提出了rStar,training-free MCTS,人工定义action space,reward是self-consistency:找另一个SLM,如果它和policy SLM的某一推理步的输出一致,那么就认为这是一个好的step(被喷可能存在consistent but wrong的情况)。性能提升巨大。
rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking (Arxiv 2025.01) [paper] self-evolution训练:每一轮让policy mode和一个本文提出的process preference model(PPM)做MCTS产生高质量推理路径,然后再用它们来训练policy model和PPM。PPM的提出是由于:很难给一个step打一个衡量好坏的分数,由此训练的PRM可能会不准。因此,提出优化正负样本偏好的方法来训练PPM。正负样本选择方法:每一步选出得分最高的action和最低的action,并强制要求它们分别导向正确和错误的答案,来作为正负样本。
【综述】Test-time Computing: from System-1 Thinking to System-2 Thinking [paper] test-time reasoning 综述
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates [paper]
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search (ICLR 2025) [paper] **核心点:**训练模型自动选择最优的推理方案。与rstar有些类似,都是将任务先从更高层次的动作空间进行规划。**方法:**将解决问题的过程分成analysis、solution、verification三个阶段,每个阶段有不同的选择,也可以选择什么都不做。给定问题-答案对,为每个问题按照success rate搜索出最优的推理方案(algo1)。选出最优方案后用gpt4o结合问题给一个对这个推理方案的解释,然后进行SFT,训练LLM预测推理方案、解释和最终答案。
Don’t Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls (Arxiv 2025.03) [paper] 发现tree search中会存在大量语义相近的节点
Better Process Supervision with Bi-directional Rewarding Signals (Arxiv 2025.03) [paper] 发现PRM在靠后的step上不准,基于terminal的MC估计在靠前的step上不准。因此设计了一个双头PRM:一个头的监督信号为从开始到第t步的推理正确与否(通过一个大模型标注得到);另一个头的监督信号是MC估计得到的。两个头分别在这两个目标上和LLM backbone一起训。
Entropy-based Exploration Conduction for Multi-step Reasoning (Arxiv 2025.03) [paper] 某一步的不确定性大,则代表问题有更多可能的解,值得进一步探索。反之则说明探索路径应该更确定。方法:计算每个推理步(一个句子)的沿着所有token的熵,以及每个token沿着词汇表的熵在整个句子的方差,根据这两个指标来决定对于某一推理步,接下来是deepen、expand还是stop。
From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models (Arxiv 2025.03) [paper] 参考o1的推理特征,定义macro-action:分析前提条件和问题/进行推理(假设生成和验证)/终止,让模型自己选这些macro-action。同时设计了一个让一个check对多种细粒度的错误类型进行分别检测。
【benchmark】Prmbench: A fine-grained and challenging benchmark for process-level reward models [paper] 将PRM对于reasoning step的评价能力划分为:评价推理过程是否冗余、推理过程是否错误、鲁棒性(是否能察觉到关键前提的丢失、陈述中的陷阱、对于多个正确的解答能否保持评价一致)。
Inference-Time Scaling for Generalist Reward Modeling [paper] 针对所有领域而不是单一领域训练scalable的reward model。方法为GRM (Generate Reward Modeling)通过大量采样critique并以此生成reward score,来实现reward model的test-time scaling。
Heimdall: test-time scaling on the generative verification (Arxiv 2025.04) [paper] 生成式的RM,用PPO训练。
Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning (Arxiv 2025.04) [paper] 完全不依赖任何RM和监督信号,只靠问题进行自监督训练。某一步的奖励信号为从该步开始的剩余步的mean log prob。
Step-by-Step Reasoning for Math Problems via Twisted Sequential Monte Carlo (ICLR 2025) [paper] 方法:如何推理:在每个推理步t,让policy model产生N个下一步。利用训练好的value function给N个步打分,然后根据打分重新sample该步(line 18),之后到t+1,再让policy model在经过resample的第t步的基础上再生成下一步;如何训练value function(一个network):loss function的优化目标为减小value function估计的分布和ground-truth分布之间的KL散度,其实让value function对于不同solution的某一步的打分接近outcome reward(每一步的监督信号相同,都是拟合outcome reward)
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (Arxiv April 2024) 提出GRPO (Group Relative Policy Optimization)
Scaling LLM Test-time Compute Optimally can be More Effective than Scaling Model Parameters [paper] 研究了两种scaling test-time compute的策略:1)基于verifier(process reward model)的;2)基于模型的self-revision的。发现了根据具体任务(不同难度)来选择最优scaling策略能在达到相同性能时相比best-of-N降低四倍计算量
Training Large Language Model to Reason in a Continuous Latent Space (COCONUT Arxiv Dec 2024, ICLR 2025 被拒,主要是因为相比于普通CoT会在GSM8K上掉点) [paper] 将reasoning step的某些中间步从word embedding 替换为该token的last hidden state。
Beyond Examples: High-level Automated Reasoning Paradigm in In-Context Learning via MCTS (Arxiv 2024.11) [paper] 用了rStar的self-consistent reward和人工定义的action space,但是加入了thought card的技术。性能和rstar差不多,但是计算代价小了很多,因为测试时不用MCTS了,只需要从seed dataset中找出card即可。
ReST-MCTS: LLM Self-Training via Process Reward Guided Tree Search* (NeurIPS 2024) [paper] 同时训练policy model和一个process reward model(一个LLM-based打分模型)。第k个推理步的process reward $v_k$的监督信号为:1)如果该步距离最终答案越近,$v_k$越大;2)如果最终答案是错的,$v_k$为0. 在用MCTS生成推理路径的过程中,也使用value model的打分指导生成,每次只探索得分最高的路径。也就是说,MCTS路径生成和模型训练是交替迭代进行的。
MCTS的过程为(原文algo2),以下过程重复T次:
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning (Arxiv 2024.05) [paper] 思想:让模型基于已有的推理链的中间步进行后续推理,降低搜索到正确答案的难度。做法:从T-1开始选择起始步进行policy gradien的计算,逐渐将起始步往前推,慢慢增大学习难度。
Calibrating Reasoning in Language Models with Internal Consistency (NeurIPS 2024) [paper] 发现模型在给出错误回答时中间各层的预测一致性较低
V-STaR: Training Verifiers for Self-Taught Reasoners (COLM 2024) [paper] 用模型生成的正确和错误回答通过DPO训练一个verifier,测试时用这个verifier来给不同回答打分
Mindstar: Enhancing math reasoning in pre-trained llms at inference time (Arxiv 2024.05) [paper] PRM+tree search。LLM as PRM, PRM的输入为当前所有推理步和下一推理步。
LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning (Arxiv 2024.11) [paper] MCTS+pair-wise preference reward model (PPRM)。一个节点是一个完整的解决方案(而不是一个推理步)。先利用现有的preference数据集(PRM800K等)训练一个PPRM(一个2B LLM),能够对两个solution输出偏好。每个节点的打分方式:局部得分(反映某节点与孩子节点的win rate)和全局得分(反映某节点在所有node里的排名)的加权平均。
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models (Arxiv2024.02) [paper] consistency的计算方法是TF (Term Frequency) - IDF (Inverse Document Frequency) vector,一种基于词频统计的文档相似度计算方法(只能反映词频上的相似度,反应不了语义相似度)
Universal Self-Consistency for Large Language Models (ICML 2024 ICL workshop) [paper] 针对self-consistency难以提取答案的问题,prompt一个gpt-3.5来从一系列回答中选取最consistent的那一个。
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing (Arxiv 2026.04)[paper] 正确样本做GRPO,错误样本做OPD。
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe (Arxiv 2026.04) [paper] OPD成功的两个前提条件:①学生与教师必须共享兼容的思维模式。②教师必须提供学生训练期间未见过的新知识,高分不等于新知识。③OPD会让student和teacher的高概率token趋于一致。优化策略:①让学生先在teacher rollout上SFT;②prompt用teacher训练时见过的格式
Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why (Arxiv 2026.05) [paper] 核心motivation:teacher在不同token上的引导作用不一样,有些只是stylistic,有些才是有利于正确推理的关键引导;从增加student回答正确的概率这一角度分析,teacher的引导可能有利/中性/有害(其实就是看teacher gradient和ideal gradient的夹角)
takeaways: ①比较稳定成立的结论:OPD主要在错误轨迹上发挥作用(与ideal gradient一致);②更强的student更适合用强teacher、summary for self-distillation;弱student更适合self-generated full correct solution + self-distillation。但这一结论并不稳定,会随数据集和模型变化。
EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation (Arxiv 2026.05) [paper] 为了解决OSPD采样不出好轨迹的问题,提出让student在50%的情况下基于privileged context采样;为了解决privileged context不是对全部token都有引导作用的问题,提出只在见到privileged context后概率增加足够大的token上做OSPD(此时student的context里还是没有privilege,只是在privilege-available的情况下采样出的轨迹上更新)。
On-Policy Distillation: Promise, Pitfalls, and Prospects (2026.06) [blog] 总结了OPD的几个问题和解决办法。问题包括:①teacher的局部监督失效(比如teacher可能既想把学生拉回teacher分布,又想continue student分布,这种混合导致监督信号不准) ②随着训练进行,student轨迹逐渐跑到了teacher熟悉的分布之外,导致监督失效 ③学生轨迹前半段有误时,OPD最多只能告诉学生后半段得重新生成,但是修正后的后半段由于没有真的生成,所以没法在后半段上提供信号
Trajectory-Refined Distillation (Arxiv 2026.06) [paper]
LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations (ICLR 2025 Ratings:8666) [paper] 用一个线性probe来根据模型中间层表示判断模型输出的正确与否。然后让LLM对同一个问题生成多个答案,并用该分类器筛选出正确概率最高的答案,发现能相比原本的答案正确率更高。
Insights into LLM Long-Context Failures: When Transformers Know but Don't Tell (EMNLP 2024 Findings) [paper] 用一个线性probe来根据模型中间层表示来直接预测问题的答案。发现probe acc比直接生成的acc好。
Does Representation Matter? Exploring Intermediate Layers in Large Language Models (NeurIPS 2024 workshop) [paper] LLM的中间层下游性能比最后一层好。探究了Prompt Entropy、Curvature等representation quality的指标和下游acc的关系。
Model Editing with Canonical Examples [paper] 提出了一个新任务:让模型学习几个特定的文本例子,以实现某些纠正,同时还不能让模型改变很多。
Evaluating Large Language Models at Evaluating Instruction Following [paper] (ICLR 2024)
Not all Layers of LLMs are Necessary during Inference (Arxiv April 2024) 训练一个对LLM中间层feature的分类器判断是否应该早停来获取早停层数,来加速LLM推理。还发现中间层预测的top prob和top prob-second top prob在各个任务上都呈现出随着层数加深而增加并逐渐稳定的趋势(但在不同任务上层数不一样)。[paper]
Demonstrating Mutual Reinforcement Effect through Information Flow (Arxiv March 2024) [paper] 研究了同时进行word分类和text分类的MRE(Mutual Reinforcement Effect)任务,也观察到了anchor那篇中的三种attention activation随layer的分布趋势。
A Theoretical Understanding of Self-Correction through In-context Alignment (Arxiv May 2024) [paper] 理论分析transformer中的各个模块在self-correction中发挥的作用
Mechanics of Next Token Prediction with Self-Attention (AISTATS 2024) [paper] 构造了一个graph来描述next token prediction任务,在简化setting下理论分析出last token更倾向于给更经常作为label的token分配更高的attention。
The pitfalls of next-token prediction (Arxiv April 2024) [paper] 指出了自回归模型的缺陷:错误滚雪球效应和在一个单一token路径上只能学出一个类似induction head的shortcut模型
A Law of Next-Token Prediction in Large Language Models (Arxiv Aug 2024) [paper]
SEMIEVOL: Semi-supervised Fine-tuning for LLM Adaptation (Arxiv Oct 2024) [paper] 提出了半监督fine-tuning框架SEMIEVOL。
LORA: LOW-RANK ADAPTATION OF LARGE LANGUAGE MODELS 将对模型权重矩阵的更新限制为低秩矩阵乘积$BA$的形式,极大减少了pre-trained model迁移到新任务的代价(不用fine-tune所有参数) [paper]
Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text (Arxiv 2026.01) [paper] 美团提出了一套从互联网原始文本合成多轮工具调用序列并定义工具的框架:
**粗筛:**从原始文本筛选出带有多步操作的;
**提取:**模型从中提取工作流和工具定义;
**序列合成:**用一个strong teacher(GLM4.6)基于工作流和工具来合成序列,每条序列为 $[s, (u_t,a_t,o_t)]$ ,$s$ 为sys prompt、 $u_t$ 为user query、 $a_t$ 为模型action、 $o_t$ 为observation
**提高序列复杂度 (见A.4): ** 通过让teacher做refinement实现。增加sys prompt中的限制条件、提高用户要求的模糊度和复杂性、提高assistant回复质量、提高环境复杂度等 。ablation显示这部分提升显著
A Subgoal-driven Framework for Improving Long-Horizon LLM Agents (Arxiv 2026.03) [paper] google的工程文章,提出MiRA-RL,针对web agent,核心技术点:
Revisiting DAgger in the Era of LLM-Agents (Arxiv 2026.05) [paper] 为了解决SFT的off policy、RLVR的sparse reward、OPD在long-horizon失效且没法提升采样成功率问题,提出让student和teacher交替产生轨迹,并逐步减少teacher占比,最后再这样的轨迹上做SFT。能在很难的SWE任务上超越GRPO、SFT、OPD
Milestone-Guided Policy Learning for Long-Horizon Language Agents (ICML 2026) [[paper]](Milestone-Guided Policy Learning for Long-Horizon Language Agents) 过程奖励:先基于规则把轨迹切分成K+1个片段(K个milestone)。然后对于属于片段k的token t,计算advantage的group为所有达到了milestone k的轨迹的第k个片段。过程reward r_t计算方法为:只要其所属的片段小于K_i(其所在轨迹达到的最后一个milestone以前)就给分(这个给分方式还是略显简单粗暴,因为不知道milestone是不是好的milestone)。
Deep Research as Rubric for Reinforcement Learning (Arxiv 2026.05) [paper] [zhihu] 针对每个问题通过deep research的方式生成高质量rubric(通过GPT5或者policy自己)。RL时ruburic给分原则:每条rubric给一部分分,全满足时reward为1。效果很好。
Memory-R2: Fair Credit Assignment for Long-Horizon Memory-Augmented LLM Agents [paper] GRPO不合适解决设计memory bank增删的场景:不同轨迹所处的memory bank状态不同,直接比较无法判断是动作不好还是memory bank不同导致的问题。做法:global reward+local reward,local reward是从同一个记忆状态出发采样不同的操作组成group算优势
Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It (Arxiv 2026.06) [paper] 做实验比较了tool-use场景RL一些trick的效果,发现如下:
The Verification Horizon: No Silver Bullet for Coding Agent Rewards (Arxiv 2026.06) [paper] qwen team,真实世界的复杂任务中agent轨迹很长且很难被准确验证做的好不好,团队更准确地何验证和奖励做了广泛的实验分析,针对不同场景,特别是现实世界中的长程复杂任务,提出了不同的奖励策略:
通用软件工程任务:SWE类,之前一般是看测试样例过不过来给奖励
前端开发任务:用LLM充当裁判存在只偏爱视觉好看而忽视功能完整性、偏好很长的代码等问题
真实世界任务:LLM将人类反馈标注为正面、中立和负面,然后用span KTO优化:正面拉进,负面推远
超长周期代码任务:agent as judge,拆需求、逐项测试、给综合打分。裁判的常见问题包括不爱写测试、只关注局部和细节、帮着改代码等。此外,规则太复杂也会导致裁判性能下降。
未来研究方向:①bug修复任务,同样是修好,也有质量差别,怎么评价;②在线用户反馈(目前大多是从历史对话里抽用户反馈,相当于离线数据);③前端任务对齐人类感受;④verifier必须和policy协同进化
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent (Arxiv 2026.06) [paper] 数据合成:self-play机制:所有domain的数据构建都可以抽象成如下的过程。从初始图出发,一个proposer随机采样图上的一条轨迹并提出一个问题,一个solver去解答,然后一个verifier去检查答案、证据、轨迹。verifier检查通过(维度包括问题可验证、答案正确、问题足够non-trivial等)轨迹会重新插入graph(包含了solver在这个过程中的一系列新操作),检查失败的则重新进行self-play。训练:SFT+GRPO训domain专家(search、science、instruction following、general tool call)。student先做所有domain的SFT,然后用专家做OPD。
53 commits