bucky1119/Awesome-LLM-Bandit-Interaction

1

0 commits

updated Feb 10, 2026

See the code

README

A Survey on Recent Advances in the Connection between Large Language Models and Multi-armed Bandits

🚀 Introduction

  • This repository provides a curated collection of papers and resources on the intersection of Large Language Models (LLMs) and Multi-Armed Bandits (MABs). As modern LLMs grow more capable, bandit algorithms offer efficient tools for improving prompt design, training, inference optimization, and personalization. Conversely, LLMs enable more expressive and context-aware bandit decision-making.

  • Our goal is to give researchers a clear entry point into this emerging area, covering both LLM-enhanced bandits and bandit-enhanced LLMs, along with key insights, methods, and open challenges.

  • We welcome any contributions and suggestions to our repository or the addition of your own work. Feel free to make a pull request or leave your comments!!

📋 Contents

💘 Tips

  • ✅ Paper searching via catatogue: directly clicking the content of the catatogue to select the area of your research and browse related papers.
  • ✅ Paper searching via author name: Free feel to search papers of a specific author via ctrl + F and then type the author name. The dropdown list of authors will automatically expand when searching.
  • ✅ Paper searching via tag: You can also search the related papers via the following tags: customization, iteractive, human motion generation tokenizer. (More tags are ongoing)

🔍 Search Strategy

This repository is curated following a systematic methodology to ensure comprehensive and reproducible coverage of research at the intersection of Large Language Models (LLMs) and Bandit Algorithms.

1. Search Framework

We adopted the PCC (Population, Concept, Context) framework as recommended in 'The Systematic Review: An Overview' by Aromataris & Pearson (2014) to structure our search strings.

2. Search Queries

Our search strategy is organized into four hierarchical layers to balance Sensitivity (finding all relevant papers) and Specificity (filtering out noise).

A. Core Intersection (High-level)

Broad terms used to identify foundational literature at the cross-section.

  1. "Large Language Model" AND "Bandit"
  2. "LLM" AND "Multi-armed Bandit"
  3. "Generative AI" AND "Contextual Bandit"
  4. "Foundation Model" AND "Sequential Decision Making"
  5. "Autoregressive Model" AND "Online Learning"

Focusing on where Bandit algorithms enhance specific LLM stages.

  1. Pre-training: ("Pre-training" AND ("Bandit" OR "Exploration"))

  2. Fine-tuning: ("Fine-tuning" AND ("Bandit" OR "Online optimization"))

  3. Alignment: (("Alignment" OR "RLHF" OR "Preference learning") AND "Bandit")

  4. Prompt Design and Selection: (("Prompt selection" OR "Prompt optimization" OR "In-context learning") AND "Bandit")

  5. Tool and Function Calling: (("Tool calling" OR "Function calling" OR "Action invocation") AND "Bandit")

  6. Context Understanding: (("Context management" OR "Long context" OR "Context window") AND "Bandit")

  7. Retrieval-Augmented Generation (RAG): (("Retrieval-augmented generation" OR "RAG") AND "Bandit")

  8. Inference Optimization: (("Inference optimization" OR "Resource allocation") AND "Bandit")

  9. Decoding Strategies: (("Decoding strategy" OR "Sampling strategy" OR "Generation control") AND "Bandit")

  10. Adaptation and Personalization: (("Personalization" OR "Model adaptation" OR "User preference modeling") AND "Bandit")

Focusing on how LLMs are integrated into Bandit framework elements.

  1. Regret Minimization Objective: (("Regret minimization" OR "Reward maximization") AND "LLM")

  2. Arm Definition: (("Action space" OR "Arm representation") AND "LLM")

  3. Environment Modeling: (("Environment modeling" OR "Dynamic environment" OR "Simulator") AND "LLM")

  4. Reward Formulation: (("Reward modeling" OR "Reward shaping") AND "LLM")

  5. Sampling Strategy: (("Thompson Sampling" OR "UCB" OR "Exploration strategy") AND "LLM")

  6. Action Decision: (("Action selection" OR "Decision making") AND "LLM")

D. Specialized & Emerging Interaction Terms

Capturing specific techniques and interdisciplinary applications.

  1. "RLHF" AND "Bandit"
  2. "Combinatorial Bandit" AND "Text Generation"
  3. "Neural Bandit" AND "Transformer"
  4. "Bayesian Optimization" AND "LLM"
  5. "Active Learning" AND "LLM" AND "Bandit"
  6. "Interactive NLP" AND "Bandit"
  7. "Resource allocation" AND "LLM inference" AND "Bandit"
  8. "Query selection" AND "RAG" AND "Bandit"
  9. "Automated prompt engineering" AND "Multi-armed Bandit"
  10. "Speculative decoding" AND "Multi-armed Bandit"
  11. "User preference modeling" AND "LLM" AND "Bandit"

📍 Bandit-enhancements for LLMs

Pre-training

  • Multi-armed bandits for resource efficient, online optimization of language model pre-training: the use case of dynamic masking (2022)

    Inigo Urteaga, Moulay Zaidane Draidia, Tomer Lancewicki, et al.Inigo Urteaga, Moulay Zaidane Draidia, Tomer Lancewicki, Shahram Khadivi
    Paper

  • Efficient online data mixing for language model pre-training (2023)

    Alon Albalak, Liangming Pan, Colin Raffel, et al.Alon Albalak, Liangming Pan, Colin Raffel, William Yang Wang
    Paper

  • Pretraining Decision Transformers with Reward Prediction for In-Context Multi-task Structured Bandit Learning (2024)

    Subhojyoti Mukherjee, Josiah P Hanna, Qiaomin Xie, et al.Subhojyoti Mukherjee, Josiah P Hanna, Qiaomin Xie, Robert Nowak
    Paper

  • Harnessing Diversity for Important Data Selection in Pretraining Large Language Models (2024)

    Chi Zhang, Huaping Zhong, Kuan Zhang, et al.Chi Zhang, Huaping Zhong, Kuan Zhang, Chengliang Chai, Rui Wang, Xinlin Zhuang, Tianyi Bai, Jiantao Qiu, Lei Cao, Ye Yuan, others
    Paper

  • Actor-Critic based Online Data Mixing For Language Model Pre-Training (2025)

    Jing Ma, Chenhao Dang, Mingjie LiaoJing Ma, Chenhao Dang, Mingjie Liao
    Paper

  • EVOLvE: Evaluating and Optimizing LLMs For In-Context Exploration (2025)

    Allen Nie, Yi Su, Bo Chang, et al.Allen Nie, Yi Su, Bo Chang, Jonathan Lee, Ed H. Chi, Quoc V Le, Minmin Chen
    Paper

Fine-tuning

  • RL-NMT: Reinforcement Learning Fine-tuning for Improved Neural Machine Translation of Burmese Dialects (2023)

    Ye Kyaw Thu, Thazin Myint Oo, Thepchai SupnithiYe Kyaw Thu, Thazin Myint Oo, Thepchai Supnithi
    Paper

  • Reflect-RL: Two-Player Online RL Fine-Tuning for LMs (2024)

    Runlong Zhou, Simon S Du, Beibin LiRunlong Zhou, Simon S Du, Beibin Li
    Paper

  • Dynamic Data Mixing Maximizes Instruction Tuning for Mixture-of-Experts (2024)

    Tong Zhu, Daize Dong, Xiaoye Qu, et al.Tong Zhu, Daize Dong, Xiaoye Qu, Jiacheng Ruan, Wenliang Chen, Yu Cheng
    Paper

  • Iterative data smoothing: Mitigating reward overfitting and overoptimization in rlhf (2024)

    Banghua Zhu, Michael I Jordan, Jiantao JiaoBanghua Zhu, Michael I Jordan, Jiantao Jiao
    Paper

  • Sharp Analysis for KL-Regularized Contextual Bandits and RLHF (Unknown Year)

    Heyang Zhao, Chenlu Ye, Quanquan Gu, et al.Heyang Zhao, Chenlu Ye, Quanquan Gu, Tong Zhang
    Paper

  • Which LLM to Play? Convergence-Aware Online Model Selection with Time-Increasing Bandits (2024)

    Yu Xia, Fang Kong, Tong Yu, et al.Yu Xia, Fang Kong, Tong Yu, Liya Guo, Ryan A Rossi, Sungchul Kim, Shuai Li
    Paper

  • Convergence-aware online model selection with time-increasing bandits (2024)

    Yu Xia, Fang Kong, Tong Yu, et al.Yu Xia, Fang Kong, Tong Yu, Liya Guo, Ryan A Rossi, Sungchul Kim, Shuai Li
    Paper

  • Preference fine-tuning of LLMs should leverage suboptimal, on-policy data (2024)

    Fahim Tajwar, Anikait Singh, Archit Sharma, et al.Fahim Tajwar, Anikait Singh, Archit Sharma, Rafael Rafailov, Jeff Schneider, Tengyang Xie, Stefano Ermon, Chelsea Finn, Aviral Kumar
    Paper

  • Sample-efficient alignment for llms (2024)

    Zichen Liu, Changyu Chen, Chao Du, et al.Zichen Liu, Changyu Chen, Chao Du, Wee Sun Lee, Min Lin
    Paper

  • Chunks as arms: Multi-armed bandit-guided sampling for long-context llm preference optimization (2025)

    Shaohua Duan, Xinze Li, Zhenghao Liu, et al.Shaohua Duan, Xinze Li, Zhenghao Liu, Xiaoyuan Yi, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu, Maosong Sun
    Paper

  • DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections (2025)

    Haebin Shin, Lei Ji, Xiao Liu, et al.Haebin Shin, Lei Ji, Xiao Liu, Zhiwei Yu, Qi Chen, Yeyun Gong
    Paper

Alignment

  • Nash Learning from Human Feedback (2024)

    Remi Munos, Michal Valko, Daniele Calandriello, et al.Remi Munos, Michal Valko, Daniele Calandriello, Mohammad Gheshlaghi Azar, Mark Rowland, Zhaohan Daniel Guo, Yunhao Tang, Matthieu Geist, Thomas Mesnard, Côme Fiegel, Andrea Michi, Marco Selvi, Sertan Girgin, Nikola Momchev, Olivier Bachem, Daniel J Mankowitz, Doina Precup, Bilal Piot
    Paper

  • Training a helpful and harmless assistant with reinforcement learning from human feedback (2022)

    Yuntao Bai, Andy Jones, Kamal Ndousse, et al.Yuntao Bai, Andy Jones, Kamal Ndousse, Amanda Askell, Anna Chen, Nova DasSarma, Dawn Drain, Stanislav Fort, Deep Ganguli, Tom Henighan, et al.
    Paper

  • Aligning large language models with human: A survey (2023)

    Yufei Wang, Wanjun Zhong, Liangyou Li, et al.Yufei Wang, Wanjun Zhong, Liangyou Li, Fei Mi, Xingshan Zeng, Wenyong Huang, Lifeng Shang, Xin Jiang, Qun Liu
    Paper

  • Training language models to follow instructions with human feedback (2022)

    Long Ouyang, Jeffrey Wu, Xu Jiang, et al.Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul F Christiano, Jan Leike, Ryan Lowe
    Paper

  • Tokenized Bandit for LLM Decoding and Alignment (2025)

    Suho Shin, Chenghao Yang, Haifeng Xu, et al.Suho Shin, Chenghao Yang, Haifeng Xu, Mohammad T Hajiaghayi
    Paper

  • Direct Preference Optimization: Your Language Model is Secretly a Reward Model (2023)

    Rafael Rafailov, Archit Sharma, Eric Mitchell, et al.Rafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D Manning, Stefano Ermon, Chelsea Finn
    Paper

Prompt Design and Selection

  • Prompt Optimization with Human Feedback (2024)

    Xiaoqiang Lin, Zhongxiang Dai, Arun Verma, et al.Xiaoqiang Lin, Zhongxiang Dai, Arun Verma, See-Kiong Ng, Patrick Jaillet, Bryan Kian Hsiang Low
    Paper

  • Best arm identification for prompt learning under a limited budget (2024)

    Chengshuai Shi, Kun Yang, Jing Yang, et al.Chengshuai Shi, Kun Yang, Jing Yang, Cong Shen
    Paper

  • Prompt optimization with EASE? efficient ordering-aware automated selection of exemplars (2024)

    Zhaoxuan Wu, Xiaoqiang Lin, Zhongxiang Dai, et al.Zhaoxuan Wu, Xiaoqiang Lin, Zhongxiang Dai, Wenyang Hu, Yao Shu, See-Kiong Ng, Patrick Jaillet, Bryan Kian Hsiang Low
    Paper

  • Prompt Optimization with Logged Bandit Data (2024)

    Haruka Kiyohara, Yuta Saito, Daniel Yiming Cao, et al.Haruka Kiyohara, Yuta Saito, Daniel Yiming Cao, Thorsten Joachims
    Paper

  • Prompt-based Code Completion via Multi-Retrieval Augmented Generation (2024)

    Hanzhuo Tan, Qi Luo, Ling Jiang, et al.Hanzhuo Tan, Qi Luo, Ling Jiang, Zizheng Zhan, Jing Li, Haotian Zhang, Yuqun Zhang
    Paper

  • Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with Transformers (2024)

    Xiaoqiang Lin, Zhaoxuan Wu, Zhongxiang Dai, et al.Xiaoqiang Lin, Zhaoxuan Wu, Zhongxiang Dai, Wenyang Hu, Yao Shu, See-Kiong Ng, Patrick Jaillet, Bryan Kian Hsiang Low
    Paper

  • Efficient prompt optimization through the lens of best arm identification (2024)

    Chengshuai Shi, Kun Yang, Zihan Chen, et al.Chengshuai Shi, Kun Yang, Zihan Chen, Jundong Li, Jing Yang, Cong Shen
    Paper

  • FedPOB: Sample-Efficient Federated Prompt Optimization via Bandits (2025)

    Pingchen Lu, Zhi Hong, Zhiwei Shang, et al.Pingchen Lu, Zhi Hong, Zhiwei Shang, Zhiyong Wang, Yikun Ban, Yao Shu, Min Zhang, Shuang Qiu, Zhongxiang Dai
    Paper

  • Prompt Tuning Decision Transformers with Structured and Scalable Bandits (2025)

    Finn Rietz, Oleg Smirnov, Sara Karimi, et al.Finn Rietz, Oleg Smirnov, Sara Karimi, Lele Cao
    Paper

  • Meta-prompt optimization for llm-based sequential decision making (2025)

    Mingze Kong, Zhiyong Wang, Yao Shu, et al.Mingze Kong, Zhiyong Wang, Yao Shu, Zhongxiang Dai
    Paper

  • Bandit-Based Prompt Design Strategy Selection Improves Prompt Optimizers (2025)

    Rin Ashizawa, Yoichi Hirose, Nozomu Yoshinari, et al.Rin Ashizawa, Yoichi Hirose, Nozomu Yoshinari, Kento Uchida, Shinichi Shirakawa
    Paper

  • Prompt Optimization with Logged Bandit Data (2025)

    Haruka Kiyohara, Daniel Yiming Cao, Yuta Saito, et al.Haruka Kiyohara, Daniel Yiming Cao, Yuta Saito, Thorsten Joachims
    Paper

  • LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization (2025)

    Yuanchen Wu, Saurabh Verma, Justin Lee, et al.Yuanchen Wu, Saurabh Verma, Justin Lee, Fangzhou Xiong, Poppy Zhang, Amel Awadelkarim, Xu Chen, Yubai Yuan, Shawndra Hill
    Paper

Tool and Function Calling

  • Reinforcing multi-turn reasoning in llm agents via turn-level credit assignment (2025)

    Siliang Zeng, Quan Wei, William Brown, et al.Siliang Zeng, Quan Wei, William Brown, Oana Frunza, Yuriy Nevmyvaka, Yang Katie Zhao, Mingyi Hong
    Paper

  • Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees (2024)

    Sijia Chen, Yibo Wang, Yi-Feng Wu, et al.Sijia Chen, Yibo Wang, Yi-Feng Wu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang
    Paper

  • Semantic Context for Tool Orchestration (2025)

    Robert MüllerRobert Müller
    Paper

  • Learning Evolving Tools for Large Language Models (2025)

    Guoxin Chen, Zhong Zhang, Xin Cong, et al.Guoxin Chen, Zhong Zhang, Xin Cong, Fangda Guo, Yesai Wu, Yankai Lin, Wenzheng Feng, Yasheng Wang
    Paper

  • Verltool: Towards holistic agentic reinforcement learning with tool use (2025)

    Dongfu Jiang, Yi Lu, Zhuofeng Li, et al.Dongfu Jiang, Yi Lu, Zhuofeng Li, Zhiheng Lyu, Ping Nie, Haozhe Wang, Alex Su, Hui Chen, Kai Zou, Chao Du, et al.
    Paper

  • AgentEvolver: Towards Efficient Self-Evolving Agent System (2025)

    Yunpeng Zhai, Shuchang Tao, Cheng Chen, et al.Yunpeng Zhai, Shuchang Tao, Cheng Chen, Anni Zou, Ziqian Chen, Qingxu Fu, Shinji Mai, Li Yu, Jiaji Deng, Zouying Cao, et al.
    Paper

Contextual Understanding

  • Can large language models explore in-context? (2024)

    Akshay Krishnamurthy, Keegan Harris, Dylan J Foster, et al.Akshay Krishnamurthy, Keegan Harris, Dylan J Foster, Cyril Zhang, Aleksandrs Slivkins
    Paper

  • Code Repair with LLMs gives an Exploration-Exploitation Tradeoff (2024)

    Hao Tang, Keya Hu, Jin Peng Zhou, et al.Hao Tang, Keya Hu, Jin Peng Zhou, Sicheng Zhong, Wei-Long Zheng, Xujie Si, Kevin Ellis
    Paper

  • Efficient exploration for llms (2024)

    Vikranth Dwaracherla, Seyed Mohammad Asghari, Botao Hao, et al.Vikranth Dwaracherla, Seyed Mohammad Asghari, Botao Hao, Benjamin Van Roy
    Paper

  • Enhancing Sequential Recommendations through Multi-Perspective Reflections and Iteration (2024)

    Weicong Qin, Yi Xu, Weijie Yu, et al.Weicong Qin, Yi Xu, Weijie Yu, Chenglei Shen, Xiao Zhang, Ming He, Jianping Fan, Jun Xu
    Paper

  • Controlling Large Language Model Agents with Entropic Activation Steering (2024)

    Nate Rahn, Pierluca D'Oro, Marc G BellemareNate Rahn, Pierluca D'Oro, Marc G Bellemare
    Paper

  • Chunks as arms: Multi-armed bandit-guided sampling for long-context llm preference optimization (2025)

    Shaohua Duan, Xinze Li, Zhenghao Liu, et al.Shaohua Duan, Xinze Li, Zhenghao Liu, Xiaoyuan Yi, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu, Maosong Sun
    Paper

  • Efficient jailbreak attack sequences on large language models via multi-armed bandit-based context switching (2025)

    Aditya Ramesh, Shivam Bhardwaj, Aditya Saibewar, et al.Aditya Ramesh, Shivam Bhardwaj, Aditya Saibewar, Manohar Kaul
    Paper

  • EVOLvE: Evaluating and Optimizing LLMs For In-Context Exploration (2025)

    Allen Nie, Yi Su, Bo Chang, et al.Allen Nie, Yi Su, Bo Chang, Jonathan Lee, Ed H. Chi, Quoc V Le, Minmin Chen
    Paper

  • Online Multi-LLM Selection via Contextual Bandits under Unstructured Context Evolution (2025)

    Manhin Poon, XiangXiang Dai, Xutong Liu, et al.Manhin Poon, XiangXiang Dai, Xutong Liu, Fang Kong, John Lui, Jinhang Zuo
    Paper

  • Context Attribution with Multi-Armed Bandit Optimization (2025)

    Deng Pan, Keerthiram Murugesan, Nuno Moniz, et al.Deng Pan, Keerthiram Murugesan, Nuno Moniz, Nitesh Chawla
    Paper

Retrieval-Augmented Generation

  • M-RAG: Reinforcing Large Language Model Performance through Retrieval-Augmented Generation with Multiple Partitions (2024)

    Zheng Wang, Shu Xian Teo, Jieer Ouyang, et al.Zheng Wang, Shu Xian Teo, Jieer Ouyang, Yongjun Xu, Wei Shi
    Paper

  • AutoRAG-HP: Automatic Online Hyper-Parameter Tuning for Retrieval-Augmented Generation (2024)

    Jia Fu, Xiaoting Qin, Fangkai Yang, et al.Jia Fu, Xiaoting Qin, Fangkai Yang, Lu Wang, Jue Zhang, Qingwei Lin, Yubo Chen, Dongmei Zhang, Saravan Rajmohan, Qi Zhang
    Paper

  • Advances in Neural Information Processing Systems (2024)

    Qinggang Zhang, Junnan Dong, Hao Chen, et al.Qinggang Zhang, Junnan Dong, Hao Chen, Daochen Zha, Zailiang Yu, Xiao Huang
    Paper

  • MBA-RAG: a Bandit Approach for Adaptive Retrieval-Augmented Generation through Question Complexity (2025)

    Xiaqiang Tang, Qiang Gao, Jian Li, et al.Xiaqiang Tang, Qiang Gao, Jian Li, Nan Du, Qi Li, Sihong Xie
    Paper

  • IEEE INFOCOM 2025 - IEEE Conference on Computer Communications (2025)

    Tao Ouyang, Guihang Hong, Kongyange Zhao, et al.Tao Ouyang, Guihang Hong, Kongyange Zhao, Zhi Zhou, Weigang Wu, Zhaobiao Lv, Xu Chen
    Paper

  • Adapting to non-stationary environments: Multi-armed bandit enhanced retrieval-augmented generation on knowledge graphs (2025)

    Xiaqiang Tang, Jian Li, Nan Du, et al.Xiaqiang Tang, Jian Li, Nan Du, Sihong Xie
    Paper

  • Context Attribution with Multi-Armed Bandit Optimization (2025)

    Deng Pan, Keerthiram Murugesan, Nuno Moniz, et al.Deng Pan, Keerthiram Murugesan, Nuno Moniz, Nitesh Chawla
    Paper

Inference Optimization

  • LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing (2025)

    Yang LiYang Li
    Paper

  • Adaptive llm routing under budget constraints (2025)

    Pranoy Panda, Raghav Magazine, Chaitanya Devaguptapu, et al.Pranoy Panda, Raghav Magazine, Chaitanya Devaguptapu, Sho Takemori, Vishal Sharma
    Paper

  • Dynamic and Cost-Efficient Deployment of Large Language Models Using Uplift Modeling and Multi Armed Bandits (2025)

    Ninad TongayNinad Tongay
    Paper

  • Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs (2025)

    Wang Wei, Tiankai Yang, Hongjie Chen, et al.Wang Wei, Tiankai Yang, Hongjie Chen, Yue Zhao, Franck Dernoncourt, Ryan A. Rossi, Hoda Eldardiry
    Paper

  • LLM Cache Bandit Revisited: Addressing Query Heterogeneity for Cost-Effective LLM Inference (2025)

    Hantao Yang, Hong Xie, Defu Lian, et al.Hantao Yang, Hong Xie, Defu Lian, Enhong Chen
    Paper

Decoding Strategies

  • BanditSpec: Adaptive Speculative Decoding via Bandit Algorithms (2025)

    Yunlong Hou, Fengzhuo Zhang, Cunxiao Du, et al.Yunlong Hou, Fengzhuo Zhang, Cunxiao Du, Xuan Zhang, Jiachun Pan, Tianyu Pang, Chao Du, Vincent YF Tan, Zhuoran Yang
    Paper

  • Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism (2024)

    Jiahao Liu, Qifan Wang, Jingang Wang, et al.Jiahao Liu, Qifan Wang, Jingang Wang, Xunliang Cai
    Paper

  • Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding for LLMs (2025)

    Hongyi Liu, Jiaji Huang, Zhen Jia, et al.Hongyi Liu, Jiaji Huang, Zhen Jia, Youngsuk Park, Yu-Xiang Wang
    Paper

  • Tokenized Bandit for LLM Decoding and Alignment (2025)

    Suho Shin, Chenghao Yang, Haifeng Xu, et al.Suho Shin, Chenghao Yang, Haifeng Xu, Mohammad T Hajiaghayi
    Paper

Adaptation and Personalization

  • Personalizing natural language understanding using multi-armed bandits and implicit feedback (2020)

    Fabian Moerchen, Patrick Ernst, Giovanni ZappellaFabian Moerchen, Patrick Ernst, Giovanni Zappella
    Paper

  • User Feedback-based Online Learning for Intent Classification (2023)

    Kaan G"on\cc, Baturay Sa\uglam, Onat Dalmaz, et al.Kaan G"on\cc, Baturay Sa\uglam, Onat Dalmaz, Tolga \cCukur, Serdar Kozat, Hamdi Dibeklioglu
    Paper

  • Online personalizing white-box llms generation with neural bandits (2024)

    Zekai Chen, Po-Yu Chen, Francois Buet-GolfouseZekai Chen, Po-Yu Chen, Francois Buet-Golfouse
    Paper

  • LLMs Are In-Context Bandit Reinforcement Learners (2024)

    Giovanni Monea, Antoine Bosselut, Kiant'e Brantley, et al.Giovanni Monea, Antoine Bosselut, Kiant'e Brantley, Yoav Artzi
    Paper

  • Cost-Effective Online Multi-LLM Selection with Versatile Reward Models (2024)

    Xiangxiang Dai, Jin Li, Xutong Liu, et al.Xiangxiang Dai, Jin Li, Xutong Liu, Anqi Yu, John Lui
    Paper

  • Tokenized Reinforcement Learning for LLM Generation: A Survey (2025)

    Minseok Shin, Anji Gao, Xiang Li, et al.Minseok Shin, Anji Gao, Xiang Li, Tianyi Xie, Wei Wang
    Paper

  • LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing (2025)

    Yang LiYang Li
    Paper

  • Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs (2025)

    Wang Wei, Tiankai Yang, Hongjie Chen, et al.Wang Wei, Tiankai Yang, Hongjie Chen, Yue Zhao, Franck Dernoncourt, Ryan A. Rossi, Hoda Eldardiry
    Paper

  • Comparing Exploration-Exploitation Strategies of LLMs and Humans: Insights from Standard Multi-armed Bandit Tasks (2025)

    Ziyuan Zhang, Darcy Wang, Ningyuan Chen, et al.Ziyuan Zhang, Darcy Wang, Ningyuan Chen, Rodrigo Mansur, Vahid Sarhangian
    Paper

📍 LLM-enhancements for Multi-armed Bandits

Regret Minimization Objective

  • On Bits and Bandits: Quantifying the Regret-Information Trade-off (2024)

    Itai Shufaro, Nadav Merlis, Nir Weinberger, et al.Itai Shufaro, Nadav Merlis, Nir Weinberger, Shie Mannor
    Paper

  • Beyond Numeric Awards: In-Context Dueling Bandits with LLM Agents (2024)

    Fanzeng Xia, Hao Liu, Yisong Yue, et al.Fanzeng Xia, Hao Liu, Yisong Yue, Tongxin Li
    Paper

  • Do llm agents have regret? a case study in online learning and games (2024)

    Chanwoo Park, Xiangyu Liu, Asuman Ozdaglar, et al.Chanwoo Park, Xiangyu Liu, Asuman Ozdaglar, Kaiqing Zhang
    Paper

  • LLMs and the Abstraction and Reasoning Corpus: Successes, Failures, and the Importance of Object-based Representations (2023)

    Ali Baheri, Aman Hosseini, Mehdi Jiang, et al.Ali Baheri, Aman Hosseini, Mehdi Jiang, Peter Chin
    Paper

  • Neural Dueling Bandits (2024)

    Arun Verma, Zhongxiang Dai, Xiaoqiang Lin, et al.Arun Verma, Zhongxiang Dai, Xiaoqiang Lin, Patrick Jaillet, Bryan Kian Hsiang Low
    Paper

  • LLM-informed multi-armed bandit strategies for non-stationary environments (2023)

    J De Curt`o, Irene de Zarz`a, Gemma Roig, et al.J De Curt`o, Irene de Zarz`a, Gemma Roig, Juan Carlos Cano, Pietro Manzoni, Carlos T Calafate
    Paper

Arm Definition

  • Neural Dueling Bandits (2024)

    Arun Verma, Zhongxiang Dai, Xiaoqiang Lin, et al.Arun Verma, Zhongxiang Dai, Xiaoqiang Lin, Patrick Jaillet, Bryan Kian Hsiang Low
    Paper

  • Beyond Numeric Awards: In-Context Dueling Bandits with LLM Agents (2024)

    Fanzeng Xia, Hao Liu, Yisong Yue, et al.Fanzeng Xia, Hao Liu, Yisong Yue, Tongxin Li
    Paper

  • LLMs and the Abstraction and Reasoning Corpus: Successes, Failures, and the Importance of Object-based Representations (2023)

    Ali Baheri, Aman Hosseini, Mehdi Jiang, et al.Ali Baheri, Aman Hosseini, Mehdi Jiang, Peter Chin
    Paper

  • Guiding pretraining in reinforcement learning with large language models (2023)

    Yuqing Du, Olivia Watkins, Zihan Wang, et al.Yuqing Du, Olivia Watkins, Zihan Wang, C'edric Colas, Trevor Darrell, Pieter Abbeel, Abhishek Gupta, Jacob Andreas
    Paper

  • Multi-Armed Bandit Approach for Optimizing Training on Synthetic Data (2024)

    Abdulrahman Kerim, Leandro Soriano Marcolino, Erickson R. Nascimento, et al.Abdulrahman Kerim, Leandro Soriano Marcolino, Erickson R. Nascimento, Richard Jiang
    Paper

  • Investigating the Relationship Between Physical Activity and Tailored Behavior Change Messaging: Connecting Contextual Bandit with Large Language Models (2025)

    Haochen Song, Dominik Hofer, Rania Islambouli, et al.Haochen Song, Dominik Hofer, Rania Islambouli, Laura Hawkins, Ananya Bhattacharjee, Meredith Franklin, Joseph Jay Williams
    Paper

Environment

  • LLM-informed multi-armed bandit strategies for non-stationary environments (2023)

    J De Curt`o, Irene de Zarz`a, Gemma Roig, et al.J De Curt`o, Irene de Zarz`a, Gemma Roig, Juan Carlos Cano, Pietro Manzoni, Carlos T Calafate
    Paper

  • Towards a Pretrained Model for Restless Bandits via Multi-arm Generalization (2024)

    Yunfan Zhao, Nikhil Behari, Edward Hughes, et al.Yunfan Zhao, Nikhil Behari, Edward Hughes, Edwin Zhang, Dheeraj Nagaraj, Karl Tuyls, Aparna Taneja, Milind Tambe
    Paper

  • Jump Starting Bandits with LLM-Generated Prior Knowledge (2024)

    Parand Alamdari, Yanshuai Cao, Kevin WilsonParand Alamdari, Yanshuai Cao, Kevin Wilson
    Paper

  • In-context impersonation reveals Large Language Models' strengths and biases (2024)

    Leonard Salewski, Stephan Alaniz, Isabel Rio-Torto, et al.Leonard Salewski, Stephan Alaniz, Isabel Rio-Torto, Eric Schulz, Zeynep Akata
    Paper

  • Multi-Armed Bandit Approach for Optimizing Training on Synthetic Data (2024)

    Abdulrahman Kerim, Leandro Soriano Marcolino, Erickson R. Nascimento, et al.Abdulrahman Kerim, Leandro Soriano Marcolino, Erickson R. Nascimento, Richard Jiang
    Paper

  • EnvGen: Generating and Adapting Environments via LLMs for Training Embodied Agents (2024)

    Abhay Zala, Jaemin Cho, Han Lin, et al.Abhay Zala, Jaemin Cho, Han Lin, Jaehong Yoon, Mohit Bansal
    Paper

  • Balancing act: prioritization strategies for llm-designed restless bandit rewards (2025)

    Shresth Verma, Niclas Boehmer, Lingkai Kong, et al.Shresth Verma, Niclas Boehmer, Lingkai Kong, Milind Tambe
    Paper

  • Investigating the Relationship Between Physical Activity and Tailored Behavior Change Messaging: Connecting Contextual Bandit with Large Language Models (2025)

    Haochen Song, Dominik Hofer, Rania Islambouli, et al.Haochen Song, Dominik Hofer, Rania Islambouli, Laura Hawkins, Ananya Bhattacharjee, Meredith Franklin, Joseph Jay Williams
    Paper

  • Toward efficient exploration by large language model agents (2025)

    Dilip Arumugam, Thomas L GriffithsDilip Arumugam, Thomas L Griffiths
    Paper

  • Prior-informed optimization of treatment recommendation via bandit algorithms trained on large language model-processed historical records (2025)

    Saman Nessari, Ali Bozorgi-AmiriSaman Nessari, Ali Bozorgi-Amiri
    Paper

Reward Formulation

  • Statistical and computational trade-off in multi-agent multi-armed bandits (2024)

    Filippo Vannella, Alexandre Proutiere, Jaeseong JeongFilippo Vannella, Alexandre Proutiere, Jaeseong Jeong
    Paper

  • On the Importance of Uncertainty in Decision-Making with Large Language Models (2024)

    Nicol`o Felicioni, Lucas Maystre, Sina Ghiassian, et al.Nicol`o Felicioni, Lucas Maystre, Sina Ghiassian, Kamil Ciosek
    Paper

  • A decision-language model (DLM) for dynamic restless multi-armed bandit tasks in public health (2024)

    Nikhil Behari, Edwin Zhang, Yunfan Zhao, et al.Nikhil Behari, Edwin Zhang, Yunfan Zhao, Aparna Taneja, Dheeraj Nagaraj, Milind Tambe
    Paper

  • Towards a Pretrained Model for Restless Bandits via Multi-arm Generalization (2024)

    Yunfan Zhao, Nikhil Behari, Edward Hughes, et al.Yunfan Zhao, Nikhil Behari, Edward Hughes, Edwin Zhang, Dheeraj Nagaraj, Karl Tuyls, Aparna Taneja, Milind Tambe
    Paper

  • Do llm agents have regret? a case study in online learning and games (2024)

    Chanwoo Park, Xiangyu Liu, Asuman Ozdaglar, et al.Chanwoo Park, Xiangyu Liu, Asuman Ozdaglar, Kaiqing Zhang
    Paper

  • Balancing act: prioritization strategies for llm-designed restless bandit rewards (2025)

    Shresth Verma, Niclas Boehmer, Lingkai Kong, et al.Shresth Verma, Niclas Boehmer, Lingkai Kong, Milind Tambe
    Paper

  • Large Language Model-Enhanced Multi-Armed Bandits (2025)

    Jiahang Sun, Zhiyong Wang, Runhan Yang, et al.Jiahang Sun, Zhiyong Wang, Runhan Yang, Chenjun Xiao, John C. S. Lui, Zhongxiang Dai
    Paper

  • Prior-informed optimization of treatment recommendation via bandit algorithms trained on large language model-processed historical records (2025)

    Saman Nessari, Ali Bozorgi-AmiriSaman Nessari, Ali Bozorgi-Amiri
    Paper

  • Prioritization Strategies for LLM-Designed Restless Bandit Rewards in Public Health (2024)

    Shresth Verma, Niclas Boehmer, Lingkai Kong, et al.Shresth Verma, Niclas Boehmer, Lingkai Kong, Milind Tambe
    Paper

  • Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents (2025)

    Fanzeng Xia, Hao Liu, Yisong Yue, et al.Fanzeng Xia, Hao Liu, Yisong Yue, Tongxin Li
    Paper

  • When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training (2025)

    Sanxing Chen, Xiaoyin Chen, Yukun Huang, et al.Sanxing Chen, Xiaoyin Chen, Yukun Huang, Roy Xie, Bhuwan Dhingra
    Paper

Sampling Strategy

  • Towards optimizing with large language models (2023)

    Pei-Fu Guo, Ying-Hsuan Chen, Yun-Da Tsai, et al.Pei-Fu Guo, Ying-Hsuan Chen, Yun-Da Tsai, Shou-De Lin
    Paper

  • On Bits and Bandits: Quantifying the Regret-Information Trade-off (2024)

    Itai Shufaro, Nadav Merlis, Nir Weinberger, et al.Itai Shufaro, Nadav Merlis, Nir Weinberger, Shie Mannor
    Paper

  • Efficient Sequential Decision Making with Large Language Models (2024)

    Dingyang Chen, Qi Zhang, Yinglun ZhuDingyang Chen, Qi Zhang, Yinglun Zhu
    Paper

  • Jump Starting Bandits with LLM-Generated Prior Knowledge (2024)

    Parand Alamdari, Yanshuai Cao, Kevin WilsonParand Alamdari, Yanshuai Cao, Kevin Wilson
    Paper

  • Cost-Effective Online Multi-LLM Selection with Versatile Reward Models (2024)

    Xiangxiang Dai, Jin Li, Xutong Liu, et al.Xiangxiang Dai, Jin Li, Xutong Liu, Anqi Yu, John Lui
    Paper

  • Large Language Model-Enhanced Multi-Armed Bandits (2025)

    Jiahang Sun, Zhiyong Wang, Runhan Yang, et al.Jiahang Sun, Zhiyong Wang, Runhan Yang, Chenjun Xiao, John C. S. Lui, Zhongxiang Dai
    Paper

  • When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training (2025)

    Sanxing Chen, Xiaoyin Chen, Yukun Huang, et al.Sanxing Chen, Xiaoyin Chen, Yukun Huang, Roy Xie, Bhuwan Dhingra
    Paper

  • Llms are greedy agents: Effects of rl fine-tuning on decision-making abilities (2025)

    Thomas Schmied, J"org Bornschein, Jordi Grau-Moya, et al.Thomas Schmied, J"org Bornschein, Jordi Grau-Moya, Markus Wulfmeier, Razvan Pascanu
    Paper

  • Evaluation of LLM Powered Agentic AI for Solving Multi-Arm Bandit Problems (2025)

    Jawad Hazime, Junaid FarooqJawad Hazime, Junaid Farooq
    Paper

  • TextBandit: Evaluating Probabilistic Reasoning in LLMs Through Language-Only Decision Tasks (2025)

    Jimin Lim, Arjun Damerla, Arthur Jiang, et al.Jimin Lim, Arjun Damerla, Arthur Jiang, Nam Le
    Paper

  • Toward efficient exploration by large language model agents (2025)

    Dilip Arumugam, Thomas L GriffithsDilip Arumugam, Thomas L Griffiths
    Paper

Action Decision

  • Using large language models for hyperparameter optimization (2023)

    Michael R Zhang, Nishkrit Desai, Juhan Bae, et al.Michael R Zhang, Nishkrit Desai, Juhan Bae, Jonathan Lorraine, Jimmy Ba
    Paper

  • Towards optimizing with large language models (2023)

    Pei-Fu Guo, Ying-Hsuan Chen, Yun-Da Tsai, et al.Pei-Fu Guo, Ying-Hsuan Chen, Yun-Da Tsai, Shou-De Lin
    Paper

  • LLMs for User Interest Exploration: A Hybrid Approach (2024)

    Jianling Wang, Haokai Lu, Yifan Liu, et al.Jianling Wang, Haokai Lu, Yifan Liu, He Ma, Yueqi Wang, Yang Gu, Shuzhou Zhang, Shuchao Bi, Lexi Baugher, Ed Chi, others
    Paper

  • Large language models as evolutionary optimizers (2024)

    Shengcai Liu, Caishun Chen, Xinghua Qu, et al.Shengcai Liu, Caishun Chen, Xinghua Qu, Ke Tang, Yew-Soon Ong
    Paper

  • Large Language Model-Enhanced Multi-Armed Bandits (2025)

    Jiahang Sun, Zhiyong Wang, Runhan Yang, et al.Jiahang Sun, Zhiyong Wang, Runhan Yang, Chenjun Xiao, John C. S. Lui, Zhongxiang Dai
    Paper

  • When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training (2025)

    Sanxing Chen, Xiaoyin Chen, Yukun Huang, et al.Sanxing Chen, Xiaoyin Chen, Yukun Huang, Roy Xie, Bhuwan Dhingra
    Paper

  • Evaluation of LLM Powered Agentic AI for Solving Multi-Arm Bandit Problems (2025)

    Jawad Hazime, Junaid FarooqJawad Hazime, Junaid Farooq
    Paper

  • Llms are greedy agents: Effects of rl fine-tuning on decision-making abilities (2025)

    Thomas Schmied, J"org Bornschein, Jordi Grau-Moya, et al.Thomas Schmied, J"org Bornschein, Jordi Grau-Moya, Markus Wulfmeier, Razvan Pascanu
    Paper

  • TextBandit: Evaluating Probabilistic Reasoning in LLMs Through Language-Only Decision Tasks (2025)

    Jimin Lim, Arjun Damerla, Arthur Jiang, et al.Jimin Lim, Arjun Damerla, Arthur Jiang, Nam Le
    Paper

  • Toward efficient exploration by large language model agents (2025)

    Dilip Arumugam, Thomas L GriffithsDilip Arumugam, Thomas L Griffiths
    Paper

👨‍💻 Team

Here is the list of our contributors in each modality of this repository.

Modality/TaskContributors
Bandit for LLMSiguang Chen, Miao Xie
LLM for BanditSiguang Chen, Miao Xie
Reference URL OrganizationYuan Wang

😉 Citation

If you find this work useful in your research, Please cite the paper as below:

@article{xxx,
    
}

bucky1119/Awesome-LLM-Bandit-Interaction

1

0 commits

updated Feb 10, 2026

See the code

README

A Survey on Recent Advances in the Connection between Large Language Models and Multi-armed Bandits

🚀 Introduction

  • This repository provides a curated collection of papers and resources on the intersection of Large Language Models (LLMs) and Multi-Armed Bandits (MABs). As modern LLMs grow more capable, bandit algorithms offer efficient tools for improving prompt design, training, inference optimization, and personalization. Conversely, LLMs enable more expressive and context-aware bandit decision-making.

  • Our goal is to give researchers a clear entry point into this emerging area, covering both LLM-enhanced bandits and bandit-enhanced LLMs, along with key insights, methods, and open challenges.

  • We welcome any contributions and suggestions to our repository or the addition of your own work. Feel free to make a pull request or leave your comments!!

📋 Contents

💘 Tips

  • ✅ Paper searching via catatogue: directly clicking the content of the catatogue to select the area of your research and browse related papers.
  • ✅ Paper searching via author name: Free feel to search papers of a specific author via ctrl + F and then type the author name. The dropdown list of authors will automatically expand when searching.
  • ✅ Paper searching via tag: You can also search the related papers via the following tags: customization, iteractive, human motion generation tokenizer. (More tags are ongoing)

🔍 Search Strategy

This repository is curated following a systematic methodology to ensure comprehensive and reproducible coverage of research at the intersection of Large Language Models (LLMs) and Bandit Algorithms.

1. Search Framework

We adopted the PCC (Population, Concept, Context) framework as recommended in 'The Systematic Review: An Overview' by Aromataris & Pearson (2014) to structure our search strings.

2. Search Queries

Our search strategy is organized into four hierarchical layers to balance Sensitivity (finding all relevant papers) and Specificity (filtering out noise).

A. Core Intersection (High-level)

Broad terms used to identify foundational literature at the cross-section.

  1. "Large Language Model" AND "Bandit"
  2. "LLM" AND "Multi-armed Bandit"
  3. "Generative AI" AND "Contextual Bandit"
  4. "Foundation Model" AND "Sequential Decision Making"
  5. "Autoregressive Model" AND "Online Learning"

Focusing on where Bandit algorithms enhance specific LLM stages.

  1. Pre-training: ("Pre-training" AND ("Bandit" OR "Exploration"))

  2. Fine-tuning: ("Fine-tuning" AND ("Bandit" OR "Online optimization"))

  3. Alignment: (("Alignment" OR "RLHF" OR "Preference learning") AND "Bandit")

  4. Prompt Design and Selection: (("Prompt selection" OR "Prompt optimization" OR "In-context learning") AND "Bandit")

  5. Tool and Function Calling: (("Tool calling" OR "Function calling" OR "Action invocation") AND "Bandit")

  6. Context Understanding: (("Context management" OR "Long context" OR "Context window") AND "Bandit")

  7. Retrieval-Augmented Generation (RAG): (("Retrieval-augmented generation" OR "RAG") AND "Bandit")

  8. Inference Optimization: (("Inference optimization" OR "Resource allocation") AND "Bandit")

  9. Decoding Strategies: (("Decoding strategy" OR "Sampling strategy" OR "Generation control") AND "Bandit")

  10. Adaptation and Personalization: (("Personalization" OR "Model adaptation" OR "User preference modeling") AND "Bandit")

Focusing on how LLMs are integrated into Bandit framework elements.

  1. Regret Minimization Objective: (("Regret minimization" OR "Reward maximization") AND "LLM")

  2. Arm Definition: (("Action space" OR "Arm representation") AND "LLM")

  3. Environment Modeling: (("Environment modeling" OR "Dynamic environment" OR "Simulator") AND "LLM")

  4. Reward Formulation: (("Reward modeling" OR "Reward shaping") AND "LLM")

  5. Sampling Strategy: (("Thompson Sampling" OR "UCB" OR "Exploration strategy") AND "LLM")

  6. Action Decision: (("Action selection" OR "Decision making") AND "LLM")

D. Specialized & Emerging Interaction Terms

Capturing specific techniques and interdisciplinary applications.

  1. "RLHF" AND "Bandit"
  2. "Combinatorial Bandit" AND "Text Generation"
  3. "Neural Bandit" AND "Transformer"
  4. "Bayesian Optimization" AND "LLM"
  5. "Active Learning" AND "LLM" AND "Bandit"
  6. "Interactive NLP" AND "Bandit"
  7. "Resource allocation" AND "LLM inference" AND "Bandit"
  8. "Query selection" AND "RAG" AND "Bandit"
  9. "Automated prompt engineering" AND "Multi-armed Bandit"
  10. "Speculative decoding" AND "Multi-armed Bandit"
  11. "User preference modeling" AND "LLM" AND "Bandit"

📍 Bandit-enhancements for LLMs

Pre-training

  • Multi-armed bandits for resource efficient, online optimization of language model pre-training: the use case of dynamic masking (2022)

    Inigo Urteaga, Moulay Zaidane Draidia, Tomer Lancewicki, et al.Inigo Urteaga, Moulay Zaidane Draidia, Tomer Lancewicki, Shahram Khadivi
    Paper

  • Efficient online data mixing for language model pre-training (2023)

    Alon Albalak, Liangming Pan, Colin Raffel, et al.Alon Albalak, Liangming Pan, Colin Raffel, William Yang Wang
    Paper

  • Pretraining Decision Transformers with Reward Prediction for In-Context Multi-task Structured Bandit Learning (2024)

    Subhojyoti Mukherjee, Josiah P Hanna, Qiaomin Xie, et al.Subhojyoti Mukherjee, Josiah P Hanna, Qiaomin Xie, Robert Nowak
    Paper

  • Harnessing Diversity for Important Data Selection in Pretraining Large Language Models (2024)

    Chi Zhang, Huaping Zhong, Kuan Zhang, et al.Chi Zhang, Huaping Zhong, Kuan Zhang, Chengliang Chai, Rui Wang, Xinlin Zhuang, Tianyi Bai, Jiantao Qiu, Lei Cao, Ye Yuan, others
    Paper

  • Actor-Critic based Online Data Mixing For Language Model Pre-Training (2025)

    Jing Ma, Chenhao Dang, Mingjie LiaoJing Ma, Chenhao Dang, Mingjie Liao
    Paper

  • EVOLvE: Evaluating and Optimizing LLMs For In-Context Exploration (2025)

    Allen Nie, Yi Su, Bo Chang, et al.Allen Nie, Yi Su, Bo Chang, Jonathan Lee, Ed H. Chi, Quoc V Le, Minmin Chen
    Paper

Fine-tuning

  • RL-NMT: Reinforcement Learning Fine-tuning for Improved Neural Machine Translation of Burmese Dialects (2023)

    Ye Kyaw Thu, Thazin Myint Oo, Thepchai SupnithiYe Kyaw Thu, Thazin Myint Oo, Thepchai Supnithi
    Paper

  • Reflect-RL: Two-Player Online RL Fine-Tuning for LMs (2024)

    Runlong Zhou, Simon S Du, Beibin LiRunlong Zhou, Simon S Du, Beibin Li
    Paper

  • Dynamic Data Mixing Maximizes Instruction Tuning for Mixture-of-Experts (2024)

    Tong Zhu, Daize Dong, Xiaoye Qu, et al.Tong Zhu, Daize Dong, Xiaoye Qu, Jiacheng Ruan, Wenliang Chen, Yu Cheng
    Paper

  • Iterative data smoothing: Mitigating reward overfitting and overoptimization in rlhf (2024)

    Banghua Zhu, Michael I Jordan, Jiantao JiaoBanghua Zhu, Michael I Jordan, Jiantao Jiao
    Paper

  • Sharp Analysis for KL-Regularized Contextual Bandits and RLHF (Unknown Year)

    Heyang Zhao, Chenlu Ye, Quanquan Gu, et al.Heyang Zhao, Chenlu Ye, Quanquan Gu, Tong Zhang
    Paper

  • Which LLM to Play? Convergence-Aware Online Model Selection with Time-Increasing Bandits (2024)

    Yu Xia, Fang Kong, Tong Yu, et al.Yu Xia, Fang Kong, Tong Yu, Liya Guo, Ryan A Rossi, Sungchul Kim, Shuai Li
    Paper

  • Convergence-aware online model selection with time-increasing bandits (2024)

    Yu Xia, Fang Kong, Tong Yu, et al.Yu Xia, Fang Kong, Tong Yu, Liya Guo, Ryan A Rossi, Sungchul Kim, Shuai Li
    Paper

  • Preference fine-tuning of LLMs should leverage suboptimal, on-policy data (2024)

    Fahim Tajwar, Anikait Singh, Archit Sharma, et al.Fahim Tajwar, Anikait Singh, Archit Sharma, Rafael Rafailov, Jeff Schneider, Tengyang Xie, Stefano Ermon, Chelsea Finn, Aviral Kumar
    Paper

  • Sample-efficient alignment for llms (2024)

    Zichen Liu, Changyu Chen, Chao Du, et al.Zichen Liu, Changyu Chen, Chao Du, Wee Sun Lee, Min Lin
    Paper

  • Chunks as arms: Multi-armed bandit-guided sampling for long-context llm preference optimization (2025)

    Shaohua Duan, Xinze Li, Zhenghao Liu, et al.Shaohua Duan, Xinze Li, Zhenghao Liu, Xiaoyuan Yi, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu, Maosong Sun
    Paper

  • DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections (2025)

    Haebin Shin, Lei Ji, Xiao Liu, et al.Haebin Shin, Lei Ji, Xiao Liu, Zhiwei Yu, Qi Chen, Yeyun Gong
    Paper

Alignment

  • Nash Learning from Human Feedback (2024)

    Remi Munos, Michal Valko, Daniele Calandriello, et al.Remi Munos, Michal Valko, Daniele Calandriello, Mohammad Gheshlaghi Azar, Mark Rowland, Zhaohan Daniel Guo, Yunhao Tang, Matthieu Geist, Thomas Mesnard, Côme Fiegel, Andrea Michi, Marco Selvi, Sertan Girgin, Nikola Momchev, Olivier Bachem, Daniel J Mankowitz, Doina Precup, Bilal Piot
    Paper

  • Training a helpful and harmless assistant with reinforcement learning from human feedback (2022)

    Yuntao Bai, Andy Jones, Kamal Ndousse, et al.Yuntao Bai, Andy Jones, Kamal Ndousse, Amanda Askell, Anna Chen, Nova DasSarma, Dawn Drain, Stanislav Fort, Deep Ganguli, Tom Henighan, et al.
    Paper

  • Aligning large language models with human: A survey (2023)

    Yufei Wang, Wanjun Zhong, Liangyou Li, et al.Yufei Wang, Wanjun Zhong, Liangyou Li, Fei Mi, Xingshan Zeng, Wenyong Huang, Lifeng Shang, Xin Jiang, Qun Liu
    Paper

  • Training language models to follow instructions with human feedback (2022)

    Long Ouyang, Jeffrey Wu, Xu Jiang, et al.Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul F Christiano, Jan Leike, Ryan Lowe
    Paper

  • Tokenized Bandit for LLM Decoding and Alignment (2025)

    Suho Shin, Chenghao Yang, Haifeng Xu, et al.Suho Shin, Chenghao Yang, Haifeng Xu, Mohammad T Hajiaghayi
    Paper

  • Direct Preference Optimization: Your Language Model is Secretly a Reward Model (2023)

    Rafael Rafailov, Archit Sharma, Eric Mitchell, et al.Rafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D Manning, Stefano Ermon, Chelsea Finn
    Paper

Prompt Design and Selection

  • Prompt Optimization with Human Feedback (2024)

    Xiaoqiang Lin, Zhongxiang Dai, Arun Verma, et al.Xiaoqiang Lin, Zhongxiang Dai, Arun Verma, See-Kiong Ng, Patrick Jaillet, Bryan Kian Hsiang Low
    Paper

  • Best arm identification for prompt learning under a limited budget (2024)

    Chengshuai Shi, Kun Yang, Jing Yang, et al.Chengshuai Shi, Kun Yang, Jing Yang, Cong Shen
    Paper

  • Prompt optimization with EASE? efficient ordering-aware automated selection of exemplars (2024)

    Zhaoxuan Wu, Xiaoqiang Lin, Zhongxiang Dai, et al.Zhaoxuan Wu, Xiaoqiang Lin, Zhongxiang Dai, Wenyang Hu, Yao Shu, See-Kiong Ng, Patrick Jaillet, Bryan Kian Hsiang Low
    Paper

  • Prompt Optimization with Logged Bandit Data (2024)

    Haruka Kiyohara, Yuta Saito, Daniel Yiming Cao, et al.Haruka Kiyohara, Yuta Saito, Daniel Yiming Cao, Thorsten Joachims
    Paper

  • Prompt-based Code Completion via Multi-Retrieval Augmented Generation (2024)

    Hanzhuo Tan, Qi Luo, Ling Jiang, et al.Hanzhuo Tan, Qi Luo, Ling Jiang, Zizheng Zhan, Jing Li, Haotian Zhang, Yuqun Zhang
    Paper

  • Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with Transformers (2024)

    Xiaoqiang Lin, Zhaoxuan Wu, Zhongxiang Dai, et al.Xiaoqiang Lin, Zhaoxuan Wu, Zhongxiang Dai, Wenyang Hu, Yao Shu, See-Kiong Ng, Patrick Jaillet, Bryan Kian Hsiang Low
    Paper

  • Efficient prompt optimization through the lens of best arm identification (2024)

    Chengshuai Shi, Kun Yang, Zihan Chen, et al.Chengshuai Shi, Kun Yang, Zihan Chen, Jundong Li, Jing Yang, Cong Shen
    Paper

  • FedPOB: Sample-Efficient Federated Prompt Optimization via Bandits (2025)

    Pingchen Lu, Zhi Hong, Zhiwei Shang, et al.Pingchen Lu, Zhi Hong, Zhiwei Shang, Zhiyong Wang, Yikun Ban, Yao Shu, Min Zhang, Shuang Qiu, Zhongxiang Dai
    Paper

  • Prompt Tuning Decision Transformers with Structured and Scalable Bandits (2025)

    Finn Rietz, Oleg Smirnov, Sara Karimi, et al.Finn Rietz, Oleg Smirnov, Sara Karimi, Lele Cao
    Paper

  • Meta-prompt optimization for llm-based sequential decision making (2025)

    Mingze Kong, Zhiyong Wang, Yao Shu, et al.Mingze Kong, Zhiyong Wang, Yao Shu, Zhongxiang Dai
    Paper

  • Bandit-Based Prompt Design Strategy Selection Improves Prompt Optimizers (2025)

    Rin Ashizawa, Yoichi Hirose, Nozomu Yoshinari, et al.Rin Ashizawa, Yoichi Hirose, Nozomu Yoshinari, Kento Uchida, Shinichi Shirakawa
    Paper

  • Prompt Optimization with Logged Bandit Data (2025)

    Haruka Kiyohara, Daniel Yiming Cao, Yuta Saito, et al.Haruka Kiyohara, Daniel Yiming Cao, Yuta Saito, Thorsten Joachims
    Paper

  • LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization (2025)

    Yuanchen Wu, Saurabh Verma, Justin Lee, et al.Yuanchen Wu, Saurabh Verma, Justin Lee, Fangzhou Xiong, Poppy Zhang, Amel Awadelkarim, Xu Chen, Yubai Yuan, Shawndra Hill
    Paper

Tool and Function Calling

  • Reinforcing multi-turn reasoning in llm agents via turn-level credit assignment (2025)

    Siliang Zeng, Quan Wei, William Brown, et al.Siliang Zeng, Quan Wei, William Brown, Oana Frunza, Yuriy Nevmyvaka, Yang Katie Zhao, Mingyi Hong
    Paper

  • Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees (2024)

    Sijia Chen, Yibo Wang, Yi-Feng Wu, et al.Sijia Chen, Yibo Wang, Yi-Feng Wu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang
    Paper

  • Semantic Context for Tool Orchestration (2025)

    Robert MüllerRobert Müller
    Paper

  • Learning Evolving Tools for Large Language Models (2025)

    Guoxin Chen, Zhong Zhang, Xin Cong, et al.Guoxin Chen, Zhong Zhang, Xin Cong, Fangda Guo, Yesai Wu, Yankai Lin, Wenzheng Feng, Yasheng Wang
    Paper

  • Verltool: Towards holistic agentic reinforcement learning with tool use (2025)

    Dongfu Jiang, Yi Lu, Zhuofeng Li, et al.Dongfu Jiang, Yi Lu, Zhuofeng Li, Zhiheng Lyu, Ping Nie, Haozhe Wang, Alex Su, Hui Chen, Kai Zou, Chao Du, et al.
    Paper

  • AgentEvolver: Towards Efficient Self-Evolving Agent System (2025)

    Yunpeng Zhai, Shuchang Tao, Cheng Chen, et al.Yunpeng Zhai, Shuchang Tao, Cheng Chen, Anni Zou, Ziqian Chen, Qingxu Fu, Shinji Mai, Li Yu, Jiaji Deng, Zouying Cao, et al.
    Paper

Contextual Understanding

  • Can large language models explore in-context? (2024)

    Akshay Krishnamurthy, Keegan Harris, Dylan J Foster, et al.Akshay Krishnamurthy, Keegan Harris, Dylan J Foster, Cyril Zhang, Aleksandrs Slivkins
    Paper

  • Code Repair with LLMs gives an Exploration-Exploitation Tradeoff (2024)

    Hao Tang, Keya Hu, Jin Peng Zhou, et al.Hao Tang, Keya Hu, Jin Peng Zhou, Sicheng Zhong, Wei-Long Zheng, Xujie Si, Kevin Ellis
    Paper

  • Efficient exploration for llms (2024)

    Vikranth Dwaracherla, Seyed Mohammad Asghari, Botao Hao, et al.Vikranth Dwaracherla, Seyed Mohammad Asghari, Botao Hao, Benjamin Van Roy
    Paper

  • Enhancing Sequential Recommendations through Multi-Perspective Reflections and Iteration (2024)

    Weicong Qin, Yi Xu, Weijie Yu, et al.Weicong Qin, Yi Xu, Weijie Yu, Chenglei Shen, Xiao Zhang, Ming He, Jianping Fan, Jun Xu
    Paper

  • Controlling Large Language Model Agents with Entropic Activation Steering (2024)

    Nate Rahn, Pierluca D'Oro, Marc G BellemareNate Rahn, Pierluca D'Oro, Marc G Bellemare
    Paper

  • Chunks as arms: Multi-armed bandit-guided sampling for long-context llm preference optimization (2025)

    Shaohua Duan, Xinze Li, Zhenghao Liu, et al.Shaohua Duan, Xinze Li, Zhenghao Liu, Xiaoyuan Yi, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu, Maosong Sun
    Paper

  • Efficient jailbreak attack sequences on large language models via multi-armed bandit-based context switching (2025)

    Aditya Ramesh, Shivam Bhardwaj, Aditya Saibewar, et al.Aditya Ramesh, Shivam Bhardwaj, Aditya Saibewar, Manohar Kaul
    Paper

  • EVOLvE: Evaluating and Optimizing LLMs For In-Context Exploration (2025)

    Allen Nie, Yi Su, Bo Chang, et al.Allen Nie, Yi Su, Bo Chang, Jonathan Lee, Ed H. Chi, Quoc V Le, Minmin Chen
    Paper

  • Online Multi-LLM Selection via Contextual Bandits under Unstructured Context Evolution (2025)

    Manhin Poon, XiangXiang Dai, Xutong Liu, et al.Manhin Poon, XiangXiang Dai, Xutong Liu, Fang Kong, John Lui, Jinhang Zuo
    Paper

  • Context Attribution with Multi-Armed Bandit Optimization (2025)

    Deng Pan, Keerthiram Murugesan, Nuno Moniz, et al.Deng Pan, Keerthiram Murugesan, Nuno Moniz, Nitesh Chawla
    Paper

Retrieval-Augmented Generation

  • M-RAG: Reinforcing Large Language Model Performance through Retrieval-Augmented Generation with Multiple Partitions (2024)

    Zheng Wang, Shu Xian Teo, Jieer Ouyang, et al.Zheng Wang, Shu Xian Teo, Jieer Ouyang, Yongjun Xu, Wei Shi
    Paper

  • AutoRAG-HP: Automatic Online Hyper-Parameter Tuning for Retrieval-Augmented Generation (2024)

    Jia Fu, Xiaoting Qin, Fangkai Yang, et al.Jia Fu, Xiaoting Qin, Fangkai Yang, Lu Wang, Jue Zhang, Qingwei Lin, Yubo Chen, Dongmei Zhang, Saravan Rajmohan, Qi Zhang
    Paper

  • Advances in Neural Information Processing Systems (2024)

    Qinggang Zhang, Junnan Dong, Hao Chen, et al.Qinggang Zhang, Junnan Dong, Hao Chen, Daochen Zha, Zailiang Yu, Xiao Huang
    Paper

  • MBA-RAG: a Bandit Approach for Adaptive Retrieval-Augmented Generation through Question Complexity (2025)

    Xiaqiang Tang, Qiang Gao, Jian Li, et al.Xiaqiang Tang, Qiang Gao, Jian Li, Nan Du, Qi Li, Sihong Xie
    Paper

  • IEEE INFOCOM 2025 - IEEE Conference on Computer Communications (2025)

    Tao Ouyang, Guihang Hong, Kongyange Zhao, et al.Tao Ouyang, Guihang Hong, Kongyange Zhao, Zhi Zhou, Weigang Wu, Zhaobiao Lv, Xu Chen
    Paper

  • Adapting to non-stationary environments: Multi-armed bandit enhanced retrieval-augmented generation on knowledge graphs (2025)

    Xiaqiang Tang, Jian Li, Nan Du, et al.Xiaqiang Tang, Jian Li, Nan Du, Sihong Xie
    Paper

  • Context Attribution with Multi-Armed Bandit Optimization (2025)

    Deng Pan, Keerthiram Murugesan, Nuno Moniz, et al.Deng Pan, Keerthiram Murugesan, Nuno Moniz, Nitesh Chawla
    Paper

Inference Optimization

  • LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing (2025)

    Yang LiYang Li
    Paper

  • Adaptive llm routing under budget constraints (2025)

    Pranoy Panda, Raghav Magazine, Chaitanya Devaguptapu, et al.Pranoy Panda, Raghav Magazine, Chaitanya Devaguptapu, Sho Takemori, Vishal Sharma
    Paper

  • Dynamic and Cost-Efficient Deployment of Large Language Models Using Uplift Modeling and Multi Armed Bandits (2025)

    Ninad TongayNinad Tongay
    Paper

  • Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs (2025)

    Wang Wei, Tiankai Yang, Hongjie Chen, et al.Wang Wei, Tiankai Yang, Hongjie Chen, Yue Zhao, Franck Dernoncourt, Ryan A. Rossi, Hoda Eldardiry
    Paper

  • LLM Cache Bandit Revisited: Addressing Query Heterogeneity for Cost-Effective LLM Inference (2025)

    Hantao Yang, Hong Xie, Defu Lian, et al.Hantao Yang, Hong Xie, Defu Lian, Enhong Chen
    Paper

Decoding Strategies

  • BanditSpec: Adaptive Speculative Decoding via Bandit Algorithms (2025)

    Yunlong Hou, Fengzhuo Zhang, Cunxiao Du, et al.Yunlong Hou, Fengzhuo Zhang, Cunxiao Du, Xuan Zhang, Jiachun Pan, Tianyu Pang, Chao Du, Vincent YF Tan, Zhuoran Yang
    Paper

  • Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism (2024)

    Jiahao Liu, Qifan Wang, Jingang Wang, et al.Jiahao Liu, Qifan Wang, Jingang Wang, Xunliang Cai
    Paper

  • Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding for LLMs (2025)

    Hongyi Liu, Jiaji Huang, Zhen Jia, et al.Hongyi Liu, Jiaji Huang, Zhen Jia, Youngsuk Park, Yu-Xiang Wang
    Paper

  • Tokenized Bandit for LLM Decoding and Alignment (2025)

    Suho Shin, Chenghao Yang, Haifeng Xu, et al.Suho Shin, Chenghao Yang, Haifeng Xu, Mohammad T Hajiaghayi
    Paper

Adaptation and Personalization

  • Personalizing natural language understanding using multi-armed bandits and implicit feedback (2020)

    Fabian Moerchen, Patrick Ernst, Giovanni ZappellaFabian Moerchen, Patrick Ernst, Giovanni Zappella
    Paper

  • User Feedback-based Online Learning for Intent Classification (2023)

    Kaan G"on\cc, Baturay Sa\uglam, Onat Dalmaz, et al.Kaan G"on\cc, Baturay Sa\uglam, Onat Dalmaz, Tolga \cCukur, Serdar Kozat, Hamdi Dibeklioglu
    Paper

  • Online personalizing white-box llms generation with neural bandits (2024)

    Zekai Chen, Po-Yu Chen, Francois Buet-GolfouseZekai Chen, Po-Yu Chen, Francois Buet-Golfouse
    Paper

  • LLMs Are In-Context Bandit Reinforcement Learners (2024)

    Giovanni Monea, Antoine Bosselut, Kiant'e Brantley, et al.Giovanni Monea, Antoine Bosselut, Kiant'e Brantley, Yoav Artzi
    Paper

  • Cost-Effective Online Multi-LLM Selection with Versatile Reward Models (2024)

    Xiangxiang Dai, Jin Li, Xutong Liu, et al.Xiangxiang Dai, Jin Li, Xutong Liu, Anqi Yu, John Lui
    Paper

  • Tokenized Reinforcement Learning for LLM Generation: A Survey (2025)

    Minseok Shin, Anji Gao, Xiang Li, et al.Minseok Shin, Anji Gao, Xiang Li, Tianyi Xie, Wei Wang
    Paper

  • LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing (2025)

    Yang LiYang Li
    Paper

  • Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs (2025)

    Wang Wei, Tiankai Yang, Hongjie Chen, et al.Wang Wei, Tiankai Yang, Hongjie Chen, Yue Zhao, Franck Dernoncourt, Ryan A. Rossi, Hoda Eldardiry
    Paper

  • Comparing Exploration-Exploitation Strategies of LLMs and Humans: Insights from Standard Multi-armed Bandit Tasks (2025)

    Ziyuan Zhang, Darcy Wang, Ningyuan Chen, et al.Ziyuan Zhang, Darcy Wang, Ningyuan Chen, Rodrigo Mansur, Vahid Sarhangian
    Paper

📍 LLM-enhancements for Multi-armed Bandits

Regret Minimization Objective

  • On Bits and Bandits: Quantifying the Regret-Information Trade-off (2024)

    Itai Shufaro, Nadav Merlis, Nir Weinberger, et al.Itai Shufaro, Nadav Merlis, Nir Weinberger, Shie Mannor
    Paper

  • Beyond Numeric Awards: In-Context Dueling Bandits with LLM Agents (2024)

    Fanzeng Xia, Hao Liu, Yisong Yue, et al.Fanzeng Xia, Hao Liu, Yisong Yue, Tongxin Li
    Paper

  • Do llm agents have regret? a case study in online learning and games (2024)

    Chanwoo Park, Xiangyu Liu, Asuman Ozdaglar, et al.Chanwoo Park, Xiangyu Liu, Asuman Ozdaglar, Kaiqing Zhang
    Paper

  • LLMs and the Abstraction and Reasoning Corpus: Successes, Failures, and the Importance of Object-based Representations (2023)

    Ali Baheri, Aman Hosseini, Mehdi Jiang, et al.Ali Baheri, Aman Hosseini, Mehdi Jiang, Peter Chin
    Paper

  • Neural Dueling Bandits (2024)

    Arun Verma, Zhongxiang Dai, Xiaoqiang Lin, et al.Arun Verma, Zhongxiang Dai, Xiaoqiang Lin, Patrick Jaillet, Bryan Kian Hsiang Low
    Paper

  • LLM-informed multi-armed bandit strategies for non-stationary environments (2023)

    J De Curt`o, Irene de Zarz`a, Gemma Roig, et al.J De Curt`o, Irene de Zarz`a, Gemma Roig, Juan Carlos Cano, Pietro Manzoni, Carlos T Calafate
    Paper

Arm Definition

  • Neural Dueling Bandits (2024)

    Arun Verma, Zhongxiang Dai, Xiaoqiang Lin, et al.Arun Verma, Zhongxiang Dai, Xiaoqiang Lin, Patrick Jaillet, Bryan Kian Hsiang Low
    Paper

  • Beyond Numeric Awards: In-Context Dueling Bandits with LLM Agents (2024)

    Fanzeng Xia, Hao Liu, Yisong Yue, et al.Fanzeng Xia, Hao Liu, Yisong Yue, Tongxin Li
    Paper

  • LLMs and the Abstraction and Reasoning Corpus: Successes, Failures, and the Importance of Object-based Representations (2023)

    Ali Baheri, Aman Hosseini, Mehdi Jiang, et al.Ali Baheri, Aman Hosseini, Mehdi Jiang, Peter Chin
    Paper

  • Guiding pretraining in reinforcement learning with large language models (2023)

    Yuqing Du, Olivia Watkins, Zihan Wang, et al.Yuqing Du, Olivia Watkins, Zihan Wang, C'edric Colas, Trevor Darrell, Pieter Abbeel, Abhishek Gupta, Jacob Andreas
    Paper

  • Multi-Armed Bandit Approach for Optimizing Training on Synthetic Data (2024)

    Abdulrahman Kerim, Leandro Soriano Marcolino, Erickson R. Nascimento, et al.Abdulrahman Kerim, Leandro Soriano Marcolino, Erickson R. Nascimento, Richard Jiang
    Paper

  • Investigating the Relationship Between Physical Activity and Tailored Behavior Change Messaging: Connecting Contextual Bandit with Large Language Models (2025)

    Haochen Song, Dominik Hofer, Rania Islambouli, et al.Haochen Song, Dominik Hofer, Rania Islambouli, Laura Hawkins, Ananya Bhattacharjee, Meredith Franklin, Joseph Jay Williams
    Paper

Environment

  • LLM-informed multi-armed bandit strategies for non-stationary environments (2023)

    J De Curt`o, Irene de Zarz`a, Gemma Roig, et al.J De Curt`o, Irene de Zarz`a, Gemma Roig, Juan Carlos Cano, Pietro Manzoni, Carlos T Calafate
    Paper

  • Towards a Pretrained Model for Restless Bandits via Multi-arm Generalization (2024)

    Yunfan Zhao, Nikhil Behari, Edward Hughes, et al.Yunfan Zhao, Nikhil Behari, Edward Hughes, Edwin Zhang, Dheeraj Nagaraj, Karl Tuyls, Aparna Taneja, Milind Tambe
    Paper

  • Jump Starting Bandits with LLM-Generated Prior Knowledge (2024)

    Parand Alamdari, Yanshuai Cao, Kevin WilsonParand Alamdari, Yanshuai Cao, Kevin Wilson
    Paper

  • In-context impersonation reveals Large Language Models' strengths and biases (2024)

    Leonard Salewski, Stephan Alaniz, Isabel Rio-Torto, et al.Leonard Salewski, Stephan Alaniz, Isabel Rio-Torto, Eric Schulz, Zeynep Akata
    Paper

  • Multi-Armed Bandit Approach for Optimizing Training on Synthetic Data (2024)

    Abdulrahman Kerim, Leandro Soriano Marcolino, Erickson R. Nascimento, et al.Abdulrahman Kerim, Leandro Soriano Marcolino, Erickson R. Nascimento, Richard Jiang
    Paper

  • EnvGen: Generating and Adapting Environments via LLMs for Training Embodied Agents (2024)

    Abhay Zala, Jaemin Cho, Han Lin, et al.Abhay Zala, Jaemin Cho, Han Lin, Jaehong Yoon, Mohit Bansal
    Paper

  • Balancing act: prioritization strategies for llm-designed restless bandit rewards (2025)

    Shresth Verma, Niclas Boehmer, Lingkai Kong, et al.Shresth Verma, Niclas Boehmer, Lingkai Kong, Milind Tambe
    Paper

  • Investigating the Relationship Between Physical Activity and Tailored Behavior Change Messaging: Connecting Contextual Bandit with Large Language Models (2025)

    Haochen Song, Dominik Hofer, Rania Islambouli, et al.Haochen Song, Dominik Hofer, Rania Islambouli, Laura Hawkins, Ananya Bhattacharjee, Meredith Franklin, Joseph Jay Williams
    Paper

  • Toward efficient exploration by large language model agents (2025)

    Dilip Arumugam, Thomas L GriffithsDilip Arumugam, Thomas L Griffiths
    Paper

  • Prior-informed optimization of treatment recommendation via bandit algorithms trained on large language model-processed historical records (2025)

    Saman Nessari, Ali Bozorgi-AmiriSaman Nessari, Ali Bozorgi-Amiri
    Paper

Reward Formulation

  • Statistical and computational trade-off in multi-agent multi-armed bandits (2024)

    Filippo Vannella, Alexandre Proutiere, Jaeseong JeongFilippo Vannella, Alexandre Proutiere, Jaeseong Jeong
    Paper

  • On the Importance of Uncertainty in Decision-Making with Large Language Models (2024)

    Nicol`o Felicioni, Lucas Maystre, Sina Ghiassian, et al.Nicol`o Felicioni, Lucas Maystre, Sina Ghiassian, Kamil Ciosek
    Paper

  • A decision-language model (DLM) for dynamic restless multi-armed bandit tasks in public health (2024)

    Nikhil Behari, Edwin Zhang, Yunfan Zhao, et al.Nikhil Behari, Edwin Zhang, Yunfan Zhao, Aparna Taneja, Dheeraj Nagaraj, Milind Tambe
    Paper

  • Towards a Pretrained Model for Restless Bandits via Multi-arm Generalization (2024)

    Yunfan Zhao, Nikhil Behari, Edward Hughes, et al.Yunfan Zhao, Nikhil Behari, Edward Hughes, Edwin Zhang, Dheeraj Nagaraj, Karl Tuyls, Aparna Taneja, Milind Tambe
    Paper

  • Do llm agents have regret? a case study in online learning and games (2024)

    Chanwoo Park, Xiangyu Liu, Asuman Ozdaglar, et al.Chanwoo Park, Xiangyu Liu, Asuman Ozdaglar, Kaiqing Zhang
    Paper

  • Balancing act: prioritization strategies for llm-designed restless bandit rewards (2025)

    Shresth Verma, Niclas Boehmer, Lingkai Kong, et al.Shresth Verma, Niclas Boehmer, Lingkai Kong, Milind Tambe
    Paper

  • Large Language Model-Enhanced Multi-Armed Bandits (2025)

    Jiahang Sun, Zhiyong Wang, Runhan Yang, et al.Jiahang Sun, Zhiyong Wang, Runhan Yang, Chenjun Xiao, John C. S. Lui, Zhongxiang Dai
    Paper

  • Prior-informed optimization of treatment recommendation via bandit algorithms trained on large language model-processed historical records (2025)

    Saman Nessari, Ali Bozorgi-AmiriSaman Nessari, Ali Bozorgi-Amiri
    Paper

  • Prioritization Strategies for LLM-Designed Restless Bandit Rewards in Public Health (2024)

    Shresth Verma, Niclas Boehmer, Lingkai Kong, et al.Shresth Verma, Niclas Boehmer, Lingkai Kong, Milind Tambe
    Paper

  • Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents (2025)

    Fanzeng Xia, Hao Liu, Yisong Yue, et al.Fanzeng Xia, Hao Liu, Yisong Yue, Tongxin Li
    Paper

  • When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training (2025)

    Sanxing Chen, Xiaoyin Chen, Yukun Huang, et al.Sanxing Chen, Xiaoyin Chen, Yukun Huang, Roy Xie, Bhuwan Dhingra
    Paper

Sampling Strategy

  • Towards optimizing with large language models (2023)

    Pei-Fu Guo, Ying-Hsuan Chen, Yun-Da Tsai, et al.Pei-Fu Guo, Ying-Hsuan Chen, Yun-Da Tsai, Shou-De Lin
    Paper

  • On Bits and Bandits: Quantifying the Regret-Information Trade-off (2024)

    Itai Shufaro, Nadav Merlis, Nir Weinberger, et al.Itai Shufaro, Nadav Merlis, Nir Weinberger, Shie Mannor
    Paper

  • Efficient Sequential Decision Making with Large Language Models (2024)

    Dingyang Chen, Qi Zhang, Yinglun ZhuDingyang Chen, Qi Zhang, Yinglun Zhu
    Paper

  • Jump Starting Bandits with LLM-Generated Prior Knowledge (2024)

    Parand Alamdari, Yanshuai Cao, Kevin WilsonParand Alamdari, Yanshuai Cao, Kevin Wilson
    Paper

  • Cost-Effective Online Multi-LLM Selection with Versatile Reward Models (2024)

    Xiangxiang Dai, Jin Li, Xutong Liu, et al.Xiangxiang Dai, Jin Li, Xutong Liu, Anqi Yu, John Lui
    Paper

  • Large Language Model-Enhanced Multi-Armed Bandits (2025)

    Jiahang Sun, Zhiyong Wang, Runhan Yang, et al.Jiahang Sun, Zhiyong Wang, Runhan Yang, Chenjun Xiao, John C. S. Lui, Zhongxiang Dai
    Paper

  • When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training (2025)

    Sanxing Chen, Xiaoyin Chen, Yukun Huang, et al.Sanxing Chen, Xiaoyin Chen, Yukun Huang, Roy Xie, Bhuwan Dhingra
    Paper

  • Llms are greedy agents: Effects of rl fine-tuning on decision-making abilities (2025)

    Thomas Schmied, J"org Bornschein, Jordi Grau-Moya, et al.Thomas Schmied, J"org Bornschein, Jordi Grau-Moya, Markus Wulfmeier, Razvan Pascanu
    Paper

  • Evaluation of LLM Powered Agentic AI for Solving Multi-Arm Bandit Problems (2025)

    Jawad Hazime, Junaid FarooqJawad Hazime, Junaid Farooq
    Paper

  • TextBandit: Evaluating Probabilistic Reasoning in LLMs Through Language-Only Decision Tasks (2025)

    Jimin Lim, Arjun Damerla, Arthur Jiang, et al.Jimin Lim, Arjun Damerla, Arthur Jiang, Nam Le
    Paper

  • Toward efficient exploration by large language model agents (2025)

    Dilip Arumugam, Thomas L GriffithsDilip Arumugam, Thomas L Griffiths
    Paper

Action Decision

  • Using large language models for hyperparameter optimization (2023)

    Michael R Zhang, Nishkrit Desai, Juhan Bae, et al.Michael R Zhang, Nishkrit Desai, Juhan Bae, Jonathan Lorraine, Jimmy Ba
    Paper

  • Towards optimizing with large language models (2023)

    Pei-Fu Guo, Ying-Hsuan Chen, Yun-Da Tsai, et al.Pei-Fu Guo, Ying-Hsuan Chen, Yun-Da Tsai, Shou-De Lin
    Paper

  • LLMs for User Interest Exploration: A Hybrid Approach (2024)

    Jianling Wang, Haokai Lu, Yifan Liu, et al.Jianling Wang, Haokai Lu, Yifan Liu, He Ma, Yueqi Wang, Yang Gu, Shuzhou Zhang, Shuchao Bi, Lexi Baugher, Ed Chi, others
    Paper

  • Large language models as evolutionary optimizers (2024)

    Shengcai Liu, Caishun Chen, Xinghua Qu, et al.Shengcai Liu, Caishun Chen, Xinghua Qu, Ke Tang, Yew-Soon Ong
    Paper

  • Large Language Model-Enhanced Multi-Armed Bandits (2025)

    Jiahang Sun, Zhiyong Wang, Runhan Yang, et al.Jiahang Sun, Zhiyong Wang, Runhan Yang, Chenjun Xiao, John C. S. Lui, Zhongxiang Dai
    Paper

  • When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training (2025)

    Sanxing Chen, Xiaoyin Chen, Yukun Huang, et al.Sanxing Chen, Xiaoyin Chen, Yukun Huang, Roy Xie, Bhuwan Dhingra
    Paper

  • Evaluation of LLM Powered Agentic AI for Solving Multi-Arm Bandit Problems (2025)

    Jawad Hazime, Junaid FarooqJawad Hazime, Junaid Farooq
    Paper

  • Llms are greedy agents: Effects of rl fine-tuning on decision-making abilities (2025)

    Thomas Schmied, J"org Bornschein, Jordi Grau-Moya, et al.Thomas Schmied, J"org Bornschein, Jordi Grau-Moya, Markus Wulfmeier, Razvan Pascanu
    Paper

  • TextBandit: Evaluating Probabilistic Reasoning in LLMs Through Language-Only Decision Tasks (2025)

    Jimin Lim, Arjun Damerla, Arthur Jiang, et al.Jimin Lim, Arjun Damerla, Arthur Jiang, Nam Le
    Paper

  • Toward efficient exploration by large language model agents (2025)

    Dilip Arumugam, Thomas L GriffithsDilip Arumugam, Thomas L Griffiths
    Paper

👨‍💻 Team

Here is the list of our contributors in each modality of this repository.

Modality/TaskContributors
Bandit for LLMSiguang Chen, Miao Xie
LLM for BanditSiguang Chen, Miao Xie
Reference URL OrganizationYuan Wang

😉 Citation

If you find this work useful in your research, Please cite the paper as below:

@article{xxx,
    
}