A curated list of papers and resources based on our survey paper "PlanGenLLMs: A Modern Survey of LLM Planning Capabilities", which is published at ACL 2025.
The template is adapted from Awesome-Language-Model-on-Graphs.
Please cite the paper in Citation and star this repository if you find the paper list and resources in this repository helpful for your research. Thanks!
LLMs have immense potential for generating plans, transforming an initial world state into a desired goal state. A large body of research has explored the use of LLMs for various planning tasks, from web navigation to travel planning and database querying. However, many of these systems are tailored to specific problems, making it challenging to compare them or determine the best approach for new tasks. There is also a lack of clear and consistent evaluation criteria. Our survey aims to offer a comprehensive overview of current LLM planners to fill this gap. It builds on foundational work by Kartam and Wilkins (1990) and examines six key performance criteria: completeness, executability, optimality, representation, generalization, and efficiency. For each, we provide a thorough analysis of representative works and highlight their strengths and weaknesses. Our paper also identifies crucial future directions, making it a valuable resource for both practitioners and newcomers interested in leveraging LLM planning to support agentic workflows.
- Awesome-LLM-Planning-Capability
-
Describe, Explain, Plan and Select: Interactive Planning with LLMs Enables Open-World Multi-Task Agents
NeurIPS 2023Zihao Wang, Shaofei Cai, Guanzhou Chen, Anji Liu, Xiaojian Ma, Yitao Liang [PDF] [Code]
-
ProgPrompt: Generating Situated Robot Task Plans using Large Language Models.
ICRA 2023Ishika Singh, Valts Blukis, Arsalan Mousavian, Ankit Goyal, Danfei Xu, Jonathan Tremblay, Dieter Fox, Jesse Thomason, Animesh Garg [PDF] [Code]
-
Can Graph Learning Improve Planning in LLM-based Agents?
NeurIPS 2024Xixi Wu, Yifei Shen, Caihua Shan, Kaitao Song, Siwei Wang, Bohang Zhang, Jiarui Feng, Hong Cheng, Wei Chen, Yun Xiong, Dongsheng Li [PDF] [Code]
-
AdaPlanner: Adaptive Planning from Feedback with Language Models
NeurIPS 2023Haotian Sun, Yuchen Zhuang, Lingkai Kong, Bo Dai, Chao Zhang [PDF] [Code]
-
SelfGoal: Your Language Agents Already Know How to Achieve High-level Goals
NACCL 2025Ruihan Yang, Jiangjie Chen, Yikai Zhang, Siyu Yuan, Aili Chen, Kyle Richardson, Yanghua Xiao, Deqing Yang [PDF] [Code]
-
Adapt: As-needed decomposition and planning with language models
NAACL 2024 FindingsArchiki Prasad, Alexander Koller, Mareike Hartmann, Peter Clark, Ashish Sabharwal, Mohit Bansal, Tushar Khot [PDF] [Code]
-
LLM+P: Empowering Large Language Models with Optimal Planning Proficiency
PreprintBo Liu, Yuqian Jiang, Xiaohan Zhang, Qiang Liu, Shiqi Zhang, Joydeep Biswas, Peter Stone [PDF] [Code]
-
Dynamic Planning with a LLM
NeurIPS 2024 LanGame Workshop -
Leveraging Pre-trained Large Language Models to Construct and Utilize World Models for Model-based Task Planning
NeurIPS 2023Lin Guan, Karthik Valmeekam, Sarath Sreedharan, Subbarao Kambhampati [PDF] [Code]
-
Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models
ICML 2024Andy Zhou, Kai Yan, Michal Shlapentokh-Rothman, Haohan Wang, Yu-Xiong Wang [PDF] [Code]
-
On the Planning Abilities of Large Language Models (A Critical Investigation with a Proposed Benchmark)
NeurIPS 2023Karthik Valmeekam, Sarath Sreedharan, Matthew Marquez, Alberto Olmo, Subbarao Kambhampati [PDF] [Code]
-
What's the Plan? Evaluating and Developing Planning-Aware Techniques for Language Models
PreprintEran Hirsch, Guy Uziel, Ateret Anaby-Tavor [PDF]
-
Tree Search for Language Model Agents
PreprintJing Yu Koh, Stephen McAleer, Daniel Fried, Ruslan Salakhutdinov [PDF] [Code]
-
Tree of Thoughts: Deliberate Problem Solving with Large Language Models
NeurIPS 2023Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao, Karthik Narasimhan [PDF] [Code]
-
Thought of Search: Planning with Language Models Through The Lens of Efficiency
NeurIPS 2024Michael Katz, Harsha Kokel, Kavitha Srinivas, Shirin Sohrabi [PDF]
-
Large Language Models as Commonsense Knowledge for Large-Scale Task Planning
NeurIPS 2023 -
Reasoning with Language Model is Planning with World Model ``
Shibo Hao, Yi Gu, Haodi Ma, Joshua Jiahua Hong, Zhen Wang, Daisy Zhe Wang, Zhiting Hu [PDF] [Code]
-
Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models
ICML 2024Andy Zhou, Kai Yan, Michal Shlapentokh-Rothman, Haohan Wang, Yu-Xiong Wang [PDF] [Code]
-
What's the Plan? Evaluating and Developing Planning-Aware Techniques for Language Models
PreprintEran Hirsch, Guy Uziel, Ateret Anaby-Tavor [PDF]
-
Tree Search for Language Model Agents
PreprintJing Yu Koh, Stephen McAleer, Daniel Fried, Ruslan Salakhutdinov [PDF] [Code]
-
Monte Carlo Planning with Large Language Model for Text-Based Game Agents
ICLR 2025 -
Scaling Autonomous Agents via Automatic Reward Modeling And Planning
ICLR 2025Zhenfang Chen, Delin Chen, Rui Sun, Wenjun Liu, Chuang Gan [PDF] [Code]
-
Visually-Grounded Planning without Vision: Language Models Infer Detailed Plans from High-level Instructions
EMNLP 2020 FindingsPeter A. Jansen [PDF]
-
Learning to Reason over Scene Graphs: A Case Study of Finetuning GPT-2 into a Robot Language Model for Grounded Task Planning
Frontiers in Robotics and AIGeorgia Chalvatzaki, Ali Younes, Daljeet Nandha, An Le, Leonardo F. R. Ribeiro, Iryna Gurevych [PDF]
-
Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents
ACL 2024Yifan Song, Da Yin, Xiang Yue, Jie Huang, Sujian Li, Bill Yuchen Lin [PDF] [Code]
-
Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models
ACL 2024 FindingsZehui Chen, Kuikun Liu, Qiuchen Wang, Wenwei Zhang, Jiangning Liu, Dahua Lin, Kai Chen, Feng Zhao [PDF] [Code]
-
AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning
NAACL 2025Jianguo Zhang, Tian Lan, Rithesh Murthy, Zhiwei Liu, Weiran Yao, Ming Zhu, Juntao Tan, Thai Hoang, Zuxin Liu, Liangwei Yang, Yihao Feng, Shirley Kokane, Tulika Awalgaonkar, Juan Carlos Niebles, Silvio Savarese, Shelby Heinecke, Huan Wang, Caiming Xiong [PDF] [Code]
-
Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents
NAACL 2025Renxi Wang, Haonan Li, Xudong Han, Yixuan Zhang, Timothy Baldwin [PDF] [Code]
-
Leveraging Pre-trained Large Language Models to Construct and Utilize World Models for Model-based Task Planning
NeurIPS 2023Lin Guan, Karthik Valmeekam, Sarath Sreedharan, Subbarao Kambhampati [PDF] [Code]
-
Large Language Models Can Solve Real-World Planning Rigorously with Formal Verification Tools
NAACL 2025Yilun Hao, Yongchao Chen, Yang Zhang, Chuchu Fan [PDF] [Code]
-
Can Large Language Models be Good Path Planners? A Benchmark and Investigation on Spatial-temporal Reasoning
ICLR 2024 Workshop on Large Language Model (LLM) Agents -
LLMs Still Can't Plan; Can LRMs? A Preliminary Evaluation of OpenAI's o1 on PlanBench
PreprintKarthik Valmeekam, Kaya Stechly, Subbarao Kambhampati [PDF]
-
Thought of Search: Planning with Language Models Through The Lens of Efficiency
NeurIPS 2024Michael Katz, Harsha Kokel, Kavitha Srinivas, Shirin Sohrabi [PDF]
-
AdaPlanner: Adaptive Planning from Feedback with Language Models
NeurIPS 2023Haotian Sun, Yuchen Zhuang, Lingkai Kong, Bo Dai, Chao Zhang [PDF] [Code]
-
Inner Monologue: Embodied Reasoning through Planning with Language Models
CoRL 2022Wenlong Huang, Fei Xia, Ted Xiao, Harris Chan, Jacky Liang, Pete Florence, Andy Zeng, Jonathan Tompson, Igor Mordatch, Yevgen Chebotar, Pierre Sermanet, Noah Brown, Tomas Jackson, Linda Luu, Sergey Levine, Karol Hausman, Brian Ichter [PDF]
-
Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
PreprintMichael Ahn, Anthony Brohan, Noah Brown, Yevgen Chebotar, Omar Cortes, Byron David, Chelsea Finn, Chuyuan Fu, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Daniel Ho, Jasmine Hsu, Julian Ibarz, Brian Ichter, Alex Irpan, Eric Jang, Rosario Jauregui Ruano, Kyle Jeffrey, Sally Jesmonth, Nikhil J Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Kuang-Huei Lee, Sergey Levine, Yao Lu, Linda Luu, Carolina Parada, Peter Pastor, Jornell Quiambao, Kanishka Rao, Jarek Rettinghouse, Diego Reyes, Pierre Sermanet, Nicolas Sievers, Clayton Tan, Alexander Toshev, Vincent Vanhoucke, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Mengyuan Yan, Andy Zeng [PDF] [Code]
-
LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language Models
ICCV 2023Chan Hee Song, Jiaman Wu, Clayton Washington, Brian M. Sadler, Wei-Lun Chao, Yu Su [PDF] [Code]
-
Skill Induction and Planning with Latent Language
ACL 2022Pratyusha Sharma, Antonio Torralba, Jacob Andreas [PDF]
-
Adapt: As-needed decomposition and planning with language models
NAACL 2024 FindingsArchiki Prasad, Alexander Koller, Mareike Hartmann, Peter Clark, Ashish Sabharwal, Mohit Bansal, Tushar Khot [PDF] [Code]
-
Dynamic Planning with a LLM
NeurIPS 2024 LanGame Workshop -
Large Language Models as Commonsense Knowledge for Large-Scale Task Planning
NeurIPS 2023 -
On Grounded Planning for Embodied Tasks with Language Models
AAAI 2023Bill Yuchen Lin, Chengsong Huang, Qian Liu, Wenda Gu, Sam Sommerer, Xiang Ren [PDF] [Code]
-
LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language Models
ICCV 2023Chan Hee Song, Jiaman Wu, Clayton Washington, Brian M. Sadler, Wei-Lun Chao, Yu Su [PDF] [Code]
-
Grounding LLMs For Robot Task Planning Using Closed-loop State Feedback
PreprintVineet Bhat, Ali Umut Kaypak, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami [PDF]
-
Planning with Large Language Models via Corrective Re-prompting
NeurIPS 2022 Foundation Models for Decision Making WorkshopShreyas Sundara Raman, Vanya Cohen, Eric Rosen, Ifrah Idrees, David Paulius and Stefanie Tellex [PDF]
-
SayCanPay: Heuristic Planning with Large Language Models using Learnable Domain Knowledge
AAAI 2024Rishi Hazra, Pedro Zuidberg Dos Martires, Luc De Raedt [PDF] [Code]
-
Distilling Script Knowledge from Large Language Models for Constrained Language Planning
ACL 2023Siyu Yuan, Jiangjie Chen, Ziquan Fu, Xuyang Ge, Soham Shah, Charles Robert Jankowski, Yanghua Xiao, Deqing Yang [PDF] [Code]
-
PlaSma: Making Small Language Models Better Procedural Knowledge Models for (Counterfactual) Planning
ICLR 2024Faeze Brahman, Chandra Bhagavatula, Valentina Pyatkin, Jena D. Hwang, Xiang Lorraine Li, Hirona J. Arai, Soumya Sanyal, Keisuke Sakaguchi, Xiang Ren, Yejin Choi [PDF] [Code]
-
Trust the PRoC3S: Solving Long-Horizon Robotics Problems with LLMs and Constraint Satisfaction
CoRL 2024Aidan Curtis, Nishanth Kumar, Jing Cao, Tomás Lozano-Pérez, Leslie Pack Kaelbling [PDF] [Code]
-
Planning with Large Language Models via Corrective Re-prompting
NeurIPS 2022 Foundation Models for Decision Making WorkshopShreyas Sundara Raman, Vanya Cohen, Eric Rosen, Ifrah Idrees, David Paulius and Stefanie Tellex [PDF]
-
ProgPrompt: Generating Situated Robot Task Plans using Large Language Models.
ICRA 2023Ishika Singh, Valts Blukis, Arsalan Mousavian, Ankit Goyal, Danfei Xu, Jonathan Tremblay, Dieter Fox, Jesse Thomason, Animesh Garg [PDF] [Code]
-
Adapt: As-needed decomposition and planning with language models
NAACL 2024 FindingsArchiki Prasad, Alexander Koller, Mareike Hartmann, Peter Clark, Ashish Sabharwal, Mohit Bansal, Tushar Khot [PDF] [Code]
-
SelfGoal: Your Language Agents Already Know How to Achieve High-level Goals
NACCL 2025Ruihan Yang, Jiangjie Chen, Yikai Zhang, Siyu Yuan, Aili Chen, Kyle Richardson, Yanghua Xiao, Deqing Yang [PDF] [Code]
-
AdaPlanner: Adaptive Planning from Feedback with Language Models
NeurIPS 2023Haotian Sun, Yuchen Zhuang, Lingkai Kong, Bo Dai, Chao Zhang [PDF] [Code]
-
ISR-LLM: Iterative Self-Refined Large Language Model for Long-Horizon Sequential Task Planning
ICRA 2024Zhehua Zhou, Jiayang Song, Kunpeng Yao, Zhan Shu, Lei Ma [PDF] [Code]
-
To the Globe (TTG): Towards Language-Driven Guaranteed Travel Planning
EMNLP 2025 System DemonstrationsDa Ju, Song Jiang, Andrew Cohen, Aaron Foss, Sasha Mitts, Arman Zharmagambetov, Brandon Amos, Xian Li, Justine T Kao, Maryam Fazel-Zarandi, Yuandong Tian [PDF]
-
Planning Anything with Rigor: General-Purpose Zero-Shot Planning with LLM-based Formalized Programming
ICLR 2025
-
ToolChain: Efficient Action Space Navigation in Large Language Models with A Search**
ICLR 2024Yuchen Zhuang, Xiang Chen, Tong Yu, Saayan Mitra, Victor Bursztyn, Ryan A. Rossi, Somdeb Sarkhel, Chao Zhang [PDF]
-
SayCanPay: Heuristic Planning with Large Language Models using Learnable Domain Knowledge
AAAI 2024Rishi Hazra, Pedro Zuidberg Dos Martires, Luc De Raedt [PDF] [Code]
-
Beyond A*: Better Planning with Transformers via Search Dynamics Bootstrapping
COLM 2024Lucas Lehnert, Sainbayar Sukhbaatar, DiJia Su, Qinqing Zheng, Paul Mcvay, Michael Rabbat, Yuandong Tian [PDF] [Code]
-
Translating Natural Language to Planning Goals with Large-Language Models
PreprintYaqi Xie, Chen Yu, Tongyao Zhu, Jinbin Bai, Ze Gong, Harold Soh [PDF] [Code] -
ISR-LLM: Iterative Self-Refined Large Language Model for Long-Horizon Sequential Task Planning
ICRA 2024Zhehua Zhou, Jiayang Song, Kunpeng Yao, Zhan Shu, Lei Ma [PDF] [Code]
-
AdaPlanner: Adaptive Planning from Feedback with Language Models
NeurIPS 2023Haotian Sun, Yuchen Zhuang, Lingkai Kong, Bo Dai, Chao Zhang [PDF] [Code]
-
Generalized Planning in PDDL Domains with Pretrained Large Language Models
AAAI 2024Tom Silver, Soham Dan, Kavitha Srinivas, Joshua B. Tenenbaum, Leslie Pack Kaelbling, Michael Katz [PDF] [Code]
-
LLM+P: Empowering Large Language Models with Optimal Planning Proficiency
PreprintBo Liu, Yuqian Jiang, Xiaohan Zhang, Qiang Liu, Shiqi Zhang, Joydeep Biswas, Peter Stone [PDF] [Code]
-
Data-Efficient Learning of Natural Language to Linear Temporal Logic Translators for Robot Task Specification
ICRA 2023 -
Dynamic Planning with a LLM
NeurIPS 2024 LanGame Workshop -
Leveraging Pre-trained Large Language Models to Construct and Utilize World Models for Model-based Task Planning
NeurIPS 2023Lin Guan, Karthik Valmeekam, Sarath Sreedharan, Subbarao Kambhampati [PDF] [Code]
-
On Grounded Planning for Embodied Tasks with Language Models
AAAI 2023Bill Yuchen Lin, Chengsong Huang, Qian Liu, Wenda Gu, Sam Sommerer, Xiang Ren [PDF] [Code]
-
Chain-of-Symbol Prompting Elicits Planning in Large Langauge Models
COLM 2024Hanxu Hu, Hongyuan Lu, Huajian Zhang, Yun-Ze Song, Wai Lam, Yue Zhang [PDF] [Code]
-
Can Large Language Models be Good Path Planners? A Benchmark and Investigation on Spatial-temporal Reasoning
ICLR 2024 Workshop on Large Language Model (LLM) Agents -
AdaPlanner: Adaptive Planning from Feedback with Language Models
NeurIPS 2023Haotian Sun, Yuchen Zhuang, Lingkai Kong, Bo Dai, Chao Zhang [PDF] [Code]
-
Graph-enhanced Large Language Models in Asynchronous Plan Reasoning
ICML 2024Fangru Lin, Emanuele La Malfa, Valentin Hofmann, Elle Michelle Yang, Anthony Cohn, Janet B. Pierrehumbert [PDF] [Code]
-
Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
PreprintMichael Ahn, Anthony Brohan, Noah Brown, Yevgen Chebotar, Omar Cortes, Byron David, Chelsea Finn, Chuyuan Fu, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Daniel Ho, Jasmine Hsu, Julian Ibarz, Brian Ichter, Alex Irpan, Eric Jang, Rosario Jauregui Ruano, Kyle Jeffrey, Sally Jesmonth, Nikhil J Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Kuang-Huei Lee, Sergey Levine, Yao Lu, Linda Luu, Carolina Parada, Peter Pastor, Jornell Quiambao, Kanishka Rao, Jarek Rettinghouse, Diego Reyes, Pierre Sermanet, Nicolas Sievers, Clayton Tan, Alexander Toshev, Vincent Vanhoucke, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Mengyuan Yan, Andy Zeng [PDF] [Code]
-
Can Graph Learning Improve Planning in LLM-based Agents?
NeurIPS 2024Xixi Wu, Yifei Shen, Caihua Shan, Kaitao Song, Siwei Wang, Bohang Zhang, Jiarui Feng, Hong Cheng, Wei Chen, Yun Xiong, Dongsheng Li [PDF] [Code]
-
Generalized Planning in PDDL Domains with Pretrained Large Language Models
AAAI 2024Tom Silver, Soham Dan, Kavitha Srinivas, Joshua B. Tenenbaum, Leslie Pack Kaelbling, Michael Katz [PDF] [Code]
-
ProgPrompt: Generating Situated Robot Task Plans using Large Language Models.
ICRA 2023Ishika Singh, Valts Blukis, Arsalan Mousavian, Ankit Goyal, Danfei Xu, Jonathan Tremblay, Dieter Fox, Jesse Thomason, Animesh Garg [PDF] [Code]
-
Pre-Trained Language Models for Interactive Decision-Making
NeurIPS 2022Shuang Li, Xavier Puig, Chris Paxton, Yilun Du, Clinton Wang, Linxi Fan, Tao Chen, De-An Huang, Ekin Akyürek, Anima Anandkumar, Jacob Andreas, Igor Mordatch, Antonio Torralba, Yuke Zhu [PDF] [Code]
-
Learning to Reason over Scene Graphs: A Case Study of Finetuning GPT-2 into a Robot Language Model for Grounded Task Planning
Frontiers in Robotics and AIGeorgia Chalvatzaki, Ali Younes, Daljeet Nandha, An Le, Leonardo F. R. Ribeiro, Iryna Gurevych [PDF]
-
Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents
ACL 2024Yifan Song, Da Yin, Xiang Yue, Jie Huang, Sujian Li, Bill Yuchen Lin [PDF] [Code]
-
Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models
ACL 2024 FindingsZehui Chen, Kuikun Liu, Qiuchen Wang, Wenwei Zhang, Jiangning Liu, Dahua Lin, Kai Chen, Feng Zhao [PDF] [Code]
-
AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning
NAACL 2025Jianguo Zhang, Tian Lan, Rithesh Murthy, Zhiwei Liu, Weiran Yao, Ming Zhu, Juntao Tan, Thai Hoang, Zuxin Liu, Liangwei Yang, Yihao Feng, Shirley Kokane, Tulika Awalgaonkar, Juan Carlos Niebles, Silvio Savarese, Shelby Heinecke, Huan Wang, Caiming Xiong [PDF] [Code]
-
Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents
NAACL 2025Renxi Wang, Haonan Li, Xudong Han, Yixuan Zhang, Timothy Baldwin [PDF] [Code]
-
Generalized Planning in PDDL Domains with Pretrained Large Language Models
AAAI 2024Tom Silver, Soham Dan, Kavitha Srinivas, Joshua B. Tenenbaum, Leslie Pack Kaelbling, Michael Katz [PDF] [Code]
- Voyager: An Open-Ended Embodied Agent with Large Language Models
TMLR
Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar [PDF] [Code]
-
AdaPlanner: Adaptive Planning from Feedback with Language Models
NeurIPS 2023Haotian Sun, Yuchen Zhuang, Lingkai Kong, Bo Dai, Chao Zhang [PDF] [Code]
-
Query-Efficient Planning with Language Models
PreprintGonzalo Gonzalez-Pumariega, Wayne Chen, Kushal Kedia, Sanjiban Choudhury [PDF] [Code]
-
Thought of Search: Planning with Language Models Through The Lens of Efficiency
NeurIPS 2024Michael Katz, Harsha Kokel, Kavitha Srinivas, Shirin Sohrabi [PDF]
-
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
ICLR 2024Mengkang Hu, Yao Mu, Xinmiao Yu, Mingyu Ding, Shiguang Wu, Wenqi Shao, Qiguang Chen, Bin Wang, Yu Qiao, Ping Luo [PDF] [Code]
-
Chain-of-Symbol Prompting Elicits Planning in Large Langauge Models
COLM 2024Hanxu Hu, Hongyuan Lu, Huajian Zhang, Yun-Ze Song, Wai Lam, Yue Zhang [PDF] [Code]
-
Beyond A*: Better Planning with Transformers via Search Dynamics Bootstrapping
COLM 2024Lucas Lehnert, Sainbayar Sukhbaatar, DiJia Su, Qinqing Zheng, Paul Mcvay, Michael Rabbat, Yuandong Tian [PDF] [Code]
-
Describe, Explain, Plan and Select: Interactive Planning with LLMs Enables Open-World Multi-Task Agents
NeurIPS 2023Zihao Wang, Shaofei Cai, Guanzhou Chen, Anji Liu, Xiaojian Ma, Yitao Liang [PDF] [Code]
-
Dynamic Planning with a LLM
NeurIPS 2024 LanGame Workshop
-
PlaSma: Making Small Language Models Better Procedural Knowledge Models for (Counterfactual) Planning
ICLR 2024Faeze Brahman, Chandra Bhagavatula, Valentina Pyatkin, Jena D. Hwang, Xiang Lorraine Li, Hirona J. Arai, Soumya Sanyal, Keisuke Sakaguchi, Xiang Ren, Yejin Choi [PDF] [Code]
Embodied Environment
-
BlocksWorld [Code]
-
Logistics [Code]
-
PlanBenchPlanBench: An Extensible Benchmark for Evaluating Large Language Models on Planning and Reasoning about ChangeNeurIPS 2023 Track on Datasets and BenchmarksKarthik Valmeekam, Matthew Marquez, Alberto Olmo, Sarath Sreedharan, Subbarao Kambhampati [PDF] [Code] -
ALFREDALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday TasksCVPR 2020Mohit Shridhar, Jesse Thomason, Daniel Gordon, Yonatan Bisk, Winson Han, Roozbeh Mottaghi, Luke Zettlemoyer, Dieter Fox [PDF] [Code]
-
VirtualHomeVirtualHome: Simulating Household Activities via ProgramsCVPR 2018Xavier Puig, Kevin Ra, Marko Boben, Jiaman Li, Tingwu Wang, Sanja Fidler, Antonio Torralba [PDF] [Code]
-
ALFWorldALFWorld: Aligning Text and Embodied Environments for Interactive LearningICLR 2021Mohit Shridhar, Xingdi Yuan, Marc-Alexandre Côté, Yonatan Bisk, Adam Trischler, Matthew Hausknecht [PDF] [Code]
-
Embodied Agent InterfaceExecutability-FocusedEmbodied Agent Interface: Benchmarking LLMs for Embodied Decision MakingNeurIPS 2024 Track on Datasets and BenchmarksManling Li, Shiyu Zhao, Qineng Wang, Kangrui Wang, Yu Zhou, Sanjana Srivastava, Cem Gokmen, Tony Lee, Li Erran Li, Ruohan Zhang, Weiyu Liu, Percy Liang, Li Fei-Fei, Jiayuan Mao, Jiajun Wu [PDF] [Code]
-
Open Grounded PlanningExecutability-FocusedOpen Grounded Planning: Challenges and Benchmark ConstructionACL 2024Shiguang Guo, Ziliang Deng, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun [PDF] [Code]
-
PPNLExecutability-FocusedCompleteness-FocusedCan Large Language Models be Good Path Planners? A Benchmark and Investigation on Spatial-temporal ReasoningICLR 2024 Workshop on Large Language Model (LLM) Agents -
AsyncHowOptimality-FocusedGraph-enhanced Large Language Models in Asynchronous Plan ReasoningICML 2024Fangru Lin, Emanuele La Malfa, Valentin Hofmann, Elle Michelle Yang, Anthony Cohn, Janet B. Pierrehumbert [PDF] [Code]
-
PlanetariumRepresentation-FocusedPlanetarium: A Rigorous Benchmark for Translating Text to Structured Planning LanguagesNAACL 2025Max Zuo, Francisco Piedrahita Velez, Xiaochen Li, Michael L. Littman, Stephen H. Bach [PDF] [Code]
-
PARTNRPARTNR: A Benchmark for Planning and Reasoning in Embodied Multi-agent TasksICLR 2025Matthew Chang, Gunjan Chhablani, Alexander Clegg, Mikael Dallaire Cote, Ruta Desai, Michal Hlavac, Vladimir Karashchuk, Jacob Krantz, Roozbeh Mottaghi, Priyam Parashar, Siddharth Patki, Ishita Prasad, Xavier Puig, Akshara Rai, Ram Ramrakhya, Daniel Tran, Joanne Truong, John M. Turner, Eric Undersander, Tsung-Yen Yang [PDF] [Code]
-
RobotouilleOptimality-FocusedRobotouille: An Asynchronous Planning Benchmark for LLM AgentsICLR 2025Gonzalo Gonzalez-Pumariega, Leong Su Yean, Neha Sunkara, Sanjiban Choudhury [PDF] [Code]
Task Scheduling
-
TravelPlannerExecutability-FoucsedTravelPlanner: A Benchmark for Real-World Planning with Language AgentsICML 2024Jian Xie, Kai Zhang, Jiangjie Chen, Tinghui Zhu, Renze Lou, Yuandong Tian, Yanghua Xiao, Yu Su [PDF] [Code]
-
Natural PlanNATURAL PLAN: Benchmarking LLMs on Natural Language PlanningPreprintHuaixiu Steven Zheng, Swaroop Mishra, Hugh Zhang, Xinyun Chen, Minmin Chen, Azade Nova, Le Hou, Heng-Tze Cheng, Quoc V. Le, Ed H. Chi, Denny Zhou [PDF] [Code]
Game
-
MineCraft [Code]
-
SmartPlaySmartPlay: A Benchmark for LLMs as Intelligent AgentsICLR 2024 -
AUCARENAPut Your Money Where Your Mouth Is: Evaluating Strategic Planning and Execution of LLM Agents in an Auction ArenaPreprintJiangjie Chen, Siyu Yuan, Rong Ye, Bodhisattwa Prasad Majumder, Kyle Richardson [PDF] [Code]
-
GAMABenchHow Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent EnvironmentsICLR 2025Jen-tse Huang, Eric John Li, Man Ho Lam, Tian Liang, Wenxuan Wang, Youliang Yuan, Wenxiang Jiao, Xing Wang, Zhaopeng Tu, Michael R. Lyu [PDF] [Code]
Task Decomposition
-
CoScriptExecutability-FocusedDistilling Script Knowledge from Large Language Models for Constrained Language PlanningACL 2023Siyu Yuan, Jiangjie Chen, Ziquan Fu, Xuyang Ge, Soham Shah, Charles Robert Jankowski, Yanghua Xiao, Deqing Yang [PDF] [Code]
-
TaskLAMATaskLAMA: Probing the Complex Task Understanding of Language ModelsAAAI 2024Quan Yuan, Mehran Kazemi, Xin Xu, Isaac Noble, Vaiva Imbrasaite, Deepak Ramachandran [PDF]
-
WorldAPIsWorldAPIs: The World Is Worth How Many APIs? A Thought ExperimentACL 2024 NLRSE WorkshopJiefu Ou, Arda Uzunoglu, Benjamin Van Durme, Daniel Khashabi [PDF]
Reasoning
-
PrOntoQALanguage Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-ThoughtICLR 2023 -
GSM8KTraining Verifiers to Solve Math Word ProblemsPreprintKarl Cobbe, Vineet Kosaraju, Mohammad Bavarian, Mark Chen, Heewoo Jun, Lukasz Kaiser, Matthias Plappert, Jerry Tworek, Jacob Hilton, Reiichiro Nakano, Christopher Hesse, John Schulman [PDF] [Code]
-
AgentBenchAgentBench: Evaluating LLMs as AgentsPreprintXiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, Jie Tang [PDF] [Code]
-
SWE-BenchSWE-bench: Can Language Models Resolve Real-World GitHub Issues?ICLR 2024Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan [PDF] [Code]
Tool Usage
-
ToolBenchOn the Tool Manipulation Capability of Open-source Large Language ModelsPreprintQiantong Xu, Fenglu Hong, Bo Li, Changran Hu, Zhengyu Chen, Jian Zhang [PDF] [Code]
-
API-BankAPI-Bank: A Comprehensive Benchmark for Tool-Augmented LLMsEMNLP 2023Minghao Li, Yingxiu Zhao, Bowen Yu, Feifan Song, Hangyu Li, Haiyang Yu, Zhoujun Li, Fei Huang, Yongbin Li [PDF] [Code]
-
TPTUTPTU: Large Language Model-based AI Agents for Task Planning and Tool UsagePreprintJingqing Ruan, Yihong Chen, Bin Zhang, Zhiwei Xu, Tianpeng Bao, Guoqing Du, Shiwei Shi, Hangyu Mao, Ziyue Li, Xingyu Zeng, Rui Zhao [PDF]
Web
-
WebArenaWebArena: A Realistic Web Environment for Building Autonomous AgentsICLR 2024Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, Graham Neubig [PDF] [Code]
-
Mind2WebMind2Web: Towards a Generalist Agent for the WebNeurIPS 2023 Track on Datasets and Benchmarks.Xiang Deng, Yu Gu, Boyuan Zheng, Shijie Chen, Samuel Stevens, Boshi Wang, Huan Sun, Yu Su [PDF] [Code]
Programming
-
CodePlanCodePlan: Repository-level Coding using LLMs and PlanningFSE 2024Ramakrishna Bairi, Atharv Sonwane, Aditya Kanade, Vageesh D C, Arun Iyer, Suresh Parthasarathy, Sriram Rajamani, B. Ashok, Shashank Shet [PDF] [Code] -
SpiderSpider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL TaskEMNLP 2018Tao Yu, Rui Zhang, Kai Yang, Michihiro Yasunaga, Dongxu Wang, Zifan Li, James Ma, Irene Li, Qingning Yao, Shanelle Roman, Zilin Zhang, Dragomir Radev [PDF] [Code]
-
BirdCan LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLsNeurIPS 2023 Track on Datasets and Benchmarks.Jinyang Li, Binyuan Hui, Ge Qu, Jiaxi Yang, Binhua Li, Bowen Li, Bailin Wang, Bowen Qin, Rongyu Cao, Ruiying Geng, Nan Huo, Xuanhe Zhou, Chenhao Ma, Guoliang Li, Kevin C.C. Chang, Fei Huang, Reynold Cheng, Yongbin Li [PDF] [Code]
Generation
-
VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning
COLM 2024 -
DiagrammerGPT: Generating Open-Domain, Open-Platform Diagrams via LLM Planning
COLM 2024 -
Step-by-Step: Separating Planning from Realization in Neural Data-to-Text Generation
NAACL 2019Amit Moryossef, Yoav Goldberg, Ido Dagan [PDF] [Code]
Verifier
-
VALVAL: automatic plan validation, continuous effects and mixed initiative planning using PDDLIEEE International Conference on Tools with Artificial IntelligenceRichard Howey, Derek Long, and Maria Fox [PDF]
-
BUTLERALFWorld: Aligning Text and Embodied Environments for Interactive LearningICLR 2021Mohit Shridhar, Xingdi Yuan, Marc-Alexandre Côté, Yonatan Bisk, Adam Trischler, Matthew Hausknecht [PDF] [Code]
Groundtruth
-
NATURAL PLAN: Benchmarking LLMs on Natural Language Planning
PreprintHuaixiu Steven Zheng, Swaroop Mishra, Hugh Zhang, Xinyun Chen, Minmin Chen, Azade Nova, Le Hou, Heng-Tze Cheng, Quoc V. Le, Ed H. Chi, Denny Zhou [PDF] [Code]
-
Can Large Language Models be Good Path Planners? A Benchmark and Investigation on Spatial-temporal Reasoning
ICLR 2024 Workshop on Large Language Model (LLM) Agents -
Skill Induction and Planning with Latent Language
ACL 2022Pratyusha Sharma, Antonio Torralba, Jacob Andreas [PDF] [Code]
-
PlaSma: Making Small Language Models Better Procedural Knowledge Models for (Counterfactual) Planning
ICLR 2024Faeze Brahman, Chandra Bhagavatula, Valentina Pyatkin, Jena D. Hwang, Xiang Lorraine Li, Hirona J. Arai, Soumya Sanyal, Keisuke Sakaguchi, Xiang Ren, Yejin Choi [PDF] [Code]
-
CAPE: Corrective Actions from Precondition Errors using Large Language Models
ICRA 2024Shreyas Sundara Raman, Vanya Cohen, Ifrah Idrees, Eric Rosen, Ray Mooney, Stefanie Tellex, David Paulius [PDF] [Code]
-
Embodied Task Planning with Large Language Models
PreprintZhenyu Wu, Ziwei Wang, Xiuwei Xu, Jiwen Lu, Haibin Yan [PDF] [Code]
-
Multimodal Procedural Planning via Dual Text-Image Prompting
ENMLP 2024 FindingsYujie Lu, Pan Lu, Zhiyu Chen, Wanrong Zhu, Xin Eric Wang, William Yang Wang [PDF] [Code]
-
Open Grounded Planning: Challenges and Benchmark Construction
ACL 2024Shiguang Guo, Ziliang Deng, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun [PDF] [Code]
-
BioPlanner: Automatic Evaluation of LLMs on Protocol Planning in Biology
EMNLP 2023Odhran O'Donoghue, Aleksandar Shtedritski, John Ginger, Ralph Abboud, Ali Essa Ghareeb, Justin Booth, Samuel G Rodriques [PDF] [Code]
This table summarizes commonly used evaluation metrics for each performance criterion, along with representative studies. For definitions of these metrics, please refer to our survey (Section 9) or the individual papers cited in the table.
| Criteria | Metrics (Representative Works) |
|---|---|
| Completeness | Success Rate (Valmeekam et al. 2023); Goal Condition Recall (Hu et al., 2023); Step Success Rate (Deng et al., 2023); Exact Match Score (Aghzal et al., 2024); True Negative Rate and False Negative Rate (Valmeekam et al. 2023); Unreachable Accuracy (Aghzal et al., 2023). |
| Executability | Executability Rate (Hazra et al., 2024); Constraint Pass Rate (Xie et al., 2024). |
| Optimality | Optimality Rate (Lehnert et al., 2024). |
| Efficiency | Inference Time (Brahman et al., 2024); Number of Output and Input Tokens (Hu et al., 2024); Number of plan Steps (Raman et al., 2022); Number of LLM and World Model Calls (Sun et al., 2024); Model Size (Brahman et al., 2024). |
| Representation | Number of Parseable Problems (Zuo et al. 2024). |
| Generalization | All above metrics can also be applied to unseen scenarios to assess generalization. |
Contributions to this repository are welcome!
If you find any error or have relevant resources, feel free to open an issue or a pull request.
Paper format:
1. **[paper title]** `[Conference_name_year/Journal_name_year/Preprint]`
*[authors]* [[PDF]([pdf link])] [[Code]([code link])]
Please cite the following paper if you find the resource helpful for your research.
@article{wei2025plangenllms,
title={Plangenllms: A modern survey of llm planning capabilities},
author={Wei, Hui and Zhang, Zihao and He, Shenghua and Xia, Tian and Pan, Shijia and Liu, Fei},
journal={arXiv preprint arXiv:2502.11221},
year={2025}
}
