Picrew/awesome-llm-story-generation

A curated list of LLM papers and open-source projects for story, novel, and script generation.

110

52 commits

updated Sep 22, 2026

See the code

README

Awesome LLM Story Generation

A curated list of story/novel/script generation research in the LLM era (2022-present), organized by method with strict link verification.

  • Total entries: 295
  • Categories: 10
  • Last verified: 2026-09-22
  • Language: English | 中文

Contents

Category Overview

CategoryEntries
Planning / Decomposition for Story Generation22
Agent Collaboration for Story Writing7
Sandbox / World Simulation Narrative Generation17
Multimodal Story Generation (Text-Image/Video/Comic/Audio)64
Memory & Long-Context Coherence20
Consistency / Controllability / Constraint Following29
Refinement / Self-Critique / Iterative Editing17
Evaluation / Benchmarks / Metrics77
Datasets / Surveys / Resources32
Open-source Projects (No Paper Required)10

Papers and Projects

Note: Project stores project/demo links; Code stores verified GitHub repositories.

Planning / Decomposition for Story Generation

TitleVenueDatePaperProjectCodeCitationsTags
GraphStory: Collaborative Story Writing through Event-Based Narrative EditingArXiv 2026 (arXiv preprint)2026-06arXiv---planning, narrative-structure
Fabula: Building a Narrative Storytelling Sidekick with the Writers' CommunityArXiv 2026 (arXiv preprint)2026-06arXiv---planning, co-creation
Towards Human-Level Book-Writing CapabilityArXiv 2026 (arXiv preprint)2026-05arXiv---planning, narrative-structure
Planning Beyond Text: Graph-based Reasoning for Complex Narrative GenerationArXiv 2026 (arXiv preprint)2026-04arXiv---planning, narrative-structure
Narrix: Remixing Narrative Strategies from Examples for Story WritingCHI 2026 (Conference on Human Factors in Computing Systems)2026-04arXiv---planning, narrative-structure
BiT-MCTS: A Theme-based Bidirectional MCTS Approach to Chinese Fiction GenerationArXiv 2026 (arXiv preprint)2026-03arXiv---planning, narrative-structure
DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative WritingArXiv 2026 (arXiv preprint)2026-01arXiv---planning, narrative-structure
Codified Foreshadowing-Payoff Text GenerationArXiv 2026 (arXiv preprint)2026-01arXiv---planning, narrative-structure
SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene ConsistencyArXiv 2025 (arXiv preprint)2025-10arXiv---planning, narrative-structure
Long Story Generation via Knowledge Graph and Literary TheoryArXiv 2025 (arXiv preprint)2025-08arXiv---planning, narrative-structure
STORYTELLER: An Enhanced Plot-Planning Framework for Coherent and Cohesive Story GenerationArXiv 2025 (arXiv preprint)2025-06arXiv---planning, narrative-structure
Can LLMs Generate Good Stories? Insights and Challenges from a Narrative Planning PerspectiveArXiv 2025 (arXiv preprint)2025-06arXiv---planning, narrative-structure
Learning to Reason for Long-Form Story GenerationArXiv 2025 (arXiv preprint)2025-03arXiv-Codecitationplanning, narrative-structure
Generating Long-form Story Using Dynamic Hierarchical Outlining with Memory-EnhancementNAACL 2025 (North American Chapter of ACL)2024-12arXiv--citationplanning, narrative-structure
Ex3: Automatic Novel Writing by Extracting, Excelsior and ExpandingACL 2024 (Annual Meeting of the Association for Computational Linguistics)2024-08arXiv--citationplanning, narrative-structure
Navigating the Path of Writing: Outline-guided Text Generation with Large Language ModelsNAACL 2025 (North American Chapter of ACL)2024-04arXiv--citationplanning, narrative-structure
Creating Suspenseful Stories: Iterative Planning with Large Language ModelsEACL 2024 (Conference of the European Chapter of ACL)2024-02arXiv--citationplanning, narrative-structure
Improving Pacing in Long-Form Story PlanningEMNLP Findings 2023 (Findings of EMNLP)2023-11arXiv--citationplanning, narrative-structure
End-to-End Story Plot GeneratorArXiv 2023 (arXiv preprint)2023-10arXiv--citationplanning, narrative-structure
The Next Chapter: A Study of Large Language Models in StorytellingArXiv 2023 (arXiv preprint)2023-01arXiv---planning, narrative-structure
DOC: Improving Long Story Coherence With Detailed Outline ControlArXiv 2022 (arXiv preprint)2022-12arXiv---planning, narrative-structure
Little Red Riding Hood Goes around the Globe: Crosslingual Story Planning and Generation with Large Language ModelsLREC-COLING 2024 (LREC-COLING)2022-12Published---planning, narrative-structure

Agent Collaboration for Story Writing

TitleVenueDatePaperProjectCodeCitationsTags
From Personas to Plot: Character-Grounded Multi-Agent Story Generation for Long-Form NarrativesArXiv 2026 (arXiv preprint)2026-07arXiv---multi-agent, collaboration
Improving Collaborative Storytelling with a Multi-Agent Framework Based on Large Language ModelsArXiv 2026 (arXiv preprint)2026-05arXiv---multi-agent, collaboration
Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery GamesACL Findings 2026 (Findings of ACL)2026-04arXiv---multi-agent, collaboration
A Cognitive Writing Perspective for Constrained Long-Form Text GenerationArXiv 2025 (arXiv preprint)2025-02arXiv-Codecitationmulti-agent, collaboration
Agents' Room: Narrative Generation through Multi-step CollaborationICLR 2025 (International Conference on Learning Representations)2024-10arXiv--citationmulti-agent, collaboration
HoLLMwood: Unleashing the Creativity of Large Language Models in Screenwriting via Role PlayingEMNLP Findings 2024 (Findings of EMNLP)2024-06arXiv--citationmulti-agent, collaboration
AutoAgents: A Framework for Automatic Agent GenerationIJCAI 2024 (International Joint Conference on Artificial Intelligence)2023-09arXiv-Codecitationmulti-agent, collaboration

Sandbox / World Simulation Narrative Generation

TitleVenueDatePaperProjectCodeCitationsTags
Orchestrated Reality: From Role-Play to Living, Playable Game Worlds -- LLM-Driven World Simulation as a Parameterized-Action POMDPArXiv 2026 (arXiv preprint)2026-06arXiv---sandbox, simulation
IVIE: A Neuro-symbolic Approach to Incremental and Validated Generation of Interactive Fiction WorldsICCC 2026 (International Conference on Computational Creativity)2026-06arXiv---sandbox, interactive
BotDirector: Robot Storytelling Across the Symmetrical Reality with Multi-modal InteractionsArXiv 2026 (arXiv preprint)2026-06arXiv---sandbox, interactive
World-State Transformations for Neuro-symbolic Interactive StorytellingArXiv 2026 (arXiv preprint)2026-05arXiv---sandbox, interactive
Material for Thought: Generative AI as an Active Creative MediumArXiv 2026 (arXiv preprint)2026-05arXiv---sandbox, co-creation
A Generative AI Driven Interactive Narrative Serious Game for Stress Relief and Its Randomized Controlled Pilot StudyArXiv 2026 (arXiv preprint)2026-05arXiv---sandbox, interactive
A Reflective Storytelling Agent for Older Adults: Integrating Argumentation Schemes and Argument Mining in LLM-Based Personalised NarrativesArXiv 2026 (arXiv preprint)2026-05arXiv---sandbox, interactive
EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative EvolutionACL 2026 (Annual Meeting of the Association for Computational Linguistics)2026-04arXiv---sandbox, simulation
StoryBox: Collaborative Multi-Agent Simulation for Hybrid Bottom-Up Long-Form Story Generation Using Large Language ModelsArXiv 2025 (arXiv preprint)2025-10arXivProject--sandbox, simulation
OPEN-THEATRE: An Open-Source Toolkit for LLM-based Interactive DramaArXiv 2025 (arXiv preprint)2025-09arXiv---sandbox, interactive
HAMLET: Hyperadaptive Agent-based Modeling for Live Embodied TheatricsArXiv 2025 (arXiv preprint)2025-07arXiv---sandbox, simulation
STORY2GAME: Generating (Almost) Everything in an Interactive Fiction GameArXiv 2025 (arXiv preprint)2025-05arXiv--citationsandbox, interactive
BookWorld: From Novels to Interactive Agent Societies for Creative Story GenerationArXiv 2025 (arXiv preprint)2025-04arXivProject--sandbox, interactive
Towards Enhanced Immersion and Agency for LLM-based Interactive DramaArXiv 2025 (arXiv preprint)2025-02arXiv--citationsandbox, interactive
IBSEN: Director-Actor Agent Collaboration for Controllable and Interactive Drama Script GenerationACL 2024 (Annual Meeting of the Association for Computational Linguistics)2024-07arXiv-Codecitationsandbox, interactive
StoryVerse: Towards Co-authoring Dynamic Plot with LLM-based Character Simulation via Narrative PlanningFDG 2024 (Foundations of Digital Games)2024-05arXiv--citationsandbox, simulation
Generative Agents: Interactive Simulacra of Human BehaviorArXiv 2023 (arXiv preprint)2023-04arXivProjectCode-sandbox, interactive

Multimodal Story Generation (Text-Image/Video/Comic/Audio)

TitleVenueDatePaperProjectCodeCitationsTags
Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story WorldsArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, visual-story
LCG: Long-Context Consistent Image Generation with Sparse Relational AttentionArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, visual-story
FreeStory: Training-Free Character Consistency for Free-Form Visual StorytellingArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, visual-story
DramaDirector: Geometry-Guided Short Drama GenerationArXiv 2026 (arXiv preprint)2026-06arXiv-Code-multimodal, video-story
Towards Error-Free Long Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware GatingArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, audio-video
GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot SchedulingArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
DataMagic: Transforming Tabular Data into Data Insight VideoArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, data-story
LooseControlVideo: Directorial Video Control using Spatial BlockingArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, video-story
Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild PriorsArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, audio-story
UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional DistillationArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, video-story
Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback LoopsArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
PermaVid: Consistent Video Generation Across Edits via Disentangled Context MemoryArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, video-story
Closed-Loop Triplet Synergistic Generation for Long-Form VideoArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
Memento: Reconstruct to Remember for Consistent Long Video GenerationArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, video-story
CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
InterleaveThinker: Reinforcing Agentic Interleaved GenerationArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, visual-story
OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired DataArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, video-story
TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted AlignmentArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific FiguresArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, visual-story
Data Journalist Agent: Transforming Data into Verifiable Multimodal StoriesArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, data-story
MilliVid: Hierarchical Latents for Long-Range Consistency in Video GenerationArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, video-story
ViMax: Agentic Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and RefinementArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, audio-story
LongLive-RAG: A General Retrieval-Augmented Framework for Long Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv-Code-multimodal, video-story
Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
JenBridge: Adaptive Long-Form Video Soundtracking across Scene TransitionsArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, audio-video
Crayotter: Traceable Multi-Agent Workflows for Long-Form Video EditingArXiv 2026 (arXiv preprint)2026-05arXiv-Code-multimodal, video-story
DecMem: Towards Minute-Long Consistent World Generation with Decoupled MemoryArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, video-story
SlotMemory: Object-Centric KV Memory for Streaming Long-Video GenerationArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, video-story
MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, visual-story
SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing ControlArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
ReCA: Multi-Shot Long Video Extrapolation via Recursive Context AllocationArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, video-story
EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
DrawVideo: Generating Long Video from Storyboard Keyframe SketchesArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
S2ED: From Story to Executable Descriptions for Consistency-Aware Story IllustrationICME 2026 (IEEE International Conference on Multimedia and Expo)2026-05arXiv---multimodal, visual-story
One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent SystemsArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, screenplay
AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion ModelsArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, visual-story
TombWriter: Scaffolding Story Archeology through Beat-Level Interaction in Human-AI Co-WritingArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, co-creation
Advancing Narrative Long Video Generation via Training-Free Identity-Aware MemoryArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent CollaborationArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video NarrativesArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, video-story
RealDiffusion: Physics-informed Attention for Multi-character Storybook GenerationArXiv 2026 (arXiv preprint)2026-05arXiv-Code-multimodal, visual-story
AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio StorytellingArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, audio-story
Co-Director: Agentic Generative Video StorytellingArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, video-story
CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene IntegrationArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, video-story
CANVAS: Continuity-Aware Narratives via Visual Agentic StoryboardingArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, visual-story
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic VideoArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, screenplay
Camera Artist: A Multi-Agent Framework for Cinematic Language Storytelling Video GenerationArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, video-story
StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal DynamicsArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, visual-story
LogiStory: A Logic-Aware Framework for Multi-Image Story VisualizationArXiv 2026 (arXiv preprint)2026-03arXiv---multimodal, visual-story
Customized Visual Storytelling with Unified Multimodal LLMsArXiv 2026 (arXiv preprint)2026-03arXiv---multimodal, visual-story
Directing the Narrative: A Finetuning Method for Controlling Coherence and Style in Story GenerationArXiv 2026 (arXiv preprint)2026-03arXiv---multimodal, visual-story
EmoStory: Emotion-Aware Story GenerationArXiv 2026 (arXiv preprint)2026-03arXiv---multimodal, visual-story
PlayWrite: A Multimodal System for AI Supported Narrative Co-Authoring Through Play in XRArXiv 2026 (arXiv preprint)2026-03arXiv---multimodal, co-creation
StoryComposerAI: A Multimodal Story Co-Creation Tool for Amateur WritersCHI EA 2026 (Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems)2026-02arXiv---multimodal, co-creation
The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video GenerationArXiv 2026 (arXiv preprint)2026-01arXiv---multimodal, screenplay
Re:Verse -- Can Your VLM Read a Manga?ICCV AISTORY Workshop 2025 (ICCV AISTORY Workshop)2025-08arXiv---multimodal, visual-story
Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story GenerationArXiv 2025 (arXiv preprint)2025-08arXiv---multimodal, visual-story
R^2: A LLM BASED NOVEL-TO-SCREENPLAY GENERATION FRAMEWORK WITH CAUSAL PLOT GRAPHSICLR 2025 (International Conference on Learning Representations)2025-03arXiv--citationmultimodal, screenplay
LongWriter-V: Enabling Ultra-Long and High-Fidelity Generation in Vision-Language ModelsArXiv 2025 (arXiv preprint)2025-02arXiv-Code-multimodal, visual-story
SEED-Story: Multimodal Long Story Generation with Large Language ModelArXiv 2024 (arXiv preprint)2024-07arXiv-Code-multimodal, visual-story
Make-A-Story: Visual Memory Conditioned Consistent Story GenerationCVPR 2023 (Conference on Computer Vision and Pattern Recognition)2022-11arXiv---multimodal, visual-story

Memory & Long-Context Coherence

TitleVenueDatePaperProjectCodeCitationsTags
Staying In Character: Perspective-Bounded Memory For Book-Based Role-Playing AgentsArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, role-playing
Not All Claims Are Equally Risky: FACTOR for Adaptive Verification in Factual Long-Form GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, factuality
Storyline Trees: Hierarchical Representations for Long-Form NarrativesArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, narrative-representation
IS-CoT: Breaking the Long-form Generation Collapse via Interleaved Structural ThinkingArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, generation
Narrative Knowledge Weaver: Narrative-Centric Retrieval-Augmented Reasoning for Long-Form Text UnderstandingArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, narrative-understanding
POLARIS: Guiding Small Models to Write Long StoriesArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, generation
Building Reliable Long-Form Generation via Hallucination Rejection SamplingArXiv 2026 (arXiv preprint)2026-06arXiv-Code-long-context, coherence
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---long-context, generation
On Stable Long-Form Generation: Benchmarking and Mitigating Length VolatilityArXiv 2026 (arXiv preprint)2026-05arXiv---long-context, coherence
Think Before you Write: QA-Guided Reasoning for Character Descriptions in BooksArXiv 2026 (arXiv preprint)2026-04arXiv---long-context, coherence
Skeleton-based Coherence Modeling in NarrativesArXiv 2026 (arXiv preprint)2026-04arXiv---long-context, coherence
Shifting Long-Context LLMs Research from Input to OutputArXiv 2025 (arXiv preprint)2025-03arXiv---long-context, coherence
Language Models can Self-Lengthen to Generate Long TextsArXiv 2024 (arXiv preprint)2024-10arXiv-Code-long-context, coherence
LongGenBench: Benchmarking Long-Form Generation in Long-Context LLMsArXiv 2024 (arXiv preprint)2024-09Published---long-context, coherence
LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMsArXiv 2024 (arXiv preprint)2024-08arXiv-Code-long-context, coherence
LongLaMP: A Benchmark for Personalized Long-form Text GenerationArXiv 2024 (arXiv preprint)2024-07arXiv---long-context, coherence
CHIRON: Rich Character Representations in Long-Form NarrativesEMNLP Findings 2024 (Findings of EMNLP)2024-06Published---long-context, coherence
With Greater Text Comes Greater Necessity: Inference-Time Training Helps Long Text GenerationCOLM 2024 (Conference on Language Modeling)2024-01arXiv--citationlong-context, coherence
LongAlign: A Recipe for Long Context Alignment of Large Language ModelsArXiv 2024 (arXiv preprint)2024-01arXiv-Code-long-context, coherence
RecurrentGPT: Interactive Generation of (Arbitrarily) Long TextArXiv 2023 (arXiv preprint)2023-05arXivProjectCodecitationlong-context, interactive

Consistency / Controllability / Constraint Following

TitleVenueDatePaperProjectCodeCitationsTags
Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy OptimizationArXiv 2026 (arXiv preprint)2026-06arXiv---controllability, character-consistency
DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time InterventionINTERSPEECH 2026 (Conference of the International Speech Communication Association)2026-06arXiv---controllability, character-consistency
Steering Emotional Dynamics for Art Therapy: Controllable Narrative Script Generation through Hierarchically Guided LLM AgentsArXiv 2026 (arXiv preprint)2026-06arXiv---controllability, screenplay
Creative Collision: Directorial Persona Steering and Competition in Large Language ModelsICML Workshop 2026 (Human-AI Co-Creativity Workshop)2026-06arXiv---controllability, style-control
Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---controllability, story-generation
Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and SafetyArXiv 2026 (arXiv preprint)2026-05arXiv---controllability, consistency
ConWriter: Transition-Constrained Stateful Long-Form Story Generation with Lightweight Neuro-Symbolic Consistency ControlEMNLP Findings 2026 (accepted; arXiv preprint)2026-05arXiv-Code-controllability, consistency
UniCreative: Unifying Long-form Logic and Short-form Sparkle via Reference-Free Reinforcement LearningArXiv 2026 (arXiv preprint)2026-04arXiv---controllability, consistency
Noise Steering for Controlled Text Generation: Improving Diversity and Reading-Level Fidelity in Arabic Educational Story GenerationArXiv 2026 (arXiv preprint)2026-04arXiv---controllability, consistency
Preconditioned Test-Time Adaptation for Out-of-Distribution Debiasing in Narrative GenerationArXiv 2026 (arXiv preprint)2026-03arXiv---controllability, consistency
TaleFrame: An Interactive Story Generation System with Fine-Grained Control and Large Language ModelsArXiv 2025 (arXiv preprint)2025-12arXiv---controllability, interactive
SRS-Stories: Vocabulary-constrained multilingual story generation for language learningEMNLP Industry Track 2025 (Industry Track)2025-12Published---controllability, consistency
SCORE: Story Coherence and Retrieval Enhancement for AI NarrativesArXiv 2025 (arXiv preprint)2025-03arXiv--citationcontrollability, retrieval
Whose story is it? Personalizing story generation by inferring author stylesArXiv 2025 (arXiv preprint)2025-02arXiv--citationcontrollability, consistency
Pastiche Novel Generation Creating: Fan Fiction You Love in Your Favorite Author's StyleArXiv 2025 (arXiv preprint)2025-02arXiv--citationcontrollability, consistency
CS4: Measuring the Creativity of Large Language Models Automatically by Controlling the Number of Story-Writing ConstraintsArXiv 2024 (arXiv preprint)2024-10arXiv-Codecitationcontrollability, consistency
Crafting Narrative Closures: Zero-Shot Learning with SSM Mamba for Short Story Ending GenerationArXiv 2024 (arXiv preprint)2024-10arXiv--citationcontrollability, consistency
MirrorStories: Reflecting Diversity through Personalized Narrative Generation with Large Language ModelsEMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2024-09arXiv--citationcontrollability, consistency
FACTTRACK: Time-Aware World State Tracking in Story OutlinesNAACL 2025 (North American Chapter of ACL)2024-07arXiv--citationcontrollability, consistency
Suri: Multi-constraint Instruction Following for Long-form Text GenerationArXiv 2024 (arXiv preprint)2024-06arXiv-Code-controllability, consistency
MoPS: Modular Story Premise Synthesis for Open-Ended Automatic Story GenerationACL 2024 (Annual Meeting of the Association for Computational Linguistics)2024-06arXivProjectCodecitationcontrollability, consistency
Measuring Psychological Depth in Language ModelsEMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2024-06arXiv--citationcontrollability, consistency
Guiding and Diversifying LLM-Based Story Generation via Answer Set ProgrammingACL Workshop 2025 (ACL Workshop)2024-06arXiv--citationcontrollability, consistency
Multigenre AI-powered Story CompositionArXiv 2024 (arXiv preprint)2024-05arXiv--citationcontrollability, consistency
Returning to the Start: Generating Narratives with Related EndpointsNAACL 2024 (North American Chapter of ACL)2024-04arXivProjectCodecitationcontrollability, consistency
NarrativeGenie: Generating Narrative Beats and Dynamic Storytelling with Large Language ModelsAIIDE 2024 (Conference on Artificial Intelligence and Interactive Digital Entertainment)2024-01Published---controllability, consistency
CAT-LLM: Prompting Large Language Models with Text Style Definition for Chinese Article-style TransferArXiv 2024 (arXiv preprint)2024-01arXiv--citationcontrollability, consistency
Learning to Generate Text in Arbitrary Writing StylesArXiv 2023 (arXiv preprint)2023-12arXiv--citationcontrollability, consistency
RLCD: Reinforcement Learning from Contrast Distillation for Language Model AlignmentICLR 2024 (International Conference on Learning Representations)2023-07arXiv--citationcontrollability, consistency

Refinement / Self-Critique / Iterative Editing

TitleVenueDatePaperProjectCodeCitationsTags
OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement LearningArXiv 2026 (arXiv preprint)2026-06arXiv-Code-refinement, creative-writing
StorySpark: Module-wise Evolutionary Search for Story Premise GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---refinement, revision
StoryLens: Preference-Aligned Story Rewriting via Context-Aware Narrative EnrichmentArXiv 2026 (arXiv preprint)2026-05arXiv---refinement, revision
DTO: a Differentiable Training Objective for Effective Counterfactual Story RewritingArXiv 2026 (arXiv preprint)2026-05arXiv---refinement, revision
R2-Write: Reflection and Revision for Open-Ended Writing with Deep ReasoningArXiv 2026 (arXiv preprint)2026-04arXiv---refinement, revision
LLM Review: Enhancing Creative Writing via Blind Peer Review FeedbackArXiv 2026 (arXiv preprint)2026-01arXiv---refinement, revision
All Stories Are One Story: Emotional Arc Guided Procedural Game Level GenerationArXiv 2025 (arXiv preprint)2025-08arXiv---refinement, revision
SuperWriter: Reflection-Driven Long-Form Generation with Large Language ModelsArXiv 2025 (arXiv preprint)2025-06arXiv---refinement, revision
Finding Flawed Fictions: Evaluating Complex Reasoning in Language Models via Plot Hole DetectionArXiv 2025 (arXiv preprint)2025-04arXiv--citationrefinement, revision
MLD-EA: Check and Complete Narrative Coherence by Introducing Emotions and ActionsArXiv 2024 (arXiv preprint)2024-12arXiv--citationrefinement, revision
Collective Critics for Creative Story GenerationEMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2024-10arXiv--citationrefinement, revision
SWAG: Storytelling With Action GuidanceEMNLP Findings 2024 (Findings of EMNLP)2024-02arXiv--citationrefinement, revision
GROVE: A Retrieval-augmented Complex Story Generation Framework with A Forest of EvidenceEMNLP Findings 2023 (Findings of EMNLP)2023-10arXiv--citationrefinement, retrieval
EIPE-text: Evaluation-Guided Iterative Plan Extraction for Long-Form Narrative Text GenerationArXiv 2023 (arXiv preprint)2023-10arXiv--citationrefinement, revision
Branch-Solve-Merge Improves Large Language Model Evaluation and GenerationArXiv 2023 (arXiv preprint)2023-10arXiv---refinement, revision
Re3: Generating Longer Stories With Recursive Reprompting and RevisionArXiv 2022 (arXiv preprint)2022-10arXiv---refinement, revision
Model Criticism for Long-Form Text GenerationArXiv 2022 (arXiv preprint)2022-10arXiv---refinement, revision

Evaluation / Benchmarks / Metrics

TitleVenueDatePaperProjectCodeCitationsTags
Floor Raiser or Ceiling Limiter? Differential Storytelling Outcomes with a Child-Centric GenAI System Across Individual DifferencesArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, evaluation
Same Lesson, Different Story: Cross-Lingual Reconstruction of Cultural Narratives in Large Language ModelsArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, evaluation
Do Language Models Pass the Bechdel Test? Auditing Gender Biases in LLM-Generated ScreenplaysArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, screenplay
CASPER in the Machine: Insights into Character Variety in LLM-Generated StoriesACL 2026 (Annual Meeting of the Association for Computational Linguistics)2026-06arXiv---benchmark, evaluation
NEST: Narrative Event Structures in Time for Long Video UnderstandingArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, narrative-understanding
NarrativeWorldBench: A Frontier-Saturated Benchmark and a Latent World Model for Long-Horizon Co-Creative Audio DramaArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, audio-story
Do Large Language Models Always Tell The Same Stories?ArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, diversity
ttda704 at SemEval-2026 Task 4: Modeling Narrative Structures via Pseudonymization and Multi-View Sentence AlignmentArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, narrative-representation
Characterizing Cultural Localization in AI-Generated StoriesACL Workshop 2026 (C3NLP Workshop)2026-06arXiv---benchmark, evaluation
Automated Creativity Evaluation of Language Models Across Open-Ended TasksACL 2026 (Annual Meeting of the Association for Computational Linguistics)2026-06arXiv-Code-benchmark, evaluation
Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal ConsistencyArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, visual-story
VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, video-story
Neutrality Bites: Gender Representation in AI-Generated Animal StoriesArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, evaluation
Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, evaluation
StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated DatasetArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, video-story
ArcANE: Do Role-Playing Language Agents Stay in Character at the Right Time?ArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, character-consistency
SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV SeriesArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, narrative-understanding
"I've Seen How This Goes": Characterizing Diversity via Progressive Conditional SurpriseArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, diversity
Benchmarking LLM-as-a-Judge for Long-Form Output EvaluationArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, evaluation
RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing AgentsArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, character-consistency
Deep Research as Rubric for Reinforcement LearningArXiv 2026 (arXiv preprint)2026-05arXiv-Code-evaluation, rubric
DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent EvaluationArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, video-story
DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing AgentsArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, character-consistency
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, audio-video
Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM FictionArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM StoriesArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief ModelingArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, narrative-understanding
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AVArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, audio-video
QUIET: A Multi-Blank Cascaded Story Cloze Benchmark for LLM Creative Generation CapabilityArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, video-story
When Reasoning Supervision Hurts: TTCW-Based Long-Form Literary Review GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---evaluation, dataset
MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, audio-video
EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video GenerationArXiv 2026 (arXiv preprint)2026-05arXivProjectCode-benchmark, video-story
Narrative Landscape: Mapping Narrative Dispositions Across LLMsArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
NARRA-Gym for Evaluating Interactive Narrative AgentsArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive DimensionsArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
StoryAlign: Evaluating and Training Reward Models for Story GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
SemEval-2026 Task 4: Narrative Story Similarity and Narrative Representation LearningArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
ATANT v1.1: Positioning Continuity Evaluation Against Memory, Long-Context, and Agentic-Memory BenchmarksArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
Attention Flows: Tracing LLM Conceptual Engagement via Story SummariesArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, dataset
MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video ProductionArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, dataset
Spoiler Alert: Narrative Forecasting as a Metric for Tension in LLM StorytellingArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
Lessons Without Borders? Evaluating Cultural Alignment of LLMs Using Multilingual Story Moral GenerationArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
Stories of Your Life as Others: A Round-Trip Evaluation of LLM-Generated Life Stories Conditioned on Rich Psychometric ProfilesArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
StoryScope: Investigating idiosyncrasies in AI fictionArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
Humans vs Vision-Language Models: A Unified Measure of Narrative CoherenceArXiv 2026 (arXiv preprint)2026-03arXiv---benchmark, evaluation
Creative Convergence or Imitation? Genre-Specific Homogeneity in LLM-Generated Chinese LiteratureArXiv 2026 (arXiv preprint)2026-03arXiv---benchmark, evaluation
Lost in Stories: Consistency Bugs in Long Story Generation by LLMsACL Findings 2026 (Findings of ACL)2026-03PublishedProjectCode-benchmark, evaluation
LLMs Exhibit Significantly Lower Uncertainty in Creative Writing Than Professional WritersArXiv 2026 (arXiv preprint)2026-02arXiv---benchmark, evaluation
Do readers prefer AI-generated Italian short stories?ArXiv 2026 (arXiv preprint)2026-01arXiv---benchmark, evaluation
STAGE: A Full-Screenplay Benchmark for Reasoning over Evolving StorieArXiv 2026 (arXiv preprint)2026-01arXiv---benchmark, screenplay
Evaluation Framework for AI Creativity: A Case Study Based on Story GenerationArXiv 2026 (arXiv preprint)2026-01arXiv---benchmark, evaluation
Evaluating LLM Story Generation through Large-scale Network Analysis of Social StructuresArXiv 2025 (arXiv preprint)2025-10arXiv---benchmark, evaluation
EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance GenerationArXiv 2025 (arXiv preprint)2025-08arXiv---benchmark, evaluation
LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative WritingArXiv 2025 (arXiv preprint)2025-07arXiv---benchmark, dataset
WebNovelBench: Placing LLM Novelists on the Web Novel DistributionEACL Findings 2026 (Findings of EACL)2025-05Published-Code-benchmark, evaluation
WritingBench: A Comprehensive Benchmark for Generative WritingArXiv 2025 (arXiv preprint)2025-03arXiv---benchmark, evaluation
CoKe: Customizable Fine-Grained Story Evaluation via Chain-of-Keyword RationalizationArXiv 2025 (arXiv preprint)2025-03arXiv--citationbenchmark, evaluation
LongEval: A Comprehensive Analysis of Long-Text Generation Through a Plan-based ParadigmArXiv 2025 (arXiv preprint)2025-02arXiv-Codecitationbenchmark, evaluation
Echoes in AI: Quantifying Lack of Plot Diversity in LLM OutputsArXiv 2025 (arXiv preprint)2025-01arXiv--citationbenchmark, evaluation
Evaluating Creative Short Story Generation in Humans and Large Language ModelsArXiv 2024 (arXiv preprint)2024-11arXiv--citationbenchmark, evaluation
Small Language Models can Outperform Humans in Short Creative Writing: A Study Comparing SLMs with Humans and LLMsCOLING 2025 (International Conference on Computational Linguistics)2024-09arXiv--citationbenchmark, evaluation
HelloBench: Evaluating Long Text Generation Capabilities of Large Language ModelsArXiv 2024 (arXiv preprint)2024-09arXiv-Code-benchmark, evaluation
STORYSUMM: Evaluating Faithfulness in Story SummarizationEMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2024-07arXiv--citationbenchmark, evaluation
Pron vs Prompt: Can Large Language Models already Challenge a World-Class Fiction Author at Creative Text Writing?ArXiv 2024 (arXiv preprint)2024-07arXiv--citationbenchmark, evaluation
Are Large Language Models Capable of Generating Human-Level Narratives?EMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2024-07arXiv--citationbenchmark, evaluation
Do Language Models Enjoy Their Own Stories? Prompting Large Language Models for Automatic Story EvaluationTACL 2024 (Transactions of the Association for Computational Linguistics)2024-05arXiv--citationbenchmark, evaluation
Reading Subtext: Evaluating Large Language Models on Short Story Summarization with WritersTACL 2024 (Transactions of the Association for Computational Linguistics)2024-03arXiv--citationbenchmark, evaluation
Learning Personalized Alignment for Evaluating Open-ended Text GenerationEMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2023-10arXiv--citationbenchmark, evaluation
A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative WritingEMNLP Findings 2023 (Findings of EMNLP)2023-10arXiv--citationbenchmark, evaluation
Art or Artifice? Large Language Models and the False Promise of CreativityCHI 2023 (Conference on Human Factors in Computing Systems)2023-09arXiv--citationbenchmark, evaluation
StoryBench: A Multifaceted Benchmark for Continuous Story VisualizationNeurIPS Datasets and Benchmarks Track 2023 (Datasets and Benchmarks Track)2023-08Published-Code-benchmark, evaluation
HAUSER: Towards Holistic and Automatic Evaluation of Simile GenerationACL 2023 (Annual Meeting of the Association for Computational Linguistics)2023-06arXiv--citationbenchmark, evaluation
Can Large Language Models Be an Alternative to Human Evaluations?ACL 2023 (Annual Meeting of the Association for Computational Linguistics)2023-05arXiv--citationbenchmark, evaluation
DeltaScore: Evaluating Story Generation with Differentiating PerturbationsEMNLP Findings 2023 (Findings of EMNLP)2023-03arXiv--citationbenchmark, evaluation
StoryER: Automatic Story Evaluation via Ranking, Rating and ReasoningEMNLP 2022 (Conference on Empirical Methods in Natural Language Processing)2022-10arXiv-Codecitationbenchmark, evaluation
Of Human Criteria and Automatic Metrics: A Benchmark of the Evaluation of Story GenerationCOLING 2022 (International Conference on Computational Linguistics)2022-08arXiv--citationbenchmark, evaluation

Datasets / Surveys / Resources

TitleVenueDatePaperProjectCodeCitationsTags
AI Fiction in the WildArXiv 2026 (arXiv preprint)2026-06arXiv---resource, fiction-generation
Characterizing Narrative Content in Web-scale LLM Pretraining DataArXiv 2026 (arXiv preprint)2026-06arXiv---dataset, resource
OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence ChainsArXiv 2026 (arXiv preprint)2026-06arXiv-Code-dataset, audio-video
CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video GenerationArXiv 2026 (arXiv preprint)2026-06arXivProject--dataset, audio-video
AI as a Tool for Simulation-Based Experiments in Literary StudiesArXiv 2026 (arXiv preprint)2026-06arXiv---resource, literary-study
GraphLit: Learning Text-Enriched Dynamic Character Network Representations for Literary StudyArXiv 2026 (arXiv preprint)2026-05arXiv---dataset, resource
LitSeg: Narrative-Aware Document Segmentation for Literary RAGArXiv 2026 (arXiv preprint)2026-05arXiv---dataset, resource
Manga109-v2026: Revisiting Manga109 Annotations for Modern Manga UnderstandingArXiv 2026 (arXiv preprint)2026-05arXivProject--dataset, dataset
LLMs for automatic annotation of Mandarin narrative transcriptsArXiv 2026 (arXiv preprint)2026-05arXiv---dataset, narrative-understanding
StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMsArXiv 2026 (arXiv preprint)2026-05arXiv---dataset, dataset
Narrative Theory-Driven LLM Methods for Automatic Story Generation and Understanding: A SurveyArXiv 2026 (arXiv preprint)2026-02arXiv---dataset, survey
MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive OrchestrationArXiv 2026 (arXiv preprint)2026-02arXiv---dataset, resource
StoryWriter: A Multi-Agent Framework for Long Story GenerationArXiv 2025 (arXiv preprint)2025-06arXiv---dataset, resource
Reasoning-Enhanced Self-Training for Long-Form Personalized Text GenerationArXiv 2025 (arXiv preprint)2025-01arXivProjectCode-dataset, resource
Multi-Agent Based Character Simulation for Story WritingIN2Writing 2025 (IN2Writing Workshop)2025-01Published---dataset, resource
BookWorm: A Dataset for Character Description and AnalysisEMNLP Findings 2024 (Findings of EMNLP)2024-10arXiv--citationdataset, dataset
What Makes a Good Story and How Can We Measure It? A Comprehensive Survey of Story EvaluationArXiv 2024 (arXiv preprint)2024-08arXiv--citationdataset, survey
The GPT-WritingPrompts Dataset: A Comparative Analysis of Character Portrayal in Short StoriesEMNLP Workshop 2025 (EMNLP Workshop)2024-06arXiv-Codecitationdataset, dataset
CollabStory: Multi-LLM Collaborative Story Generation and Authorship AnalysisNAACL Findings 2025 (Findings of NAACL)2024-06arXiv-Codecitationdataset, resource
The Value, Benefits, and Concerns of Generative AI-Powered Assistance in WritingCHI 2024 (Conference on Human Factors in Computing Systems)2024-03arXiv--citationdataset, resource
Large Language Models Fall Short: Understanding Complex Relationships in Detective NarrativesACL Findings 2024 (Findings of ACL)2024-02arXiv--citationdataset, resource
CMDAG: A Chinese Metaphor Dataset with Annotated Grounds as CoT for Boosting Metaphor GenerationLREC-COLING 2024 (LREC-COLING)2024-02arXiv-Codecitationdataset, dataset
Assisting in Writing Wikipedia-like Articles From Scratch with Large Language ModelsArXiv 2024 (arXiv preprint)2024-02arXiv---dataset, resource
Weaver: Foundation Models for Creative WritingArXiv 2024 (arXiv preprint)2024-01arXiv--citationdataset, resource
Reflections & Resonance: Two-Agent Partnership for Advancing LLM-based Story AnnotationLREC-COLING 2024 (LREC-COLING)2024-01Published--citationdataset, resource
CLAUSE-ATLAS: A Corpus of Narrative Information to Scale up Computational Literary AnalysisLREC-COLING 2024 (LREC-COLING)2024-01Published--citationdataset, resource
STONYBOOK: A System and Resource for Large-Scale Analysis of NovelsArXiv 2023 (arXiv preprint)2023-11arXiv--citationdataset, resource
Are NLP Models Good at Tracing Thoughts: An Overview of Narrative UnderstandingEMNLP Findings 2023 (Findings of EMNLP)2023-10arXiv--citationdataset, resource
StoryWars: A Dataset and Instruction Tuning Baselines for Collaborative Story Understanding and GenerationACL 2023 (Annual Meeting of the Association for Computational Linguistics)2023-05arXiv--citationdataset, dataset
Open-world Story Generation with Structured Knowledge Enhancement: A Comprehensive SurveyNeurocomputing 2023 (Neurocomputing (Journal))2022-12arXiv---dataset, survey
Co-Writing Screenplays and Theatre Scripts with Language Models: An Evaluation by Industry ProfessionalsArXiv 2022 (arXiv preprint)2022-09arXivProjectCode-dataset, screenplay
A corpus for understanding and generating moral storiesNAACL 2022 (North American Chapter of ACL)2022-04arXiv--citationdataset, resource

Open-source Projects (No Paper Required)

TitleVenueDatePaperProjectCodeCitationsTags
FireRed-OpenStorylineGitHub 2026 (Open-source repository)2026-01-ProjectCode-tooling, open-source
ReasoningNCP (Official Repository)GitHub 2025 (Open-source repository)2025-03arXivProjectCode-tooling, open-source
SEED-Story (Official Repository)GitHub 2024 (Open-source repository)2024-07arXivProjectCode-tooling, open-source
IBSEN (Official Repository)GitHub 2024 (Open-source repository)2024-07arXivProjectCode-tooling, open-source
RENarGen (Official Repository)GitHub 2024 (Open-source repository)2024-04arXivProjectCode-tooling, open-source
fictionx-story-genGitHub 2024 (Open-source repository)2024-01-ProjectCode-tooling, open-source
SillyTavernGitHub 2023 (Open-source repository)2023-01-ProjectCode-tooling, open-source
GOAT-Storytelling-AgentGitHub 2023 (Open-source repository)2023-01-ProjectCode-tooling, open-source
Dramatron (Official Repository)GitHub 2022 (Open-source repository)2022-09arXivProjectCode-tooling, screenplay
TavernAIGitHub 2022 (Open-source repository)2022-01-ProjectCode-tooling, open-source

Maintenance Notes

  • Check duplicate titles before adding new entries.
  • Update README.md and README_zh.md together.
  • Use YYYY-MM for Date.
  • Keep Paper as one primary link (Published preferred, otherwise arXiv; use - if unavailable).

Citation

If this repository helps your research or project, please cite:

@misc{lijunjie2026awesomellmstorygeneration,
  title        = {Awesome LLM Story Generation},
  author       = {Lijunjie},
  year         = {2026},
  howpublished = {\url{https://github.com/lijunjie/awesome-llm-story-generation}},
  note         = {GitHub repository, accessed 2026-02-27}
}

If you later change your GitHub account or repository name, update author and howpublished accordingly.

creative-writing
long-context
story-generation

Contributors

Picrew

52 commits

Picrew/awesome-llm-story-generation

A curated list of LLM papers and open-source projects for story, novel, and script generation.

110

52 commits

updated Sep 22, 2026

See the code

README

Awesome LLM Story Generation

A curated list of story/novel/script generation research in the LLM era (2022-present), organized by method with strict link verification.

  • Total entries: 295
  • Categories: 10
  • Last verified: 2026-09-22
  • Language: English | 中文

Contents

Category Overview

CategoryEntries
Planning / Decomposition for Story Generation22
Agent Collaboration for Story Writing7
Sandbox / World Simulation Narrative Generation17
Multimodal Story Generation (Text-Image/Video/Comic/Audio)64
Memory & Long-Context Coherence20
Consistency / Controllability / Constraint Following29
Refinement / Self-Critique / Iterative Editing17
Evaluation / Benchmarks / Metrics77
Datasets / Surveys / Resources32
Open-source Projects (No Paper Required)10

Papers and Projects

Note: Project stores project/demo links; Code stores verified GitHub repositories.

Planning / Decomposition for Story Generation

TitleVenueDatePaperProjectCodeCitationsTags
GraphStory: Collaborative Story Writing through Event-Based Narrative EditingArXiv 2026 (arXiv preprint)2026-06arXiv---planning, narrative-structure
Fabula: Building a Narrative Storytelling Sidekick with the Writers' CommunityArXiv 2026 (arXiv preprint)2026-06arXiv---planning, co-creation
Towards Human-Level Book-Writing CapabilityArXiv 2026 (arXiv preprint)2026-05arXiv---planning, narrative-structure
Planning Beyond Text: Graph-based Reasoning for Complex Narrative GenerationArXiv 2026 (arXiv preprint)2026-04arXiv---planning, narrative-structure
Narrix: Remixing Narrative Strategies from Examples for Story WritingCHI 2026 (Conference on Human Factors in Computing Systems)2026-04arXiv---planning, narrative-structure
BiT-MCTS: A Theme-based Bidirectional MCTS Approach to Chinese Fiction GenerationArXiv 2026 (arXiv preprint)2026-03arXiv---planning, narrative-structure
DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative WritingArXiv 2026 (arXiv preprint)2026-01arXiv---planning, narrative-structure
Codified Foreshadowing-Payoff Text GenerationArXiv 2026 (arXiv preprint)2026-01arXiv---planning, narrative-structure
SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene ConsistencyArXiv 2025 (arXiv preprint)2025-10arXiv---planning, narrative-structure
Long Story Generation via Knowledge Graph and Literary TheoryArXiv 2025 (arXiv preprint)2025-08arXiv---planning, narrative-structure
STORYTELLER: An Enhanced Plot-Planning Framework for Coherent and Cohesive Story GenerationArXiv 2025 (arXiv preprint)2025-06arXiv---planning, narrative-structure
Can LLMs Generate Good Stories? Insights and Challenges from a Narrative Planning PerspectiveArXiv 2025 (arXiv preprint)2025-06arXiv---planning, narrative-structure
Learning to Reason for Long-Form Story GenerationArXiv 2025 (arXiv preprint)2025-03arXiv-Codecitationplanning, narrative-structure
Generating Long-form Story Using Dynamic Hierarchical Outlining with Memory-EnhancementNAACL 2025 (North American Chapter of ACL)2024-12arXiv--citationplanning, narrative-structure
Ex3: Automatic Novel Writing by Extracting, Excelsior and ExpandingACL 2024 (Annual Meeting of the Association for Computational Linguistics)2024-08arXiv--citationplanning, narrative-structure
Navigating the Path of Writing: Outline-guided Text Generation with Large Language ModelsNAACL 2025 (North American Chapter of ACL)2024-04arXiv--citationplanning, narrative-structure
Creating Suspenseful Stories: Iterative Planning with Large Language ModelsEACL 2024 (Conference of the European Chapter of ACL)2024-02arXiv--citationplanning, narrative-structure
Improving Pacing in Long-Form Story PlanningEMNLP Findings 2023 (Findings of EMNLP)2023-11arXiv--citationplanning, narrative-structure
End-to-End Story Plot GeneratorArXiv 2023 (arXiv preprint)2023-10arXiv--citationplanning, narrative-structure
The Next Chapter: A Study of Large Language Models in StorytellingArXiv 2023 (arXiv preprint)2023-01arXiv---planning, narrative-structure
DOC: Improving Long Story Coherence With Detailed Outline ControlArXiv 2022 (arXiv preprint)2022-12arXiv---planning, narrative-structure
Little Red Riding Hood Goes around the Globe: Crosslingual Story Planning and Generation with Large Language ModelsLREC-COLING 2024 (LREC-COLING)2022-12Published---planning, narrative-structure

Agent Collaboration for Story Writing

TitleVenueDatePaperProjectCodeCitationsTags
From Personas to Plot: Character-Grounded Multi-Agent Story Generation for Long-Form NarrativesArXiv 2026 (arXiv preprint)2026-07arXiv---multi-agent, collaboration
Improving Collaborative Storytelling with a Multi-Agent Framework Based on Large Language ModelsArXiv 2026 (arXiv preprint)2026-05arXiv---multi-agent, collaboration
Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery GamesACL Findings 2026 (Findings of ACL)2026-04arXiv---multi-agent, collaboration
A Cognitive Writing Perspective for Constrained Long-Form Text GenerationArXiv 2025 (arXiv preprint)2025-02arXiv-Codecitationmulti-agent, collaboration
Agents' Room: Narrative Generation through Multi-step CollaborationICLR 2025 (International Conference on Learning Representations)2024-10arXiv--citationmulti-agent, collaboration
HoLLMwood: Unleashing the Creativity of Large Language Models in Screenwriting via Role PlayingEMNLP Findings 2024 (Findings of EMNLP)2024-06arXiv--citationmulti-agent, collaboration
AutoAgents: A Framework for Automatic Agent GenerationIJCAI 2024 (International Joint Conference on Artificial Intelligence)2023-09arXiv-Codecitationmulti-agent, collaboration

Sandbox / World Simulation Narrative Generation

TitleVenueDatePaperProjectCodeCitationsTags
Orchestrated Reality: From Role-Play to Living, Playable Game Worlds -- LLM-Driven World Simulation as a Parameterized-Action POMDPArXiv 2026 (arXiv preprint)2026-06arXiv---sandbox, simulation
IVIE: A Neuro-symbolic Approach to Incremental and Validated Generation of Interactive Fiction WorldsICCC 2026 (International Conference on Computational Creativity)2026-06arXiv---sandbox, interactive
BotDirector: Robot Storytelling Across the Symmetrical Reality with Multi-modal InteractionsArXiv 2026 (arXiv preprint)2026-06arXiv---sandbox, interactive
World-State Transformations for Neuro-symbolic Interactive StorytellingArXiv 2026 (arXiv preprint)2026-05arXiv---sandbox, interactive
Material for Thought: Generative AI as an Active Creative MediumArXiv 2026 (arXiv preprint)2026-05arXiv---sandbox, co-creation
A Generative AI Driven Interactive Narrative Serious Game for Stress Relief and Its Randomized Controlled Pilot StudyArXiv 2026 (arXiv preprint)2026-05arXiv---sandbox, interactive
A Reflective Storytelling Agent for Older Adults: Integrating Argumentation Schemes and Argument Mining in LLM-Based Personalised NarrativesArXiv 2026 (arXiv preprint)2026-05arXiv---sandbox, interactive
EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative EvolutionACL 2026 (Annual Meeting of the Association for Computational Linguistics)2026-04arXiv---sandbox, simulation
StoryBox: Collaborative Multi-Agent Simulation for Hybrid Bottom-Up Long-Form Story Generation Using Large Language ModelsArXiv 2025 (arXiv preprint)2025-10arXivProject--sandbox, simulation
OPEN-THEATRE: An Open-Source Toolkit for LLM-based Interactive DramaArXiv 2025 (arXiv preprint)2025-09arXiv---sandbox, interactive
HAMLET: Hyperadaptive Agent-based Modeling for Live Embodied TheatricsArXiv 2025 (arXiv preprint)2025-07arXiv---sandbox, simulation
STORY2GAME: Generating (Almost) Everything in an Interactive Fiction GameArXiv 2025 (arXiv preprint)2025-05arXiv--citationsandbox, interactive
BookWorld: From Novels to Interactive Agent Societies for Creative Story GenerationArXiv 2025 (arXiv preprint)2025-04arXivProject--sandbox, interactive
Towards Enhanced Immersion and Agency for LLM-based Interactive DramaArXiv 2025 (arXiv preprint)2025-02arXiv--citationsandbox, interactive
IBSEN: Director-Actor Agent Collaboration for Controllable and Interactive Drama Script GenerationACL 2024 (Annual Meeting of the Association for Computational Linguistics)2024-07arXiv-Codecitationsandbox, interactive
StoryVerse: Towards Co-authoring Dynamic Plot with LLM-based Character Simulation via Narrative PlanningFDG 2024 (Foundations of Digital Games)2024-05arXiv--citationsandbox, simulation
Generative Agents: Interactive Simulacra of Human BehaviorArXiv 2023 (arXiv preprint)2023-04arXivProjectCode-sandbox, interactive

Multimodal Story Generation (Text-Image/Video/Comic/Audio)

TitleVenueDatePaperProjectCodeCitationsTags
Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story WorldsArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, visual-story
LCG: Long-Context Consistent Image Generation with Sparse Relational AttentionArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, visual-story
FreeStory: Training-Free Character Consistency for Free-Form Visual StorytellingArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, visual-story
DramaDirector: Geometry-Guided Short Drama GenerationArXiv 2026 (arXiv preprint)2026-06arXiv-Code-multimodal, video-story
Towards Error-Free Long Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware GatingArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, audio-video
GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot SchedulingArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
DataMagic: Transforming Tabular Data into Data Insight VideoArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, data-story
LooseControlVideo: Directorial Video Control using Spatial BlockingArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, video-story
Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild PriorsArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, audio-story
UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional DistillationArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, video-story
Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback LoopsArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
PermaVid: Consistent Video Generation Across Edits via Disentangled Context MemoryArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, video-story
Closed-Loop Triplet Synergistic Generation for Long-Form VideoArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
Memento: Reconstruct to Remember for Consistent Long Video GenerationArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, video-story
CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
InterleaveThinker: Reinforcing Agentic Interleaved GenerationArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, visual-story
OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired DataArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, video-story
TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted AlignmentArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific FiguresArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, visual-story
Data Journalist Agent: Transforming Data into Verifiable Multimodal StoriesArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, data-story
MilliVid: Hierarchical Latents for Long-Range Consistency in Video GenerationArXiv 2026 (arXiv preprint)2026-06arXivProject--multimodal, video-story
ViMax: Agentic Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and RefinementArXiv 2026 (arXiv preprint)2026-06arXivProjectCode-multimodal, audio-story
LongLive-RAG: A General Retrieval-Augmented Framework for Long Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv-Code-multimodal, video-story
Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, video-story
JenBridge: Adaptive Long-Form Video Soundtracking across Scene TransitionsArXiv 2026 (arXiv preprint)2026-06arXiv---multimodal, audio-video
Crayotter: Traceable Multi-Agent Workflows for Long-Form Video EditingArXiv 2026 (arXiv preprint)2026-05arXiv-Code-multimodal, video-story
DecMem: Towards Minute-Long Consistent World Generation with Decoupled MemoryArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, video-story
SlotMemory: Object-Centric KV Memory for Streaming Long-Video GenerationArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, video-story
MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, visual-story
SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing ControlArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
ReCA: Multi-Shot Long Video Extrapolation via Recursive Context AllocationArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, video-story
EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
DrawVideo: Generating Long Video from Storyboard Keyframe SketchesArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
S2ED: From Story to Executable Descriptions for Consistency-Aware Story IllustrationICME 2026 (IEEE International Conference on Multimedia and Expo)2026-05arXiv---multimodal, visual-story
One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent SystemsArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, screenplay
AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion ModelsArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, visual-story
TombWriter: Scaffolding Story Archeology through Beat-Level Interaction in Human-AI Co-WritingArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, co-creation
Advancing Narrative Long Video Generation via Training-Free Identity-Aware MemoryArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent CollaborationArXiv 2026 (arXiv preprint)2026-05arXiv---multimodal, video-story
CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video NarrativesArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, video-story
RealDiffusion: Physics-informed Attention for Multi-character Storybook GenerationArXiv 2026 (arXiv preprint)2026-05arXiv-Code-multimodal, visual-story
AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio StorytellingArXiv 2026 (arXiv preprint)2026-05arXivProject--multimodal, audio-story
Co-Director: Agentic Generative Video StorytellingArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, video-story
CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene IntegrationArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, video-story
CANVAS: Continuity-Aware Narratives via Visual Agentic StoryboardingArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, visual-story
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic VideoArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, screenplay
Camera Artist: A Multi-Agent Framework for Cinematic Language Storytelling Video GenerationArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, video-story
StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal DynamicsArXiv 2026 (arXiv preprint)2026-04arXiv---multimodal, visual-story
LogiStory: A Logic-Aware Framework for Multi-Image Story VisualizationArXiv 2026 (arXiv preprint)2026-03arXiv---multimodal, visual-story
Customized Visual Storytelling with Unified Multimodal LLMsArXiv 2026 (arXiv preprint)2026-03arXiv---multimodal, visual-story
Directing the Narrative: A Finetuning Method for Controlling Coherence and Style in Story GenerationArXiv 2026 (arXiv preprint)2026-03arXiv---multimodal, visual-story
EmoStory: Emotion-Aware Story GenerationArXiv 2026 (arXiv preprint)2026-03arXiv---multimodal, visual-story
PlayWrite: A Multimodal System for AI Supported Narrative Co-Authoring Through Play in XRArXiv 2026 (arXiv preprint)2026-03arXiv---multimodal, co-creation
StoryComposerAI: A Multimodal Story Co-Creation Tool for Amateur WritersCHI EA 2026 (Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems)2026-02arXiv---multimodal, co-creation
The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video GenerationArXiv 2026 (arXiv preprint)2026-01arXiv---multimodal, screenplay
Re:Verse -- Can Your VLM Read a Manga?ICCV AISTORY Workshop 2025 (ICCV AISTORY Workshop)2025-08arXiv---multimodal, visual-story
Lay2Story: Extending Diffusion Transformers for Layout-Togglable Story GenerationArXiv 2025 (arXiv preprint)2025-08arXiv---multimodal, visual-story
R^2: A LLM BASED NOVEL-TO-SCREENPLAY GENERATION FRAMEWORK WITH CAUSAL PLOT GRAPHSICLR 2025 (International Conference on Learning Representations)2025-03arXiv--citationmultimodal, screenplay
LongWriter-V: Enabling Ultra-Long and High-Fidelity Generation in Vision-Language ModelsArXiv 2025 (arXiv preprint)2025-02arXiv-Code-multimodal, visual-story
SEED-Story: Multimodal Long Story Generation with Large Language ModelArXiv 2024 (arXiv preprint)2024-07arXiv-Code-multimodal, visual-story
Make-A-Story: Visual Memory Conditioned Consistent Story GenerationCVPR 2023 (Conference on Computer Vision and Pattern Recognition)2022-11arXiv---multimodal, visual-story

Memory & Long-Context Coherence

TitleVenueDatePaperProjectCodeCitationsTags
Staying In Character: Perspective-Bounded Memory For Book-Based Role-Playing AgentsArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, role-playing
Not All Claims Are Equally Risky: FACTOR for Adaptive Verification in Factual Long-Form GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, factuality
Storyline Trees: Hierarchical Representations for Long-Form NarrativesArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, narrative-representation
IS-CoT: Breaking the Long-form Generation Collapse via Interleaved Structural ThinkingArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, generation
Narrative Knowledge Weaver: Narrative-Centric Retrieval-Augmented Reasoning for Long-Form Text UnderstandingArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, narrative-understanding
POLARIS: Guiding Small Models to Write Long StoriesArXiv 2026 (arXiv preprint)2026-06arXiv---long-context, generation
Building Reliable Long-Form Generation via Hallucination Rejection SamplingArXiv 2026 (arXiv preprint)2026-06arXiv-Code-long-context, coherence
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---long-context, generation
On Stable Long-Form Generation: Benchmarking and Mitigating Length VolatilityArXiv 2026 (arXiv preprint)2026-05arXiv---long-context, coherence
Think Before you Write: QA-Guided Reasoning for Character Descriptions in BooksArXiv 2026 (arXiv preprint)2026-04arXiv---long-context, coherence
Skeleton-based Coherence Modeling in NarrativesArXiv 2026 (arXiv preprint)2026-04arXiv---long-context, coherence
Shifting Long-Context LLMs Research from Input to OutputArXiv 2025 (arXiv preprint)2025-03arXiv---long-context, coherence
Language Models can Self-Lengthen to Generate Long TextsArXiv 2024 (arXiv preprint)2024-10arXiv-Code-long-context, coherence
LongGenBench: Benchmarking Long-Form Generation in Long-Context LLMsArXiv 2024 (arXiv preprint)2024-09Published---long-context, coherence
LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMsArXiv 2024 (arXiv preprint)2024-08arXiv-Code-long-context, coherence
LongLaMP: A Benchmark for Personalized Long-form Text GenerationArXiv 2024 (arXiv preprint)2024-07arXiv---long-context, coherence
CHIRON: Rich Character Representations in Long-Form NarrativesEMNLP Findings 2024 (Findings of EMNLP)2024-06Published---long-context, coherence
With Greater Text Comes Greater Necessity: Inference-Time Training Helps Long Text GenerationCOLM 2024 (Conference on Language Modeling)2024-01arXiv--citationlong-context, coherence
LongAlign: A Recipe for Long Context Alignment of Large Language ModelsArXiv 2024 (arXiv preprint)2024-01arXiv-Code-long-context, coherence
RecurrentGPT: Interactive Generation of (Arbitrarily) Long TextArXiv 2023 (arXiv preprint)2023-05arXivProjectCodecitationlong-context, interactive

Consistency / Controllability / Constraint Following

TitleVenueDatePaperProjectCodeCitationsTags
Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy OptimizationArXiv 2026 (arXiv preprint)2026-06arXiv---controllability, character-consistency
DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time InterventionINTERSPEECH 2026 (Conference of the International Speech Communication Association)2026-06arXiv---controllability, character-consistency
Steering Emotional Dynamics for Art Therapy: Controllable Narrative Script Generation through Hierarchically Guided LLM AgentsArXiv 2026 (arXiv preprint)2026-06arXiv---controllability, screenplay
Creative Collision: Directorial Persona Steering and Competition in Large Language ModelsICML Workshop 2026 (Human-AI Co-Creativity Workshop)2026-06arXiv---controllability, style-control
Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---controllability, story-generation
Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and SafetyArXiv 2026 (arXiv preprint)2026-05arXiv---controllability, consistency
ConWriter: Transition-Constrained Stateful Long-Form Story Generation with Lightweight Neuro-Symbolic Consistency ControlEMNLP Findings 2026 (accepted; arXiv preprint)2026-05arXiv-Code-controllability, consistency
UniCreative: Unifying Long-form Logic and Short-form Sparkle via Reference-Free Reinforcement LearningArXiv 2026 (arXiv preprint)2026-04arXiv---controllability, consistency
Noise Steering for Controlled Text Generation: Improving Diversity and Reading-Level Fidelity in Arabic Educational Story GenerationArXiv 2026 (arXiv preprint)2026-04arXiv---controllability, consistency
Preconditioned Test-Time Adaptation for Out-of-Distribution Debiasing in Narrative GenerationArXiv 2026 (arXiv preprint)2026-03arXiv---controllability, consistency
TaleFrame: An Interactive Story Generation System with Fine-Grained Control and Large Language ModelsArXiv 2025 (arXiv preprint)2025-12arXiv---controllability, interactive
SRS-Stories: Vocabulary-constrained multilingual story generation for language learningEMNLP Industry Track 2025 (Industry Track)2025-12Published---controllability, consistency
SCORE: Story Coherence and Retrieval Enhancement for AI NarrativesArXiv 2025 (arXiv preprint)2025-03arXiv--citationcontrollability, retrieval
Whose story is it? Personalizing story generation by inferring author stylesArXiv 2025 (arXiv preprint)2025-02arXiv--citationcontrollability, consistency
Pastiche Novel Generation Creating: Fan Fiction You Love in Your Favorite Author's StyleArXiv 2025 (arXiv preprint)2025-02arXiv--citationcontrollability, consistency
CS4: Measuring the Creativity of Large Language Models Automatically by Controlling the Number of Story-Writing ConstraintsArXiv 2024 (arXiv preprint)2024-10arXiv-Codecitationcontrollability, consistency
Crafting Narrative Closures: Zero-Shot Learning with SSM Mamba for Short Story Ending GenerationArXiv 2024 (arXiv preprint)2024-10arXiv--citationcontrollability, consistency
MirrorStories: Reflecting Diversity through Personalized Narrative Generation with Large Language ModelsEMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2024-09arXiv--citationcontrollability, consistency
FACTTRACK: Time-Aware World State Tracking in Story OutlinesNAACL 2025 (North American Chapter of ACL)2024-07arXiv--citationcontrollability, consistency
Suri: Multi-constraint Instruction Following for Long-form Text GenerationArXiv 2024 (arXiv preprint)2024-06arXiv-Code-controllability, consistency
MoPS: Modular Story Premise Synthesis for Open-Ended Automatic Story GenerationACL 2024 (Annual Meeting of the Association for Computational Linguistics)2024-06arXivProjectCodecitationcontrollability, consistency
Measuring Psychological Depth in Language ModelsEMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2024-06arXiv--citationcontrollability, consistency
Guiding and Diversifying LLM-Based Story Generation via Answer Set ProgrammingACL Workshop 2025 (ACL Workshop)2024-06arXiv--citationcontrollability, consistency
Multigenre AI-powered Story CompositionArXiv 2024 (arXiv preprint)2024-05arXiv--citationcontrollability, consistency
Returning to the Start: Generating Narratives with Related EndpointsNAACL 2024 (North American Chapter of ACL)2024-04arXivProjectCodecitationcontrollability, consistency
NarrativeGenie: Generating Narrative Beats and Dynamic Storytelling with Large Language ModelsAIIDE 2024 (Conference on Artificial Intelligence and Interactive Digital Entertainment)2024-01Published---controllability, consistency
CAT-LLM: Prompting Large Language Models with Text Style Definition for Chinese Article-style TransferArXiv 2024 (arXiv preprint)2024-01arXiv--citationcontrollability, consistency
Learning to Generate Text in Arbitrary Writing StylesArXiv 2023 (arXiv preprint)2023-12arXiv--citationcontrollability, consistency
RLCD: Reinforcement Learning from Contrast Distillation for Language Model AlignmentICLR 2024 (International Conference on Learning Representations)2023-07arXiv--citationcontrollability, consistency

Refinement / Self-Critique / Iterative Editing

TitleVenueDatePaperProjectCodeCitationsTags
OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement LearningArXiv 2026 (arXiv preprint)2026-06arXiv-Code-refinement, creative-writing
StorySpark: Module-wise Evolutionary Search for Story Premise GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---refinement, revision
StoryLens: Preference-Aligned Story Rewriting via Context-Aware Narrative EnrichmentArXiv 2026 (arXiv preprint)2026-05arXiv---refinement, revision
DTO: a Differentiable Training Objective for Effective Counterfactual Story RewritingArXiv 2026 (arXiv preprint)2026-05arXiv---refinement, revision
R2-Write: Reflection and Revision for Open-Ended Writing with Deep ReasoningArXiv 2026 (arXiv preprint)2026-04arXiv---refinement, revision
LLM Review: Enhancing Creative Writing via Blind Peer Review FeedbackArXiv 2026 (arXiv preprint)2026-01arXiv---refinement, revision
All Stories Are One Story: Emotional Arc Guided Procedural Game Level GenerationArXiv 2025 (arXiv preprint)2025-08arXiv---refinement, revision
SuperWriter: Reflection-Driven Long-Form Generation with Large Language ModelsArXiv 2025 (arXiv preprint)2025-06arXiv---refinement, revision
Finding Flawed Fictions: Evaluating Complex Reasoning in Language Models via Plot Hole DetectionArXiv 2025 (arXiv preprint)2025-04arXiv--citationrefinement, revision
MLD-EA: Check and Complete Narrative Coherence by Introducing Emotions and ActionsArXiv 2024 (arXiv preprint)2024-12arXiv--citationrefinement, revision
Collective Critics for Creative Story GenerationEMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2024-10arXiv--citationrefinement, revision
SWAG: Storytelling With Action GuidanceEMNLP Findings 2024 (Findings of EMNLP)2024-02arXiv--citationrefinement, revision
GROVE: A Retrieval-augmented Complex Story Generation Framework with A Forest of EvidenceEMNLP Findings 2023 (Findings of EMNLP)2023-10arXiv--citationrefinement, retrieval
EIPE-text: Evaluation-Guided Iterative Plan Extraction for Long-Form Narrative Text GenerationArXiv 2023 (arXiv preprint)2023-10arXiv--citationrefinement, revision
Branch-Solve-Merge Improves Large Language Model Evaluation and GenerationArXiv 2023 (arXiv preprint)2023-10arXiv---refinement, revision
Re3: Generating Longer Stories With Recursive Reprompting and RevisionArXiv 2022 (arXiv preprint)2022-10arXiv---refinement, revision
Model Criticism for Long-Form Text GenerationArXiv 2022 (arXiv preprint)2022-10arXiv---refinement, revision

Evaluation / Benchmarks / Metrics

TitleVenueDatePaperProjectCodeCitationsTags
Floor Raiser or Ceiling Limiter? Differential Storytelling Outcomes with a Child-Centric GenAI System Across Individual DifferencesArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, evaluation
Same Lesson, Different Story: Cross-Lingual Reconstruction of Cultural Narratives in Large Language ModelsArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, evaluation
Do Language Models Pass the Bechdel Test? Auditing Gender Biases in LLM-Generated ScreenplaysArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, screenplay
CASPER in the Machine: Insights into Character Variety in LLM-Generated StoriesACL 2026 (Annual Meeting of the Association for Computational Linguistics)2026-06arXiv---benchmark, evaluation
NEST: Narrative Event Structures in Time for Long Video UnderstandingArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, narrative-understanding
NarrativeWorldBench: A Frontier-Saturated Benchmark and a Latent World Model for Long-Horizon Co-Creative Audio DramaArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, audio-story
Do Large Language Models Always Tell The Same Stories?ArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, diversity
ttda704 at SemEval-2026 Task 4: Modeling Narrative Structures via Pseudonymization and Multi-View Sentence AlignmentArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, narrative-representation
Characterizing Cultural Localization in AI-Generated StoriesACL Workshop 2026 (C3NLP Workshop)2026-06arXiv---benchmark, evaluation
Automated Creativity Evaluation of Language Models Across Open-Ended TasksACL 2026 (Annual Meeting of the Association for Computational Linguistics)2026-06arXiv-Code-benchmark, evaluation
Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal ConsistencyArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, visual-story
VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video GenerationArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, video-story
Neutrality Bites: Gender Representation in AI-Generated Animal StoriesArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, evaluation
Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text GenerationArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, evaluation
StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated DatasetArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, video-story
ArcANE: Do Role-Playing Language Agents Stay in Character at the Right Time?ArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, character-consistency
SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV SeriesArXiv 2026 (arXiv preprint)2026-06arXiv---benchmark, narrative-understanding
"I've Seen How This Goes": Characterizing Diversity via Progressive Conditional SurpriseArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, diversity
Benchmarking LLM-as-a-Judge for Long-Form Output EvaluationArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, evaluation
RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing AgentsArXiv 2026 (arXiv preprint)2026-06arXiv-Code-benchmark, character-consistency
Deep Research as Rubric for Reinforcement LearningArXiv 2026 (arXiv preprint)2026-05arXiv-Code-evaluation, rubric
DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent EvaluationArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, video-story
DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing AgentsArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, character-consistency
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, audio-video
Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM FictionArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM StoriesArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief ModelingArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, narrative-understanding
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AVArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, audio-video
QUIET: A Multi-Blank Cascaded Story Cloze Benchmark for LLM Creative Generation CapabilityArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, video-story
When Reasoning Supervision Hurts: TTCW-Based Long-Form Literary Review GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---evaluation, dataset
MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, audio-video
EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video GenerationArXiv 2026 (arXiv preprint)2026-05arXivProjectCode-benchmark, video-story
Narrative Landscape: Mapping Narrative Dispositions Across LLMsArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
NARRA-Gym for Evaluating Interactive Narrative AgentsArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive DimensionsArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
StoryAlign: Evaluating and Training Reward Models for Story GenerationArXiv 2026 (arXiv preprint)2026-05arXiv---benchmark, evaluation
SemEval-2026 Task 4: Narrative Story Similarity and Narrative Representation LearningArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
ATANT v1.1: Positioning Continuity Evaluation Against Memory, Long-Context, and Agentic-Memory BenchmarksArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
Attention Flows: Tracing LLM Conceptual Engagement via Story SummariesArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, dataset
MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video ProductionArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, dataset
Spoiler Alert: Narrative Forecasting as a Metric for Tension in LLM StorytellingArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
Lessons Without Borders? Evaluating Cultural Alignment of LLMs Using Multilingual Story Moral GenerationArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
Stories of Your Life as Others: A Round-Trip Evaluation of LLM-Generated Life Stories Conditioned on Rich Psychometric ProfilesArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
StoryScope: Investigating idiosyncrasies in AI fictionArXiv 2026 (arXiv preprint)2026-04arXiv---benchmark, evaluation
Humans vs Vision-Language Models: A Unified Measure of Narrative CoherenceArXiv 2026 (arXiv preprint)2026-03arXiv---benchmark, evaluation
Creative Convergence or Imitation? Genre-Specific Homogeneity in LLM-Generated Chinese LiteratureArXiv 2026 (arXiv preprint)2026-03arXiv---benchmark, evaluation
Lost in Stories: Consistency Bugs in Long Story Generation by LLMsACL Findings 2026 (Findings of ACL)2026-03PublishedProjectCode-benchmark, evaluation
LLMs Exhibit Significantly Lower Uncertainty in Creative Writing Than Professional WritersArXiv 2026 (arXiv preprint)2026-02arXiv---benchmark, evaluation
Do readers prefer AI-generated Italian short stories?ArXiv 2026 (arXiv preprint)2026-01arXiv---benchmark, evaluation
STAGE: A Full-Screenplay Benchmark for Reasoning over Evolving StorieArXiv 2026 (arXiv preprint)2026-01arXiv---benchmark, screenplay
Evaluation Framework for AI Creativity: A Case Study Based on Story GenerationArXiv 2026 (arXiv preprint)2026-01arXiv---benchmark, evaluation
Evaluating LLM Story Generation through Large-scale Network Analysis of Social StructuresArXiv 2025 (arXiv preprint)2025-10arXiv---benchmark, evaluation
EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance GenerationArXiv 2025 (arXiv preprint)2025-08arXiv---benchmark, evaluation
LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative WritingArXiv 2025 (arXiv preprint)2025-07arXiv---benchmark, dataset
WebNovelBench: Placing LLM Novelists on the Web Novel DistributionEACL Findings 2026 (Findings of EACL)2025-05Published-Code-benchmark, evaluation
WritingBench: A Comprehensive Benchmark for Generative WritingArXiv 2025 (arXiv preprint)2025-03arXiv---benchmark, evaluation
CoKe: Customizable Fine-Grained Story Evaluation via Chain-of-Keyword RationalizationArXiv 2025 (arXiv preprint)2025-03arXiv--citationbenchmark, evaluation
LongEval: A Comprehensive Analysis of Long-Text Generation Through a Plan-based ParadigmArXiv 2025 (arXiv preprint)2025-02arXiv-Codecitationbenchmark, evaluation
Echoes in AI: Quantifying Lack of Plot Diversity in LLM OutputsArXiv 2025 (arXiv preprint)2025-01arXiv--citationbenchmark, evaluation
Evaluating Creative Short Story Generation in Humans and Large Language ModelsArXiv 2024 (arXiv preprint)2024-11arXiv--citationbenchmark, evaluation
Small Language Models can Outperform Humans in Short Creative Writing: A Study Comparing SLMs with Humans and LLMsCOLING 2025 (International Conference on Computational Linguistics)2024-09arXiv--citationbenchmark, evaluation
HelloBench: Evaluating Long Text Generation Capabilities of Large Language ModelsArXiv 2024 (arXiv preprint)2024-09arXiv-Code-benchmark, evaluation
STORYSUMM: Evaluating Faithfulness in Story SummarizationEMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2024-07arXiv--citationbenchmark, evaluation
Pron vs Prompt: Can Large Language Models already Challenge a World-Class Fiction Author at Creative Text Writing?ArXiv 2024 (arXiv preprint)2024-07arXiv--citationbenchmark, evaluation
Are Large Language Models Capable of Generating Human-Level Narratives?EMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2024-07arXiv--citationbenchmark, evaluation
Do Language Models Enjoy Their Own Stories? Prompting Large Language Models for Automatic Story EvaluationTACL 2024 (Transactions of the Association for Computational Linguistics)2024-05arXiv--citationbenchmark, evaluation
Reading Subtext: Evaluating Large Language Models on Short Story Summarization with WritersTACL 2024 (Transactions of the Association for Computational Linguistics)2024-03arXiv--citationbenchmark, evaluation
Learning Personalized Alignment for Evaluating Open-ended Text GenerationEMNLP 2024 (Conference on Empirical Methods in Natural Language Processing)2023-10arXiv--citationbenchmark, evaluation
A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative WritingEMNLP Findings 2023 (Findings of EMNLP)2023-10arXiv--citationbenchmark, evaluation
Art or Artifice? Large Language Models and the False Promise of CreativityCHI 2023 (Conference on Human Factors in Computing Systems)2023-09arXiv--citationbenchmark, evaluation
StoryBench: A Multifaceted Benchmark for Continuous Story VisualizationNeurIPS Datasets and Benchmarks Track 2023 (Datasets and Benchmarks Track)2023-08Published-Code-benchmark, evaluation
HAUSER: Towards Holistic and Automatic Evaluation of Simile GenerationACL 2023 (Annual Meeting of the Association for Computational Linguistics)2023-06arXiv--citationbenchmark, evaluation
Can Large Language Models Be an Alternative to Human Evaluations?ACL 2023 (Annual Meeting of the Association for Computational Linguistics)2023-05arXiv--citationbenchmark, evaluation
DeltaScore: Evaluating Story Generation with Differentiating PerturbationsEMNLP Findings 2023 (Findings of EMNLP)2023-03arXiv--citationbenchmark, evaluation
StoryER: Automatic Story Evaluation via Ranking, Rating and ReasoningEMNLP 2022 (Conference on Empirical Methods in Natural Language Processing)2022-10arXiv-Codecitationbenchmark, evaluation
Of Human Criteria and Automatic Metrics: A Benchmark of the Evaluation of Story GenerationCOLING 2022 (International Conference on Computational Linguistics)2022-08arXiv--citationbenchmark, evaluation

Datasets / Surveys / Resources

TitleVenueDatePaperProjectCodeCitationsTags
AI Fiction in the WildArXiv 2026 (arXiv preprint)2026-06arXiv---resource, fiction-generation
Characterizing Narrative Content in Web-scale LLM Pretraining DataArXiv 2026 (arXiv preprint)2026-06arXiv---dataset, resource
OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence ChainsArXiv 2026 (arXiv preprint)2026-06arXiv-Code-dataset, audio-video
CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video GenerationArXiv 2026 (arXiv preprint)2026-06arXivProject--dataset, audio-video
AI as a Tool for Simulation-Based Experiments in Literary StudiesArXiv 2026 (arXiv preprint)2026-06arXiv---resource, literary-study
GraphLit: Learning Text-Enriched Dynamic Character Network Representations for Literary StudyArXiv 2026 (arXiv preprint)2026-05arXiv---dataset, resource
LitSeg: Narrative-Aware Document Segmentation for Literary RAGArXiv 2026 (arXiv preprint)2026-05arXiv---dataset, resource
Manga109-v2026: Revisiting Manga109 Annotations for Modern Manga UnderstandingArXiv 2026 (arXiv preprint)2026-05arXivProject--dataset, dataset
LLMs for automatic annotation of Mandarin narrative transcriptsArXiv 2026 (arXiv preprint)2026-05arXiv---dataset, narrative-understanding
StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMsArXiv 2026 (arXiv preprint)2026-05arXiv---dataset, dataset
Narrative Theory-Driven LLM Methods for Automatic Story Generation and Understanding: A SurveyArXiv 2026 (arXiv preprint)2026-02arXiv---dataset, survey
MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive OrchestrationArXiv 2026 (arXiv preprint)2026-02arXiv---dataset, resource
StoryWriter: A Multi-Agent Framework for Long Story GenerationArXiv 2025 (arXiv preprint)2025-06arXiv---dataset, resource
Reasoning-Enhanced Self-Training for Long-Form Personalized Text GenerationArXiv 2025 (arXiv preprint)2025-01arXivProjectCode-dataset, resource
Multi-Agent Based Character Simulation for Story WritingIN2Writing 2025 (IN2Writing Workshop)2025-01Published---dataset, resource
BookWorm: A Dataset for Character Description and AnalysisEMNLP Findings 2024 (Findings of EMNLP)2024-10arXiv--citationdataset, dataset
What Makes a Good Story and How Can We Measure It? A Comprehensive Survey of Story EvaluationArXiv 2024 (arXiv preprint)2024-08arXiv--citationdataset, survey
The GPT-WritingPrompts Dataset: A Comparative Analysis of Character Portrayal in Short StoriesEMNLP Workshop 2025 (EMNLP Workshop)2024-06arXiv-Codecitationdataset, dataset
CollabStory: Multi-LLM Collaborative Story Generation and Authorship AnalysisNAACL Findings 2025 (Findings of NAACL)2024-06arXiv-Codecitationdataset, resource
The Value, Benefits, and Concerns of Generative AI-Powered Assistance in WritingCHI 2024 (Conference on Human Factors in Computing Systems)2024-03arXiv--citationdataset, resource
Large Language Models Fall Short: Understanding Complex Relationships in Detective NarrativesACL Findings 2024 (Findings of ACL)2024-02arXiv--citationdataset, resource
CMDAG: A Chinese Metaphor Dataset with Annotated Grounds as CoT for Boosting Metaphor GenerationLREC-COLING 2024 (LREC-COLING)2024-02arXiv-Codecitationdataset, dataset
Assisting in Writing Wikipedia-like Articles From Scratch with Large Language ModelsArXiv 2024 (arXiv preprint)2024-02arXiv---dataset, resource
Weaver: Foundation Models for Creative WritingArXiv 2024 (arXiv preprint)2024-01arXiv--citationdataset, resource
Reflections & Resonance: Two-Agent Partnership for Advancing LLM-based Story AnnotationLREC-COLING 2024 (LREC-COLING)2024-01Published--citationdataset, resource
CLAUSE-ATLAS: A Corpus of Narrative Information to Scale up Computational Literary AnalysisLREC-COLING 2024 (LREC-COLING)2024-01Published--citationdataset, resource
STONYBOOK: A System and Resource for Large-Scale Analysis of NovelsArXiv 2023 (arXiv preprint)2023-11arXiv--citationdataset, resource
Are NLP Models Good at Tracing Thoughts: An Overview of Narrative UnderstandingEMNLP Findings 2023 (Findings of EMNLP)2023-10arXiv--citationdataset, resource
StoryWars: A Dataset and Instruction Tuning Baselines for Collaborative Story Understanding and GenerationACL 2023 (Annual Meeting of the Association for Computational Linguistics)2023-05arXiv--citationdataset, dataset
Open-world Story Generation with Structured Knowledge Enhancement: A Comprehensive SurveyNeurocomputing 2023 (Neurocomputing (Journal))2022-12arXiv---dataset, survey
Co-Writing Screenplays and Theatre Scripts with Language Models: An Evaluation by Industry ProfessionalsArXiv 2022 (arXiv preprint)2022-09arXivProjectCode-dataset, screenplay
A corpus for understanding and generating moral storiesNAACL 2022 (North American Chapter of ACL)2022-04arXiv--citationdataset, resource

Open-source Projects (No Paper Required)

TitleVenueDatePaperProjectCodeCitationsTags
FireRed-OpenStorylineGitHub 2026 (Open-source repository)2026-01-ProjectCode-tooling, open-source
ReasoningNCP (Official Repository)GitHub 2025 (Open-source repository)2025-03arXivProjectCode-tooling, open-source
SEED-Story (Official Repository)GitHub 2024 (Open-source repository)2024-07arXivProjectCode-tooling, open-source
IBSEN (Official Repository)GitHub 2024 (Open-source repository)2024-07arXivProjectCode-tooling, open-source
RENarGen (Official Repository)GitHub 2024 (Open-source repository)2024-04arXivProjectCode-tooling, open-source
fictionx-story-genGitHub 2024 (Open-source repository)2024-01-ProjectCode-tooling, open-source
SillyTavernGitHub 2023 (Open-source repository)2023-01-ProjectCode-tooling, open-source
GOAT-Storytelling-AgentGitHub 2023 (Open-source repository)2023-01-ProjectCode-tooling, open-source
Dramatron (Official Repository)GitHub 2022 (Open-source repository)2022-09arXivProjectCode-tooling, screenplay
TavernAIGitHub 2022 (Open-source repository)2022-01-ProjectCode-tooling, open-source

Maintenance Notes

  • Check duplicate titles before adding new entries.
  • Update README.md and README_zh.md together.
  • Use YYYY-MM for Date.
  • Keep Paper as one primary link (Published preferred, otherwise arXiv; use - if unavailable).

Citation

If this repository helps your research or project, please cite:

@misc{lijunjie2026awesomellmstorygeneration,
  title        = {Awesome LLM Story Generation},
  author       = {Lijunjie},
  year         = {2026},
  howpublished = {\url{https://github.com/lijunjie/awesome-llm-story-generation}},
  note         = {GitHub repository, accessed 2026-02-27}
}

If you later change your GitHub account or repository name, update author and howpublished accordingly.

creative-writing
long-context
story-generation

Contributors

Picrew

52 commits