KarthikRagunathAnandaKumar/sliderl-multi-turn-rollouts

Dataset

SlideRL Multi-Turn Rollouts

0

8 commits

1 linked in READMEs

updated Mar 14, 2026

See the code

README

SlideRL Multi-Turn Rollouts

Multi-turn rollout trajectories from the SlideRL environment across 6 different models. Each trajectory captures an agent interacting with the SlideRL slide-generation environment over multiple tool-use turns.

Models

FileModelEpisodesDescription
claude_opus_4_6_trajectories.jsonClaude Opus 4.648Anthropic Claude Opus 4.6
claude_sonnet_4_6_trajectories.jsonClaude Sonnet 4.648Anthropic Claude Sonnet 4.6
llama_4_scout_trajectories.jsonLlama 4 Scout48Meta Llama 4 Scout
gpt_oss_120b_trajectories.jsonGPT-OSS-120B48OpenAI GPT-OSS-120B
finetuned_model_trajectories.jsonSlideRL Finetuned48GRPO-finetuned model
base_model_trajectories.jsonSlideRL Base48Base model before finetuning

Trajectory Format

Each JSON file contains a list of episodes. Each episode has:

{
  "episode_id": "uuid",
  "model": "model-name",
  "brief": { "topic": "...", "audience": "...", "num_slides": N, ... },
  "brief_topic": "Topic Name",
  "turns": [
    {
      "turn": 0,
      "assistant": "model's response text",
      "tool_call": { "tool": "tool_name", ... },
      "observation": "environment feedback",
      "success": true,
      "phase": "RESEARCH|PLAN|BUILD|REFINE",
      "slide_count": 0,
      "done": false,
      "step_reward": 0.01,
      "cumulative_reward": 0.01
    }
  ],
  "total_steps": 25,
  "final_phase": "REFINE",
  "completed": true,
  "slides_created": 6,
  "cumulative_reward": 1.15,
  "final_quality": { "aggregate": 0.80, ... },
  "slides_html": ["<slide html>..."],
  "elapsed_seconds": 120.5
}

Environment

The SlideRL environment is a multi-turn tool-use environment where agents create presentation slide decks by:

  1. Researching the topic via web search
  2. Planning an outline
  3. Building slides with HTML/CSS
  4. Refining slides for quality

Agents interact through structured tool calls (web_search, create_outline, set_theme, add_slide, replace_slide, delete_slide, etc.) and receive environment observations with quality feedback.

48 Diverse Business Topics

All models are evaluated on the same 48 business presentation briefs spanning finance, technology, marketing, cybersecurity, healthcare, and more.

Citation

Part of the SlideRL project — an open-ended RL environment for training LLM agents on multi-turn tool-use tasks.

grpo
multi-turn
presentation-generation
rl
rollouts
sliderl
tool-use

Contributors

KarthikRagunathAnandaKumar/sliderl-multi-turn-rollouts

Dataset

SlideRL Multi-Turn Rollouts

0

8 commits

1 linked in READMEs

updated Mar 14, 2026

See the code

README

SlideRL Multi-Turn Rollouts

Multi-turn rollout trajectories from the SlideRL environment across 6 different models. Each trajectory captures an agent interacting with the SlideRL slide-generation environment over multiple tool-use turns.

Models

FileModelEpisodesDescription
claude_opus_4_6_trajectories.jsonClaude Opus 4.648Anthropic Claude Opus 4.6
claude_sonnet_4_6_trajectories.jsonClaude Sonnet 4.648Anthropic Claude Sonnet 4.6
llama_4_scout_trajectories.jsonLlama 4 Scout48Meta Llama 4 Scout
gpt_oss_120b_trajectories.jsonGPT-OSS-120B48OpenAI GPT-OSS-120B
finetuned_model_trajectories.jsonSlideRL Finetuned48GRPO-finetuned model
base_model_trajectories.jsonSlideRL Base48Base model before finetuning

Trajectory Format

Each JSON file contains a list of episodes. Each episode has:

{
  "episode_id": "uuid",
  "model": "model-name",
  "brief": { "topic": "...", "audience": "...", "num_slides": N, ... },
  "brief_topic": "Topic Name",
  "turns": [
    {
      "turn": 0,
      "assistant": "model's response text",
      "tool_call": { "tool": "tool_name", ... },
      "observation": "environment feedback",
      "success": true,
      "phase": "RESEARCH|PLAN|BUILD|REFINE",
      "slide_count": 0,
      "done": false,
      "step_reward": 0.01,
      "cumulative_reward": 0.01
    }
  ],
  "total_steps": 25,
  "final_phase": "REFINE",
  "completed": true,
  "slides_created": 6,
  "cumulative_reward": 1.15,
  "final_quality": { "aggregate": 0.80, ... },
  "slides_html": ["<slide html>..."],
  "elapsed_seconds": 120.5
}

Environment

The SlideRL environment is a multi-turn tool-use environment where agents create presentation slide decks by:

  1. Researching the topic via web search
  2. Planning an outline
  3. Building slides with HTML/CSS
  4. Refining slides for quality

Agents interact through structured tool calls (web_search, create_outline, set_theme, add_slide, replace_slide, delete_slide, etc.) and receive environment observations with quality feedback.

48 Diverse Business Topics

All models are evaluated on the same 48 business presentation briefs spanning finance, technology, marketing, cybersecurity, healthcare, and more.

Citation

Part of the SlideRL project — an open-ended RL environment for training LLM agents on multi-turn tool-use tasks.

grpo
multi-turn
presentation-generation
rl
rollouts
sliderl
tool-use

Contributors