nvidia/PixelDiT-ImageNet

Model

14

stars

13

commits

2

linked in READMEs

Apr 15, 2026

updated

class-conditional
diffusion
dit
image-generation
imagenet
pixel-space
pytorch
unconditional-image-generation
Browse cluster: Diffusion Models & Image Generation

README

PixelDiT: Pixel Diffusion Transformers for Image Generation

Yongsheng Yu1,2   Wei Xiong1†   Weili Nie1   Yichen Sheng1   Shiqiu Liu1   Jiebo Luo2

1NVIDIA   2University of Rochester
Project Lead and Main Advising

   

Pre-trained Checkpoints

CheckpointResolutionEpochsgFIDCFG ScaleTime ShiftCFG Interval
imagenet256_pixeldit_xl_epoch80.ckpt256x256802.363.251.0[0.1, 1.0]
imagenet256_pixeldit_xl_epoch160.ckpt256x2561601.973.251.0[0.1, 1.0]
imagenet256_pixeldit_xl_epoch320.ckpt256x2563201.612.751.0[0.1, 0.9]
imagenet512_pixeldit_xl.ckpt512x5128501.813.52.0[0.1, 1.0]

All evaluations use FlowDPMSolver with 100 steps. 50K samples. Metrics follow the ADM evaluation protocol.

Usage

Installation

pip install -r requirements.txt

Evaluation (Generate 50K Samples)

cd c2i/

# ImageNet 256x256 (epoch 320, best FID)
torchrun --nproc_per_node=8 main.py predict \
  -c configs/pix256_xl.yaml \
  --ckpt_path=imagenet256_pixeldit_xl_epoch320.ckpt \
  --model.diffusion_sampler.class_path=src.diffusion.FlowDPMSolverSampler \
  --model.diffusion_sampler.init_args.num_steps=100 \
  --model.diffusion_sampler.init_args.guidance=2.75 \
  --model.diffusion_sampler.init_args.timeshift=1.0 \
  --model.diffusion_sampler.init_args.guidance_interval_min=0.1 \
  --model.diffusion_sampler.init_args.guidance_interval_max=0.9 \
  --per_run_seed=false --seed_everything=1000

# ImageNet 512x512
torchrun --nproc_per_node=8 main.py predict \
  -c configs/pix512_xl.yaml \
  --ckpt_path=imagenet512_pixeldit_xl.ckpt \
  --model.diffusion_sampler.class_path=src.diffusion.FlowDPMSolverSampler \
  --model.diffusion_sampler.init_args.num_steps=100 \
  --model.diffusion_sampler.init_args.guidance=3.5 \
  --model.diffusion_sampler.init_args.timeshift=2.0 \
  --model.diffusion_sampler.init_args.guidance_interval_min=0.1 \
  --model.diffusion_sampler.init_args.guidance_interval_max=1.0 \
  --per_run_seed=false --seed_everything=10000

After generating samples, compute FID with the ADM evaluation toolkit.

Citation

@inproceedings{yu2025pixeldit,
      title={PixelDiT: Pixel Diffusion Transformers for Image Generation},
      author={Yongsheng Yu and Wei Xiong and Weili Nie and Yichen Sheng and Shiqiu Liu and Jiebo Luo},
      booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2026},
}

License

This model is released under the NSCLv1 License. The work and any derivative works may only be used for non-commercial (research or evaluation) purposes.

Contributors

yongshengy

13 commits

nvidia/PixelDiT-ImageNet

Model

14

stars

13

commits

2

linked in READMEs

Apr 15, 2026

updated

class-conditional
diffusion
dit
image-generation
imagenet
pixel-space
pytorch
unconditional-image-generation
Browse cluster: Diffusion Models & Image Generation

README

PixelDiT: Pixel Diffusion Transformers for Image Generation

Yongsheng Yu1,2   Wei Xiong1†   Weili Nie1   Yichen Sheng1   Shiqiu Liu1   Jiebo Luo2

1NVIDIA   2University of Rochester
Project Lead and Main Advising

   

Pre-trained Checkpoints

CheckpointResolutionEpochsgFIDCFG ScaleTime ShiftCFG Interval
imagenet256_pixeldit_xl_epoch80.ckpt256x256802.363.251.0[0.1, 1.0]
imagenet256_pixeldit_xl_epoch160.ckpt256x2561601.973.251.0[0.1, 1.0]
imagenet256_pixeldit_xl_epoch320.ckpt256x2563201.612.751.0[0.1, 0.9]
imagenet512_pixeldit_xl.ckpt512x5128501.813.52.0[0.1, 1.0]

All evaluations use FlowDPMSolver with 100 steps. 50K samples. Metrics follow the ADM evaluation protocol.

Usage

Installation

pip install -r requirements.txt

Evaluation (Generate 50K Samples)

cd c2i/

# ImageNet 256x256 (epoch 320, best FID)
torchrun --nproc_per_node=8 main.py predict \
  -c configs/pix256_xl.yaml \
  --ckpt_path=imagenet256_pixeldit_xl_epoch320.ckpt \
  --model.diffusion_sampler.class_path=src.diffusion.FlowDPMSolverSampler \
  --model.diffusion_sampler.init_args.num_steps=100 \
  --model.diffusion_sampler.init_args.guidance=2.75 \
  --model.diffusion_sampler.init_args.timeshift=1.0 \
  --model.diffusion_sampler.init_args.guidance_interval_min=0.1 \
  --model.diffusion_sampler.init_args.guidance_interval_max=0.9 \
  --per_run_seed=false --seed_everything=1000

# ImageNet 512x512
torchrun --nproc_per_node=8 main.py predict \
  -c configs/pix512_xl.yaml \
  --ckpt_path=imagenet512_pixeldit_xl.ckpt \
  --model.diffusion_sampler.class_path=src.diffusion.FlowDPMSolverSampler \
  --model.diffusion_sampler.init_args.num_steps=100 \
  --model.diffusion_sampler.init_args.guidance=3.5 \
  --model.diffusion_sampler.init_args.timeshift=2.0 \
  --model.diffusion_sampler.init_args.guidance_interval_min=0.1 \
  --model.diffusion_sampler.init_args.guidance_interval_max=1.0 \
  --per_run_seed=false --seed_everything=10000

After generating samples, compute FID with the ADM evaluation toolkit.

Citation

@inproceedings{yu2025pixeldit,
      title={PixelDiT: Pixel Diffusion Transformers for Image Generation},
      author={Yongsheng Yu and Wei Xiong and Weili Nie and Yichen Sheng and Shiqiu Liu and Jiebo Luo},
      booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2026},
}

License

This model is released under the NSCLv1 License. The work and any derivative works may only be used for non-commercial (research or evaluation) purposes.

Contributors

yongshengy

13 commits