mirror of
https://github.com/zenlm/enso.git
synced 2026-07-26 22:30:28 +00:00
fc07d0fa3ad7d594c7611425eb5b5a30054a89b1
Scaling Diffusion Transformers with Mixture of Experts
Official PyTorch Implementation
This repo contains PyTorch model definitions, pre-trained weights and training/sampling code for our paper scaling Diffusion Transformers to 16 billion parameters (DiT-MoE). DiT-MoE as a sparse version of the diffusion Transformer, is scalable and competitive with dense networks while exhibiting highly optimized inference.
- 🪐 A PyTorch implementation of DiT-MoE
- ⚡️ Pre-trained checkpoints in paper
- 💥 A sampling script for running pre-trained DiT-MoE
- 🛸 A DiT-MoE training script using PyTorch DDP
To do list
- training / inference scripts
- huggingface ckpts
- experts routing analysis
- synthesized data
1. Training
2. CKPTs and Data
3. Expert Specialization Analysis Tools
4. BibTeX
@article{FeiDiTMoE2024,
title={Scaling Diffusion Transformers to 16 Billion Parameters},
author={Zhengcong Fei, Mingyuan Fan, Changqian Yu, Debang Li, Jusnshi Huang},
year={2024},
journal={arXiv preprint},
}
5. Acknowledgments
The codebase is based on the awesome DiT and DeepSeek-MoE repos.
Description
Enso Diffusion: Multimodal Mixture of Unbound Experts (MUEN) — unifying text, vision, and audio through diffusion-based intelligence.
1 MiB
Languages
Python
100%
