Flask server hosting the Qwen3-0.6B-diffusion-bd3lm-v0.1 model with real-time streaming inference. Watch diffusion language models generate text step-by-step!
GET /health
POST /generate
Content-Type: application/json
{
"prompt": "Your question here",
"max_new_tokens": 256
}
POST /generate_sse
Content-Type: application/json
{
"prompt": "Your question here",
"max_new_tokens": 100,
"capture_interval": 10
}
# Simple generation
curl -X POST https://YOUR_USERNAME-diffusion-chatbot.hf.space/generate \
-H "Content-Type: application/json" \
-d '{"prompt": "Hello, how are you?", "max_new_tokens": 50}'
# Real-time streaming
curl -N -X POST https://YOUR_USERNAME-diffusion-chatbot.hf.space/generate_sse \
-H "Content-Type: application/json" \
-d '{"prompt": "Write a poem", "max_new_tokens": 100, "capture_interval": 10}'
| Component | Technology |
|---|---|
| Model | dllm-hub/Qwen3-0.6B-diffusion-bd3lm-v0.1 |
| Framework | Flask + PyTorch |
| Method | Block Diffusion Language Model (BD3LM) |
| Base Model | Qwen |
| Variable | Description | Default |
|---|---|---|
MODEL_NAME | HuggingFace model name | dllm-hub/Qwen3-0.6B-diffusion-bd3lm-v0.1 |
PORT | Server port | 7860 |
Unlike traditional language models that generate text left-to-right, diffusion language models:
capture_interval = more frequent updates6 commits
1 commits
Flask server hosting the Qwen3-0.6B-diffusion-bd3lm-v0.1 model with real-time streaming inference. Watch diffusion language models generate text step-by-step!
GET /health
POST /generate
Content-Type: application/json
{
"prompt": "Your question here",
"max_new_tokens": 256
}
POST /generate_sse
Content-Type: application/json
{
"prompt": "Your question here",
"max_new_tokens": 100,
"capture_interval": 10
}
# Simple generation
curl -X POST https://YOUR_USERNAME-diffusion-chatbot.hf.space/generate \
-H "Content-Type: application/json" \
-d '{"prompt": "Hello, how are you?", "max_new_tokens": 50}'
# Real-time streaming
curl -N -X POST https://YOUR_USERNAME-diffusion-chatbot.hf.space/generate_sse \
-H "Content-Type: application/json" \
-d '{"prompt": "Write a poem", "max_new_tokens": 100, "capture_interval": 10}'
| Component | Technology |
|---|---|
| Model | dllm-hub/Qwen3-0.6B-diffusion-bd3lm-v0.1 |
| Framework | Flask + PyTorch |
| Method | Block Diffusion Language Model (BD3LM) |
| Base Model | Qwen |
| Variable | Description | Default |
|---|---|---|
MODEL_NAME | HuggingFace model name | dllm-hub/Qwen3-0.6B-diffusion-bd3lm-v0.1 |
PORT | Server port | 7860 |
Unlike traditional language models that generate text left-to-right, diffusion language models:
capture_interval = more frequent updates6 commits
1 commits