Cool Japan Diffusion 2.1.0 Model Card
65
22 commits
4 linked in READMEs
updated Jan 28, 2023

泚æäºé¡¹ãä»2023幎1æ10æ¥èµ·ïŒäžåœå°å¯¹åŸåçæç人工æºèœå®æœæ³åŸéå¶ã ïŒäžåœåœå ã«ãã人ãžã®èŠåïŒ
English version is here.
Cool Japan Diffusion (for learning) ã¯Stable Diffsionããã¡ã€ã³ãã¥ãŒãã³ã°ããŠãã¢ãã¡ããã³ã¬ãã²ãŒã ãªã©ã®ã¯ãŒã«ãžã£ãã³ã衚çŸããããšã«ç¹åããã¢ãã«ã§ãããªããå é£åºã®ã¯ãŒã«ãžã£ãã³æŠç¥ãšã¯ç¹ã«é¢ä¿ã¯ãããŸããã
ã©ã€ã»ã³ã¹ã«ã€ããŠã¯ãããšã®ã©ã€ã»ã³ã¹ CreativeML Open RAIL++-M License ã«äŸå€ãé€ãåçšå©çšçŠæ¢ã远å ããã ãã§ãã äŸå€ãé€ãåçšå©çšçŠæ¢ã远å ããçç±ã¯åµäœæ¥çã«æªåœ±é¿ãåãŒããããªããšããæžå¿µããã§ãã ãã®æžå¿µãææãããã°ã次ã®ããŒãžã§ã³ããå ã®ã©ã€ã»ã³ã¹ã«æ»ããåçšå©çšå¯èœãšããŸãã ã¡ãªã¿ã«ãå ã®ã©ã€ã»ã³ã¹ã®æ¥æ¬èªèš³ã¯ãã¡ãã«ãªããŸãã å¶å©äŒæ¥ã«ããæ¹ã¯æ³åéšã«ãã人ãšçžè«ããŠãã ããã è¶£å³ã§å©çšããæ¹ã¯ããŸãæ°ã«ããªããŠãäžè¬åžžèãå®ãã°å€§äžå€«ãªã¯ãã§ãã ãªããã©ã€ã»ã³ã¹ã«ããéãããã®ã¢ãã«ãæ¹é ããŠãããã®ã©ã€ã»ã³ã¹ãåŒãç¶ãå¿ èŠããããŸãã
æ¬ã¢ãã«ã¯æ¥æ¬ã«ãŠäœæãããŸããããããã£ãŠãæ¥æ¬ã®æ³åŸãé©çšãããŸãã æ¬ã¢ãã«ã®åŠç¿ã¯ãèäœæš©æ³ç¬¬30æ¡ã®4ã«åºã¥ããåæ³ã§ãããšäž»åŒµããŸãã ãŸããæ¬ã¢ãã«ã®é åžã«ã€ããŠã¯ãèäœæš©æ³ãåæ³175æ¡ã«ç §ãããŠã¿ãŠãã æ£ç¯ãå¹å©ç¯ã«ã該åœããªããšäž»åŒµããŸãã詳ããã¯æ¿æ²ŒåŒè·å£«ã®èŠè§£ã埡芧ãã ããã ãã ããã©ã€ã»ã³ã¹ã«ãããéããæ¬ã¢ãã«ã®çæç©ã¯åçš®æ³ä»€ã«åŸã£ãŠåãæ±ã£ãŠäžããã
ããããæ¬ã¢ãã«ãé åžããè¡çºãå«ççã«è¯ããªããšã¯äœè ã¯æã£ãŠããŸãã ããã¯åŠç¿ããèäœç©ã«å¯ŸããŠèäœè ã®èš±å¯ãåŸãŠããªãããã§ãã ãã ããåŠç¿ããã«ã¯èäœè ã®èš±å¯ã¯æ³åŸäžå¿ èŠããªããæ€çŽ¢ãšã³ãžã³ãšåæ§æ³åŸäžã¯åé¡ã¯ãããŸããã ãããã£ãŠãæ³çãªåŽé¢ã§ã¯ãªããå«ççãªåŽé¢ã調æ»ããç®çãæ¬é åžã¯å ŒããŠãããšèããŠãã ããã
æè»œã«æ¥œãã¿ããæ¹ã¯ããã¡ãã®Spaceãã䜿ããã ããã 詳ããæ¬ã¢ãã«ã®åãæ±ãæ¹ã¯ãã¡ãã®åæ±èª¬ææžã«ããããŠããŸãã ã¢ãã«ã¯ããããããŠã³ããŒãã§ããŸãã
以äžãäžè¬çãªã¢ãã«ã«ãŒãã®æ¥æ¬èªèš³ã§ãã
éçºè : Robin Rombach, Patrick Esser, Alfred Increment
ã¢ãã«ã¿ã€ã: æ¡æ£ã¢ãã«ããŒã¹ã® text-to-image çæã¢ãã«
èšèª: æ¥æ¬èª
ã©ã€ã»ã³ã¹: CreativeML Open RAIL++-M-NC License
ã¢ãã«ã®èª¬æ: ãã®ã¢ãã«ã¯ããã³ããã«å¿ããŠé©åãªç»åãçæããããšãã§ããŸããã¢ã«ãŽãªãºã 㯠Latent Diffusion Model ãš OpenCLIP-ViT/H ã§ãã
è£è¶³:
åèæç®:
@InProceedings{Rombach_2022_CVPR,
author = {Rombach, Robin and Blattmann, Andreas and Lorenz, Dominik and Esser, Patrick and Ommer, Bj\"orn},
title = {High-Resolution Image Synthesis With Latent Diffusion Models},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
month = {June},
year = {2022},
pages = {10684-10695}
}
Stable Diffusion v2ãšåãäœ¿ãæ¹ã§ãã ããããã®æ¹æ³ããããŸãããïŒã€ã®ãã¿ãŒã³ãæäŸããŸãã
ãã¡ãã®åæ±èª¬ææžã«åŸã£ãŠäœæããŠãã ããã
ð€'s Diffusers library ã䜿ã£ãŠãã ããã
ãŸãã¯ã以äžã®ã¹ã¯ãªãããå®è¡ããã©ã€ãã©ãªããããŠãã ããã
pip install --upgrade git+https://github.com/huggingface/diffusers.git transformers accelerate scipy
次ã®ã¹ã¯ãªãããå®è¡ããç»åãçæããŠãã ããã
from diffusers import StableDiffusionPipeline, EulerDiscreteScheduler
import torch
model_id = "aipicasso/cool-japan-diffusion-2-1-0-beta"
scheduler = EulerDiscreteScheduler.from_pretrained(model_id, subfolder="scheduler")
pipe = StableDiffusionPipeline.from_pretrained(model_id, scheduler=scheduler, torch_dtype=torch.float16)
pipe = pipe.to("cuda")
prompt = "anime, a portrait of a girl with black short hair and red eyes, kimono, full color illustration, official art, 4k, detailed"
negative_prompt="low quality, bad face, bad anatomy, bad hand, lowres, jpeg artifacts, 2d, 3d, cg, text"
image = pipe(prompt,negative_prompt=negative_prompt).images[0]
image.save("girl.png")
泚æ:
pipe.enable_attention_slicing() ã䜿ã£ãŠãã ãããStable Diffusionãšåããã€ã¢ã¹ãæãã£ãŠããŸãã æ°ãã€ããŠãã ããã
åŠç¿ããŒã¿
次ã®ããŒã¿ãäž»ã«äœ¿ã£ãŠStable Diffusionããã¡ã€ã³ãã¥ãŒãã³ã°ããŠããŸãã
åŠç¿ããã»ã¹
Stable Diffusionã®VAEãšU-Netããã¡ã€ã³ãã¥ãŒãã³ã°ããŸããã
ã»ãšãã©ãããŸããã
@InProceedings{Rombach_2022_CVPR,
author = {Rombach, Robin and Blattmann, Andreas and Lorenz, Dominik and Esser, Patrick and Ommer, Bj\"orn},
title = {High-Resolution Image Synthesis With Latent Diffusion Models},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
month = {June},
year = {2022},
pages = {10684-10695}
}
*ãã®ã¢ãã«ã«ãŒã㯠Stable Diffusion v2 ã«åºã¥ããŠãAlfred IncrementããããŸããã
Cool Japan Diffusion 2.1.0 Model Card
65
22 commits
4 linked in READMEs
updated Jan 28, 2023

泚æäºé¡¹ãä»2023幎1æ10æ¥èµ·ïŒäžåœå°å¯¹åŸåçæç人工æºèœå®æœæ³åŸéå¶ã ïŒäžåœåœå ã«ãã人ãžã®èŠåïŒ
English version is here.
Cool Japan Diffusion (for learning) ã¯Stable Diffsionããã¡ã€ã³ãã¥ãŒãã³ã°ããŠãã¢ãã¡ããã³ã¬ãã²ãŒã ãªã©ã®ã¯ãŒã«ãžã£ãã³ã衚çŸããããšã«ç¹åããã¢ãã«ã§ãããªããå é£åºã®ã¯ãŒã«ãžã£ãã³æŠç¥ãšã¯ç¹ã«é¢ä¿ã¯ãããŸããã
ã©ã€ã»ã³ã¹ã«ã€ããŠã¯ãããšã®ã©ã€ã»ã³ã¹ CreativeML Open RAIL++-M License ã«äŸå€ãé€ãåçšå©çšçŠæ¢ã远å ããã ãã§ãã äŸå€ãé€ãåçšå©çšçŠæ¢ã远å ããçç±ã¯åµäœæ¥çã«æªåœ±é¿ãåãŒããããªããšããæžå¿µããã§ãã ãã®æžå¿µãææãããã°ã次ã®ããŒãžã§ã³ããå ã®ã©ã€ã»ã³ã¹ã«æ»ããåçšå©çšå¯èœãšããŸãã ã¡ãªã¿ã«ãå ã®ã©ã€ã»ã³ã¹ã®æ¥æ¬èªèš³ã¯ãã¡ãã«ãªããŸãã å¶å©äŒæ¥ã«ããæ¹ã¯æ³åéšã«ãã人ãšçžè«ããŠãã ããã è¶£å³ã§å©çšããæ¹ã¯ããŸãæ°ã«ããªããŠãäžè¬åžžèãå®ãã°å€§äžå€«ãªã¯ãã§ãã ãªããã©ã€ã»ã³ã¹ã«ããéãããã®ã¢ãã«ãæ¹é ããŠãããã®ã©ã€ã»ã³ã¹ãåŒãç¶ãå¿ èŠããããŸãã
æ¬ã¢ãã«ã¯æ¥æ¬ã«ãŠäœæãããŸããããããã£ãŠãæ¥æ¬ã®æ³åŸãé©çšãããŸãã æ¬ã¢ãã«ã®åŠç¿ã¯ãèäœæš©æ³ç¬¬30æ¡ã®4ã«åºã¥ããåæ³ã§ãããšäž»åŒµããŸãã ãŸããæ¬ã¢ãã«ã®é åžã«ã€ããŠã¯ãèäœæš©æ³ãåæ³175æ¡ã«ç §ãããŠã¿ãŠãã æ£ç¯ãå¹å©ç¯ã«ã該åœããªããšäž»åŒµããŸãã詳ããã¯æ¿æ²ŒåŒè·å£«ã®èŠè§£ã埡芧ãã ããã ãã ããã©ã€ã»ã³ã¹ã«ãããéããæ¬ã¢ãã«ã®çæç©ã¯åçš®æ³ä»€ã«åŸã£ãŠåãæ±ã£ãŠäžããã
ããããæ¬ã¢ãã«ãé åžããè¡çºãå«ççã«è¯ããªããšã¯äœè ã¯æã£ãŠããŸãã ããã¯åŠç¿ããèäœç©ã«å¯ŸããŠèäœè ã®èš±å¯ãåŸãŠããªãããã§ãã ãã ããåŠç¿ããã«ã¯èäœè ã®èš±å¯ã¯æ³åŸäžå¿ èŠããªããæ€çŽ¢ãšã³ãžã³ãšåæ§æ³åŸäžã¯åé¡ã¯ãããŸããã ãããã£ãŠãæ³çãªåŽé¢ã§ã¯ãªããå«ççãªåŽé¢ã調æ»ããç®çãæ¬é åžã¯å ŒããŠãããšèããŠãã ããã
æè»œã«æ¥œãã¿ããæ¹ã¯ããã¡ãã®Spaceãã䜿ããã ããã 詳ããæ¬ã¢ãã«ã®åãæ±ãæ¹ã¯ãã¡ãã®åæ±èª¬ææžã«ããããŠããŸãã ã¢ãã«ã¯ããããããŠã³ããŒãã§ããŸãã
以äžãäžè¬çãªã¢ãã«ã«ãŒãã®æ¥æ¬èªèš³ã§ãã
éçºè : Robin Rombach, Patrick Esser, Alfred Increment
ã¢ãã«ã¿ã€ã: æ¡æ£ã¢ãã«ããŒã¹ã® text-to-image çæã¢ãã«
èšèª: æ¥æ¬èª
ã©ã€ã»ã³ã¹: CreativeML Open RAIL++-M-NC License
ã¢ãã«ã®èª¬æ: ãã®ã¢ãã«ã¯ããã³ããã«å¿ããŠé©åãªç»åãçæããããšãã§ããŸããã¢ã«ãŽãªãºã 㯠Latent Diffusion Model ãš OpenCLIP-ViT/H ã§ãã
è£è¶³:
åèæç®:
@InProceedings{Rombach_2022_CVPR,
author = {Rombach, Robin and Blattmann, Andreas and Lorenz, Dominik and Esser, Patrick and Ommer, Bj\"orn},
title = {High-Resolution Image Synthesis With Latent Diffusion Models},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
month = {June},
year = {2022},
pages = {10684-10695}
}
Stable Diffusion v2ãšåãäœ¿ãæ¹ã§ãã ããããã®æ¹æ³ããããŸãããïŒã€ã®ãã¿ãŒã³ãæäŸããŸãã
ãã¡ãã®åæ±èª¬ææžã«åŸã£ãŠäœæããŠãã ããã
ð€'s Diffusers library ã䜿ã£ãŠãã ããã
ãŸãã¯ã以äžã®ã¹ã¯ãªãããå®è¡ããã©ã€ãã©ãªããããŠãã ããã
pip install --upgrade git+https://github.com/huggingface/diffusers.git transformers accelerate scipy
次ã®ã¹ã¯ãªãããå®è¡ããç»åãçæããŠãã ããã
from diffusers import StableDiffusionPipeline, EulerDiscreteScheduler
import torch
model_id = "aipicasso/cool-japan-diffusion-2-1-0-beta"
scheduler = EulerDiscreteScheduler.from_pretrained(model_id, subfolder="scheduler")
pipe = StableDiffusionPipeline.from_pretrained(model_id, scheduler=scheduler, torch_dtype=torch.float16)
pipe = pipe.to("cuda")
prompt = "anime, a portrait of a girl with black short hair and red eyes, kimono, full color illustration, official art, 4k, detailed"
negative_prompt="low quality, bad face, bad anatomy, bad hand, lowres, jpeg artifacts, 2d, 3d, cg, text"
image = pipe(prompt,negative_prompt=negative_prompt).images[0]
image.save("girl.png")
泚æ:
pipe.enable_attention_slicing() ã䜿ã£ãŠãã ãããStable Diffusionãšåããã€ã¢ã¹ãæãã£ãŠããŸãã æ°ãã€ããŠãã ããã
åŠç¿ããŒã¿
次ã®ããŒã¿ãäž»ã«äœ¿ã£ãŠStable Diffusionããã¡ã€ã³ãã¥ãŒãã³ã°ããŠããŸãã
åŠç¿ããã»ã¹
Stable Diffusionã®VAEãšU-Netããã¡ã€ã³ãã¥ãŒãã³ã°ããŸããã
ã»ãšãã©ãããŸããã
@InProceedings{Rombach_2022_CVPR,
author = {Rombach, Robin and Blattmann, Andreas and Lorenz, Dominik and Esser, Patrick and Ommer, Bj\"orn},
title = {High-Resolution Image Synthesis With Latent Diffusion Models},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
month = {June},
year = {2022},
pages = {10684-10695}
}
*ãã®ã¢ãã«ã«ãŒã㯠Stable Diffusion v2 ã«åºã¥ããŠãAlfred IncrementããããŸããã