GPU 和 TPU 学习与实践知识库
在 Google Cloud TPU v6e-8 上运行 HunyuanVideo-1.5 视频生成模型。
关键特性:
性能数据(121帧 720p, 50步):
| 模式 | 每步时间 | 总时间 | 加速比 |
|---|---|---|---|
| 标准 TP | 8.12s | 6.8 分钟 | 1.0x |
| TP + fc2 Replicated | 7.29s | 6.1 分钟 | 1.11x |
| TP + DeepCache | ~4s | ~3.5 分钟 | ~2x |
文档:
在 TPU 上运行 CogVideoX 视频生成模型,JAX/Flax 原生实现。
关键特性:
性能:
文档:
完整的 PyTorch 到 JAX/Flax 迁移方法论,基于 2,013 行 VAE 代码的实战经验。
核心价值:
关键教训:
文档:
从零开始学习如何在 TPU 上运行 HuggingFace 模型。
教程内容:
展示 GPU→TPU 图像处理迁移,包含 crop/resize/blur 等操作。
关键发现:
文档:
在 Google Kubernetes Engine (GKE) 上部署 DeepSeek 的 DeepEP 框架。
关键特性:
技术栈:
文档:
在 NVIDIA H100 8卡上运行 HunyuanVideo-1.5 视频生成。
关键特性:
Attention 性能对比:
| 模式 | 加速比 | 质量 | 推荐场景 |
|---|---|---|---|
| Flash Attention 2 | 1.0x | ✅ 最优 | 生产环境 |
| DeepCache | 1.83x | ✅ 良好 | 日常使用 |
| SageAttention | 1.6x | ⚠️ 有损 | 快速预览 |
文档:
欢迎提交 Issues 和 Pull Requests!
本项目采用开源许可。详见各子项目的许可声明。
6 commits
HTML
49.7%
Python
42.8%
Shell
5.1%
JavaScript
1.4%
GPU 和 TPU 学习与实践知识库
在 Google Cloud TPU v6e-8 上运行 HunyuanVideo-1.5 视频生成模型。
关键特性:
性能数据(121帧 720p, 50步):
| 模式 | 每步时间 | 总时间 | 加速比 |
|---|---|---|---|
| 标准 TP | 8.12s | 6.8 分钟 | 1.0x |
| TP + fc2 Replicated | 7.29s | 6.1 分钟 | 1.11x |
| TP + DeepCache | ~4s | ~3.5 分钟 | ~2x |
文档:
在 TPU 上运行 CogVideoX 视频生成模型,JAX/Flax 原生实现。
关键特性:
性能:
文档:
完整的 PyTorch 到 JAX/Flax 迁移方法论,基于 2,013 行 VAE 代码的实战经验。
核心价值:
关键教训:
文档:
从零开始学习如何在 TPU 上运行 HuggingFace 模型。
教程内容:
展示 GPU→TPU 图像处理迁移,包含 crop/resize/blur 等操作。
关键发现:
文档:
在 Google Kubernetes Engine (GKE) 上部署 DeepSeek 的 DeepEP 框架。
关键特性:
技术栈:
文档:
在 NVIDIA H100 8卡上运行 HunyuanVideo-1.5 视频生成。
关键特性:
Attention 性能对比:
| 模式 | 加速比 | 质量 | 推荐场景 |
|---|---|---|---|
| Flash Attention 2 | 1.0x | ✅ 最优 | 生产环境 |
| DeepCache | 1.83x | ✅ 良好 | 日常使用 |
| SageAttention | 1.6x | ⚠️ 有损 | 快速预览 |
文档:
欢迎提交 Issues 和 Pull Requests!
本项目采用开源许可。详见各子项目的许可声明。
6 commits
HTML
49.7%
Python
42.8%
Shell
5.1%
JavaScript
1.4%