我是张一凡,海光信息客户应用优化部成员, 欢迎来到我的github主页,本人专注于 国产海光芯片(DCU)生态下的大模型与具身智能性能优化。这个站点是我的工作成果归档:每个项目包含优化思路、性能数据与代码。
| # | 项目 | 类型 | 关键词 |
|---|---|---|---|
| 01 | DeepSeek-V3 671B 千卡集群训练 | 训练 | ✅基于DCU-Megatron的千卡集群训练 线性度计算 集群通信 |
| 02 | Qwen3.5-0.8B 训练优化 | 训练 | ✅基于deepspeed的训练优化 吞吐提升近4倍 引入fla |
| 03 | Qwen3.5-35B 强化学习适配 | 训练 | ✅基于verl+megatron+grpo的单机8卡强化学习性能跑通 |
| 04 | Qwen3-30B 训练优化 | 训练 | ✅ 基于megatron-sft的多机训练优化任务 性能翻倍 |
| 05 | Qwen3.6-27B 多模态推理优化 | 推理 | ✅ 基于vllm0.21的推理任务优化 性能提升3倍以上 |
| 06 | Qwen3-VL-Embedding 推理优化 | 推理 | ✅解决高并发时性能劣化问题 |
| 07 | DeepSeek-V4-Flash 推理优化 | 推理 | ✅ 三大瓶颈定位 多种并行方式寻优 |
| 08 | DeepSeek-V4-Pro / GLM5.2 推理部署 | 推理 | ✅指定缓存命中率并基于PD分离/PD分离的性能压测 |
| 09 | 讯飞自研模型适配及优化 | 推理 | ✅ 客户闭源模型的适配+优化 |
| # | 项目 | 优化效果 |
|---|---|---|
| 10 | DreamZero-DCU | ✅ 性能提升32% |
| 11 | Isaac-GR00T-DCU | ✅ 性能提升42% |
| 12 | LeRobot-ACT-DCU | ✅ 性能提升30% |
| 13 | LingBot-VA-DCU | ✅ 性能提升28% |
| 14 | LingBot-VLA-DCU | ✅ 性能提升52% |
| 15 | Cosmos3-Nano-DCU | ✅ 性能提升37% |
| 16 | OpenPI-DCU | ✅ 性能提升26% |
欢迎提出任何宝贵意见!
44 commits
Python
83.5%
Jupyter Notebook
11.1%
Shell
2.5%
MDX
2.5%
我是张一凡,海光信息客户应用优化部成员, 欢迎来到我的github主页,本人专注于 国产海光芯片(DCU)生态下的大模型与具身智能性能优化。这个站点是我的工作成果归档:每个项目包含优化思路、性能数据与代码。
| # | 项目 | 类型 | 关键词 |
|---|---|---|---|
| 01 | DeepSeek-V3 671B 千卡集群训练 | 训练 | ✅基于DCU-Megatron的千卡集群训练 线性度计算 集群通信 |
| 02 | Qwen3.5-0.8B 训练优化 | 训练 | ✅基于deepspeed的训练优化 吞吐提升近4倍 引入fla |
| 03 | Qwen3.5-35B 强化学习适配 | 训练 | ✅基于verl+megatron+grpo的单机8卡强化学习性能跑通 |
| 04 | Qwen3-30B 训练优化 | 训练 | ✅ 基于megatron-sft的多机训练优化任务 性能翻倍 |
| 05 | Qwen3.6-27B 多模态推理优化 | 推理 | ✅ 基于vllm0.21的推理任务优化 性能提升3倍以上 |
| 06 | Qwen3-VL-Embedding 推理优化 | 推理 | ✅解决高并发时性能劣化问题 |
| 07 | DeepSeek-V4-Flash 推理优化 | 推理 | ✅ 三大瓶颈定位 多种并行方式寻优 |
| 08 | DeepSeek-V4-Pro / GLM5.2 推理部署 | 推理 | ✅指定缓存命中率并基于PD分离/PD分离的性能压测 |
| 09 | 讯飞自研模型适配及优化 | 推理 | ✅ 客户闭源模型的适配+优化 |
| # | 项目 | 优化效果 |
|---|---|---|
| 10 | DreamZero-DCU | ✅ 性能提升32% |
| 11 | Isaac-GR00T-DCU | ✅ 性能提升42% |
| 12 | LeRobot-ACT-DCU | ✅ 性能提升30% |
| 13 | LingBot-VA-DCU | ✅ 性能提升28% |
| 14 | LingBot-VLA-DCU | ✅ 性能提升52% |
| 15 | Cosmos3-Nano-DCU | ✅ 性能提升37% |
| 16 | OpenPI-DCU | ✅ 性能提升26% |
欢迎提出任何宝贵意见!
44 commits
Python
83.5%
Jupyter Notebook
11.1%
Shell
2.5%
MDX
2.5%