ZhangFanYi/ZhangFanYi.github.io

2

stars

44

commits

Python

primary language

Aug 22, 2026

updated

README

个人主页

我是张一凡,海光信息客户应用优化部成员, 欢迎来到我的github主页,本人专注于 国产海光芯片(DCU)生态下的大模型与具身智能性能优化。这个站点是我的工作成果归档:每个项目包含优化思路、性能数据与代码。


一、大模型训练与推理优化

#项目类型关键词
01DeepSeek-V3 671B 千卡集群训练训练✅基于DCU-Megatron的千卡集群训练 线性度计算 集群通信
02Qwen3.5-0.8B 训练优化训练✅基于deepspeed的训练优化 吞吐提升近4倍 引入fla
03Qwen3.5-35B 强化学习适配训练✅基于verl+megatron+grpo的单机8卡强化学习性能跑通
04Qwen3-30B 训练优化训练✅ 基于megatron-sft的多机训练优化任务 性能翻倍
05Qwen3.6-27B 多模态推理优化推理✅ 基于vllm0.21的推理任务优化 性能提升3倍以上
06Qwen3-VL-Embedding 推理优化推理✅解决高并发时性能劣化问题
07DeepSeek-V4-Flash 推理优化推理✅ 三大瓶颈定位 多种并行方式寻优
08DeepSeek-V4-Pro / GLM5.2 推理部署推理✅指定缓存命中率并基于PD分离/PD分离的性能压测
09讯飞自研模型适配及优化推理✅ 客户闭源模型的适配+优化

二、具身智能模型优化

#项目优化效果
10DreamZero-DCU✅ 性能提升32%
11Isaac-GR00T-DCU✅ 性能提升42%
12LeRobot-ACT-DCU✅ 性能提升30%
13LingBot-VA-DCU✅ 性能提升28%
14LingBot-VLA-DCU✅ 性能提升52%
15Cosmos3-Nano-DCU✅ 性能提升37%
16OpenPI-DCU✅ 性能提升26%

能力标签

  • 训练优化:Megatron / DeepSpeed / FSDP / ddp / verl, prof 抓取与算子级分析, 框架与 Attention 选型, 模型框架层行为优化
  • 推理优化:vLLM / SGLang, PD分离 / IFB / Mooncake 部署,模型量化,kv-cache量化/固定缓存命中压测
  • 集群任务:多机通信 / K8s / Ray / mp / Clusconf / mpirun /等多机任务启动 基础硬件故障识别

欢迎提出任何宝贵意见!

Contributors

ZhangFanYi

44 commits

ZhangFanYi/ZhangFanYi.github.io

2

stars

44

commits

Python

primary language

Aug 22, 2026

updated

README

个人主页

我是张一凡,海光信息客户应用优化部成员, 欢迎来到我的github主页,本人专注于 国产海光芯片(DCU)生态下的大模型与具身智能性能优化。这个站点是我的工作成果归档:每个项目包含优化思路、性能数据与代码。


一、大模型训练与推理优化

#项目类型关键词
01DeepSeek-V3 671B 千卡集群训练训练✅基于DCU-Megatron的千卡集群训练 线性度计算 集群通信
02Qwen3.5-0.8B 训练优化训练✅基于deepspeed的训练优化 吞吐提升近4倍 引入fla
03Qwen3.5-35B 强化学习适配训练✅基于verl+megatron+grpo的单机8卡强化学习性能跑通
04Qwen3-30B 训练优化训练✅ 基于megatron-sft的多机训练优化任务 性能翻倍
05Qwen3.6-27B 多模态推理优化推理✅ 基于vllm0.21的推理任务优化 性能提升3倍以上
06Qwen3-VL-Embedding 推理优化推理✅解决高并发时性能劣化问题
07DeepSeek-V4-Flash 推理优化推理✅ 三大瓶颈定位 多种并行方式寻优
08DeepSeek-V4-Pro / GLM5.2 推理部署推理✅指定缓存命中率并基于PD分离/PD分离的性能压测
09讯飞自研模型适配及优化推理✅ 客户闭源模型的适配+优化

二、具身智能模型优化

#项目优化效果
10DreamZero-DCU✅ 性能提升32%
11Isaac-GR00T-DCU✅ 性能提升42%
12LeRobot-ACT-DCU✅ 性能提升30%
13LingBot-VA-DCU✅ 性能提升28%
14LingBot-VLA-DCU✅ 性能提升52%
15Cosmos3-Nano-DCU✅ 性能提升37%
16OpenPI-DCU✅ 性能提升26%

能力标签

  • 训练优化:Megatron / DeepSpeed / FSDP / ddp / verl, prof 抓取与算子级分析, 框架与 Attention 选型, 模型框架层行为优化
  • 推理优化:vLLM / SGLang, PD分离 / IFB / Mooncake 部署,模型量化,kv-cache量化/固定缓存命中压测
  • 集群任务:多机通信 / K8s / Ray / mp / Clusconf / mpirun /等多机任务启动 基础硬件故障识别

欢迎提出任何宝贵意见!

Contributors

ZhangFanYi

44 commits

Languages

Python

83.5%

Jupyter Notebook

11.1%

Shell

2.5%

MDX

2.5%