无锡超算研发中心组会纪要
- 填写时尽可能简明扼要
- 阅读论文需要提供论文出处(题目,链接)
- 读论文时建议做笔记;详细笔记或者其它参考资料,可以按类别放在Quantization(神经网络量化)或者CryoEM(冷冻电镜)目录下
目录
2023-08-14
2023-08-07
2023-07-24
2023-07-17
2023-07-10
2023-07-03
2023-08-14
主要事项
上周工作总结
-
(朱梦静)
- 阅读INT4论文及Transformer、CNN论文
- 整理梯度量化的方法
-
(刘 涛)
1.
2.
3.
-
(邓 佺)
- 修改论文,已完成初稿修改
- 学习量子计算中的Grover算法
- 调研量子计算与神威、FPGA相关工作(未完成,赶论文修改进度)
遗留问题和当前问题汇总
本周安排
- (刘)
- (朱)
- (邓) 继续学习量子计算领域其他经典算法;调研量子计算与神威、FPGA相关的工作
- (徐) 调研Poe的实现方式、后端服务的部署框架
2023-08-07
主要事项
上周工作总结
-
(朱梦静)
- transformer-base+WMT14-en-de复现完成
- 整理近年来8比特和4比特全量化训练的论文
-
(刘 涛)
- 完成meta版本的LLaMA2在sumsum数据集上的微调
- 完成MobilenetV2的模型在imagenet-1k训练
- 解决git访问和翻墙问题
-
(邓 佺)
- 安装IBM Qiskit量子计算模拟器
- 学习量子计算经典算法Deutsch-Jozsa算法原理,并在Qiskit中对其复现
- 继续修改论文
遗留问题和当前问题汇总
本周安排
- (刘) 完成LLaMA在其他经典数据集上的复现; 解决LLaMA单卡Fine-Tune的bug; 完成DeepSpeed-RLHF系统对LLaMA大模型微调工作;
- (朱) 朱军论文在CNN和LLaMA上的适用性;调研FQT中梯度量化的方法
- (邓) 继续学习量子计算领域其他经典算法;调研量子计算与神威、FPGA相关的工作
2023-07-24
主要事项
上周工作总结
-
(朱梦静)
- 微调BERT,(bert-base-uncased+COLA, bert-base-chines+THUCNews)
- 复现 FP8 Quantization:The Power of the Exponent 实验;
-
(刘 涛)
- ViT-B/32在imagenet-1k的训练与微调,模型精度75.1%
- 完成Training Transformer with 4-bit Integers论文的数学推导与实现代码分析; 未完全理解BP位分割和LSS的代码实现; 周末继续研读代码逻辑。
-
(邓 佺)
- 搭建分子动力学模拟实验环境(LAMMPS和GPUMD), 记录RTX 3090以及I7-11700的性能以及功耗表现
- 按照审稿意见修改论文图表标题以增加额外信息
- 学习量子计算基础(https://zhuanlan.zhihu.com/p/48958223), 了解基本概念和原理(量子态、态矢、态空间,不确定原理, Stern-Gerlach实验,波函数以及薛定谔方程)
遗留问题和当前问题汇总
本周安排
- (刘) 了解LLaMa(1,2)开源LLM (https://arxiv.org/abs/2302.13971, https://github.com/facebookresearch/llama ), 完成一次微调任务,并记录实验结果; 复现朱军INT4训练
- (朱) 微调机器翻译Transformer-based模型(Attention is all you need, NIPS2017) + WMT14 En-De ; 运行目标识别和定位模型 MaskRCNN(ResNet50) (COCO),SSD-Lite(MobileNetV2) (VOC); 针对朱军Training Transformer with 4-bit Integers论文实验中提到的所有模型,把浮点baseline的实验跑一遍;记录实验结果、训练或微调运行时间;
- (邓) 理解量子计算与张量运算的关系,了解计算过程; 修改论文
- Paper Reading -1
2023-07-17
主要事项
上周工作总结
- (朱梦静)
- 已下载mnist和cifar10数据集并完成一次LeNet训练
- 已在PyTorch上安装NVIDIA DALI并根据官方手册,完成了简单的pipeline创建;
- 已下载bert-base-chinese和bert-base-uncased模型
- 已下载WMT数据库中2022年的中英数据集;
- 已跑通ppq里的实例
- (刘 涛)
- 下载ImageNet 1k
- 21k数据集较大,wget下载不稳定,暂尝试使用公开21k预训练模型进行微调
- 进行ViT-B模型训练,但训练结果未达预期
- 阅读《Training Transformers with 4-bit Integers》,但尚未完成int4量化实验复现
- (邓 佺)
- 修改返修论文;
- 学习量子计算相关基础知识
- (盐城运维)已安装Module, cmake, gcc等常用工具/库
当前问题汇总
- git clone经常失败,就算成功了下载速度也很慢:目前使用sftp。(需要翻墙)
本周安排
量化分PQT(post traing quantization), QAT(quantization aware training ), FQT(fully quantization training).
我们当前的主要目标是FQT.
- (刘) ViT-B训练/微调; 复现朱军INT4训练
- (朱) 完成一次BERT微调; 复现FP8训练
- (邓)
2023-07-10
主要事项
上周任务完成情况
当前问题汇总
- 版本、工具库(cmake, gcc ,ninja ): 后续由盐城方面协助统一解决
- 安排近期见面交流
本周工作内容
- (刘 涛)Training Transformers with 4-bit Integers (https://arxiv.org/abs/2306.11987, 朱军)
- (朱梦静)继续复现FP8训练(CV, NLP, Transformer)
- (刘,朱)建立神经网络FP32 Baseline环境,本周务必完成
- 下载CV数据集 ImageNet 1K(2012) 和 ImageNet 21K; 至少完成一次ViT-B/32模型训练;
- 下载mnist和cifar10/100数据集; 完成一次LeNet/ Resnet训练
- 在PyTorch上安装NVIDIA DALI
- 下载WMT数据库
- 下载BERT模型,进行微调
- 所有数据集都放在 ~/dataset目录下
2023-07-03
主要事项
研究方向
- 神经网络和量化
- 高性能计算(HPC)
- Security
神经网络和量化
阅读文档和论文
- NVIDIA H100 Tensor Core GPU Architecture(White paper)
- FP8 Formats for Deep Learning, arXiv:2209.05433
- FP8 Quantization: The Power of the Exponent, arXiv:2208.09225
工作内容
- 入门: 下载数据集,训练resnet18, BERT模型
- 量化: 复现在训练中使用FP8量化的结果; 要求能读懂论文和开源代码
- 可选任务: 收集目前已开源的大语言模型,如LLaMA,完成一次微调
Security
加密技术
可信执行环境(TEE)
- TDX
- SGX
- TrustZone
- SVE
- Penglai(蓬莱)
- H100 MIG-level TEE
高性能计算HPC
开发环境
注意事项: 不要在开发主机上运行与工作无关的软件
完成情况
问题汇总