2024 年第八届招商银行数字/科技金融训练营 FinTech 线上复赛方案
比赛题目以及流程详见我的小红书笔记:http://xhslink.com/a/yW6Gf8CKJ0Sbb
一个基于大语言模型的智能文档问答系统,专为金融投研和文档分析设计,支持多种文档格式和多路召回的问答机制。
docs 文件夹内为方案设计文档的 PDF 文件。
由于文档第四章涉及到数据集信息,为防止侵权,已删除真实数据集信息。
方案设计仅供参考,最终以主办方赛题为准
项目介绍由 Claude 3.7 自动生成,如有疑问或错漏,请提交 issue。
本项目是一个金融文档智能问答系统,可以处理各种文档格式(PDF、TXT、Markdown、Excel、CSV等),并基于多路召回和多模型协作的方式,实现高质量的文档问答、信息抽取和数据可视化功能。
本项目采用以下技术方案:
├── docs/ # 项目文档
│ └── FinTech2024.pdf # 技术方案文档
├── src/ # 源代码
│ ├── api_server.py # API 服务器
│ ├── chat_page.py # 主界面和交互逻辑
│ ├── document.py # 文档处理模块
│ ├── embedding.py # 文本向量化模块
│ ├── Retriever.py # 检索模块
│ ├── VectorDatabase.py # 向量数据库
│ ├── template.py # 提示词模板
│ ├── functions.py # 功能函数
│ ├── logger.py # 日志模块
│ ├── pdf2txt.py # PDF 转文本工具
│ ├── txt2md.py # 文本转 Markdown 工具
│ ├── utils.py # 工具函数
│ └── finetune/ # 模型微调相关
│ ├── embedding/ # 向量模型微调
│ └── llm/ # 大语言模型微调
├── requirements.txt # 依赖项
└── LICENSE.txt # 许可证
处理各种格式的文档,包括文本文档、PDF文档和表格文档,提供文档解析、分段和管理功能。
TextDocument: 处理文本类文档PDFDocument: 处理PDF文档SheetDocument: 处理表格类文档负责文本向量化和多路召回机制:
EmbeddingAPI: 文本向量化接口BM25: 基于 BM25 算法的文本检索Route: 定义检索路由策略Retriever: 多路召回检索器HyDE: 基于假设的检索增强基于 Streamlit 构建的用户界面,处理用户上传文档、问答交互等功能。
包含各种问答场景的提示词模板:
pip install -r requirements.txt
cd src
streamlit run chat_page.py
本项目中 PDF 转 TXT 工具使用了来源于 FinGLM 的代码。感谢 FinGLM 项目团队的贡献。
由于 FinGLM 项目未设置明确的开源协议,使用时请遵循其公益性质和相关规定。
您可以按照以下 BibTex 格式引用本仓库:
@software{FinTech2024,
author = {shtdbb},
title = {FinTech2024:文档问答投研 Agent 系统},
url = {https://github.com/shtdbb/FinTech2024},
year = {2025}
}
本项目采用 MIT 许可证,详情请参阅 LICENSE.txt 文件。
6 commits
Python
98.7%
Shell
1.3%
2024 年第八届招商银行数字/科技金融训练营 FinTech 线上复赛方案
比赛题目以及流程详见我的小红书笔记:http://xhslink.com/a/yW6Gf8CKJ0Sbb
一个基于大语言模型的智能文档问答系统,专为金融投研和文档分析设计,支持多种文档格式和多路召回的问答机制。
docs 文件夹内为方案设计文档的 PDF 文件。
由于文档第四章涉及到数据集信息,为防止侵权,已删除真实数据集信息。
方案设计仅供参考,最终以主办方赛题为准
项目介绍由 Claude 3.7 自动生成,如有疑问或错漏,请提交 issue。
本项目是一个金融文档智能问答系统,可以处理各种文档格式(PDF、TXT、Markdown、Excel、CSV等),并基于多路召回和多模型协作的方式,实现高质量的文档问答、信息抽取和数据可视化功能。
本项目采用以下技术方案:
├── docs/ # 项目文档
│ └── FinTech2024.pdf # 技术方案文档
├── src/ # 源代码
│ ├── api_server.py # API 服务器
│ ├── chat_page.py # 主界面和交互逻辑
│ ├── document.py # 文档处理模块
│ ├── embedding.py # 文本向量化模块
│ ├── Retriever.py # 检索模块
│ ├── VectorDatabase.py # 向量数据库
│ ├── template.py # 提示词模板
│ ├── functions.py # 功能函数
│ ├── logger.py # 日志模块
│ ├── pdf2txt.py # PDF 转文本工具
│ ├── txt2md.py # 文本转 Markdown 工具
│ ├── utils.py # 工具函数
│ └── finetune/ # 模型微调相关
│ ├── embedding/ # 向量模型微调
│ └── llm/ # 大语言模型微调
├── requirements.txt # 依赖项
└── LICENSE.txt # 许可证
处理各种格式的文档,包括文本文档、PDF文档和表格文档,提供文档解析、分段和管理功能。
TextDocument: 处理文本类文档PDFDocument: 处理PDF文档SheetDocument: 处理表格类文档负责文本向量化和多路召回机制:
EmbeddingAPI: 文本向量化接口BM25: 基于 BM25 算法的文本检索Route: 定义检索路由策略Retriever: 多路召回检索器HyDE: 基于假设的检索增强基于 Streamlit 构建的用户界面,处理用户上传文档、问答交互等功能。
包含各种问答场景的提示词模板:
pip install -r requirements.txt
cd src
streamlit run chat_page.py
本项目中 PDF 转 TXT 工具使用了来源于 FinGLM 的代码。感谢 FinGLM 项目团队的贡献。
由于 FinGLM 项目未设置明确的开源协议,使用时请遵循其公益性质和相关规定。
您可以按照以下 BibTex 格式引用本仓库:
@software{FinTech2024,
author = {shtdbb},
title = {FinTech2024:文档问答投研 Agent 系统},
url = {https://github.com/shtdbb/FinTech2024},
year = {2025}
}
本项目采用 MIT 许可证,详情请参阅 LICENSE.txt 文件。
6 commits
Python
98.7%
Shell
1.3%