WALLE-AI/uLMTutorial

从0到1动手学习大模型技术

89

11 commits

updated Mar 25, 2024

See the code

README

uLMTutorial

从0到1动手学习大模型技术,uLMTutorial提供全面大模型技术路线,小白也能够入行学习,完全免费,完全免费

:telescope:目录

  • :computer:入门科普课程

  • :bomb:AI神器推荐---提高办公效率、上班摸鱼好利器

  • :mag_right:数据收集与分析

  • :chart_with_upwards_trend:应用技术

  • :ledger:模型基础技术

  • :dart:基础平台技术能力

:computer:入门科普课程

科普课程课程描述内容推荐值
Recent Advances on Foundation Models滑铁卢大学Wenhu Chen老师的课程“Recent Advances on Foundation Models”在滑铁卢大学是公开的。课程中,覆盖了许多有趣的话题,包括Transformers、LLM、预训练、量化、稀疏注意力、指令调整、RLHF、提示、视觉Transformers、扩散模型、多模态模型、代理、RAG等。https://cs.uwaterloo.ca/~wenhuche/teaching/cs886/:yellow_heart::yellow_heart::yellow_heart:
stas00/ml-engineering《Machine Learning Engineering Open Book》的开源书籍,该书籍汇集了多种方法论,旨在帮助训练大型语言模型和多模态模型。文章指出,这本书适合用于大型语言模型(LLM)和超大型语言模型(VLM)的培训工程师和操作员,其中包含了许多脚本和复制粘贴命令,以便快速满足需求。文章还提到,这本书是一个持续的脑洞集合,作者在训练开源BLOOM-176B模型和IDEFICS-80B多模态模型时获得了许多专业知识。目前,作者正在Contextual.AI开发/训练开源检索增强模型。文章最后提到了该书籍的目录结构,包括见解、关键硬件组件、性能、操作、开发、杂项等部分。:yellow_heart::yellow_heart:
langchain/cookbookLangChain提供了一个名为cookbook的代码示例集合,可用于构建使用LangChain的应用程序。这个cookbook强调更多应用和端到端示例,而不是主要文档中包含的示例。其中包括一个构建聊天应用程序的示例,该应用程序可以使用开源的llm(llama2)与SQL数据库进行交互,具体示例展示了包含名单的SQLite数据库:yellow_heart::yellow_heart::yellow_heart:
rasbt/LLMs-from-scratch如何从零开始构建一个类似于ChatGPT的大型语言模型(LLM)。通过逐步的指导和清晰的文本、图表和例子,引导读者创建自己的LLM。文章还提到了训练和发展自己用于教育目的的小型但功能齐全的模型的方法,这与创建大型基础模型(如ChatGPT)的方法类似。文章还提供了章节标题和主要代码的快速访问链接:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
2024年构建大型语言模型的小指南Hugging Face创始人Thomas Wolf讲解如何构建大型语言模型的文章。该文章可能提供了关于大型语言模型的定义、预训练过程、技术挑战和伦理关注点等内容。它还可能介绍了Meta AI在2024年推出的大型语言模型,并突出了其性能优势。文章可能还包括关于大型语言模型在自然语言处理和人工智能领域的应用以及构建这类模型所需的专业技能和知识然而,由于上下文提供的信息有限,无法对文章的具体内容进行进一步详细解释:yellow_heart::yellow_heart::yellow_heart:
Hung-yi Lee GPT科普视频(油管)通俗易懂讲解什么chatgpt?什么GenAI,课程生动有趣:yellow_heart::yellow_heart::yellow_heart:
datawhalechina/ so-large-lmdatawhale构建项目旨在作为一个大规模预训练语言模型的教程,从数据准备、模型构建、训练策略到模型评估与改进,以及模型在安全、隐私、环境和法律道德方面的方面来提供开源知识。项目将以斯坦福大学大规模语言模型课程李宏毅生成式AI课程为基础,结合来自开源贡献者的补充和完善,以及对前沿大模型知识的及时更新,为读者提供较为全面而深入的理论知识和实践方法。通过对模型构建、训练、评估与改进等方面的系统性讲解,以及代码的实战,我们希望建立一个具有广泛参考价值的项目:yellow_heart::yellow_heart::yellow_heart:
CS224N: Natural Language Processing with Deep Learning从传统的NLP到大模型技术进行全面的讲解,其中包含各种小项目实践操作:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
Intro to Large Language Models无代码的科普,讲述大模型如何通过算力压缩得到,ppt地址:yellow_heart::yellow_heart::yellow_heart:
mlabonne/llm-course该文章主要介绍了如何通过一个课程进入大型语言模型(LLMs)的学习,该课程分为三个部分:LLM基础、LLM科学家和LLM工程师。课程提供了相关的笔记本和文章,包括用于评估LLMs、合并模型、量化LLMs和其他相关主题的工具和资源,分别提供基础课程以及LLM科学家和工程师技术路线,课程具备了基础知识、理论阐述和项目实践操纵:yellow_heart::yellow_heart::yellow_heart:
microsoft/generative-ai-for-beginners主要介绍了一个由微软云倡导者提供的12节课的课程,旨在帮助初学者学习生成式AI应用程序的开发。课程涵盖了生成式AI原理和应用程序开发的关键方面,通过学习,学生可以构建自己的生成式AI初创公司,以了解启动创意所需的条件。文章还提到了如何开始学习、与其他学习者交流和支持、进一步学习资源以及如何为课程做出贡献:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
复旦大学-《大规模语言模型:理论到实践》基本阐述大模型发展历史、技术细节和评估方式 复旦大学张奇教授相关资料:yellow_heart::yellow_heart::yellow_heart:
easywithai/ai-coursesGenAI各种课程,从普通入门到进阶,基本都是付费/免费的课程培训,其他包括吴恩达 deeplearning-ai:yellow_heart::yellow_heart::yellow_heart::yellow_heart:

:bomb:AI神器推荐---提高办公效率、上班摸鱼好利器

Prompt大魔法案例与技巧

文本生成类(OpenAI GPTs相关免费应用)描述推荐值
https://github.com/ai-boost/awesome-prompts?tab=readme-ov-file
https://promptfolder.com/midjourney-prompt-helper/
promptbasePrompt商场,可以发布自己prompt进行售卖,也可以购买商城中prompt案例:yellow_heart::yellow_heart:
Awesome-GPTs-Big-List参考Openai GPTs 的Prompt写法:yellow_heart::yellow_heart::yellow_heart:
awesome-promptsOpen GPTs Prompt聚集地,学习大量场景的prompt写法:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
BlackFriday-GPTs-Prompts参考Openai GPTs 的Prompt写法:yellow_heart::yellow_heart::yellow_heart:
Leaked-GPTs参考Openai GPTs 的Prompt写法:yellow_heart::yellow_heart::yellow_heart:
Prompt-Engineering-Guide
prompt-guide
chatgpt-prompt-engineering-for-developers
prompt-engineering
https://github.com/phodal/prompt-patterns
https://promptport.ai/
https://www.aishort.top/
https://flowgpt.com/
https://github.com/f/awesome-chatgpt-prompts
https://promptperfect.jina.ai/
https://flowgpt.com/p/promptenhancer
https://replicate.com/methexis-inc/img2prompt
https://prompthero.com/
PromptLLMPromptLLM是由贾扬清团队LeptonAl平台推出的AIGC提示词工具,只需输入一行简短的提示词,PromptLLM就
能在几秒内生成一个更加完整、具体的提示词,顺便再用StableDiffusionXL生成两张图片。PromptLLM简化了内
容创作过程,为个人和团队提供了一个高效且富有创意的写作助手。
:yellow_heart::yellow_heart::yellow_heart:

AI办公/摸鱼神器推荐

来一张示意图

智能助手系列描述推荐值
字节Coze扣子为你提供了一站式 AI 开发平台,无需编程,你的创新理念都能迅速化身为下一代的 AI 应用,可以快速无代码方式搭建自己GPT应用,缺点是只能使用字节本身的模型,比如云雀、豆包:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
POE提供主流的模型能力,比如Openai GPT4 Claude3 Midjourney,以及创作各个类型的助手,大部分是免费的,需要梯子:yellow_heart::yellow_heart::yellow_heart:
Monica提供了GPT4服务,具备聊天、文档阅读、AI search、写作、翻译与艺术创作等较大的AI功能,支持PC端、浏览器端、移动端,缺点就是价格太贵,需要梯子:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
百度超级助手超级助理是基于文心大模型的智能助手,含Copilot应用端和Agent开发平台两部分。Copilot以浏览器插件提供翻译、创作、总结、问答等知识服务,也可调用Agent开发平台插件自定义任务。Agent平台则支持插件注册与编排,快速打造场景化应用:yellow_heart::yellow_heart::yellow_heart:
智普AI 清言能够使用智普AI最新的GLM4模型,零代码方式构建智能体服务,具备生图、数据分析、文档分析、联网等功能:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
LOBE社区LLMs/AI 聊天框架。它支持多个 AI 提供商(如 OpenAI、Claude 3、Gemini、Perplexity、Bedrock、Azure、Mistral、Ollama),以及多模态(视觉/TTS)和插件系统。它支持一键免费部署私有的 ChatGPT 聊天应用程序。该项目提供了详细的设置开发指南和资源文档,以及插件和主题定制的能力 开源社区:yellow_heart::yellow_heart::yellow_heart:
Difylanggenius/dify是一个名为Dify的LLM应用开发平台,它结合了Backend-as-a-Service和LLMOps的概念,旨在帮助开发者快速构建高质量的生成式AI应用Dify提供了一个可视化编排工具,使应用的开发、运维和数据集管理更加简单它还集成了一个内置的RAG引擎,支持全文搜索和向量数据库嵌入的功能,并允许直接上传各种文本格式的文件Dify支持多种类型的应用,包括开箱即用的Web站点、表单模式和聊天对话模式的应用 开源社区:yellow_heart::yellow_heart::yellow_heart:
easywithai:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
AI Search/Chat描述推荐值
天工AIcopilot方式会对搜索**query进行分析(明显的子问题分析与扩展)**和关键字抽取,同时对搜索内容进行过滤与分析,可实现多轮search的方式接着询问:yellow_heart::yellow_heart::yellow_heart:
Kimi(月之暗面)暂时没有提供联网搜索的内容,支持本地文件上传,提供chatpdf的能力:yellow_heart::yellow_heart:
https://gptcall.net/通过代理方式接入大部分Openai GPTs应用,每天限时免费:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
秘塔AIquery分析,其实做子问题生成与问题扩展 调用搜索API接口或者其他搜索技术,搜索30条相关信息 对search result结果进行重排序和url内容总结,整理出搜索上下文 Prompt设计应该采用引用策略 延申功能做很多,比如大纲生成(包括脑图生成)、实体解读概述(主要是人名、机构等)、事件生成以及延申阅读:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
Youyou.com的产品相对之前有较大改动,之前有chat、search 产品形态较为复杂,改版后,直接通过chat方式完成多轮AI search 问题,这个方式跟openai web search plugin的方式类似需要梯子:yellow_heart::yellow_heart::yellow_heart:
生图系列描述推荐值
Midjourney能够生成高质量图片,具有较强的仿真能力,月租价格较贵 需要梯子:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
stability.ai开源SDXL\SDXL Tubo等模型,也提供官方PROB版本模型,缺点是价格较贵 需要梯子:yellow_heart::yellow_heart::yellow_heart:
DALLE-3OpenAI 提供的生图模型服务,只能在ChatGPT或者GPTs的产品中使用 需要梯子:yellow_heart::yellow_heart::yellow_heart:
视频生成系列描述推荐值
RunwayRunway拥有30多种工具,可以轻松进行创意构思、生成和编辑内容,带来前所未有的体验。你可以免费试用它,无论你想创作什么,Runway都能满足你的需求:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
PIKAPika是一家重新设计视频制作和编辑体验的AI视频平台。他们最近推出了Pika 1.0版本,这是一次重大的产品升级。Pika 1.0拥有强大的AI模型,可以将照片、绘画和视频转化为沉浸式、动态的场景,并进行编辑和修改:yellow_heart::yellow_heart::yellow_heart:
Sora
stable-videoStable Video Diffusion,这是一个基于图像模型的生成式视频模型10。Stability AI的目标是提供一系列AI模型,涵盖图像、语言、音频、3D和代码等不同领域,以增强人类智能2。他们的产品适用于多个领域,如媒体、娱乐、教育和营销,并且可以将文本和图像转化为生动的场景,创作出生动的电影作品:yellow_heart::yellow_heart::yellow_heart:
文档问答/写作PPT生成系列描述推荐值
askyoupdfAskYourPDF是一个PDF AI Chat应用程序,旨在帮助用户从文档中提取有价值的见解和答案,以帮助他们做出明智的决策。用户可以轻松地上传PDF文件并与智能聊天AI进行交互。1 用户上传文件后,AskYourPDF会处理文件,分析其中的内容以提取重要信息:yellow_heart::yellow_heart::yellow_heart:
chatpdfChatPDF是一个基于人工智能技术的文档阅读工具。它可以帮助用户更轻松地理解和提取PDF文档中的有效信息。ChatPDF的主要功能包括文档整理和管理、智能阅读和理解、注释和标记等。用户可以通过与ChatPDF进行实时对话的方式与其PDF文件进行交互,而无需依赖传统的PDF阅读器或编辑器:yellow_heart::yellow_heart:
秘塔写作猫秘塔写作猫是一个集成了多种人工智能技术的中英文写作辅助平台,提供智能文本纠错、改写润色、自动续写、智能配图等功能,还提供API接口和Word插件。它已经升级为魔写作,提供更智能、更个性化的写作过程,包括智能问答和个性化问题回答。秘塔写作猫还可以生成大纲、思维导图、相关事件和人物,提供直接、精准的答案,并包含引用源:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
Notion AI对notion 云文档续写、翻译、改写等等提供强大的功能:yellow_heart::yellow_heart:
GammaGamma是一种一键生成PPT的工具,它可以帮助用户快速创建演示文稿:yellow_heart::yellow_heart:
百度文库通过文心模型生成PPT大纲,在更具大纲生成完整PPT,PPT中素材可能来之百度图库和生成:yellow_heart::yellow_heart::yellow_heart:
Tome一款 AI 驱动的 PPT/幻灯片内容辅助生成工具。只需要输入一个标题或者一段特定的描述,AI 便会自动生成一套包括标题、大纲、内容、配图的完整 PPT.:yellow_heart::yellow_heart::yellow_heart:
讯飞智文一键生成Word、PPT文档,让工作和学习更轻松、更高效:yellow_heart::yellow_heart::yellow_heart:
图标设计描述
Logo Diffsuion
AIDesign
标小智人工智能为您在线LOGO设计,生成企业VI,打造个性品牌
AIGC导航类描述
aihubAIGC 工具、语言模型等等汇聚地导航栏入口
easywithaichatbot 、生图 、视频生成、AI tools聚集地,各类AI产品导航栏与入口
aigcAIGC 工具、语言模型等等汇聚地导航栏入口

:mag_right:数据收集与分析

预训练数据集

数据集名称描述领域类型
SkyPile-150BSkyPile-150B是一个全面的大规模中文数据集,专为大型语言模型的预训练而设计。它源自各种可公开访问的中文互联网网页。为了确保其质量,我们采用了严格的过滤、广泛的重复数据删除和彻底的敏感数据过滤。此外,我们还利用 fastText 和 BERT 等高级工具来过滤掉低质量的数据。SkyPile-150B数据集的可公开访问部分包含大约2.33亿个独特的网页,每个网页平均包含超过1,000个汉字。该数据集总共包含大约 1500 亿个令牌和 620 GB 的纯文本数据通识中文,预处理数据集
WuDaoCorpora Text采用20多种规则从100TB原始网页数据中清洗得出最终数据集,注重隐私数据信息的去除,源头上避免GPT-3存在的隐私泄露风险;包含教育、科技等50+个行业数据标签,可以支持多领域预训练模型的训练通识中文;预处理数据集
wikipedia-cn-20230720-filtered本数据集基于中文维基2023年7月20日的dump存档。作为一项以数据为中心的工作,本数据集仅保留了 254,547条 质量较高的词条内容。具体而言: 过滤了Template, Category, Wikipedia, File, Topic, Portal, MediaWiki, Draft, Help等特殊类型的词条 使用启发式的方法和自有的NLU模型过滤了一部分质量较低的词条 过滤了一部分内容较为敏感或存在争议性的词条。 进行了简繁转换和习惯用词转换,确保符合中国大陆地区的习惯用词通识wiki百,中文;预处理数据集
RefinedWeb (en)Falcon RefinedWeb 是由阿布扎比技术创新研究院(TII )在Common Crawl [1]语料库基础上进行严格过滤和大规模去重构建,并根据 ODC-By 1.0 许可证发布的大型英文网络数据集通识英文;预处理
RedPajama V2 (en)RedPajama-V2数据集是一个包含30万亿个过滤和去重标记的数据集,覆盖了5种语言,包括英语、法语、西班牙语、德语和意大利语。这个数据集是从84个CommonCrawl数据转储中获取的通识多语言,预处理
BaiduBaiKe530W百度百科的数据集通识百度百科
The Stack v1.2The Stack数据集,这是一个具有3.1TB的合法开源代码语料,拥有30种编程语言代码
CodeXGLUEmicrosoft 开源的,包含10个任务及14个数据集代码
CodeSearchNet包含了约600万种函数,取自Go,Java,JavaScript,PHP,Python和Ruby这六种编程语言的开源代码。代码
ProjectCodeNet数据集包含 1400 万个代码样本,共有用 55 种编程语言编写的 5 亿行代码,其中 C++ 是样本中使用最多的语言代码
PolyCodeitHub上的公开代码,主要选取的是各种编程语言中比较受欢迎的库,每个库至少有50 Stars,采用了多种编程语言代码集来训练,一共有12种代码
CodeParrot github-code代码
Google BigQueryGoogle BigQuery提供了GitHub上许可存储库的快照,可以通过SQL查询进行过滤。AlphaCode,BLOOM,InCoderCodeGen)都在他们的预训练数据集中包括了这部分数据代码
MNBVCMNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。数据均来源于互联网收集,目前总数据量31935GB,目标是达到chatGPT3.5的40T数据,目前进度79.83%通识
epfl-llm/guidelines临床指南语料库是来自17个高质量在线医疗来源的47K临床实践指南的新数据集。该数据集是Meditron大型语言模型(LLM)原始训练语料库的重要组成部分。我们公开发布了指南语料库中37K篇文章的子集,这些文章从17个允许内容重新分发的来源中提取,即CCO、CDC、CMA、ICRC、NICE、PubMed、SPOR、世界卫生组织和WikiDoc医学
pubmedPubMed 是美国国立卫生研究院国家医学图书馆开发的免费医学论文数据库,收录了超过 3600 万篇生物医学文献的引用和摘要。PubMed Central 是一个免费全文期刊文章的电子档案,提供对超过 600 万篇生物医学和生命科学期刊文章的免费访问医学文献
S2ORCS2ORC是一个包含大量英文学术论文的数据集,涵盖了多个学术领域。该数据集包括丰富的元数据、论文摘要、已解析的文献引用以及约810万篇开放获取论文的结构化全文,https://huggingface.co/datasets/leminda-ai/s2orc_small医学文献
CMeKG_toolsMeKG_tools的项目,由king-yyf创建和维护。该项目是关于CMeKG(Chinese Medical Knowledge Graph)的,CMeKG是一个利用自然语言处理和文本挖掘技术构建的中文医学知识图谱12。该项目使用Python语言,提供了一些主要模型工具,包括医学文本分词、医学实体识别和医学关系抽取医学知识图谱
mhenrichsen/terra对C4 OSCAR-2019等数据集来进行精炼得到

SFT微调数据集

数据集名称描述领域
cMedQA2用于中文社区医疗问答任务的数据集。这个数据集的目标是支持和推动医疗健康领域自动问答系统的研究。它提供了大量涵盖多种疾病、症状、治疗方法等医疗健康领域知识的医疗相关问题和答案对。数据集版本号为2.0医学QA
Hello-SimpleAI/HC3-ChineseHC3-Chinese的数据集,用于人工智能领域的文本分类任务。它是一个用于人类与ChatGPT对比的语料库,旨在促进开源和开放科学
ms-agentmodescope agent数据集 并将loss-scale技术(https://arxiv.org/pdf/2309.00986.pdf)应用到agent训练中,使中小模型API Call能力更稳定,并支持使用单张商业级显卡进行Agent推理和部署,可以直接在生产场景中全链路闭环落地使用agent微调
iic/ms_bench魔搭通用SFT数据集是MSAgent-Bench的子集,主要覆盖通用的问答SFT数据,具体的类型可以参考论文agent微调
glaive_toolcallfunction call数据集

RLHF数据集

数据集名称描述领域
Anthropic/hh-rlhfAnthropic/hh-rlhf数据集是一个包含有关帮助性和无害性的人类偏好数据的数据集。该数据集用于使用人类反馈的强化学习训练一个有帮助且无害的助手。该数据集还包含了来自红队测试语言模型以减少伤害的人类生成数据
mayflowergmbh/intel_orca_dpo_pairs_de
OpenAssistant/oasst1数据集是通过人类对话收集的数据,并用于训练助手模型。数据集包含9,846个高评分路径的样本,主要用于对话树的训练
mlabonne/chatml_dpo_pairsMaxime提供的一个样本优先级数据集,用于DPO fine-tuning的实验7。该数据集经过预处理2,是Orca风格数据集Open-Orca/OpenOrca的一个子集,包含了12,000个示例。它可以用于训练模型,以压缩信息和构建强大的、成本低廉的模型
berkeley-nest/Nectar包括RLHF、RLAIF和reward model

:chart_with_upwards_trend:应用技术

Prompt Enginnering

RAG应用技术

Agent应用技术

:ledger:模型基础技术

:dart:基础平台技术能力

Contributors

WALLE-AI

11 commits

WALLE-AI/uLMTutorial

从0到1动手学习大模型技术

89

11 commits

updated Mar 25, 2024

See the code

README

uLMTutorial

从0到1动手学习大模型技术,uLMTutorial提供全面大模型技术路线,小白也能够入行学习,完全免费,完全免费

:telescope:目录

  • :computer:入门科普课程

  • :bomb:AI神器推荐---提高办公效率、上班摸鱼好利器

  • :mag_right:数据收集与分析

  • :chart_with_upwards_trend:应用技术

  • :ledger:模型基础技术

  • :dart:基础平台技术能力

:computer:入门科普课程

科普课程课程描述内容推荐值
Recent Advances on Foundation Models滑铁卢大学Wenhu Chen老师的课程“Recent Advances on Foundation Models”在滑铁卢大学是公开的。课程中,覆盖了许多有趣的话题,包括Transformers、LLM、预训练、量化、稀疏注意力、指令调整、RLHF、提示、视觉Transformers、扩散模型、多模态模型、代理、RAG等。https://cs.uwaterloo.ca/~wenhuche/teaching/cs886/:yellow_heart::yellow_heart::yellow_heart:
stas00/ml-engineering《Machine Learning Engineering Open Book》的开源书籍,该书籍汇集了多种方法论,旨在帮助训练大型语言模型和多模态模型。文章指出,这本书适合用于大型语言模型(LLM)和超大型语言模型(VLM)的培训工程师和操作员,其中包含了许多脚本和复制粘贴命令,以便快速满足需求。文章还提到,这本书是一个持续的脑洞集合,作者在训练开源BLOOM-176B模型和IDEFICS-80B多模态模型时获得了许多专业知识。目前,作者正在Contextual.AI开发/训练开源检索增强模型。文章最后提到了该书籍的目录结构,包括见解、关键硬件组件、性能、操作、开发、杂项等部分。:yellow_heart::yellow_heart:
langchain/cookbookLangChain提供了一个名为cookbook的代码示例集合,可用于构建使用LangChain的应用程序。这个cookbook强调更多应用和端到端示例,而不是主要文档中包含的示例。其中包括一个构建聊天应用程序的示例,该应用程序可以使用开源的llm(llama2)与SQL数据库进行交互,具体示例展示了包含名单的SQLite数据库:yellow_heart::yellow_heart::yellow_heart:
rasbt/LLMs-from-scratch如何从零开始构建一个类似于ChatGPT的大型语言模型(LLM)。通过逐步的指导和清晰的文本、图表和例子,引导读者创建自己的LLM。文章还提到了训练和发展自己用于教育目的的小型但功能齐全的模型的方法,这与创建大型基础模型(如ChatGPT)的方法类似。文章还提供了章节标题和主要代码的快速访问链接:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
2024年构建大型语言模型的小指南Hugging Face创始人Thomas Wolf讲解如何构建大型语言模型的文章。该文章可能提供了关于大型语言模型的定义、预训练过程、技术挑战和伦理关注点等内容。它还可能介绍了Meta AI在2024年推出的大型语言模型,并突出了其性能优势。文章可能还包括关于大型语言模型在自然语言处理和人工智能领域的应用以及构建这类模型所需的专业技能和知识然而,由于上下文提供的信息有限,无法对文章的具体内容进行进一步详细解释:yellow_heart::yellow_heart::yellow_heart:
Hung-yi Lee GPT科普视频(油管)通俗易懂讲解什么chatgpt?什么GenAI,课程生动有趣:yellow_heart::yellow_heart::yellow_heart:
datawhalechina/ so-large-lmdatawhale构建项目旨在作为一个大规模预训练语言模型的教程,从数据准备、模型构建、训练策略到模型评估与改进,以及模型在安全、隐私、环境和法律道德方面的方面来提供开源知识。项目将以斯坦福大学大规模语言模型课程李宏毅生成式AI课程为基础,结合来自开源贡献者的补充和完善,以及对前沿大模型知识的及时更新,为读者提供较为全面而深入的理论知识和实践方法。通过对模型构建、训练、评估与改进等方面的系统性讲解,以及代码的实战,我们希望建立一个具有广泛参考价值的项目:yellow_heart::yellow_heart::yellow_heart:
CS224N: Natural Language Processing with Deep Learning从传统的NLP到大模型技术进行全面的讲解,其中包含各种小项目实践操作:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
Intro to Large Language Models无代码的科普,讲述大模型如何通过算力压缩得到,ppt地址:yellow_heart::yellow_heart::yellow_heart:
mlabonne/llm-course该文章主要介绍了如何通过一个课程进入大型语言模型(LLMs)的学习,该课程分为三个部分:LLM基础、LLM科学家和LLM工程师。课程提供了相关的笔记本和文章,包括用于评估LLMs、合并模型、量化LLMs和其他相关主题的工具和资源,分别提供基础课程以及LLM科学家和工程师技术路线,课程具备了基础知识、理论阐述和项目实践操纵:yellow_heart::yellow_heart::yellow_heart:
microsoft/generative-ai-for-beginners主要介绍了一个由微软云倡导者提供的12节课的课程,旨在帮助初学者学习生成式AI应用程序的开发。课程涵盖了生成式AI原理和应用程序开发的关键方面,通过学习,学生可以构建自己的生成式AI初创公司,以了解启动创意所需的条件。文章还提到了如何开始学习、与其他学习者交流和支持、进一步学习资源以及如何为课程做出贡献:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
复旦大学-《大规模语言模型:理论到实践》基本阐述大模型发展历史、技术细节和评估方式 复旦大学张奇教授相关资料:yellow_heart::yellow_heart::yellow_heart:
easywithai/ai-coursesGenAI各种课程,从普通入门到进阶,基本都是付费/免费的课程培训,其他包括吴恩达 deeplearning-ai:yellow_heart::yellow_heart::yellow_heart::yellow_heart:

:bomb:AI神器推荐---提高办公效率、上班摸鱼好利器

Prompt大魔法案例与技巧

文本生成类(OpenAI GPTs相关免费应用)描述推荐值
https://github.com/ai-boost/awesome-prompts?tab=readme-ov-file
https://promptfolder.com/midjourney-prompt-helper/
promptbasePrompt商场,可以发布自己prompt进行售卖,也可以购买商城中prompt案例:yellow_heart::yellow_heart:
Awesome-GPTs-Big-List参考Openai GPTs 的Prompt写法:yellow_heart::yellow_heart::yellow_heart:
awesome-promptsOpen GPTs Prompt聚集地,学习大量场景的prompt写法:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
BlackFriday-GPTs-Prompts参考Openai GPTs 的Prompt写法:yellow_heart::yellow_heart::yellow_heart:
Leaked-GPTs参考Openai GPTs 的Prompt写法:yellow_heart::yellow_heart::yellow_heart:
Prompt-Engineering-Guide
prompt-guide
chatgpt-prompt-engineering-for-developers
prompt-engineering
https://github.com/phodal/prompt-patterns
https://promptport.ai/
https://www.aishort.top/
https://flowgpt.com/
https://github.com/f/awesome-chatgpt-prompts
https://promptperfect.jina.ai/
https://flowgpt.com/p/promptenhancer
https://replicate.com/methexis-inc/img2prompt
https://prompthero.com/
PromptLLMPromptLLM是由贾扬清团队LeptonAl平台推出的AIGC提示词工具,只需输入一行简短的提示词,PromptLLM就
能在几秒内生成一个更加完整、具体的提示词,顺便再用StableDiffusionXL生成两张图片。PromptLLM简化了内
容创作过程,为个人和团队提供了一个高效且富有创意的写作助手。
:yellow_heart::yellow_heart::yellow_heart:

AI办公/摸鱼神器推荐

来一张示意图

智能助手系列描述推荐值
字节Coze扣子为你提供了一站式 AI 开发平台,无需编程,你的创新理念都能迅速化身为下一代的 AI 应用,可以快速无代码方式搭建自己GPT应用,缺点是只能使用字节本身的模型,比如云雀、豆包:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
POE提供主流的模型能力,比如Openai GPT4 Claude3 Midjourney,以及创作各个类型的助手,大部分是免费的,需要梯子:yellow_heart::yellow_heart::yellow_heart:
Monica提供了GPT4服务,具备聊天、文档阅读、AI search、写作、翻译与艺术创作等较大的AI功能,支持PC端、浏览器端、移动端,缺点就是价格太贵,需要梯子:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
百度超级助手超级助理是基于文心大模型的智能助手,含Copilot应用端和Agent开发平台两部分。Copilot以浏览器插件提供翻译、创作、总结、问答等知识服务,也可调用Agent开发平台插件自定义任务。Agent平台则支持插件注册与编排,快速打造场景化应用:yellow_heart::yellow_heart::yellow_heart:
智普AI 清言能够使用智普AI最新的GLM4模型,零代码方式构建智能体服务,具备生图、数据分析、文档分析、联网等功能:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
LOBE社区LLMs/AI 聊天框架。它支持多个 AI 提供商(如 OpenAI、Claude 3、Gemini、Perplexity、Bedrock、Azure、Mistral、Ollama),以及多模态(视觉/TTS)和插件系统。它支持一键免费部署私有的 ChatGPT 聊天应用程序。该项目提供了详细的设置开发指南和资源文档,以及插件和主题定制的能力 开源社区:yellow_heart::yellow_heart::yellow_heart:
Difylanggenius/dify是一个名为Dify的LLM应用开发平台,它结合了Backend-as-a-Service和LLMOps的概念,旨在帮助开发者快速构建高质量的生成式AI应用Dify提供了一个可视化编排工具,使应用的开发、运维和数据集管理更加简单它还集成了一个内置的RAG引擎,支持全文搜索和向量数据库嵌入的功能,并允许直接上传各种文本格式的文件Dify支持多种类型的应用,包括开箱即用的Web站点、表单模式和聊天对话模式的应用 开源社区:yellow_heart::yellow_heart::yellow_heart:
easywithai:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
AI Search/Chat描述推荐值
天工AIcopilot方式会对搜索**query进行分析(明显的子问题分析与扩展)**和关键字抽取,同时对搜索内容进行过滤与分析,可实现多轮search的方式接着询问:yellow_heart::yellow_heart::yellow_heart:
Kimi(月之暗面)暂时没有提供联网搜索的内容,支持本地文件上传,提供chatpdf的能力:yellow_heart::yellow_heart:
https://gptcall.net/通过代理方式接入大部分Openai GPTs应用,每天限时免费:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
秘塔AIquery分析,其实做子问题生成与问题扩展 调用搜索API接口或者其他搜索技术,搜索30条相关信息 对search result结果进行重排序和url内容总结,整理出搜索上下文 Prompt设计应该采用引用策略 延申功能做很多,比如大纲生成(包括脑图生成)、实体解读概述(主要是人名、机构等)、事件生成以及延申阅读:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
Youyou.com的产品相对之前有较大改动,之前有chat、search 产品形态较为复杂,改版后,直接通过chat方式完成多轮AI search 问题,这个方式跟openai web search plugin的方式类似需要梯子:yellow_heart::yellow_heart::yellow_heart:
生图系列描述推荐值
Midjourney能够生成高质量图片,具有较强的仿真能力,月租价格较贵 需要梯子:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
stability.ai开源SDXL\SDXL Tubo等模型,也提供官方PROB版本模型,缺点是价格较贵 需要梯子:yellow_heart::yellow_heart::yellow_heart:
DALLE-3OpenAI 提供的生图模型服务,只能在ChatGPT或者GPTs的产品中使用 需要梯子:yellow_heart::yellow_heart::yellow_heart:
视频生成系列描述推荐值
RunwayRunway拥有30多种工具,可以轻松进行创意构思、生成和编辑内容,带来前所未有的体验。你可以免费试用它,无论你想创作什么,Runway都能满足你的需求:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
PIKAPika是一家重新设计视频制作和编辑体验的AI视频平台。他们最近推出了Pika 1.0版本,这是一次重大的产品升级。Pika 1.0拥有强大的AI模型,可以将照片、绘画和视频转化为沉浸式、动态的场景,并进行编辑和修改:yellow_heart::yellow_heart::yellow_heart:
Sora
stable-videoStable Video Diffusion,这是一个基于图像模型的生成式视频模型10。Stability AI的目标是提供一系列AI模型,涵盖图像、语言、音频、3D和代码等不同领域,以增强人类智能2。他们的产品适用于多个领域,如媒体、娱乐、教育和营销,并且可以将文本和图像转化为生动的场景,创作出生动的电影作品:yellow_heart::yellow_heart::yellow_heart:
文档问答/写作PPT生成系列描述推荐值
askyoupdfAskYourPDF是一个PDF AI Chat应用程序,旨在帮助用户从文档中提取有价值的见解和答案,以帮助他们做出明智的决策。用户可以轻松地上传PDF文件并与智能聊天AI进行交互。1 用户上传文件后,AskYourPDF会处理文件,分析其中的内容以提取重要信息:yellow_heart::yellow_heart::yellow_heart:
chatpdfChatPDF是一个基于人工智能技术的文档阅读工具。它可以帮助用户更轻松地理解和提取PDF文档中的有效信息。ChatPDF的主要功能包括文档整理和管理、智能阅读和理解、注释和标记等。用户可以通过与ChatPDF进行实时对话的方式与其PDF文件进行交互,而无需依赖传统的PDF阅读器或编辑器:yellow_heart::yellow_heart:
秘塔写作猫秘塔写作猫是一个集成了多种人工智能技术的中英文写作辅助平台,提供智能文本纠错、改写润色、自动续写、智能配图等功能,还提供API接口和Word插件。它已经升级为魔写作,提供更智能、更个性化的写作过程,包括智能问答和个性化问题回答。秘塔写作猫还可以生成大纲、思维导图、相关事件和人物,提供直接、精准的答案,并包含引用源:yellow_heart::yellow_heart::yellow_heart::yellow_heart:
Notion AI对notion 云文档续写、翻译、改写等等提供强大的功能:yellow_heart::yellow_heart:
GammaGamma是一种一键生成PPT的工具,它可以帮助用户快速创建演示文稿:yellow_heart::yellow_heart:
百度文库通过文心模型生成PPT大纲,在更具大纲生成完整PPT,PPT中素材可能来之百度图库和生成:yellow_heart::yellow_heart::yellow_heart:
Tome一款 AI 驱动的 PPT/幻灯片内容辅助生成工具。只需要输入一个标题或者一段特定的描述,AI 便会自动生成一套包括标题、大纲、内容、配图的完整 PPT.:yellow_heart::yellow_heart::yellow_heart:
讯飞智文一键生成Word、PPT文档,让工作和学习更轻松、更高效:yellow_heart::yellow_heart::yellow_heart:
图标设计描述
Logo Diffsuion
AIDesign
标小智人工智能为您在线LOGO设计,生成企业VI,打造个性品牌
AIGC导航类描述
aihubAIGC 工具、语言模型等等汇聚地导航栏入口
easywithaichatbot 、生图 、视频生成、AI tools聚集地,各类AI产品导航栏与入口
aigcAIGC 工具、语言模型等等汇聚地导航栏入口

:mag_right:数据收集与分析

预训练数据集

数据集名称描述领域类型
SkyPile-150BSkyPile-150B是一个全面的大规模中文数据集,专为大型语言模型的预训练而设计。它源自各种可公开访问的中文互联网网页。为了确保其质量,我们采用了严格的过滤、广泛的重复数据删除和彻底的敏感数据过滤。此外,我们还利用 fastText 和 BERT 等高级工具来过滤掉低质量的数据。SkyPile-150B数据集的可公开访问部分包含大约2.33亿个独特的网页,每个网页平均包含超过1,000个汉字。该数据集总共包含大约 1500 亿个令牌和 620 GB 的纯文本数据通识中文,预处理数据集
WuDaoCorpora Text采用20多种规则从100TB原始网页数据中清洗得出最终数据集,注重隐私数据信息的去除,源头上避免GPT-3存在的隐私泄露风险;包含教育、科技等50+个行业数据标签,可以支持多领域预训练模型的训练通识中文;预处理数据集
wikipedia-cn-20230720-filtered本数据集基于中文维基2023年7月20日的dump存档。作为一项以数据为中心的工作,本数据集仅保留了 254,547条 质量较高的词条内容。具体而言: 过滤了Template, Category, Wikipedia, File, Topic, Portal, MediaWiki, Draft, Help等特殊类型的词条 使用启发式的方法和自有的NLU模型过滤了一部分质量较低的词条 过滤了一部分内容较为敏感或存在争议性的词条。 进行了简繁转换和习惯用词转换,确保符合中国大陆地区的习惯用词通识wiki百,中文;预处理数据集
RefinedWeb (en)Falcon RefinedWeb 是由阿布扎比技术创新研究院(TII )在Common Crawl [1]语料库基础上进行严格过滤和大规模去重构建,并根据 ODC-By 1.0 许可证发布的大型英文网络数据集通识英文;预处理
RedPajama V2 (en)RedPajama-V2数据集是一个包含30万亿个过滤和去重标记的数据集,覆盖了5种语言,包括英语、法语、西班牙语、德语和意大利语。这个数据集是从84个CommonCrawl数据转储中获取的通识多语言,预处理
BaiduBaiKe530W百度百科的数据集通识百度百科
The Stack v1.2The Stack数据集,这是一个具有3.1TB的合法开源代码语料,拥有30种编程语言代码
CodeXGLUEmicrosoft 开源的,包含10个任务及14个数据集代码
CodeSearchNet包含了约600万种函数,取自Go,Java,JavaScript,PHP,Python和Ruby这六种编程语言的开源代码。代码
ProjectCodeNet数据集包含 1400 万个代码样本,共有用 55 种编程语言编写的 5 亿行代码,其中 C++ 是样本中使用最多的语言代码
PolyCodeitHub上的公开代码,主要选取的是各种编程语言中比较受欢迎的库,每个库至少有50 Stars,采用了多种编程语言代码集来训练,一共有12种代码
CodeParrot github-code代码
Google BigQueryGoogle BigQuery提供了GitHub上许可存储库的快照,可以通过SQL查询进行过滤。AlphaCode,BLOOM,InCoderCodeGen)都在他们的预训练数据集中包括了这部分数据代码
MNBVCMNBVC数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。MNBVC数据集包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。数据均来源于互联网收集,目前总数据量31935GB,目标是达到chatGPT3.5的40T数据,目前进度79.83%通识
epfl-llm/guidelines临床指南语料库是来自17个高质量在线医疗来源的47K临床实践指南的新数据集。该数据集是Meditron大型语言模型(LLM)原始训练语料库的重要组成部分。我们公开发布了指南语料库中37K篇文章的子集,这些文章从17个允许内容重新分发的来源中提取,即CCO、CDC、CMA、ICRC、NICE、PubMed、SPOR、世界卫生组织和WikiDoc医学
pubmedPubMed 是美国国立卫生研究院国家医学图书馆开发的免费医学论文数据库,收录了超过 3600 万篇生物医学文献的引用和摘要。PubMed Central 是一个免费全文期刊文章的电子档案,提供对超过 600 万篇生物医学和生命科学期刊文章的免费访问医学文献
S2ORCS2ORC是一个包含大量英文学术论文的数据集,涵盖了多个学术领域。该数据集包括丰富的元数据、论文摘要、已解析的文献引用以及约810万篇开放获取论文的结构化全文,https://huggingface.co/datasets/leminda-ai/s2orc_small医学文献
CMeKG_toolsMeKG_tools的项目,由king-yyf创建和维护。该项目是关于CMeKG(Chinese Medical Knowledge Graph)的,CMeKG是一个利用自然语言处理和文本挖掘技术构建的中文医学知识图谱12。该项目使用Python语言,提供了一些主要模型工具,包括医学文本分词、医学实体识别和医学关系抽取医学知识图谱
mhenrichsen/terra对C4 OSCAR-2019等数据集来进行精炼得到

SFT微调数据集

数据集名称描述领域
cMedQA2用于中文社区医疗问答任务的数据集。这个数据集的目标是支持和推动医疗健康领域自动问答系统的研究。它提供了大量涵盖多种疾病、症状、治疗方法等医疗健康领域知识的医疗相关问题和答案对。数据集版本号为2.0医学QA
Hello-SimpleAI/HC3-ChineseHC3-Chinese的数据集,用于人工智能领域的文本分类任务。它是一个用于人类与ChatGPT对比的语料库,旨在促进开源和开放科学
ms-agentmodescope agent数据集 并将loss-scale技术(https://arxiv.org/pdf/2309.00986.pdf)应用到agent训练中,使中小模型API Call能力更稳定,并支持使用单张商业级显卡进行Agent推理和部署,可以直接在生产场景中全链路闭环落地使用agent微调
iic/ms_bench魔搭通用SFT数据集是MSAgent-Bench的子集,主要覆盖通用的问答SFT数据,具体的类型可以参考论文agent微调
glaive_toolcallfunction call数据集

RLHF数据集

数据集名称描述领域
Anthropic/hh-rlhfAnthropic/hh-rlhf数据集是一个包含有关帮助性和无害性的人类偏好数据的数据集。该数据集用于使用人类反馈的强化学习训练一个有帮助且无害的助手。该数据集还包含了来自红队测试语言模型以减少伤害的人类生成数据
mayflowergmbh/intel_orca_dpo_pairs_de
OpenAssistant/oasst1数据集是通过人类对话收集的数据,并用于训练助手模型。数据集包含9,846个高评分路径的样本,主要用于对话树的训练
mlabonne/chatml_dpo_pairsMaxime提供的一个样本优先级数据集,用于DPO fine-tuning的实验7。该数据集经过预处理2,是Orca风格数据集Open-Orca/OpenOrca的一个子集,包含了12,000个示例。它可以用于训练模型,以压缩信息和构建强大的、成本低廉的模型
berkeley-nest/Nectar包括RLHF、RLAIF和reward model

:chart_with_upwards_trend:应用技术

Prompt Enginnering

RAG应用技术

Agent应用技术

:ledger:模型基础技术

:dart:基础平台技术能力

Contributors

WALLE-AI

11 commits