该项目旨在为初学者提供一条清晰的大模型学习路径,从零基础出发,循序渐进地理解 LLM 的核心原理、训练机制与应用范式,并逐步过渡到智能体(Agent)的构建与基础实践。我们希望在“会用”的基础上,进一步帮助学习者实现“看懂、做出、跑通”。由于我们能力与经验有限,内容难免存在不足,欢迎交流与指正。😀
🧭 你能获得什么从 Big Picture 到 DL / RL、LLM、Agent 的完整学习主线。 |
🧱 这份路线怎么学按阶段推进,每阶段都给出目标、资料与可落地的练习方向。 |
🎯 适合谁适合零基础入门且准备做 LLM或Agent 项目的人。 |
本仓库采用阶段式学习路径(Staged Learning Path),旨在帮助你从零基础逐步成长为具备 LLM 研究能力的开发者。每个阶段都有明确的学习重点和核心目标。
| 阶段 | 学习重点 | 核心目标 |
|---|---|---|
| 🗺️ Stage 0 | Big Picture | 理解整体路径与最终目标 |
| 📚 Stage 1 | DL + RL | 建立深度学习与强化学习基础 |
| 🤖 Stage 2 | LLM | 构建大语言模型并掌握后训练方法 |
| 🧩 Stage 3 | Agent | 构建智能体框架与应用 |
针对不同程度的学习者,本项目建立了两个版本的学习路径供您选择:
在开始学习任何技术细节之前,先建立对整个 LLM 领域的全局认知至关重要。很多初学者容易陷入"学了很多,但不知道自己在哪里"的困境——Stage 0 就是为了避免这种迷失。
本阶段目标: 理解 LLM 的来龙去脉、主流技术路线、以及你自己的学习路径,产出一份个人学习计划。
① LLM 是什么?能做什么?
在深入学习之前,先从宏观视角理解大语言模型:
② LLM 的技术演进脉络
理解历史脉络有助于理解为何现在的技术是这样的:
词向量时代(Word2Vec)
→ RNN / LSTM 序列模型
→ Transformer 架构(2017, Attention is All You Need)
→ BERT(理解型)/ GPT(生成型)
→ 大规模预训练(GPT-3, 175B 参数)
→ 指令对齐(InstructGPT, RLHF)
→ 当代 LLM(ChatGPT, Claude, Gemini...)
李沐精读论文系列
在完成上述内容后,请根据自身情况回答以下问题,写出你的学习计划:
| 问题 | 思考方向 |
|---|---|
| 我的目标是什么? | 做应用开发 / 研究模型 / 理解原理 |
| 我的时间预算? | 每周可投入多少小时 |
| 我的已有基础? | Python 熟练度 / 数学基础(线代、概率) |
| 我计划跳过哪些内容? | 结合目标裁剪路径,避免无效学习 |
💬 建议:把你的学习计划写成一个 Markdown 文件放在本地仓库的专用文件夹,定期回顾和更新。
深度学习是理解 LLM 的基石。本部分帮助你掌握神经网络、反向传播、优化算法等核心概念,为后续学习 Transformer 架构打下坚实基础。
吴恩达:深度学习专项课程
经典论文代码实现
强化学习是 LLM 后训练(RLHF)的核心技术。掌握 RL 基础将帮助你理解如何通过人类反馈优化模型行为。
动画中学强化学习
Hands-on-RL(动手学强化学习)
完成 Stage 1 后,你已具备深度学习与强化学习的基础。Stage 2 的目标是真正理解 LLM 的内部机制,并亲手构建和训练一个语言模型。
本阶段目标: 掌握 Transformer 架构原理 → 理解预训练与后训练方法 → 掌握推理模型 → 从零实现小型 LLM → 在真实大模型上做微调实战 → 拓展到多模态。
在动手写代码之前,必须真正理解 Transformer 的每一个组件——注意力机制不是魔法,它是有数学直觉的。
Attention is All You Need
李宏毅:生成式 AI 时代下的机器学习(LLM 重点章节)
理论学完,动手是关键。这一部分帮助你把前面所学串联起来,亲手训练一个完整的小型语言模型。
① minimind
② LLM-from-scratch (从零实现大模型功能拆解讲述)
完成 Stage 2 后,你已掌握 LLM 的训练、推理与部署。Stage 3 关注如何把模型放进闭环:感知 → 决策 → 行动 → 观察 → 更新状态,直至任务完成。
本阶段目标: 从范式上区分“聊天模型”与“行动者”→ 掌握规划(任务分解、动态规划与反思)、记忆(短期/长期记忆管理)与工具调用的核心能力 → 理解多智能体的协议、组织与环境 → 跟跑至少一个开源项目,并自选垂直场景深入。
定义: 智能体(Agent)被定义为一种能够感知环境、进行推理、自主决策并采取行动以实现特定目标的系统。
与普通 Chatbot 的区别:
| Chatbot | Agent |
|---|---|
| 被动响应用户输入 | 主动规划并执行任务 |
| 单轮或有限轮对话 | 多轮迭代直至目标达成 |
| 仅依赖内置知识 | 可调外部工具获取实时信息 |
能力边界:
✅ 能做到:多步推理与规划、调用外部工具扩展能力、与环境/用户持续交互、利用长期记忆保持上下文。
❌ 做不到:完全自主设定目标(仍需人类定义任务)、真正的理解与意识(仍是模式匹配)。
李宏毅:一堂课搞懂 AI Agent 的原理
langchain-ai/open_deep_research
UI-TARS
Browser Use
① OpenClaw
② xiaohongshu-ops-skill(OpenClaw 小红书运营插件)
1. 安装 OpenClaw 本体,配置 LLM API Key
2. 安装小红书 Skill:https://github.com/Xiangyu-CAS/xiaohongshu-ops-skill
3. 扫码绑定小红书账号(仅需一次)
4. 下达自然语言指令,Agent 自动完成热点抓取 → 文案创作 → 定时发布
在开始学习任何技术细节之前,先建立对整个 LLM 领域的全局认知至关重要。很多初学者容易陷入"学了很多,但不知道自己在哪里"的困境——Stage 0 就是为了避免这种迷失。
本阶段目标: 理解 LLM 的来龙去脉、主流技术路线、以及你自己的学习路径,产出一份个人学习计划。
① LLM 是什么?能做什么?
在深入学习之前,先从宏观视角理解大语言模型:
② LLM 的技术演进脉络
理解历史脉络有助于理解为何现在的技术是这样的:
词向量时代(Word2Vec)
→ RNN / LSTM 序列模型
→ Transformer 架构(2017, Attention is All You Need)
→ BERT(理解型)/ GPT(生成型)
→ 大规模预训练(GPT-3, 175B 参数)
→ 指令对齐(InstructGPT, RLHF)
→ 当代 LLM(ChatGPT, Claude, Gemini...)
① 李沐精读论文系列(必看)
② Andrej Karpathy:Neural Networks: Zero to Hero
在完成上述内容后,请根据自身情况回答以下问题,写出你的学习计划:
| 问题 | 思考方向 |
|---|---|
| 我的目标是什么? | 做应用开发 / 研究模型 / 理解原理 |
| 我的时间预算? | 每周可投入多少小时 |
| 我的已有基础? | Python 熟练度 / 数学基础(线代、概率) |
| 我计划跳过哪些内容? | 结合目标裁剪路径,避免无效学习 |
💬 建议:把你的学习计划写成一个 Markdown 文件放在本地仓库的专用文件夹,定期回顾和更新。
深度学习是理解 LLM 的基石。本部分帮助你掌握神经网络、反向传播、优化算法等核心概念,为后续学习 Transformer 架构打下坚实基础。
① 吴恩达:深度学习专项课程
② 李沐:动手学深度学习
① 经典论文代码实现(强烈推荐)
② 可视化学习网站
强化学习是 LLM 后训练(RLHF)的核心技术。掌握 RL 基础将帮助你理解如何通过人类反馈优化模型行为。
① 动画中学强化学习(最容易理解)
② 李宏毅:强化学习课程
③ 王树森:深度强化学习(DRL)
① Hands-on-RL(动手学强化学习)
② easy-rl(强化学习中文教程)
完成 Stage 1 后,你已具备深度学习与强化学习的基础。Stage 2 的目标是真正理解 LLM 的内部机制,并亲手构建和训练一个语言模型。
本阶段目标: 掌握 Transformer 架构原理 → 理解预训练与后训练方法 → 掌握推理模型 → 从零实现小型 LLM → 在真实大模型上做微调实战 → 拓展到多模态。
在动手写代码之前,必须真正理解 Transformer 的每一个组件——注意力机制不是魔法,它是有数学直觉的。
① Attention is All You Need(2017,必读)
② The Illustrated Transformer(最直观的图解)
李宏毅:生成式 AI 时代下的机器学习(LLM 重点章节)
Andrej Karpathy:Let's build GPT from scratch
预训练是 LLM 能力的来源。理解预训练的目标函数、数据处理和训练技巧,是研究 LLM 的必要基础。
核心概念:
① Scaling Laws for Neural Language Models(必读论文)
② LLaMA 技术报告(工程实践参考)
预训练后的模型只会"续写文本",后训练让模型变得"听话"且"有用"。这是当前 LLM 研究最活跃的方向之一。
后训练技术路线:
预训练模型(Base Model)
→ SFT 监督微调:用高质量对话数据教模型"怎么回答"
→ RM 奖励模型训练:学习人类对回答质量的偏好
→ RLHF / PPO:用 RL 让模型最大化奖励,对齐人类期望
→ DPO:更简洁的对齐方案,无需显式 RM
① InstructGPT 论文(RLHF 的奠基之作)
② DPO 论文(更简洁的对齐方法)
传统 LLM 是"快思考"模型,直接输出答案。推理模型引入"慢思考"机制,通过显式的推理过程(如思维链、自我反思)来提升复杂问题的求解能力。
核心思想: 让模型在回答前先"思考"——生成中间推理步骤,而不是直接给出答案。这类似人类的 System 2 思维(深思熟虑),而非 System 1(直觉反应)。
代表模型:
① DeepSeek-R1 技术报告(必读)
② Chain-of-Thought Prompting(思维链提示)
③ 代码实践:OpenR(开源推理模型训练框架)
理论学完,动手是关键。这一部分帮助你把前面所学串联起来,亲手训练一个完整的小型语言模型。
① nanoGPT(最推荐的起点)
② minimind(中文小模型全流程实现)
③ LLM-from-scratch (从零实现大模型功能拆解讲述)
推荐学习顺序:
在真实大模型上做实验,是从"理解原理"到"工程落地"的关键一步。
全量微调大模型成本极高,PEFT 方法只训练少量参数,即可达到接近全量微调的效果。
① LoRA(最主流的高效微调方法)
② LLaMA-Factory(一站式微调框架)
③ veRL(大规模 RLHF 训练框架)
① Ollama(本地运行大模型最简单的方式)
② vLLM(高性能推理框架)
纯文本 LLM 之外,多模态模型能够同时理解图像、视频、音频等信息。这是当前前沿研究和产品落地最活跃的方向之一。
多模态的核心问题: 如何把不同模态的信息"对齐"到同一个语义空间,让语言模型能够理解图像?
模态融合的主流架构:
图像编码器(Vision Encoder,如 ViT / CLIP)
→ 将图像切成 Patch,编码为向量序列
→ 投影层(Projector):把视觉 token 映射到语言模型的词向量空间
→ 语言模型(LLM):统一处理文字 + 图像 token,生成回答
① CLIP(视觉-语言对齐的奠基之作)
② LLaVA(最具影响力的开源多模态模型)
③ Qwen-VL 技术报告(工程实践参考)
LLaVA 官方仓库
完成 Stage 2 后,你已掌握 LLM 的训练、推理与部署。Stage 3 关注如何把模型放进闭环:感知 → 决策 → 行动 → 观察 → 更新状态,直至任务完成。
本阶段目标: 从范式上区分“聊天模型”与“行动者”→ 掌握规划(任务分解、动态规划与反思)、记忆(短期/长期记忆管理)与工具调用的核心能力 → 理解多智能体的协议、组织与环境 → 跟跑至少一个开源项目,并自选垂直场景深入。
定义: 智能体(Agent)被定义为一种能够感知环境、进行推理、自主决策并采取行动以实现特定目标的系统。
与普通 Chatbot 的区别:
| Chatbot | Agent |
|---|---|
| 被动响应用户输入 | 主动规划并执行任务 |
| 单轮或有限轮对话 | 多轮迭代直至目标达成 |
| 仅依赖内置知识 | 可调外部工具获取实时信息 |
能力边界:
✅ 能做到:多步推理与规划、调用外部工具扩展能力、与环境/用户持续交互、利用长期记忆保持上下文。
❌ 做不到:完全自主设定目标(仍需人类定义任务)、真正的理解与意识(仍是模式匹配)。
① 李宏毅:一堂课搞懂 AI Agent 的原理
② 吴恩达:Agentic AI
③ Lilian Weng:LLM Powered Autonomous Agents
④ Agent 领域综述
Agent 的本质是“系统”而非“模型”,LLM 提供推理能力,而系统架构决定 Agent 能否从“对话”走向“行动”。这涉及三个核心能力——规划、记忆和工具调用。
规划 (Planning):决定任务如何分解、执行顺序如何安排、遇到错误如何调整。包括任务拆解(将复杂目标拆分为可执行的子任务链)、动态规划(ReAct 模式的推理-行动-观察循环)和自我反思(从失败中学习并优化策略)。
记忆 (Memory):管理信息的存储与检索。短期记忆利用上下文窗口记录当前对话状态;长期记忆通过向量数据库存储历史经验或专业知识,随取随用。
工具调用 (Tool Use):让 Agent 能操作外部环境。通过 API 调用搜索引擎、运行代码、访问数据库等,需要约定清晰的接口规范、权限控制和错误处理机制。
规划(Planning)是 Agent 的"大脑",决定任务如何分解、执行顺序如何安排、遇到错误如何调整。好的规划能力让 Agent 从单次响应走向多步迭代,从被动执行走向主动优化。
任务分解:
将复杂目标拆分为可管理的子任务链。例如“帮我写一篇行业分析报告”可分解为:确定主题→搜集资料→整理大纲→撰写各章节→审核修改。每个子任务有明确的输入、输出和验收标准,便于 Agent 逐一执行和检查进度。
动态规划与反思:
ReAct 模式:推理(Reasoning)→ 行动(Action)→ 观察(Observation)→ 再推理的循环。Agent 在每一步行动前先思考"我需要做什么",执行后观察结果,再决定下一步。这种"思考-行动-反馈"的闭环让 Agent 能根据环境反馈调整策略。
自我反思(Self-Reflection):当行动结果不达标或出现错误时,Agent 能分析失败原因、总结教训并调整后续计划。Reflexion 等框架通过将失败经验存入记忆,让 Agent 在类似场景下避免重复犯错。
推荐阅读:
① ReAct
② Plan-and-Solve Prompting
③ Reflexion
本节探讨 Agent 如何管理信息的存储与流动:短期(工作)记忆关注在有限上下文窗口内如何保留关键信息,长期记忆解决跨会话的知识持久化与检索,RAG 则负责将外部知识库实时接入推理过程。
短期(工作)记忆:
上下文窗口有限,只能保留最近的对话。常用策略:
长期记忆:
RAG 技术(检索增强生成):
推荐阅读:
① MemGPT
② Anthropic:Effective Context Engineering for AI Agents
③ Claude-Mem
④ Mem0
⑤ Agent Memory 综述(长文 PDF,选读)
⑥ LangChain 文档:RAG
工具是什么:把外部能力封装成可调用的函数
工具是 Agent 的“手脚”:搜索、计算器、访问数据库、发消息等。除了名字和说明要清楚,还要约定入参/出参、超时、重试、是否改数据、给多大权限。
工具设计原则:
search_weather 优于 func_01;常见工具类型:
| 类型 | 示例 | 用途 |
|---|---|---|
| 信息获取 | 搜索引擎、天气查询、数据库查询 | 补充模型知识盲点 |
| 操作执行 | 发送邮件、创建日程、文件操作 | 与外部系统交互 |
| 计算处理 | 计算器、代码执行器、数据分析 | 处理精确计算任务 |
| 决策辅助 | 风险评估、合规检查、评分系统 | 提供结构化判断 |
工具 vs 技能(Tool vs Skill):
在实际项目中,Skill 往往对应一个可复用的能力模块,通过组合不同 Tool 实现完整场景闭环。
推荐阅读:
① OpenAI:Function Calling 指南
② Anthropic:Tool Use 概览
③ Model Context Protocol(MCP)
④ Agent Skills with Anthropic
多智能体系统(Multi-Agent System,MAS)是指由多个具有自主决策能力的 AI Agent 协同完成复杂任务的系统。多 Agent 的核心优势在于任务分解、角色专业化与并行执行。
核心思想: 将一个复杂任务拆解给多个具有不同角色或能力的 Agent,让它们通过协作共同完成目标——类似于一个软件开发团队,产品经理、程序员、测试员各司其职。
两种典型范式:
| 范式 | 说明 | 代表系统 |
|---|---|---|
| 任务驱动协作 | 由明确目标驱动,Agent 分工完成子任务,最终汇总结果 | ChatDev、AutoGen |
| 自治群体交互 | Agent 在共享环境中自由交互,涌现出复杂的社会行为 | 斯坦福小镇 (Generative Agents) |
推荐课程:
① 吴恩达:多智能体系统入门介绍
② HuggingFace Agents Course(系统入门首选)
代表系统精读:
① ChatDev(任务驱动的软件开发多智能体)
② Generative Agents:斯坦福小镇(自治群体交互)
延伸阅读:
① A Survey on LLM-based Autonomous Agents(全景综述)
② Large Language Model based Multi-Agents: A Survey of Progress and Challenges(多智能体专项综述)
多 Agent 协作的基础是通信。不同系统对 Agent 间的消息格式、通信方式有不同设计。
① 自然语言消息(最常见)
② 结构化消息(更可靠)
③ 共享黑板(Blackboard)
④ 工具调用(Tool Call)
关键设计问题:
推荐课程:
① CMU: Agents and Multi-Agent Communication
推荐阅读:
① AutoGen 论文(结构化多 Agent 对话框架)
② CAMEL(角色扮演的多 Agent 通信范式)
Agent 的组织方式决定了任务如何分解、结果如何汇聚、错误如何被发现与纠正。
① 层级式(Hierarchical)
Orchestrator Agent(总指挥)
├── Sub-Agent A(负责子任务 1)
├── Sub-Agent B(负责子任务 2)
└── Sub-Agent C(负责子任务 3)
→ 适合任务边界清晰、需要统一调度的场景
→ 代表:AutoGen GroupChat with Manager、LangGraph supervisor
② 扁平式(Flat / Peer-to-Peer)
Agent A ←→ Agent B ←→ Agent C
→ Agent 平等协商,无中心节点
→ 灵活但容易陷入无效循环,需要设计好终止机制
③ 流水线式(Pipeline)
Agent A → Agent B → Agent C → 输出
→ 每个 Agent 处理上一个的输出,适合有明确先后依赖的任务
→ 代表:ChatDev 的开发流程、RAG pipeline
角色设计的核心原则:
推荐课程:
① DeepLearning.AI:Multi AI Agent Systems with crewAI
推荐阅读:
① CrewAI(角色扮演式多 Agent 框架)
② LangGraph(基于图结构的 Agent 编排)
③ MetaGPT(将公司 SOP 编码为 Agent 协作规范)
Agent 的行动空间(Environment)定义了它能感知什么、能执行什么操作。不同任务对环境的要求差异很大。
① 文本/对话环境
→ Agent 的世界就是消息历史(Context Window)
→ 感知:读取对话历史;行动:生成文本或调用工具
→ 适合:问答、写作、代码生成等纯语言任务
② 工具/代码执行环境
→ Agent 可以调用外部工具:搜索引擎、代码解释器、数据库、API
→ 感知:工具返回结果;行动:选择并调用工具
→ 适合:需要与真实世界交互的任务(如数据分析、网页操作)
→ 代表:OpenAI Code Interpreter、LangChain Tools
③ 模拟/沙盒环境
→ 为 Agent 构建一个模拟的”世界”(如模拟小镇、虚拟代码仓库)
→ 感知:环境状态(位置、物品、其他 Agent 的行为);行动:移动、交互、修改环境
→ 适合:研究 Agent 的社会行为、测试复杂策略
→ 代表:斯坦福小镇(Smallville)、SWE-bench(模拟软件工程任务)
关键挑战:
推荐阅读:
① AgentVerse
② MultiAgentBench
① MobileRun
② UI-TARS
③ AgentCPM-GUI
① Browser Use
② Anthropic Computer Use
① langchain-ai/open_deep_research
② dzhng/deep-research
① OpenClaw
② xiaohongshu-ops-skill(OpenClaw 小红书运营插件)
1. 安装 OpenClaw 本体,配置 LLM API Key
2. 安装小红书 Skill:https://github.com/Xiangyu-CAS/xiaohongshu-ops-skill
3. 扫码绑定小红书账号(仅需一次)
4. 下达自然语言指令,Agent 自动完成热点抓取 → 文案创作 → 定时发布
① ChatLaw
① FinGPT
② FinRobot(金融 Agent 平台,更推荐实战)
⭐ GitHub Stars: 6k+
💡 推荐理由:FinGPT 的 Agent 进阶版,集成 LLM + 强化学习 + 量化分析三大能力,提供完整的投研自动化、交易策略生成、风险评估 Agent pipeline,适合作为金融智能体实战的完整项目模板。
⚠️ 注意:该项目仅适合作为教学 Demo,不构成投资建议,不应用于真实交易决策。
① HuatuoGPT
该项目旨在为初学者提供一条清晰的大模型学习路径,从零基础出发,循序渐进地理解 LLM 的核心原理、训练机制与应用范式,并逐步过渡到智能体(Agent)的构建与基础实践。我们希望在“会用”的基础上,进一步帮助学习者实现“看懂、做出、跑通”。由于我们能力与经验有限,内容难免存在不足,欢迎交流与指正。😀
🧭 你能获得什么从 Big Picture 到 DL / RL、LLM、Agent 的完整学习主线。 |
🧱 这份路线怎么学按阶段推进,每阶段都给出目标、资料与可落地的练习方向。 |
🎯 适合谁适合零基础入门且准备做 LLM或Agent 项目的人。 |
本仓库采用阶段式学习路径(Staged Learning Path),旨在帮助你从零基础逐步成长为具备 LLM 研究能力的开发者。每个阶段都有明确的学习重点和核心目标。
| 阶段 | 学习重点 | 核心目标 |
|---|---|---|
| 🗺️ Stage 0 | Big Picture | 理解整体路径与最终目标 |
| 📚 Stage 1 | DL + RL | 建立深度学习与强化学习基础 |
| 🤖 Stage 2 | LLM | 构建大语言模型并掌握后训练方法 |
| 🧩 Stage 3 | Agent | 构建智能体框架与应用 |
针对不同程度的学习者,本项目建立了两个版本的学习路径供您选择:
在开始学习任何技术细节之前,先建立对整个 LLM 领域的全局认知至关重要。很多初学者容易陷入"学了很多,但不知道自己在哪里"的困境——Stage 0 就是为了避免这种迷失。
本阶段目标: 理解 LLM 的来龙去脉、主流技术路线、以及你自己的学习路径,产出一份个人学习计划。
① LLM 是什么?能做什么?
在深入学习之前,先从宏观视角理解大语言模型:
② LLM 的技术演进脉络
理解历史脉络有助于理解为何现在的技术是这样的:
词向量时代(Word2Vec)
→ RNN / LSTM 序列模型
→ Transformer 架构(2017, Attention is All You Need)
→ BERT(理解型)/ GPT(生成型)
→ 大规模预训练(GPT-3, 175B 参数)
→ 指令对齐(InstructGPT, RLHF)
→ 当代 LLM(ChatGPT, Claude, Gemini...)
李沐精读论文系列
在完成上述内容后,请根据自身情况回答以下问题,写出你的学习计划:
| 问题 | 思考方向 |
|---|---|
| 我的目标是什么? | 做应用开发 / 研究模型 / 理解原理 |
| 我的时间预算? | 每周可投入多少小时 |
| 我的已有基础? | Python 熟练度 / 数学基础(线代、概率) |
| 我计划跳过哪些内容? | 结合目标裁剪路径,避免无效学习 |
💬 建议:把你的学习计划写成一个 Markdown 文件放在本地仓库的专用文件夹,定期回顾和更新。
深度学习是理解 LLM 的基石。本部分帮助你掌握神经网络、反向传播、优化算法等核心概念,为后续学习 Transformer 架构打下坚实基础。
吴恩达:深度学习专项课程
经典论文代码实现
强化学习是 LLM 后训练(RLHF)的核心技术。掌握 RL 基础将帮助你理解如何通过人类反馈优化模型行为。
动画中学强化学习
Hands-on-RL(动手学强化学习)
完成 Stage 1 后,你已具备深度学习与强化学习的基础。Stage 2 的目标是真正理解 LLM 的内部机制,并亲手构建和训练一个语言模型。
本阶段目标: 掌握 Transformer 架构原理 → 理解预训练与后训练方法 → 掌握推理模型 → 从零实现小型 LLM → 在真实大模型上做微调实战 → 拓展到多模态。
在动手写代码之前,必须真正理解 Transformer 的每一个组件——注意力机制不是魔法,它是有数学直觉的。
Attention is All You Need
李宏毅:生成式 AI 时代下的机器学习(LLM 重点章节)
理论学完,动手是关键。这一部分帮助你把前面所学串联起来,亲手训练一个完整的小型语言模型。
① minimind
② LLM-from-scratch (从零实现大模型功能拆解讲述)
完成 Stage 2 后,你已掌握 LLM 的训练、推理与部署。Stage 3 关注如何把模型放进闭环:感知 → 决策 → 行动 → 观察 → 更新状态,直至任务完成。
本阶段目标: 从范式上区分“聊天模型”与“行动者”→ 掌握规划(任务分解、动态规划与反思)、记忆(短期/长期记忆管理)与工具调用的核心能力 → 理解多智能体的协议、组织与环境 → 跟跑至少一个开源项目,并自选垂直场景深入。
定义: 智能体(Agent)被定义为一种能够感知环境、进行推理、自主决策并采取行动以实现特定目标的系统。
与普通 Chatbot 的区别:
| Chatbot | Agent |
|---|---|
| 被动响应用户输入 | 主动规划并执行任务 |
| 单轮或有限轮对话 | 多轮迭代直至目标达成 |
| 仅依赖内置知识 | 可调外部工具获取实时信息 |
能力边界:
✅ 能做到:多步推理与规划、调用外部工具扩展能力、与环境/用户持续交互、利用长期记忆保持上下文。
❌ 做不到:完全自主设定目标(仍需人类定义任务)、真正的理解与意识(仍是模式匹配)。
李宏毅:一堂课搞懂 AI Agent 的原理
langchain-ai/open_deep_research
UI-TARS
Browser Use
① OpenClaw
② xiaohongshu-ops-skill(OpenClaw 小红书运营插件)
1. 安装 OpenClaw 本体,配置 LLM API Key
2. 安装小红书 Skill:https://github.com/Xiangyu-CAS/xiaohongshu-ops-skill
3. 扫码绑定小红书账号(仅需一次)
4. 下达自然语言指令,Agent 自动完成热点抓取 → 文案创作 → 定时发布
在开始学习任何技术细节之前,先建立对整个 LLM 领域的全局认知至关重要。很多初学者容易陷入"学了很多,但不知道自己在哪里"的困境——Stage 0 就是为了避免这种迷失。
本阶段目标: 理解 LLM 的来龙去脉、主流技术路线、以及你自己的学习路径,产出一份个人学习计划。
① LLM 是什么?能做什么?
在深入学习之前,先从宏观视角理解大语言模型:
② LLM 的技术演进脉络
理解历史脉络有助于理解为何现在的技术是这样的:
词向量时代(Word2Vec)
→ RNN / LSTM 序列模型
→ Transformer 架构(2017, Attention is All You Need)
→ BERT(理解型)/ GPT(生成型)
→ 大规模预训练(GPT-3, 175B 参数)
→ 指令对齐(InstructGPT, RLHF)
→ 当代 LLM(ChatGPT, Claude, Gemini...)
① 李沐精读论文系列(必看)
② Andrej Karpathy:Neural Networks: Zero to Hero
在完成上述内容后,请根据自身情况回答以下问题,写出你的学习计划:
| 问题 | 思考方向 |
|---|---|
| 我的目标是什么? | 做应用开发 / 研究模型 / 理解原理 |
| 我的时间预算? | 每周可投入多少小时 |
| 我的已有基础? | Python 熟练度 / 数学基础(线代、概率) |
| 我计划跳过哪些内容? | 结合目标裁剪路径,避免无效学习 |
💬 建议:把你的学习计划写成一个 Markdown 文件放在本地仓库的专用文件夹,定期回顾和更新。
深度学习是理解 LLM 的基石。本部分帮助你掌握神经网络、反向传播、优化算法等核心概念,为后续学习 Transformer 架构打下坚实基础。
① 吴恩达:深度学习专项课程
② 李沐:动手学深度学习
① 经典论文代码实现(强烈推荐)
② 可视化学习网站
强化学习是 LLM 后训练(RLHF)的核心技术。掌握 RL 基础将帮助你理解如何通过人类反馈优化模型行为。
① 动画中学强化学习(最容易理解)
② 李宏毅:强化学习课程
③ 王树森:深度强化学习(DRL)
① Hands-on-RL(动手学强化学习)
② easy-rl(强化学习中文教程)
完成 Stage 1 后,你已具备深度学习与强化学习的基础。Stage 2 的目标是真正理解 LLM 的内部机制,并亲手构建和训练一个语言模型。
本阶段目标: 掌握 Transformer 架构原理 → 理解预训练与后训练方法 → 掌握推理模型 → 从零实现小型 LLM → 在真实大模型上做微调实战 → 拓展到多模态。
在动手写代码之前,必须真正理解 Transformer 的每一个组件——注意力机制不是魔法,它是有数学直觉的。
① Attention is All You Need(2017,必读)
② The Illustrated Transformer(最直观的图解)
李宏毅:生成式 AI 时代下的机器学习(LLM 重点章节)
Andrej Karpathy:Let's build GPT from scratch
预训练是 LLM 能力的来源。理解预训练的目标函数、数据处理和训练技巧,是研究 LLM 的必要基础。
核心概念:
① Scaling Laws for Neural Language Models(必读论文)
② LLaMA 技术报告(工程实践参考)
预训练后的模型只会"续写文本",后训练让模型变得"听话"且"有用"。这是当前 LLM 研究最活跃的方向之一。
后训练技术路线:
预训练模型(Base Model)
→ SFT 监督微调:用高质量对话数据教模型"怎么回答"
→ RM 奖励模型训练:学习人类对回答质量的偏好
→ RLHF / PPO:用 RL 让模型最大化奖励,对齐人类期望
→ DPO:更简洁的对齐方案,无需显式 RM
① InstructGPT 论文(RLHF 的奠基之作)
② DPO 论文(更简洁的对齐方法)
传统 LLM 是"快思考"模型,直接输出答案。推理模型引入"慢思考"机制,通过显式的推理过程(如思维链、自我反思)来提升复杂问题的求解能力。
核心思想: 让模型在回答前先"思考"——生成中间推理步骤,而不是直接给出答案。这类似人类的 System 2 思维(深思熟虑),而非 System 1(直觉反应)。
代表模型:
① DeepSeek-R1 技术报告(必读)
② Chain-of-Thought Prompting(思维链提示)
③ 代码实践:OpenR(开源推理模型训练框架)
理论学完,动手是关键。这一部分帮助你把前面所学串联起来,亲手训练一个完整的小型语言模型。
① nanoGPT(最推荐的起点)
② minimind(中文小模型全流程实现)
③ LLM-from-scratch (从零实现大模型功能拆解讲述)
推荐学习顺序:
在真实大模型上做实验,是从"理解原理"到"工程落地"的关键一步。
全量微调大模型成本极高,PEFT 方法只训练少量参数,即可达到接近全量微调的效果。
① LoRA(最主流的高效微调方法)
② LLaMA-Factory(一站式微调框架)
③ veRL(大规模 RLHF 训练框架)
① Ollama(本地运行大模型最简单的方式)
② vLLM(高性能推理框架)
纯文本 LLM 之外,多模态模型能够同时理解图像、视频、音频等信息。这是当前前沿研究和产品落地最活跃的方向之一。
多模态的核心问题: 如何把不同模态的信息"对齐"到同一个语义空间,让语言模型能够理解图像?
模态融合的主流架构:
图像编码器(Vision Encoder,如 ViT / CLIP)
→ 将图像切成 Patch,编码为向量序列
→ 投影层(Projector):把视觉 token 映射到语言模型的词向量空间
→ 语言模型(LLM):统一处理文字 + 图像 token,生成回答
① CLIP(视觉-语言对齐的奠基之作)
② LLaVA(最具影响力的开源多模态模型)
③ Qwen-VL 技术报告(工程实践参考)
LLaVA 官方仓库
完成 Stage 2 后,你已掌握 LLM 的训练、推理与部署。Stage 3 关注如何把模型放进闭环:感知 → 决策 → 行动 → 观察 → 更新状态,直至任务完成。
本阶段目标: 从范式上区分“聊天模型”与“行动者”→ 掌握规划(任务分解、动态规划与反思)、记忆(短期/长期记忆管理)与工具调用的核心能力 → 理解多智能体的协议、组织与环境 → 跟跑至少一个开源项目,并自选垂直场景深入。
定义: 智能体(Agent)被定义为一种能够感知环境、进行推理、自主决策并采取行动以实现特定目标的系统。
与普通 Chatbot 的区别:
| Chatbot | Agent |
|---|---|
| 被动响应用户输入 | 主动规划并执行任务 |
| 单轮或有限轮对话 | 多轮迭代直至目标达成 |
| 仅依赖内置知识 | 可调外部工具获取实时信息 |
能力边界:
✅ 能做到:多步推理与规划、调用外部工具扩展能力、与环境/用户持续交互、利用长期记忆保持上下文。
❌ 做不到:完全自主设定目标(仍需人类定义任务)、真正的理解与意识(仍是模式匹配)。
① 李宏毅:一堂课搞懂 AI Agent 的原理
② 吴恩达:Agentic AI
③ Lilian Weng:LLM Powered Autonomous Agents
④ Agent 领域综述
Agent 的本质是“系统”而非“模型”,LLM 提供推理能力,而系统架构决定 Agent 能否从“对话”走向“行动”。这涉及三个核心能力——规划、记忆和工具调用。
规划 (Planning):决定任务如何分解、执行顺序如何安排、遇到错误如何调整。包括任务拆解(将复杂目标拆分为可执行的子任务链)、动态规划(ReAct 模式的推理-行动-观察循环)和自我反思(从失败中学习并优化策略)。
记忆 (Memory):管理信息的存储与检索。短期记忆利用上下文窗口记录当前对话状态;长期记忆通过向量数据库存储历史经验或专业知识,随取随用。
工具调用 (Tool Use):让 Agent 能操作外部环境。通过 API 调用搜索引擎、运行代码、访问数据库等,需要约定清晰的接口规范、权限控制和错误处理机制。
规划(Planning)是 Agent 的"大脑",决定任务如何分解、执行顺序如何安排、遇到错误如何调整。好的规划能力让 Agent 从单次响应走向多步迭代,从被动执行走向主动优化。
任务分解:
将复杂目标拆分为可管理的子任务链。例如“帮我写一篇行业分析报告”可分解为:确定主题→搜集资料→整理大纲→撰写各章节→审核修改。每个子任务有明确的输入、输出和验收标准,便于 Agent 逐一执行和检查进度。
动态规划与反思:
ReAct 模式:推理(Reasoning)→ 行动(Action)→ 观察(Observation)→ 再推理的循环。Agent 在每一步行动前先思考"我需要做什么",执行后观察结果,再决定下一步。这种"思考-行动-反馈"的闭环让 Agent 能根据环境反馈调整策略。
自我反思(Self-Reflection):当行动结果不达标或出现错误时,Agent 能分析失败原因、总结教训并调整后续计划。Reflexion 等框架通过将失败经验存入记忆,让 Agent 在类似场景下避免重复犯错。
推荐阅读:
① ReAct
② Plan-and-Solve Prompting
③ Reflexion
本节探讨 Agent 如何管理信息的存储与流动:短期(工作)记忆关注在有限上下文窗口内如何保留关键信息,长期记忆解决跨会话的知识持久化与检索,RAG 则负责将外部知识库实时接入推理过程。
短期(工作)记忆:
上下文窗口有限,只能保留最近的对话。常用策略:
长期记忆:
RAG 技术(检索增强生成):
推荐阅读:
① MemGPT
② Anthropic:Effective Context Engineering for AI Agents
③ Claude-Mem
④ Mem0
⑤ Agent Memory 综述(长文 PDF,选读)
⑥ LangChain 文档:RAG
工具是什么:把外部能力封装成可调用的函数
工具是 Agent 的“手脚”:搜索、计算器、访问数据库、发消息等。除了名字和说明要清楚,还要约定入参/出参、超时、重试、是否改数据、给多大权限。
工具设计原则:
search_weather 优于 func_01;常见工具类型:
| 类型 | 示例 | 用途 |
|---|---|---|
| 信息获取 | 搜索引擎、天气查询、数据库查询 | 补充模型知识盲点 |
| 操作执行 | 发送邮件、创建日程、文件操作 | 与外部系统交互 |
| 计算处理 | 计算器、代码执行器、数据分析 | 处理精确计算任务 |
| 决策辅助 | 风险评估、合规检查、评分系统 | 提供结构化判断 |
工具 vs 技能(Tool vs Skill):
在实际项目中,Skill 往往对应一个可复用的能力模块,通过组合不同 Tool 实现完整场景闭环。
推荐阅读:
① OpenAI:Function Calling 指南
② Anthropic:Tool Use 概览
③ Model Context Protocol(MCP)
④ Agent Skills with Anthropic
多智能体系统(Multi-Agent System,MAS)是指由多个具有自主决策能力的 AI Agent 协同完成复杂任务的系统。多 Agent 的核心优势在于任务分解、角色专业化与并行执行。
核心思想: 将一个复杂任务拆解给多个具有不同角色或能力的 Agent,让它们通过协作共同完成目标——类似于一个软件开发团队,产品经理、程序员、测试员各司其职。
两种典型范式:
| 范式 | 说明 | 代表系统 |
|---|---|---|
| 任务驱动协作 | 由明确目标驱动,Agent 分工完成子任务,最终汇总结果 | ChatDev、AutoGen |
| 自治群体交互 | Agent 在共享环境中自由交互,涌现出复杂的社会行为 | 斯坦福小镇 (Generative Agents) |
推荐课程:
① 吴恩达:多智能体系统入门介绍
② HuggingFace Agents Course(系统入门首选)
代表系统精读:
① ChatDev(任务驱动的软件开发多智能体)
② Generative Agents:斯坦福小镇(自治群体交互)
延伸阅读:
① A Survey on LLM-based Autonomous Agents(全景综述)
② Large Language Model based Multi-Agents: A Survey of Progress and Challenges(多智能体专项综述)
多 Agent 协作的基础是通信。不同系统对 Agent 间的消息格式、通信方式有不同设计。
① 自然语言消息(最常见)
② 结构化消息(更可靠)
③ 共享黑板(Blackboard)
④ 工具调用(Tool Call)
关键设计问题:
推荐课程:
① CMU: Agents and Multi-Agent Communication
推荐阅读:
① AutoGen 论文(结构化多 Agent 对话框架)
② CAMEL(角色扮演的多 Agent 通信范式)
Agent 的组织方式决定了任务如何分解、结果如何汇聚、错误如何被发现与纠正。
① 层级式(Hierarchical)
Orchestrator Agent(总指挥)
├── Sub-Agent A(负责子任务 1)
├── Sub-Agent B(负责子任务 2)
└── Sub-Agent C(负责子任务 3)
→ 适合任务边界清晰、需要统一调度的场景
→ 代表:AutoGen GroupChat with Manager、LangGraph supervisor
② 扁平式(Flat / Peer-to-Peer)
Agent A ←→ Agent B ←→ Agent C
→ Agent 平等协商,无中心节点
→ 灵活但容易陷入无效循环,需要设计好终止机制
③ 流水线式(Pipeline)
Agent A → Agent B → Agent C → 输出
→ 每个 Agent 处理上一个的输出,适合有明确先后依赖的任务
→ 代表:ChatDev 的开发流程、RAG pipeline
角色设计的核心原则:
推荐课程:
① DeepLearning.AI:Multi AI Agent Systems with crewAI
推荐阅读:
① CrewAI(角色扮演式多 Agent 框架)
② LangGraph(基于图结构的 Agent 编排)
③ MetaGPT(将公司 SOP 编码为 Agent 协作规范)
Agent 的行动空间(Environment)定义了它能感知什么、能执行什么操作。不同任务对环境的要求差异很大。
① 文本/对话环境
→ Agent 的世界就是消息历史(Context Window)
→ 感知:读取对话历史;行动:生成文本或调用工具
→ 适合:问答、写作、代码生成等纯语言任务
② 工具/代码执行环境
→ Agent 可以调用外部工具:搜索引擎、代码解释器、数据库、API
→ 感知:工具返回结果;行动:选择并调用工具
→ 适合:需要与真实世界交互的任务(如数据分析、网页操作)
→ 代表:OpenAI Code Interpreter、LangChain Tools
③ 模拟/沙盒环境
→ 为 Agent 构建一个模拟的”世界”(如模拟小镇、虚拟代码仓库)
→ 感知:环境状态(位置、物品、其他 Agent 的行为);行动:移动、交互、修改环境
→ 适合:研究 Agent 的社会行为、测试复杂策略
→ 代表:斯坦福小镇(Smallville)、SWE-bench(模拟软件工程任务)
关键挑战:
推荐阅读:
① AgentVerse
② MultiAgentBench
① MobileRun
② UI-TARS
③ AgentCPM-GUI
① Browser Use
② Anthropic Computer Use
① langchain-ai/open_deep_research
② dzhng/deep-research
① OpenClaw
② xiaohongshu-ops-skill(OpenClaw 小红书运营插件)
1. 安装 OpenClaw 本体,配置 LLM API Key
2. 安装小红书 Skill:https://github.com/Xiangyu-CAS/xiaohongshu-ops-skill
3. 扫码绑定小红书账号(仅需一次)
4. 下达自然语言指令,Agent 自动完成热点抓取 → 文案创作 → 定时发布
① ChatLaw
① FinGPT
② FinRobot(金融 Agent 平台,更推荐实战)
⭐ GitHub Stars: 6k+
💡 推荐理由:FinGPT 的 Agent 进阶版,集成 LLM + 强化学习 + 量化分析三大能力,提供完整的投研自动化、交易策略生成、风险评估 Agent pipeline,适合作为金融智能体实战的完整项目模板。
⚠️ 注意:该项目仅适合作为教学 Demo,不构成投资建议,不应用于真实交易决策。
① HuatuoGPT