从零走向AGI之路!!!旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。涵盖AI Agent、RAG、MCP、具身智能、大语言模型、多模态、数字人、AI绘画、AI视频等!!
See the code一个面向 AI 学习者、开发者与研究者的中文开源知识库,系统覆盖 LLM、多模态、AI 生成、Agent、具身智能、模型部署与项目实战。
如果这个项目对你有帮助,欢迎点亮 Star。你的支持是持续更新的重要动力。
AI 技术发展很快,但学习资料往往分散在论文、博客、课程、开源项目和产品新闻中。From Zero to AGI 希望把这些碎片重新组织成一套长期可学习、可检索、可实践的知识体系。
本仓库不只追踪“最近发布了什么”,更关注:
仓库内容由 猫先生 of「魔方AI空间」 持续维护。公众号负责追踪前沿与发布深度文章,GitHub 仓库负责结构化沉淀、学习编排和项目复现。
公众号前沿解读 → GitHub 系统沉淀 → 项目代码实践 → 建立完整 AI 认知
先通过核心内容地图定位学习方向,再进入对应章节系统学习;每个板块同时提供公众号深度阅读和相关项目实践,帮助你从概念理解走向工程落地。
[!TIP] 本仓库以大模型及其延伸方向为主。具备 Python 和神经网络基础后,建议从 大语言模型基础 开始;已经掌握 Transformer,可以直接进入 多模态大模型基础、AI 智能体或具身智能方向。
AI 与深度学习基础
↓
Transformer 与 LLM
↓
多模态理解与生成
↓
Agent / RAG / MCP
↓
具身智能与世界模型
↓
推理部署与项目实战
| 学习目标 | 推荐路径 |
|---|---|
| 大模型入门 | Python 与神经网络基础 → Transformer → LLM 基础 |
| 理解大模型原理 | Token 与 Embedding → Attention → Transformer → 预训练 → 对齐 → 推理与评测 |
| 开发 AI 应用 | LLM → Prompt → RAG → Agent → MCP / Skills → 部署 |
| 学习多模态与视频 | 视觉编码器 → 跨模态对齐 → VLM → 多模态生成 → 视频理解与生成 |
| 研究具身智能 | VLM → VLN / VLA → 世界模型 → 机器人数据 → 仿真、控制与评测 |
| 面向工程落地 | 模型基础 → 推理优化 → 分布式并行 → Serving → 项目实战 |
| 板块 | 核心知识 | 状态 | 板块入口 |
|---|---|---|---|
| 01. AI 入门基础 | Python、机器学习、深度学习、NLP、CV、目标检测 | 持续更新 | 进入板块 |
| 02. 大语言模型基础 | Token、Embedding、Transformer、Attention、MoE、预训练、微调、RLHF、推理、评测 | 已上线 | 进入板块 |
| 03. 多模态大模型基础 | 视觉编码器、连接器、VLM、统一多模态、视频、音频、多模态训练与评测 | 已上线 | 进入板块 |
| 04. AI 图像生成 | Diffusion、DiT、LoRA、ControlNet、图像编辑、一致性生成 | 构建中 | 进入板块 |
| 05. AI 视频生成 | 视频扩散、时空建模、可控生成、视频编辑、长视频、音视频联合生成 | 持续更新 | 进入板块 |
| 06. 数字人 | 肖像动画、语音驱动、口型同步、动作控制、情感表达 | 构建中 | 进入板块 |
| 07. Agent | 检索、工具调用、MCP、A2A、Skills、Memory、Harness、Agentic RL | 构建中 | 进入板块 |
| 08. 具身智能 | VLM、VLN、VLA、世界模型、机器人数据、仿真、控制与评测 | 构建中 | 进入板块 |
| 09. 大模型推理与部署 | 量化、推理框架、并行策略、KV Cache、PD 分离、Serving | 构建中 | 进入板块 |
| 10. 项目实战 | Transformer、文生视频、多模态系统、Agent 与具身部署 | 持续更新 | 进入板块 |
这一部分建立理解现代 AI 系统所需的共同语言,从编程、神经网络和经典计算机视觉逐步走向生成式 AI。
核心知识节点
Python → 机器学习 → 神经网络 → NLP / CV → Transformer 前置知识
板块内容
从文本如何变成 Token 开始,逐步理解现代大语言模型的架构、训练、对齐、推理和评测。
核心知识节点
LLM 概念 → Token / Embedding → Transformer → Attention → 位置编码
→ 主流架构 → MoE → 预训练 → 指令微调 → RLHF → 推理 → Prompt → 评测
板块内容
理解文本、图像、视频和音频如何被编码、对齐、生成,并进一步连接到推理和行动系统。
核心知识节点
多模态概念 → 视觉编码器 → LLM 底座 → 跨模态连接器 → VLM
→ 多模态生成 → 视频 / 音频 → 数据与训练 → 评测 → 多模态 Agent
板块内容
从扩散模型基础出发,理解文生图、图像编辑、可控生成、个性化微调和统一视觉生成。
核心知识节点
Diffusion → Latent Diffusion → DiT → 文生图 → LoRA / ControlNet
→ 图像编辑 → 主体与风格一致性 → 统一生成模型
板块入口:AI 图像生成
系统学习视频的时空表示、扩散与 Transformer 架构、可控生成、视频编辑、长视频叙事及音视频联合建模。
核心知识节点
视频表示 → Video Diffusion / DiT → 时空建模 → 条件与运动控制
→ 视频编辑 → 长视频与多镜头 → 音视频联合生成 → 评测与实践
板块内容
关注人物外观、声音、表情与动作之间的跨模态驱动,理解数字人从“会说话”到“自然表达”的完整链路。
核心知识节点
语音识别 / 合成 → 肖像动画 → 口型同步 → 表情与情感驱动
→ 人体视频生成 → 实时交互 → 数字人系统
板块入口:数字人
让大模型从“回答问题”走向“检索信息、调用工具、积累经验并持续完成任务”。
核心知识节点
RAG → Agent → 工具调用 → MCP / A2A → Skills → Memory
→ Context Engineering → Harness → Loop Engineering → Agentic RL → Multi-Agent
板块入口:Agent
研究智能体如何在物理世界中感知、推理、规划和行动,并通过数据与环境交互持续学习。
核心知识节点
VLM → VLN / VA / VLA → 机器人策略 → 世界模型 → 机器人数据
→ 遥操作与示范学习 → 仿真与 Sim-to-Real → 控制 → 评测与部署
板块入口:具身智能
关注模型如何从研究和 Demo 走向稳定、低成本、可扩展的生产系统。
核心知识节点
模型压缩与量化 → KV Cache / Attention 优化 → 推理框架
→ DP / TP / PP / CP / EP / SP → PD 分离 → 分布式 Serving → 监控与评测
板块入口:大模型推理与部署
实战的目标不是“把接口调用成功”,而是完成一个目标明确、可以运行、能够评测和复现的技术闭环。
| 项目 | 学习目标 | 技术栈 | 入口 |
|---|---|---|---|
| From-Zero-to-Transformer | 从零理解并训练约 51M 参数的语言模型 | Python、PyTorch、Transformer | 查看项目 |
| From-Zero-to-small-T2V | 理解文本条件视频生成、数据构造与训练闭环 | Python、PyTorch、GAN | 查看项目 |
| From-Zero-to-OpenClaw | 探索 Agent 系统的配置、容器化与部署 | Docker、OpenClaw | 查看项目 |
「魔方AI空间」长期分享 LLM、多模态、AI 视频、Agent、具身智能、开源项目与工程实践。仓库负责沉淀系统知识,公众号同步更新前沿解读与深度文章。
| 渠道 | 入口 |
|---|---|
| 微信公众号 | 微信搜索 魔方AI空间 · 查看公众号代表文章 |
| CSDN | 猫先生的技术博客 |
| 知乎 | 猫先生 |
| 飞书知识库 | AIGCmagic 知识库 |
| 知识星球 | AIGCmagic 社区 |
| 【三年面试五年模拟】面试面经 | Interview for Algorithm Engineer |
如果你希望获取更多 AI 前沿资料、深度内容与社区交流,可以扫码加入 AIGCmagic 知识星球。
如果你发现内容错误、失效链接或值得补充的技术方向,欢迎通过 Issue 告诉我们。
本项目采用 GNU General Public License v3.0。引用、转载或二次创作仓库内容时,请保留原作者和项目来源。
长期主义不是追完所有热点,而是逐步建立能够解释变化的知识体系。
关注「魔方AI空间」,持续获取前沿技术解读、系统综述与项目实践。
115 commits
Jupyter Notebook
83.4%
Python
15.2%
Dockerfile
1.2%
从零走向AGI之路!!!旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。涵盖AI Agent、RAG、MCP、具身智能、大语言模型、多模态、数字人、AI绘画、AI视频等!!
See the code一个面向 AI 学习者、开发者与研究者的中文开源知识库,系统覆盖 LLM、多模态、AI 生成、Agent、具身智能、模型部署与项目实战。
如果这个项目对你有帮助,欢迎点亮 Star。你的支持是持续更新的重要动力。
AI 技术发展很快,但学习资料往往分散在论文、博客、课程、开源项目和产品新闻中。From Zero to AGI 希望把这些碎片重新组织成一套长期可学习、可检索、可实践的知识体系。
本仓库不只追踪“最近发布了什么”,更关注:
仓库内容由 猫先生 of「魔方AI空间」 持续维护。公众号负责追踪前沿与发布深度文章,GitHub 仓库负责结构化沉淀、学习编排和项目复现。
公众号前沿解读 → GitHub 系统沉淀 → 项目代码实践 → 建立完整 AI 认知
先通过核心内容地图定位学习方向,再进入对应章节系统学习;每个板块同时提供公众号深度阅读和相关项目实践,帮助你从概念理解走向工程落地。
[!TIP] 本仓库以大模型及其延伸方向为主。具备 Python 和神经网络基础后,建议从 大语言模型基础 开始;已经掌握 Transformer,可以直接进入 多模态大模型基础、AI 智能体或具身智能方向。
AI 与深度学习基础
↓
Transformer 与 LLM
↓
多模态理解与生成
↓
Agent / RAG / MCP
↓
具身智能与世界模型
↓
推理部署与项目实战
| 学习目标 | 推荐路径 |
|---|---|
| 大模型入门 | Python 与神经网络基础 → Transformer → LLM 基础 |
| 理解大模型原理 | Token 与 Embedding → Attention → Transformer → 预训练 → 对齐 → 推理与评测 |
| 开发 AI 应用 | LLM → Prompt → RAG → Agent → MCP / Skills → 部署 |
| 学习多模态与视频 | 视觉编码器 → 跨模态对齐 → VLM → 多模态生成 → 视频理解与生成 |
| 研究具身智能 | VLM → VLN / VLA → 世界模型 → 机器人数据 → 仿真、控制与评测 |
| 面向工程落地 | 模型基础 → 推理优化 → 分布式并行 → Serving → 项目实战 |
| 板块 | 核心知识 | 状态 | 板块入口 |
|---|---|---|---|
| 01. AI 入门基础 | Python、机器学习、深度学习、NLP、CV、目标检测 | 持续更新 | 进入板块 |
| 02. 大语言模型基础 | Token、Embedding、Transformer、Attention、MoE、预训练、微调、RLHF、推理、评测 | 已上线 | 进入板块 |
| 03. 多模态大模型基础 | 视觉编码器、连接器、VLM、统一多模态、视频、音频、多模态训练与评测 | 已上线 | 进入板块 |
| 04. AI 图像生成 | Diffusion、DiT、LoRA、ControlNet、图像编辑、一致性生成 | 构建中 | 进入板块 |
| 05. AI 视频生成 | 视频扩散、时空建模、可控生成、视频编辑、长视频、音视频联合生成 | 持续更新 | 进入板块 |
| 06. 数字人 | 肖像动画、语音驱动、口型同步、动作控制、情感表达 | 构建中 | 进入板块 |
| 07. Agent | 检索、工具调用、MCP、A2A、Skills、Memory、Harness、Agentic RL | 构建中 | 进入板块 |
| 08. 具身智能 | VLM、VLN、VLA、世界模型、机器人数据、仿真、控制与评测 | 构建中 | 进入板块 |
| 09. 大模型推理与部署 | 量化、推理框架、并行策略、KV Cache、PD 分离、Serving | 构建中 | 进入板块 |
| 10. 项目实战 | Transformer、文生视频、多模态系统、Agent 与具身部署 | 持续更新 | 进入板块 |
这一部分建立理解现代 AI 系统所需的共同语言,从编程、神经网络和经典计算机视觉逐步走向生成式 AI。
核心知识节点
Python → 机器学习 → 神经网络 → NLP / CV → Transformer 前置知识
板块内容
从文本如何变成 Token 开始,逐步理解现代大语言模型的架构、训练、对齐、推理和评测。
核心知识节点
LLM 概念 → Token / Embedding → Transformer → Attention → 位置编码
→ 主流架构 → MoE → 预训练 → 指令微调 → RLHF → 推理 → Prompt → 评测
板块内容
理解文本、图像、视频和音频如何被编码、对齐、生成,并进一步连接到推理和行动系统。
核心知识节点
多模态概念 → 视觉编码器 → LLM 底座 → 跨模态连接器 → VLM
→ 多模态生成 → 视频 / 音频 → 数据与训练 → 评测 → 多模态 Agent
板块内容
从扩散模型基础出发,理解文生图、图像编辑、可控生成、个性化微调和统一视觉生成。
核心知识节点
Diffusion → Latent Diffusion → DiT → 文生图 → LoRA / ControlNet
→ 图像编辑 → 主体与风格一致性 → 统一生成模型
板块入口:AI 图像生成
系统学习视频的时空表示、扩散与 Transformer 架构、可控生成、视频编辑、长视频叙事及音视频联合建模。
核心知识节点
视频表示 → Video Diffusion / DiT → 时空建模 → 条件与运动控制
→ 视频编辑 → 长视频与多镜头 → 音视频联合生成 → 评测与实践
板块内容
关注人物外观、声音、表情与动作之间的跨模态驱动,理解数字人从“会说话”到“自然表达”的完整链路。
核心知识节点
语音识别 / 合成 → 肖像动画 → 口型同步 → 表情与情感驱动
→ 人体视频生成 → 实时交互 → 数字人系统
板块入口:数字人
让大模型从“回答问题”走向“检索信息、调用工具、积累经验并持续完成任务”。
核心知识节点
RAG → Agent → 工具调用 → MCP / A2A → Skills → Memory
→ Context Engineering → Harness → Loop Engineering → Agentic RL → Multi-Agent
板块入口:Agent
研究智能体如何在物理世界中感知、推理、规划和行动,并通过数据与环境交互持续学习。
核心知识节点
VLM → VLN / VA / VLA → 机器人策略 → 世界模型 → 机器人数据
→ 遥操作与示范学习 → 仿真与 Sim-to-Real → 控制 → 评测与部署
板块入口:具身智能
关注模型如何从研究和 Demo 走向稳定、低成本、可扩展的生产系统。
核心知识节点
模型压缩与量化 → KV Cache / Attention 优化 → 推理框架
→ DP / TP / PP / CP / EP / SP → PD 分离 → 分布式 Serving → 监控与评测
板块入口:大模型推理与部署
实战的目标不是“把接口调用成功”,而是完成一个目标明确、可以运行、能够评测和复现的技术闭环。
| 项目 | 学习目标 | 技术栈 | 入口 |
|---|---|---|---|
| From-Zero-to-Transformer | 从零理解并训练约 51M 参数的语言模型 | Python、PyTorch、Transformer | 查看项目 |
| From-Zero-to-small-T2V | 理解文本条件视频生成、数据构造与训练闭环 | Python、PyTorch、GAN | 查看项目 |
| From-Zero-to-OpenClaw | 探索 Agent 系统的配置、容器化与部署 | Docker、OpenClaw | 查看项目 |
「魔方AI空间」长期分享 LLM、多模态、AI 视频、Agent、具身智能、开源项目与工程实践。仓库负责沉淀系统知识,公众号同步更新前沿解读与深度文章。
| 渠道 | 入口 |
|---|---|
| 微信公众号 | 微信搜索 魔方AI空间 · 查看公众号代表文章 |
| CSDN | 猫先生的技术博客 |
| 知乎 | 猫先生 |
| 飞书知识库 | AIGCmagic 知识库 |
| 知识星球 | AIGCmagic 社区 |
| 【三年面试五年模拟】面试面经 | Interview for Algorithm Engineer |
如果你希望获取更多 AI 前沿资料、深度内容与社区交流,可以扫码加入 AIGCmagic 知识星球。
如果你发现内容错误、失效链接或值得补充的技术方向,欢迎通过 Issue 告诉我们。
本项目采用 GNU General Public License v3.0。引用、转载或二次创作仓库内容时,请保留原作者和项目来源。
长期主义不是追完所有热点,而是逐步建立能够解释变化的知识体系。
关注「魔方AI空间」,持续获取前沿技术解读、系统综述与项目实践。
115 commits
Jupyter Notebook
83.4%
Python
15.2%
Dockerfile
1.2%