AI-mzq/From-Zero-to-AGI

从零走向AGI之路!!!旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。涵盖AI Agent、RAG、MCP、具身智能、大语言模型、多模态、数字人、AI绘画、AI视频等!!

Jupyter Notebook

268

115 commits

updated Sep 21, 2026

See the code

README

From Zero to AGI

从基础认知到智能系统,构建完整的 AI 学习路线

一个面向 AI 学习者、开发者与研究者的中文开源知识库,系统覆盖 LLM、多模态、AI 生成、Agent、具身智能、模型部署与项目实战

GitHub stars GitHub last commit License 公众号

开始学习 · 多模态路线 · 项目实战 · 项目主页

如果这个项目对你有帮助,欢迎点亮 Star。你的支持是持续更新的重要动力。

从零走向 AGI 学习路线图

🎯 项目介绍

AI 技术发展很快,但学习资料往往分散在论文、博客、课程、开源项目和产品新闻中。From Zero to AGI 希望把这些碎片重新组织成一套长期可学习、可检索、可实践的知识体系。

本仓库不只追踪“最近发布了什么”,更关注:

  • 一个概念在完整技术体系中的位置是什么?
  • 不同模型和方法之间如何演进、继承与分化?
  • 从基础原理到工程系统,应该按照什么顺序学习?
  • 哪些论文、文章和项目值得长期保留与反复阅读?

仓库内容由 猫先生 of「魔方AI空间」 持续维护。公众号负责追踪前沿与发布深度文章,GitHub 仓库负责结构化沉淀、学习编排和项目复现。

公众号前沿解读 → GitHub 系统沉淀 → 项目代码实践 → 建立完整 AI 认知

🧭 如何使用这个仓库

先通过核心内容地图定位学习方向,再进入对应章节系统学习;每个板块同时提供公众号深度阅读和相关项目实践,帮助你从概念理解走向工程落地。

[!TIP] 本仓库以大模型及其延伸方向为主。具备 Python 和神经网络基础后,建议从 大语言模型基础 开始;已经掌握 Transformer,可以直接进入 多模态大模型基础、AI 智能体或具身智能方向。

🛤️ 推荐学习路线

主学习路线

AI 与深度学习基础
        ↓
Transformer 与 LLM
        ↓
多模态理解与生成
        ↓
Agent / RAG / MCP
        ↓
具身智能与世界模型
        ↓
推理部署与项目实战

按学习目标选择

学习目标推荐路径
大模型入门Python 与神经网络基础 → Transformer → LLM 基础
理解大模型原理Token 与 Embedding → Attention → Transformer → 预训练 → 对齐 → 推理与评测
开发 AI 应用LLM → Prompt → RAG → Agent → MCP / Skills → 部署
学习多模态与视频视觉编码器 → 跨模态对齐 → VLM → 多模态生成 → 视频理解与生成
研究具身智能VLM → VLN / VLA → 世界模型 → 机器人数据 → 仿真、控制与评测
面向工程落地模型基础 → 推理优化 → 分布式并行 → Serving → 项目实战

🗺️ 完整核心内容地图

板块核心知识状态板块入口
01. AI 入门基础Python、机器学习、深度学习、NLP、CV、目标检测持续更新进入板块
02. 大语言模型基础Token、Embedding、Transformer、Attention、MoE、预训练、微调、RLHF、推理、评测已上线进入板块
03. 多模态大模型基础视觉编码器、连接器、VLM、统一多模态、视频、音频、多模态训练与评测已上线进入板块
04. AI 图像生成Diffusion、DiT、LoRA、ControlNet、图像编辑、一致性生成构建中进入板块
05. AI 视频生成视频扩散、时空建模、可控生成、视频编辑、长视频、音视频联合生成持续更新进入板块
06. 数字人肖像动画、语音驱动、口型同步、动作控制、情感表达构建中进入板块
07. Agent检索、工具调用、MCP、A2A、Skills、Memory、Harness、Agentic RL构建中进入板块
08. 具身智能VLM、VLN、VLA、世界模型、机器人数据、仿真、控制与评测构建中进入板块
09. 大模型推理与部署量化、推理框架、并行策略、KV Cache、PD 分离、Serving构建中进入板块
10. 项目实战Transformer、文生视频、多模态系统、Agent 与具身部署持续更新进入板块

🌱 01. AI 入门基础

这一部分建立理解现代 AI 系统所需的共同语言,从编程、神经网络和经典计算机视觉逐步走向生成式 AI。

核心知识节点

Python → 机器学习 → 神经网络 → NLP / CV → Transformer 前置知识

板块内容

延伸阅读|魔方AI空间

🧠 02. 大语言模型基础

从文本如何变成 Token 开始,逐步理解现代大语言模型的架构、训练、对齐、推理和评测。

核心知识节点

LLM 概念 → Token / Embedding → Transformer → Attention → 位置编码
→ 主流架构 → MoE → 预训练 → 指令微调 → RLHF → 推理 → Prompt → 评测

板块内容

延伸阅读|魔方AI空间

🌐 03. 多模态大模型基础

理解文本、图像、视频和音频如何被编码、对齐、生成,并进一步连接到推理和行动系统。

核心知识节点

多模态概念 → 视觉编码器 → LLM 底座 → 跨模态连接器 → VLM
→ 多模态生成 → 视频 / 音频 → 数据与训练 → 评测 → 多模态 Agent

板块内容

延伸阅读|魔方AI空间

🎨 04. AI 图像生成

从扩散模型基础出发,理解文生图、图像编辑、可控生成、个性化微调和统一视觉生成。

核心知识节点

Diffusion → Latent Diffusion → DiT → 文生图 → LoRA / ControlNet
→ 图像编辑 → 主体与风格一致性 → 统一生成模型

板块入口AI 图像生成

延伸阅读|魔方AI空间

🎬 05. AI 视频生成

系统学习视频的时空表示、扩散与 Transformer 架构、可控生成、视频编辑、长视频叙事及音视频联合建模。

核心知识节点

视频表示 → Video Diffusion / DiT → 时空建模 → 条件与运动控制
→ 视频编辑 → 长视频与多镜头 → 音视频联合生成 → 评测与实践

板块内容

延伸阅读|魔方AI空间

🎭 06. 数字人

关注人物外观、声音、表情与动作之间的跨模态驱动,理解数字人从“会说话”到“自然表达”的完整链路。

核心知识节点

语音识别 / 合成 → 肖像动画 → 口型同步 → 表情与情感驱动
→ 人体视频生成 → 实时交互 → 数字人系统

板块入口数字人

延伸阅读|魔方AI空间

🧩 07. Agent

让大模型从“回答问题”走向“检索信息、调用工具、积累经验并持续完成任务”。

核心知识节点

RAG → Agent → 工具调用 → MCP / A2A → Skills → Memory
→ Context Engineering → Harness → Loop Engineering → Agentic RL → Multi-Agent

板块入口Agent

延伸阅读|魔方AI空间

🤖 08. 具身智能与机器人

研究智能体如何在物理世界中感知、推理、规划和行动,并通过数据与环境交互持续学习。

核心知识节点

VLM → VLN / VA / VLA → 机器人策略 → 世界模型 → 机器人数据
→ 遥操作与示范学习 → 仿真与 Sim-to-Real → 控制 → 评测与部署

板块入口具身智能

延伸阅读|魔方AI空间

🚀 09. 大模型推理与部署

关注模型如何从研究和 Demo 走向稳定、低成本、可扩展的生产系统。

核心知识节点

模型压缩与量化 → KV Cache / Attention 优化 → 推理框架
→ DP / TP / PP / CP / EP / SP → PD 分离 → 分布式 Serving → 监控与评测

板块入口大模型推理与部署

延伸阅读|魔方AI空间

🛠️ 10. 项目实战

实战的目标不是“把接口调用成功”,而是完成一个目标明确、可以运行、能够评测和复现的技术闭环。

项目学习目标技术栈入口
From-Zero-to-Transformer从零理解并训练约 51M 参数的语言模型Python、PyTorch、Transformer查看项目
From-Zero-to-small-T2V理解文本条件视频生成、数据构造与训练闭环Python、PyTorch、GAN查看项目
From-Zero-to-OpenClaw探索 Agent 系统的配置、容器化与部署Docker、OpenClaw查看项目
实践延伸阅读|魔方AI空间

🕰️ 经典大模型时间线

经典大模型发展时间线

📬 关注魔方AI空间

「魔方AI空间」长期分享 LLM、多模态、AI 视频、Agent、具身智能、开源项目与工程实践。仓库负责沉淀系统知识,公众号同步更新前沿解读与深度文章。

渠道入口
微信公众号微信搜索 魔方AI空间 · 查看公众号代表文章
CSDN猫先生的技术博客
知乎猫先生
飞书知识库AIGCmagic 知识库
知识星球AIGCmagic 社区
【三年面试五年模拟】面试面经Interview for Algorithm Engineer
魔方AI空间

加入 AIGCmagic 社区

如果你希望获取更多 AI 前沿资料、深度内容与社区交流,可以扫码加入 AIGCmagic 知识星球。

AIGCmagic 社区知识星球与新人优惠券

💬 反馈与建议

如果你发现内容错误、失效链接或值得补充的技术方向,欢迎通过 Issue 告诉我们。

📄 License

本项目采用 GNU General Public License v3.0。引用、转载或二次创作仓库内容时,请保留原作者和项目来源。


长期主义不是追完所有热点,而是逐步建立能够解释变化的知识体系。

关注「魔方AI空间」,持续获取前沿技术解读、系统综述与项目实践。

Contributors

AI-mzq

115 commits

AI-mzq/From-Zero-to-AGI

从零走向AGI之路!!!旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。涵盖AI Agent、RAG、MCP、具身智能、大语言模型、多模态、数字人、AI绘画、AI视频等!!

Jupyter Notebook

268

115 commits

updated Sep 21, 2026

See the code

README

From Zero to AGI

从基础认知到智能系统,构建完整的 AI 学习路线

一个面向 AI 学习者、开发者与研究者的中文开源知识库,系统覆盖 LLM、多模态、AI 生成、Agent、具身智能、模型部署与项目实战

GitHub stars GitHub last commit License 公众号

开始学习 · 多模态路线 · 项目实战 · 项目主页

如果这个项目对你有帮助,欢迎点亮 Star。你的支持是持续更新的重要动力。

从零走向 AGI 学习路线图

🎯 项目介绍

AI 技术发展很快,但学习资料往往分散在论文、博客、课程、开源项目和产品新闻中。From Zero to AGI 希望把这些碎片重新组织成一套长期可学习、可检索、可实践的知识体系。

本仓库不只追踪“最近发布了什么”,更关注:

  • 一个概念在完整技术体系中的位置是什么?
  • 不同模型和方法之间如何演进、继承与分化?
  • 从基础原理到工程系统,应该按照什么顺序学习?
  • 哪些论文、文章和项目值得长期保留与反复阅读?

仓库内容由 猫先生 of「魔方AI空间」 持续维护。公众号负责追踪前沿与发布深度文章,GitHub 仓库负责结构化沉淀、学习编排和项目复现。

公众号前沿解读 → GitHub 系统沉淀 → 项目代码实践 → 建立完整 AI 认知

🧭 如何使用这个仓库

先通过核心内容地图定位学习方向,再进入对应章节系统学习;每个板块同时提供公众号深度阅读和相关项目实践,帮助你从概念理解走向工程落地。

[!TIP] 本仓库以大模型及其延伸方向为主。具备 Python 和神经网络基础后,建议从 大语言模型基础 开始;已经掌握 Transformer,可以直接进入 多模态大模型基础、AI 智能体或具身智能方向。

🛤️ 推荐学习路线

主学习路线

AI 与深度学习基础
        ↓
Transformer 与 LLM
        ↓
多模态理解与生成
        ↓
Agent / RAG / MCP
        ↓
具身智能与世界模型
        ↓
推理部署与项目实战

按学习目标选择

学习目标推荐路径
大模型入门Python 与神经网络基础 → Transformer → LLM 基础
理解大模型原理Token 与 Embedding → Attention → Transformer → 预训练 → 对齐 → 推理与评测
开发 AI 应用LLM → Prompt → RAG → Agent → MCP / Skills → 部署
学习多模态与视频视觉编码器 → 跨模态对齐 → VLM → 多模态生成 → 视频理解与生成
研究具身智能VLM → VLN / VLA → 世界模型 → 机器人数据 → 仿真、控制与评测
面向工程落地模型基础 → 推理优化 → 分布式并行 → Serving → 项目实战

🗺️ 完整核心内容地图

板块核心知识状态板块入口
01. AI 入门基础Python、机器学习、深度学习、NLP、CV、目标检测持续更新进入板块
02. 大语言模型基础Token、Embedding、Transformer、Attention、MoE、预训练、微调、RLHF、推理、评测已上线进入板块
03. 多模态大模型基础视觉编码器、连接器、VLM、统一多模态、视频、音频、多模态训练与评测已上线进入板块
04. AI 图像生成Diffusion、DiT、LoRA、ControlNet、图像编辑、一致性生成构建中进入板块
05. AI 视频生成视频扩散、时空建模、可控生成、视频编辑、长视频、音视频联合生成持续更新进入板块
06. 数字人肖像动画、语音驱动、口型同步、动作控制、情感表达构建中进入板块
07. Agent检索、工具调用、MCP、A2A、Skills、Memory、Harness、Agentic RL构建中进入板块
08. 具身智能VLM、VLN、VLA、世界模型、机器人数据、仿真、控制与评测构建中进入板块
09. 大模型推理与部署量化、推理框架、并行策略、KV Cache、PD 分离、Serving构建中进入板块
10. 项目实战Transformer、文生视频、多模态系统、Agent 与具身部署持续更新进入板块

🌱 01. AI 入门基础

这一部分建立理解现代 AI 系统所需的共同语言,从编程、神经网络和经典计算机视觉逐步走向生成式 AI。

核心知识节点

Python → 机器学习 → 神经网络 → NLP / CV → Transformer 前置知识

板块内容

延伸阅读|魔方AI空间

🧠 02. 大语言模型基础

从文本如何变成 Token 开始,逐步理解现代大语言模型的架构、训练、对齐、推理和评测。

核心知识节点

LLM 概念 → Token / Embedding → Transformer → Attention → 位置编码
→ 主流架构 → MoE → 预训练 → 指令微调 → RLHF → 推理 → Prompt → 评测

板块内容

延伸阅读|魔方AI空间

🌐 03. 多模态大模型基础

理解文本、图像、视频和音频如何被编码、对齐、生成,并进一步连接到推理和行动系统。

核心知识节点

多模态概念 → 视觉编码器 → LLM 底座 → 跨模态连接器 → VLM
→ 多模态生成 → 视频 / 音频 → 数据与训练 → 评测 → 多模态 Agent

板块内容

延伸阅读|魔方AI空间

🎨 04. AI 图像生成

从扩散模型基础出发,理解文生图、图像编辑、可控生成、个性化微调和统一视觉生成。

核心知识节点

Diffusion → Latent Diffusion → DiT → 文生图 → LoRA / ControlNet
→ 图像编辑 → 主体与风格一致性 → 统一生成模型

板块入口AI 图像生成

延伸阅读|魔方AI空间

🎬 05. AI 视频生成

系统学习视频的时空表示、扩散与 Transformer 架构、可控生成、视频编辑、长视频叙事及音视频联合建模。

核心知识节点

视频表示 → Video Diffusion / DiT → 时空建模 → 条件与运动控制
→ 视频编辑 → 长视频与多镜头 → 音视频联合生成 → 评测与实践

板块内容

延伸阅读|魔方AI空间

🎭 06. 数字人

关注人物外观、声音、表情与动作之间的跨模态驱动,理解数字人从“会说话”到“自然表达”的完整链路。

核心知识节点

语音识别 / 合成 → 肖像动画 → 口型同步 → 表情与情感驱动
→ 人体视频生成 → 实时交互 → 数字人系统

板块入口数字人

延伸阅读|魔方AI空间

🧩 07. Agent

让大模型从“回答问题”走向“检索信息、调用工具、积累经验并持续完成任务”。

核心知识节点

RAG → Agent → 工具调用 → MCP / A2A → Skills → Memory
→ Context Engineering → Harness → Loop Engineering → Agentic RL → Multi-Agent

板块入口Agent

延伸阅读|魔方AI空间

🤖 08. 具身智能与机器人

研究智能体如何在物理世界中感知、推理、规划和行动,并通过数据与环境交互持续学习。

核心知识节点

VLM → VLN / VA / VLA → 机器人策略 → 世界模型 → 机器人数据
→ 遥操作与示范学习 → 仿真与 Sim-to-Real → 控制 → 评测与部署

板块入口具身智能

延伸阅读|魔方AI空间

🚀 09. 大模型推理与部署

关注模型如何从研究和 Demo 走向稳定、低成本、可扩展的生产系统。

核心知识节点

模型压缩与量化 → KV Cache / Attention 优化 → 推理框架
→ DP / TP / PP / CP / EP / SP → PD 分离 → 分布式 Serving → 监控与评测

板块入口大模型推理与部署

延伸阅读|魔方AI空间

🛠️ 10. 项目实战

实战的目标不是“把接口调用成功”,而是完成一个目标明确、可以运行、能够评测和复现的技术闭环。

项目学习目标技术栈入口
From-Zero-to-Transformer从零理解并训练约 51M 参数的语言模型Python、PyTorch、Transformer查看项目
From-Zero-to-small-T2V理解文本条件视频生成、数据构造与训练闭环Python、PyTorch、GAN查看项目
From-Zero-to-OpenClaw探索 Agent 系统的配置、容器化与部署Docker、OpenClaw查看项目
实践延伸阅读|魔方AI空间

🕰️ 经典大模型时间线

经典大模型发展时间线

📬 关注魔方AI空间

「魔方AI空间」长期分享 LLM、多模态、AI 视频、Agent、具身智能、开源项目与工程实践。仓库负责沉淀系统知识,公众号同步更新前沿解读与深度文章。

渠道入口
微信公众号微信搜索 魔方AI空间 · 查看公众号代表文章
CSDN猫先生的技术博客
知乎猫先生
飞书知识库AIGCmagic 知识库
知识星球AIGCmagic 社区
【三年面试五年模拟】面试面经Interview for Algorithm Engineer
魔方AI空间

加入 AIGCmagic 社区

如果你希望获取更多 AI 前沿资料、深度内容与社区交流,可以扫码加入 AIGCmagic 知识星球。

AIGCmagic 社区知识星球与新人优惠券

💬 反馈与建议

如果你发现内容错误、失效链接或值得补充的技术方向,欢迎通过 Issue 告诉我们。

📄 License

本项目采用 GNU General Public License v3.0。引用、转载或二次创作仓库内容时,请保留原作者和项目来源。


长期主义不是追完所有热点,而是逐步建立能够解释变化的知识体系。

关注「魔方AI空间」,持续获取前沿技术解读、系统综述与项目实践。

Contributors

AI-mzq

115 commits

Languages

Jupyter Notebook

83.4%

Python

15.2%

Dockerfile

1.2%