面向新同学进组的学习指南
See the code[科研实习/保研/直博申请] 姓名-学校-年级-专业本学习大纲面向从 0 到 1 入门的本科生,目标是在 6-8 周 内,帮助同学建立对课题组研究方向的整体认知、核心技术理解与基础科研能力,为后续参与真实科研项目打下基础。
说明:在申请进组之前,你应当具备一定的机器学习、大模型、智能体基础知识,自测标准:
- 了解提升大模型推理能力的常用后训练算法:如SFT、GRPO
- 能够加载某个开源大模型或者调用闭源大模型API,在某个评测数据上完成性能评估
- 了解智能体基础知识,能够基于ReAct实现一个简单工具调用的Agent
如果你觉得自己能力已经达标,便可通过邮件约时间进行交流(线下或线上会议),无需准备PPT等材料,交流方式为面试提问,通过后即可作为科研实习生加入课题组;如果你觉得自己还没有掌握相应知识,可以参考如下提供的学习资料进行学习
学习目标:
参考资料:(仅作为学习的参考,不是要完全读完)
学习目标:
参考资料:
学习目标:
参考资料:
学习目标:
参考资料:
学习目标:
参考资料:
说明:在面试通过后,你便可以正式开始科研训练。本阶段重点在于论文调研、阅读、复现与思考
核心流程:
本训练计划并非考核某个固定答案,而是帮助你判断: 你是否真正享受分析问题、阅读论文、调试代码和反思实验的过程。 如果你对“研究问题本身”感到兴奋,那么欢迎加入我们。
请结合个人兴趣选择一个方向,检索并阅读相关论文并完成代码实践
⚠️ 注意事项:
LLaMA-Factory, TRL, LangChain 等),重点在于掌握算法流程以及分析实验结果,而非重复造轮子LLM很擅长“看起来有道理但实际错误的回答”,在需要严格逻辑推导的任务上容易出错,本方向的主要目标是提升大模型严谨的逻辑推理能力。如果你对数理逻辑、形式化方法感兴趣,或者喜欢一步步推导结论的严谨感,可以关注这个方向。
🎯 实践任务
基于上述提供的论文,调研结合Formal Language与Symbolic Solver提升LLM逻辑推理能力的工作,在至少1个逻辑推理benchmark中进行1篇论文复现
目标:体会结合形式化语言与求解器提升LLM逻辑推理能力的思想
数学推理是检验LLM推理能力的经典战场,从小学应用题到IMO竞赛题,模型的表现差异巨大。本方向主要目标是提升大模型的数学推理能力,其中涉及到的算法思路也可以迁移到司法、医疗等其他垂直领域场景。如果你对数学、或者垂域大模型训练感兴趣,可以关注这个方向。
🎯 实践任务:
复现上述论文数据合成的方法,并基于SFT或GRPO算法微调一个开源大语言模型或者多模态大模型,在一个数学推理数据集(例如GSM8K、MATH、MathVista、WeMath等)进行评测,分析合成数据与训练算法对模型推理性能的影响
目标:体会SFT与RL作为两种常用post-training范式的区别,并学会使用两种方式提升base model推理能力;SFT为必选任务,GRPO如果跑不起来,可以只掌握原理/代码实现
给定一幅图像和对应的问题,如何完成相应的推理任务?人类在处理图像推理时会在脑海里思考,例如“画辅助线”、“放大局部”等,但现有的多模态大模型只能被动地看一眼图片然后回答,这个方向探索如何让模型在推理过程中主动生成、修改和利用中间图像,实现边想边看。
🎯 实践任务:
调研 "Think with Images" 方向的论文,尝试在一个视觉推理数据集上,复现一种方法,并进行结果分析
目标:体会think with images这一方向的主要研究问题和常见范式;如果算力不允许可以优先选择Training-Free的方法
ARC-AGI-Challenge是一个专门设计来测试AI泛化能力的视觉谜题,每道题会给你若干个输入输出的图案样例,需要归纳出背后的抽象规则,并预测新的输入。这是一个难度很高的谜题,被认为是实现AGI的重要挑战。基于该数据集,每年都会举办奖金超过100万美元的比赛。
🎯 实践任务:
了解什么是 ARC Challenge,调研相应的论文与解决方案,并尝试实现至少一种方法,分析其结果和瓶颈
目标:了解ARC Challenge这一任务,熟悉已有的方法范式
给定一个复杂的用户旅行需求,例如,“预算5000元,从南京出发,三天游云南,需要满足xxx偏好”,如何让Agent自动调用工具、查询信息、并生成一个满足约束的合理方案?这个方向的核心挑战在于如何让LLM真正可靠的完成复杂的约束满足和规划任务,比较贴近实际应用场景。
🎯 实践任务:
基于 ReAct 框架构建一个简单的 Agent,分析其在上述两个数据集中的性能表现
目标:体会Travel Planning这一任务的关键挑战(约束可满足的复杂规划能力)以及潜在解决方案
这个方向尝试探索让Agent在模拟或真实的环境中行动,比如在Minecraft中自主探索、采矿、建造,或者在家居场景中,让机器人完成具身任务,这里的挑战在于环境是动态的、反馈是稀疏的、任务是长程的,Agent需要具备记忆、技能积累和自我反思的能力。如果你对游戏智能体、具身智能体感兴趣,这个方向会比较有意思。
🎯 实践任务:
参考上面的论文,在我的世界 (MineCraft) 环境或具身数据集 ALFWorld 或者Web Agent环境WebShop中进行实验,并汇报性能结果。 (注:MineCraft 相对来说环境更为复杂,且对模型能力要求较高,请根据自身工程能力选择)
目标:了解Agent Skill、Agent Memory等相关内容,熟悉相关的benchmark
给你一批科学家的观测数据,能否发现背后隐藏的科学规律?比如从物理实验数据中自动发现牛顿定律,这就是符号回归的目标。传统方法依赖演化计算等搜索策略,而近年来LLM的引入带来了新的思路,如果你对AI4Science感兴趣,这个方向值得关注。
🎯 实践任务:
基于上述 Tutorial,阅读相关论文,尝试复现论文 LLM-SR: Scientific Equation Discovery via Programming with Large Language Models,根据论文给出的 Github 仓库跑通代码,并对比原文中的结果
目标:了解Symbolic Regression任务,常见的benchmark以及LLM时代的主流方法
💡 自定义方向 如果你对其他隶属于 Neuro-Symbolic Learning、Agent、LLM Reasoning 领域的研究方向感兴趣(比如多模态医学推理、遥感图像推理、Chart QA、智慧司法、或者我的世界之外的其他游戏场景等),也可以提前进行沟通,得到允许之后,可以自行发挥查阅相关文献,按对等要求完成(即复现至少 1 篇论文算法在 1 个数据集上的实验结果)
完成上述任务之后,需要准备一份 PPT 进行汇报,内容应包含:
PPT 制作基本原则:
关于本文档的任何问题或者建议,欢迎留言或邮件咨询~~
51 commits
面向新同学进组的学习指南
See the code[科研实习/保研/直博申请] 姓名-学校-年级-专业本学习大纲面向从 0 到 1 入门的本科生,目标是在 6-8 周 内,帮助同学建立对课题组研究方向的整体认知、核心技术理解与基础科研能力,为后续参与真实科研项目打下基础。
说明:在申请进组之前,你应当具备一定的机器学习、大模型、智能体基础知识,自测标准:
- 了解提升大模型推理能力的常用后训练算法:如SFT、GRPO
- 能够加载某个开源大模型或者调用闭源大模型API,在某个评测数据上完成性能评估
- 了解智能体基础知识,能够基于ReAct实现一个简单工具调用的Agent
如果你觉得自己能力已经达标,便可通过邮件约时间进行交流(线下或线上会议),无需准备PPT等材料,交流方式为面试提问,通过后即可作为科研实习生加入课题组;如果你觉得自己还没有掌握相应知识,可以参考如下提供的学习资料进行学习
学习目标:
参考资料:(仅作为学习的参考,不是要完全读完)
学习目标:
参考资料:
学习目标:
参考资料:
学习目标:
参考资料:
学习目标:
参考资料:
说明:在面试通过后,你便可以正式开始科研训练。本阶段重点在于论文调研、阅读、复现与思考
核心流程:
本训练计划并非考核某个固定答案,而是帮助你判断: 你是否真正享受分析问题、阅读论文、调试代码和反思实验的过程。 如果你对“研究问题本身”感到兴奋,那么欢迎加入我们。
请结合个人兴趣选择一个方向,检索并阅读相关论文并完成代码实践
⚠️ 注意事项:
LLaMA-Factory, TRL, LangChain 等),重点在于掌握算法流程以及分析实验结果,而非重复造轮子LLM很擅长“看起来有道理但实际错误的回答”,在需要严格逻辑推导的任务上容易出错,本方向的主要目标是提升大模型严谨的逻辑推理能力。如果你对数理逻辑、形式化方法感兴趣,或者喜欢一步步推导结论的严谨感,可以关注这个方向。
🎯 实践任务
基于上述提供的论文,调研结合Formal Language与Symbolic Solver提升LLM逻辑推理能力的工作,在至少1个逻辑推理benchmark中进行1篇论文复现
目标:体会结合形式化语言与求解器提升LLM逻辑推理能力的思想
数学推理是检验LLM推理能力的经典战场,从小学应用题到IMO竞赛题,模型的表现差异巨大。本方向主要目标是提升大模型的数学推理能力,其中涉及到的算法思路也可以迁移到司法、医疗等其他垂直领域场景。如果你对数学、或者垂域大模型训练感兴趣,可以关注这个方向。
🎯 实践任务:
复现上述论文数据合成的方法,并基于SFT或GRPO算法微调一个开源大语言模型或者多模态大模型,在一个数学推理数据集(例如GSM8K、MATH、MathVista、WeMath等)进行评测,分析合成数据与训练算法对模型推理性能的影响
目标:体会SFT与RL作为两种常用post-training范式的区别,并学会使用两种方式提升base model推理能力;SFT为必选任务,GRPO如果跑不起来,可以只掌握原理/代码实现
给定一幅图像和对应的问题,如何完成相应的推理任务?人类在处理图像推理时会在脑海里思考,例如“画辅助线”、“放大局部”等,但现有的多模态大模型只能被动地看一眼图片然后回答,这个方向探索如何让模型在推理过程中主动生成、修改和利用中间图像,实现边想边看。
🎯 实践任务:
调研 "Think with Images" 方向的论文,尝试在一个视觉推理数据集上,复现一种方法,并进行结果分析
目标:体会think with images这一方向的主要研究问题和常见范式;如果算力不允许可以优先选择Training-Free的方法
ARC-AGI-Challenge是一个专门设计来测试AI泛化能力的视觉谜题,每道题会给你若干个输入输出的图案样例,需要归纳出背后的抽象规则,并预测新的输入。这是一个难度很高的谜题,被认为是实现AGI的重要挑战。基于该数据集,每年都会举办奖金超过100万美元的比赛。
🎯 实践任务:
了解什么是 ARC Challenge,调研相应的论文与解决方案,并尝试实现至少一种方法,分析其结果和瓶颈
目标:了解ARC Challenge这一任务,熟悉已有的方法范式
给定一个复杂的用户旅行需求,例如,“预算5000元,从南京出发,三天游云南,需要满足xxx偏好”,如何让Agent自动调用工具、查询信息、并生成一个满足约束的合理方案?这个方向的核心挑战在于如何让LLM真正可靠的完成复杂的约束满足和规划任务,比较贴近实际应用场景。
🎯 实践任务:
基于 ReAct 框架构建一个简单的 Agent,分析其在上述两个数据集中的性能表现
目标:体会Travel Planning这一任务的关键挑战(约束可满足的复杂规划能力)以及潜在解决方案
这个方向尝试探索让Agent在模拟或真实的环境中行动,比如在Minecraft中自主探索、采矿、建造,或者在家居场景中,让机器人完成具身任务,这里的挑战在于环境是动态的、反馈是稀疏的、任务是长程的,Agent需要具备记忆、技能积累和自我反思的能力。如果你对游戏智能体、具身智能体感兴趣,这个方向会比较有意思。
🎯 实践任务:
参考上面的论文,在我的世界 (MineCraft) 环境或具身数据集 ALFWorld 或者Web Agent环境WebShop中进行实验,并汇报性能结果。 (注:MineCraft 相对来说环境更为复杂,且对模型能力要求较高,请根据自身工程能力选择)
目标:了解Agent Skill、Agent Memory等相关内容,熟悉相关的benchmark
给你一批科学家的观测数据,能否发现背后隐藏的科学规律?比如从物理实验数据中自动发现牛顿定律,这就是符号回归的目标。传统方法依赖演化计算等搜索策略,而近年来LLM的引入带来了新的思路,如果你对AI4Science感兴趣,这个方向值得关注。
🎯 实践任务:
基于上述 Tutorial,阅读相关论文,尝试复现论文 LLM-SR: Scientific Equation Discovery via Programming with Large Language Models,根据论文给出的 Github 仓库跑通代码,并对比原文中的结果
目标:了解Symbolic Regression任务,常见的benchmark以及LLM时代的主流方法
💡 自定义方向 如果你对其他隶属于 Neuro-Symbolic Learning、Agent、LLM Reasoning 领域的研究方向感兴趣(比如多模态医学推理、遥感图像推理、Chart QA、智慧司法、或者我的世界之外的其他游戏场景等),也可以提前进行沟通,得到允许之后,可以自行发挥查阅相关文献,按对等要求完成(即复现至少 1 篇论文算法在 1 个数据集上的实验结果)
完成上述任务之后,需要准备一份 PPT 进行汇报,内容应包含:
PPT 制作基本原则:
关于本文档的任何问题或者建议,欢迎留言或邮件咨询~~
51 commits