整理了一些深度学习的理论相关内容,持续更新。
2026-03 更新:先补一版
2025–2026 Highlights,集中记录最近在Lean形式化、AI for Math、machine-assisted proof 方向上的一些代表性进展。
2025–2026 Highlights:最近一年左右最值得优先看的少量代表性进展。Overview:深度学习理论与智能理论综述。Course:课程、讲义与系统性学习资源。Architecture / Approximation / Optimization / Geometry:若干专题条目。AI4Math / 数学家 / 近似:数学与 AI 交叉方向的历史条目与延伸阅读。🔥 Sphere Packing in Lean / official post:Maryna Viazovska 2022 Fields Medal 相关的 8 维与 24 维球堆积结果在 Lean 中得到完整形式化。Math, Inc. 官方页给出的说法是:Gauss 在约 5 天内补完 8 维剩余部分,约 2 周完成 24 维与周期唯一性。这是近年最有代表性的 autoformalization 事件之一。
The Riemann Hypothesis for curves, autoformalized:有限域上超椭圆曲线的 Riemann-Hypothesis 型估计被形式化,README 给出规模约 4000 行 Lean。这个项目很适合作为 AI-assisted formal verification 进入数论 / 代数几何边界的代表案例。
Archon: An Agentic System for Formalizing Research-Level Mathematics:这篇文章强调的重点不是传统 benchmark,而是 repository-level 的研究级形式化:Plan Agent 与 Lean Agent 协同,把复杂证明拆分成模块、循环规划并逐步填补 sorry。文中报告 Archon 全自动 formalize 了 FirstProof Problem 6,并在几乎自动的条件下完成了 Problem 4。
The Equational Theories Project: Advancing Collaborative Mathematical Research at Scale:一个非常值得单列的案例:人类协作、自动证明与 Lean 验证深度结合,Terence Tao 参与其中。摘要写得很直接:项目确定了 4694 个最简单 magma 等式律之间全部 22,028,942 条蕴含边,是 machine-assisted collaborative mathematics 的里程碑事件。

Eigenweights for arithmetic Hirzebruch Proportionality (Tony Feng, 2026):这篇文章明确记录了一个基于 Gemini Deep Think 的定制 AI agent。它借助代数组合与对称群表示论,把 arithmetic Hirzebruch proportionality 里出现的 eigenweights 计算推广到所有 classical groups,是 AI 深入代数几何 / 表示论工作流的一个漂亮案例。
The motivic class of the space of genus 0 maps to the flag variety:摘要中直接说明:论文中的结果是在 Google Gemini 及相关工具协助下得到的;同时正文仍然保持人类作者主导的写法。这类工作很值得关注,因为它不是 formalization,而是 AI 直接参与研究发现与证明构思。
Murmurations of elliptic curves 不是最近一年的论文,但我倾向于把它保留成一个单独案例:它很可能是很多人第一次真正感受到“AI / 数据分析已经开始进入数论研究工作流”的代表作之一。论文研究的是不同 rank 椭圆曲线族的 Frobenius trace,也就是各个素数上的 a_p 系数。
a_p 构成的高维向量,再把这些向量当作 point cloud 来处理。logistic regression、PCA 等基础机器学习工具,但已经足以暴露出稳定而醒目的模式。a_p 平均后,会出现非常显著的振荡图样,且不同 rank 之间像鸟群转向一样彼此呼应,因此被称作 murmurations。

Optimization Constants in Mathematics:这是一个很有意思的问题基础设施项目:整理各类数学优化常数的最好上下界、来源、验证状态与可更新条目。它并不是 theorem proving 仓库,但非常适合观察 AI、计算与协作如何改变数学研究的组织方式。相关博文可见 Terence Tao: A crowdsourced repository for optimization constants?
math-inc:这一组织近来连续公开了 Sphere-Packing-Lean、RiemannHypothesisCurves、KakeyaFiniteFields、ZkLinalg 等项目。无论是否完全接受其叙事,这些仓库都值得持续跟踪,因为它们代表了前沿 autoformalization 的最新公开样本。
Recent advances in deep learning theory 总结了目前深度学习理论研究的六个方向的一些结果,概述型,没做深入探讨(2021)。
1.1 complexity and capacity-basedapproaches for analyzing the generalizability of deep learning;
1.2 stochastic differential equations andtheir dynamic systems for modelling stochastic gradient descent and its variants, which characterizethe optimization and generalization of deep learning, partially inspired by Bayesian inference;
1.3 thegeometrical structures of the loss landscape that drives the trajectories of the dynamic systems;
1.4 theroles of over-parameterization of deep neural networks from both positive and negative perspectives;
1.5 theoretical foundations of several special structures in network architectures;
1.6 the increasinglyintensive concerns in ethics and security and their relationships with generalizability
🔥 On the Principles of Parsimony and Self-Consistency for the Emergence of Intelligence(2022.7.马毅、沈向洋、曹颖)"任何一个智能系统,作为一个看似简单的自主闭环:信息、控制、对策、优化、神经网络,紧密结合,缺一不可。总而言之,人工智能的研究从现在开始,应该能够也必须与科学、数学、和计算紧密结合。从最根本、最基础的第一性原理(简约、自洽)出发,把基于经验的归纳方法与基于基础原理的演绎方法严格地、系统地结合起来发展。理论与实践紧密结合、相辅相成、共同推进我们对智能的理解。" 知乎解读可看:https://zhuanlan.zhihu.com/p/543041107 。
Machine Learning in Physics and Geometry(2023.3)总结了ml在几何和理论物理上的一些进展,主要涉及到pca,t-sne,k-means,nn,svm,数据拓扑分析技术内容,理论物理包含了Polytopes,Amoebae,Quivers,Brane Webs。
Machine-Assisted Proofs(2025)Terence Tao 将探讨机器在数学中使用的历史和近期发展。他还将推测机器辅助在该领域的未来作用。
2+. 2021 Deep learning theory lecture note + 2.1 逼近,优化,通用性,三方面做了总结,核心内容网页可见,比较友好。
MathsDL-spring19,MathDL系列,18,19,20年均有。
3.1 Geometry of Data
3.2 Geometry of Optimization and Generalization
3.3 Open qustions on Reinforcement Learning
IFT 6169: Theoretical principles for deep learning(2022 Winter),大多内容较为基础,传统。
深度学习几何课程(2022, Michael Bronstein)内容比较高级.
5.1 2022 年的 GDL100 共包含 12 节常规课程、3 节辅导课程和 5 次专题研讨。12 节常规课程主要介绍了几何深度学习的基本概念知识,包括高维学习、几何先验知识、图与集合、网格(grid)、群、测地线(geodesic)、流形(manifold)、规范(gauge)等。3 节辅导课主要面向表达型图神经网络、群等变神经网络和几何图神经网络。
5 次专题研讨的话题分别是:
Advanced Topics in Machine Learning and Game Theory游戏,强化方面的课程,2022。
AMS-ASA-SIAM Special Session on Mathematics of Deep Learning: A High-Dimensional Probability Perspective, I(2025)高维概率角度视角课程。
SGD
offconvex几个学术工作者维护的AI博客。
Smooth momentum: improving lipschitzness in gradient descent 提出了平滑动量,一种新的优化器,它改善了在”陡峭墙壁”上的行为。作者对所提出的优化器的特性进行了数学分析,并证明了平滑动量展现出改进的利普希茨特性和收敛性,这允许在梯度下降中稳定且更快的收敛。 (2023)
Muon(2024).作者解读.中文解析可参考Muon优化器赏析:从向量到矩阵的本质跨越
Theory of Deep Learning(draft)Rong Ge 等(2019)。
Spectral Learning on Matrices and TensorsMajid Janzamin等(2020)
Deep Learning Architectures A Mathematical Approach(2020),你可以libgen获取,内容如其名字,大概包含:工业问题,DL基础(激活,结构,优化等),函数逼近,万有逼近,RELU等逼近新研究,函数表示,以及两大方向,信息角度,几何角度等相关知识,实际场景中的卷积,池化,循环,生成,随机网络等具体实用内容的数学化,另外附录集合论,测度论,概率论,泛函,实分析等基础知识。
The Principles of Deep Learning Theory(2021)Daniel A. Roberts and Sho Yaida(mit),Beginning from a first-principles component-level picture of networks,本书解释了如何通过求解层到层迭代方程和非线性学习动力学来确定训练网络输出的准确描述。一个主要的结果是网络的预测是由近高斯分布描述的,网络的深度与宽度的纵横比控制着与无限宽度高斯描述的偏差。本书解释了这些有效深度网络如何从训练中学习非平凡的表示,并更广泛地分析非线性模型的表示学习机制。从近内核方法的角度来看,发现这些模型的预测对底层学习算法的依赖可以用一种简单而通用的方式来表达。为了获得这些结果,作者开发了表示组流(RG 流)的概念来表征信号通过网络的传播。通过将网络调整到临界状态,他们为梯度爆炸和消失问题提供了一个实用的解决方案。作者进一步解释了 RG 流如何导致近乎普遍的行为,从而可以将由不同激活函数构建的网络做类别划分。Altogether, they show that the depth-to-width ratio governs the effective model complexity of the ensemble of trained networks。利用信息理论,作者估计了模型性能最好的最佳深宽比,并证明了残差连接能将深度推向任意深度。利用以上理论工具,就可以更加细致的研究架构的归纳偏差,超参数,优化。原作者的视频说明(2021.12.1)
Physics-based Deep Learning(2021)N. Thuerey, P. Holl,etc.github resources深度学习与物理学的联系。比如基于物理的损失函数,可微流体模拟,逆问题的求解,Navier-Stokes方程的前向模拟,Controlling Burgers’ Equation和强化学习的关系等。
Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges(Michael M. Bronstein, Joan Bruna, Taco Cohen, Petar Veličković,2021),见上面课程5:深度学习几何课程.
dynamical systems and ml 2, 2020看起来写得很好,有Connection between ResNets and Dynamical Systems。
Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory 这本书把深度学习的理论和实践结合的比较紧密,并且配有代码。主要包含了ANN相关的的基础组件分析、逼近、优化、KL散度、生成的概率误差分析、DL在PDE的应用(PINN,DKM)。另外比较好的是。LaTeX工作室给出了对应的tex源码。《深度学习的数学介绍》LaTeX 代码下载2023。
Robust Learning with Jacobian Regularization(2019)Judy Hoffman...,
Predicting Generalization using GANs(2022.6),用GAN来评估泛化性.
Implicit Regularization in Tensor Factorization: Can Tensor Rank Shed Light on Generalization in Deep Learning?(2021.7)Tensor Rank 能否揭示深度学习中的泛化?
如何通过Meta Learning实现域泛化Domain Generalization(2022.4),Domain Generalization CVPR2022博文参考.
Generalization-Causality 一博士关于domain generalization等工作的实时汇总。
Implicit Regularization in Hierarchical Tensor Factorization and Deep Convolutional Networks(Noam Razin • Jul 15, 2022)
6.1 Across three different neural network types (equivalent to matrix, tensor, and hierarchical tensor factorizations), we have an architecture-dependant notion of rank that is implicitly lowered. Moreover, the underlying mechanism for this implicit regularization is identical in all cases. This leads us to believe that implicit regularization towards low rank may be a general phenomenon. If true, finding notions of rank lowered for different architectures can facilitate an understanding of generalization in deep learning.
6.2 Our findings imply that the tendency of modern convolutional networks towards locality may largely be due to implicit regularization, and not an inherent limitation of expressive power as often believed. More broadly, they showcase that deep learning architectures considered suboptimal for certain tasks can be greatly improved through a right choice of explicit regularization. Theoretical understanding of implicit regularization may be key to discovering such regularizers.
Theoretical issues in deep networks 表明指数型损失函数中存在隐式的正则化,其优化的结果和一般损失函数优化结果一致,优化收敛结果和梯度流的迹有关,目前还不能证明哪个结果最优(2020)。
The Dawning of a New Erain Applied MathematicsWeinan E关于在DL的新处境下结合历史的工作范式给出的指导性总结(2021)。
redunet_paper白盒神经网络代码。
Theory of Deep Convolutional Neural Networks:Downsampling下采样的数学分析Ding-Xuan Zhou(2020)
Theory of deep convolutional neural networks II: Spherical analysis还有III:radial functions 逼近,(2020)。不过这些工作到底如何,只是用数学转换了一下,理论上没做过多贡献,或者和实际结合没难么紧密,还不得而知。
The Modern Mathematics of Deep Learning(2021)主要是deep laerning的数学分析描述,涉及的问题包括:超参数网络的通用能力,深度在深度模型中的核心作用,深度学习对维度灾难的克服,优化在非凸优化问题的成功,学习的表示特征的数学分析,为何深度模型在物理问题上有超常表现,模型架构中的哪些因素以何种方式影响不同任务的学习中的不同方面。
Topos and Stacks of Deep Neural Networks(2021)每一个已知的深度神经网络(DNN)对应于一个典型的 Grothendieck 的 topos 中的一个对象; 它的学习动态对应于这个 topos 中的一个态射流。层中的不变性结构(如 CNNs 或 LSTMs)与Giraud's stacks相对应。这种不变性被认为是泛化性质的原因,即从约束条件下的学习数据进行推断。纤维代表前语义类别(Culioli,Thom) ,其上人工语言的定义,内部逻辑,直觉主义,经典或线性(Girard)。网络的语义功能是用这种语言表达理论的能力,用于回答输入数据输出中的问题。语义信息的量和空间的定义与香农熵的同源解释相类似。他们推广了 Carnap 和 Bar-Hillel (1952)所发现的度量。令人惊讶的是,上述语义结构被分类为几何纤维对象在一个封闭的Quillen模型范畴,然后他们引起同时局部不变的 dnn 和他们的语义功能。Intentional type theories (Martin-Loef)组织这些对象和它们之间的纤维化。信息内容和交换由 Grothendieck's derivators分析。
Visualizing the Emergence of Intermediate Visual Patterns in DNNs(2021,NIPS)文章设计了一种神经网络中层特征的可视化方法,使得能 (1)更直观地分析神经网络中层特征的表达能力,并且展示中层特征表达能力的时空涌现; (2)量化神经网络中层知识点,从而定量地分析神经网络中层特征的质量; (3)为一些深度学习技术(如对抗攻击、知识蒸馏)提供新见解。
神经网络的博弈交互解释性(知乎)。上交大张拳石团队研究论文整理而得,作为博弈交互解释性的体系框架(不怎么稳固)。
Advancing mathematics by guiding human intuition with AI(2021,nature)机器学习和数学家工作的一个有机结合,主要利用机器学习分析众多特征和目标变量的主要相关因子,加强数学家的直觉,该论文得到了两个漂亮的定理,一个拓扑,一个表示论。可参考回答。
🔥A New Perspective of Entropy(2022) 通过莱布尼兹微分法则(Leibniz rule)将信息熵,抽象代数,拓 扑学联系起来。该文章是一个零基础可阅读的综述,具体参考Entropy as a Topological Operad Derivation (2021.7,Tai-Danae Bradley.)
minerva(2022)google提出的解题模型,在公共高等数学等考试中比人类平均分高.[测试地址](https://minerva-demo. github.io/#category=Algebra&index=1).
🔥An automatic theorem proving project菲尔兹获得者数学家高尔斯关于 自动证明数学定理的项目进展How can it be feasible to find proofs?(2022, W.T. Gowers).
GRAND: Graph Neural Diffusion (2021)该网站包含了一些相似论文资料,[项目地址graph-neural-pde](https://github.com/twitter-research /graph-neural-pde),其优化版本GRAND++.(2022).有博文介绍图神经网络的困境,用微分几何和代数拓扑解决仅供参 考.
Weinan È-A Mathematical Perspective on Machine Learning(2022.icm),room1最后一排,鄂维南在icm的演讲视频.
contrastive learning证明包括InfoNCE在内的一大类对比学习目标函数,等价于一个有两类变量(或者说两类玩家)参与的交替优化(或者说游戏)过程.
可解释性:Batch Normalization未必客观地反应损失函数信息2022,张拳石等.
Homotopy Theoretic and Categorical Models of Neural Information Networks该工作第一作者俄罗斯数学家Yuri Manin,2020工作,2022年8月arxiv有更新。ncatlab有讨论。博文讲解。
Deep learning via dynamical systems: An approximation perspective动力系统逼近。论文见。
群论角度群论角度去理解的一系列视频,群论视角,2014年出现过,视频系统讲解,2022年。
Constructions in combinatorics via neural networks作者Adam Zsolt Wagner通过神经网络和强化学习构建了一系列反例,推翻了几个组合学的猜想,2021年。
不动点2023这篇文章主要研究任意深度的一维神经网络中的固定点问题。首先,文章介绍了一种新的方法,通过代数拓扑理论来研究神经网络中的固定点。然后,文章证明了任意深度的一维神经网络在某些情况下一定存在固定点。特别地,当网络中的激活函数为sigmoid函数时,网络在存在足够多的神经元时必定存在固定点。此外,文章还证明了某些特殊情况下,任意深度的一维神经网络中的固定点是稠密的,即在网络参数的空间中,存在无限多的参数可以使得网络的输出为固定值。这项研究具有深入探究神经网络理论的意义,有助于深入理解神经网络在不同条件下的表现和性质。后面内容是直接输入题目,chatgpt总结的。
Overparameterized ReLU Neural Networks Learn the Simplest Model: Neural Isometry and Phase Transitions2023,这是一篇关于深度学习理论的论文,研究了过参数化的ReLU神经网络的训练和泛化性能,以及其学习的模型复杂度。研究表明,即使神经网络的参数数量极高,它们也能够学习出非常简单的模型,这与传统的统计智慧相矛盾。本文采用了凸优化和稀疏恢复的视角,提出了神经同构和相变的概念,来解释神经网络学习简单模型的原因。 本文的主要贡献包括以下几个方面:
总之,本文通过理论分析和数值实验,证明了过参数化的ReLU神经网络能够学习最简单的模型,这为深度学习的理论研究和实际应用提供了重要的启示。(问chatgpt论文题目给的回复)
FAST COMPUTATION OF PERMUTATION EQUIVARIANT LAYERS WITH THE PARTITION ALGEBRA 2023.1, 该论文主要介绍了一种快速计算置换等变层的方法,该方法使用了分区代数。
Omnigrok: Grokking Beyond Algorithmic Data2022.10. Grokking 是算法数据集的一种不寻常现象,在过度拟合训练数据后很久就会发生泛化,这种现象仍然难以捉摸。我们的目标是通过分析神经网络的损失情况来理解 grokking,将训练和测试损失之间的不匹配确定为 grokking 的原因。我们将此称为“LU 机制”,因为训练和测试损失(针对模型权重范数)通常分别类似于“L”和“U”。这种简单的机制可以很好地解释 grokking 的许多方面:数据大小依赖性、权重衰减依赖性、表示的出现等。在直观图片的指导下,我们能够在涉及图像、语言和分子的任务上诱导 grokking。在相反的方向,我们能够消除算法数据集的 grokking。我们将算法数据集的 grokking 的戏剧性归因于表征学习。
Grokking modular arithmetic2023.1 我们提出了一个简单的神经网络,它可以学习模块化算术任务并表现出泛化的突然跳跃,称为“grokking”。具体来说,我们提出(i)完全连接的两层网络,在没有任何正则化的情况下,在普通梯度下降下使用 MSE 损失函数表现出对各种模块化算术任务的 grokking; (ii) 证据表明 grokking 模块化算法对应于学习其结构由任务确定的特定特征图; (iii) 权重的解析表达式——以及特征图——解决一大类模块化算术任务; (iv) 证明这些特征图也可以通过普通梯度下降法和 AdamW 找到,从而建立网络学习表示的完整可解释性。
Progress measures for grokking via mechanistic interpretability2023.2神经网络可解释性方面研究。研究表明,grokking不是突然的转变,而是源于权重中编码的结构化机制的逐渐放大,随后是记忆组件的删除。
awesome-deep-phenomena 2022.5, 神经网络表现出的各种现象的研究git整理。
Deep Learning for Mathematical Reasoning (DL4MATH)DL和数学相关的资料git整理。
PCAST Working Group on Generative AI Invites Public Input2023.5.13. 陶哲轩将主持美国总统科技顾问委员会(PCAST)成立的一个生成式人工智能工作组的会议。
🔥CRATE 白盒ai 训练进展.知乎上有人讨论, 该文章拼凑比较多,且论文和代码相差十万八千里。 知乎参考。(2023)
An Ambiguity Measure for Recognizing the Unknowns in Deep Learning自华为香港研究中心的学者,给出了模型对未知量(类)的模糊性度量框架。该模糊度量能够判断未知量和已知模型所能判断的范围的相关性大小。(2023)
flow_matching(2025)meta在扩散模型中的流模型的基础理论研究与实践。
Harmonic Loss Trains Interpretable AI Models(2025)在本文中,我们引入了谐波损失作为训练神经网络和大型语言模型(LLMs)的标准交叉熵损失的替代方案。谐波损失通过其尺度不变性和设计上的有限收敛点(可解释为类别中心),实现了更好的可解释性和更快的收敛。我们首先在算法、视觉和语言数据集上验证了谐波模型的性能。通过广泛的实验,我们证明了使用谐波损失训练的模型在以下方面优于标准模型:(a) 增强可解释性,(b) 泛化所需的训练数据更少,(c) 减少“顿悟”(grokking)现象。此外,我们将使用谐波损失训练的 GPT-2 模型与标准 GPT-2 模型进行比较,表明谐波模型能够生成更具可解释性的表示。展望未来,我们认为谐波损失有潜力成为数据可用性有限的领域或对可解释性和可靠性要求极高的高风险应用中的重要工具,为更稳健、更高效的神经网络模型铺平道路。(grok译)
懒得分类了,随便新加了一类
39 commits
整理了一些深度学习的理论相关内容,持续更新。
2026-03 更新:先补一版
2025–2026 Highlights,集中记录最近在Lean形式化、AI for Math、machine-assisted proof 方向上的一些代表性进展。
2025–2026 Highlights:最近一年左右最值得优先看的少量代表性进展。Overview:深度学习理论与智能理论综述。Course:课程、讲义与系统性学习资源。Architecture / Approximation / Optimization / Geometry:若干专题条目。AI4Math / 数学家 / 近似:数学与 AI 交叉方向的历史条目与延伸阅读。🔥 Sphere Packing in Lean / official post:Maryna Viazovska 2022 Fields Medal 相关的 8 维与 24 维球堆积结果在 Lean 中得到完整形式化。Math, Inc. 官方页给出的说法是:Gauss 在约 5 天内补完 8 维剩余部分,约 2 周完成 24 维与周期唯一性。这是近年最有代表性的 autoformalization 事件之一。
The Riemann Hypothesis for curves, autoformalized:有限域上超椭圆曲线的 Riemann-Hypothesis 型估计被形式化,README 给出规模约 4000 行 Lean。这个项目很适合作为 AI-assisted formal verification 进入数论 / 代数几何边界的代表案例。
Archon: An Agentic System for Formalizing Research-Level Mathematics:这篇文章强调的重点不是传统 benchmark,而是 repository-level 的研究级形式化:Plan Agent 与 Lean Agent 协同,把复杂证明拆分成模块、循环规划并逐步填补 sorry。文中报告 Archon 全自动 formalize 了 FirstProof Problem 6,并在几乎自动的条件下完成了 Problem 4。
The Equational Theories Project: Advancing Collaborative Mathematical Research at Scale:一个非常值得单列的案例:人类协作、自动证明与 Lean 验证深度结合,Terence Tao 参与其中。摘要写得很直接:项目确定了 4694 个最简单 magma 等式律之间全部 22,028,942 条蕴含边,是 machine-assisted collaborative mathematics 的里程碑事件。

Eigenweights for arithmetic Hirzebruch Proportionality (Tony Feng, 2026):这篇文章明确记录了一个基于 Gemini Deep Think 的定制 AI agent。它借助代数组合与对称群表示论,把 arithmetic Hirzebruch proportionality 里出现的 eigenweights 计算推广到所有 classical groups,是 AI 深入代数几何 / 表示论工作流的一个漂亮案例。
The motivic class of the space of genus 0 maps to the flag variety:摘要中直接说明:论文中的结果是在 Google Gemini 及相关工具协助下得到的;同时正文仍然保持人类作者主导的写法。这类工作很值得关注,因为它不是 formalization,而是 AI 直接参与研究发现与证明构思。
Murmurations of elliptic curves 不是最近一年的论文,但我倾向于把它保留成一个单独案例:它很可能是很多人第一次真正感受到“AI / 数据分析已经开始进入数论研究工作流”的代表作之一。论文研究的是不同 rank 椭圆曲线族的 Frobenius trace,也就是各个素数上的 a_p 系数。
a_p 构成的高维向量,再把这些向量当作 point cloud 来处理。logistic regression、PCA 等基础机器学习工具,但已经足以暴露出稳定而醒目的模式。a_p 平均后,会出现非常显著的振荡图样,且不同 rank 之间像鸟群转向一样彼此呼应,因此被称作 murmurations。

Optimization Constants in Mathematics:这是一个很有意思的问题基础设施项目:整理各类数学优化常数的最好上下界、来源、验证状态与可更新条目。它并不是 theorem proving 仓库,但非常适合观察 AI、计算与协作如何改变数学研究的组织方式。相关博文可见 Terence Tao: A crowdsourced repository for optimization constants?
math-inc:这一组织近来连续公开了 Sphere-Packing-Lean、RiemannHypothesisCurves、KakeyaFiniteFields、ZkLinalg 等项目。无论是否完全接受其叙事,这些仓库都值得持续跟踪,因为它们代表了前沿 autoformalization 的最新公开样本。
Recent advances in deep learning theory 总结了目前深度学习理论研究的六个方向的一些结果,概述型,没做深入探讨(2021)。
1.1 complexity and capacity-basedapproaches for analyzing the generalizability of deep learning;
1.2 stochastic differential equations andtheir dynamic systems for modelling stochastic gradient descent and its variants, which characterizethe optimization and generalization of deep learning, partially inspired by Bayesian inference;
1.3 thegeometrical structures of the loss landscape that drives the trajectories of the dynamic systems;
1.4 theroles of over-parameterization of deep neural networks from both positive and negative perspectives;
1.5 theoretical foundations of several special structures in network architectures;
1.6 the increasinglyintensive concerns in ethics and security and their relationships with generalizability
🔥 On the Principles of Parsimony and Self-Consistency for the Emergence of Intelligence(2022.7.马毅、沈向洋、曹颖)"任何一个智能系统,作为一个看似简单的自主闭环:信息、控制、对策、优化、神经网络,紧密结合,缺一不可。总而言之,人工智能的研究从现在开始,应该能够也必须与科学、数学、和计算紧密结合。从最根本、最基础的第一性原理(简约、自洽)出发,把基于经验的归纳方法与基于基础原理的演绎方法严格地、系统地结合起来发展。理论与实践紧密结合、相辅相成、共同推进我们对智能的理解。" 知乎解读可看:https://zhuanlan.zhihu.com/p/543041107 。
Machine Learning in Physics and Geometry(2023.3)总结了ml在几何和理论物理上的一些进展,主要涉及到pca,t-sne,k-means,nn,svm,数据拓扑分析技术内容,理论物理包含了Polytopes,Amoebae,Quivers,Brane Webs。
Machine-Assisted Proofs(2025)Terence Tao 将探讨机器在数学中使用的历史和近期发展。他还将推测机器辅助在该领域的未来作用。
2+. 2021 Deep learning theory lecture note + 2.1 逼近,优化,通用性,三方面做了总结,核心内容网页可见,比较友好。
MathsDL-spring19,MathDL系列,18,19,20年均有。
3.1 Geometry of Data
3.2 Geometry of Optimization and Generalization
3.3 Open qustions on Reinforcement Learning
IFT 6169: Theoretical principles for deep learning(2022 Winter),大多内容较为基础,传统。
深度学习几何课程(2022, Michael Bronstein)内容比较高级.
5.1 2022 年的 GDL100 共包含 12 节常规课程、3 节辅导课程和 5 次专题研讨。12 节常规课程主要介绍了几何深度学习的基本概念知识,包括高维学习、几何先验知识、图与集合、网格(grid)、群、测地线(geodesic)、流形(manifold)、规范(gauge)等。3 节辅导课主要面向表达型图神经网络、群等变神经网络和几何图神经网络。
5 次专题研讨的话题分别是:
Advanced Topics in Machine Learning and Game Theory游戏,强化方面的课程,2022。
AMS-ASA-SIAM Special Session on Mathematics of Deep Learning: A High-Dimensional Probability Perspective, I(2025)高维概率角度视角课程。
SGD
offconvex几个学术工作者维护的AI博客。
Smooth momentum: improving lipschitzness in gradient descent 提出了平滑动量,一种新的优化器,它改善了在”陡峭墙壁”上的行为。作者对所提出的优化器的特性进行了数学分析,并证明了平滑动量展现出改进的利普希茨特性和收敛性,这允许在梯度下降中稳定且更快的收敛。 (2023)
Muon(2024).作者解读.中文解析可参考Muon优化器赏析:从向量到矩阵的本质跨越
Theory of Deep Learning(draft)Rong Ge 等(2019)。
Spectral Learning on Matrices and TensorsMajid Janzamin等(2020)
Deep Learning Architectures A Mathematical Approach(2020),你可以libgen获取,内容如其名字,大概包含:工业问题,DL基础(激活,结构,优化等),函数逼近,万有逼近,RELU等逼近新研究,函数表示,以及两大方向,信息角度,几何角度等相关知识,实际场景中的卷积,池化,循环,生成,随机网络等具体实用内容的数学化,另外附录集合论,测度论,概率论,泛函,实分析等基础知识。
The Principles of Deep Learning Theory(2021)Daniel A. Roberts and Sho Yaida(mit),Beginning from a first-principles component-level picture of networks,本书解释了如何通过求解层到层迭代方程和非线性学习动力学来确定训练网络输出的准确描述。一个主要的结果是网络的预测是由近高斯分布描述的,网络的深度与宽度的纵横比控制着与无限宽度高斯描述的偏差。本书解释了这些有效深度网络如何从训练中学习非平凡的表示,并更广泛地分析非线性模型的表示学习机制。从近内核方法的角度来看,发现这些模型的预测对底层学习算法的依赖可以用一种简单而通用的方式来表达。为了获得这些结果,作者开发了表示组流(RG 流)的概念来表征信号通过网络的传播。通过将网络调整到临界状态,他们为梯度爆炸和消失问题提供了一个实用的解决方案。作者进一步解释了 RG 流如何导致近乎普遍的行为,从而可以将由不同激活函数构建的网络做类别划分。Altogether, they show that the depth-to-width ratio governs the effective model complexity of the ensemble of trained networks。利用信息理论,作者估计了模型性能最好的最佳深宽比,并证明了残差连接能将深度推向任意深度。利用以上理论工具,就可以更加细致的研究架构的归纳偏差,超参数,优化。原作者的视频说明(2021.12.1)
Physics-based Deep Learning(2021)N. Thuerey, P. Holl,etc.github resources深度学习与物理学的联系。比如基于物理的损失函数,可微流体模拟,逆问题的求解,Navier-Stokes方程的前向模拟,Controlling Burgers’ Equation和强化学习的关系等。
Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges(Michael M. Bronstein, Joan Bruna, Taco Cohen, Petar Veličković,2021),见上面课程5:深度学习几何课程.
dynamical systems and ml 2, 2020看起来写得很好,有Connection between ResNets and Dynamical Systems。
Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory 这本书把深度学习的理论和实践结合的比较紧密,并且配有代码。主要包含了ANN相关的的基础组件分析、逼近、优化、KL散度、生成的概率误差分析、DL在PDE的应用(PINN,DKM)。另外比较好的是。LaTeX工作室给出了对应的tex源码。《深度学习的数学介绍》LaTeX 代码下载2023。
Robust Learning with Jacobian Regularization(2019)Judy Hoffman...,
Predicting Generalization using GANs(2022.6),用GAN来评估泛化性.
Implicit Regularization in Tensor Factorization: Can Tensor Rank Shed Light on Generalization in Deep Learning?(2021.7)Tensor Rank 能否揭示深度学习中的泛化?
如何通过Meta Learning实现域泛化Domain Generalization(2022.4),Domain Generalization CVPR2022博文参考.
Generalization-Causality 一博士关于domain generalization等工作的实时汇总。
Implicit Regularization in Hierarchical Tensor Factorization and Deep Convolutional Networks(Noam Razin • Jul 15, 2022)
6.1 Across three different neural network types (equivalent to matrix, tensor, and hierarchical tensor factorizations), we have an architecture-dependant notion of rank that is implicitly lowered. Moreover, the underlying mechanism for this implicit regularization is identical in all cases. This leads us to believe that implicit regularization towards low rank may be a general phenomenon. If true, finding notions of rank lowered for different architectures can facilitate an understanding of generalization in deep learning.
6.2 Our findings imply that the tendency of modern convolutional networks towards locality may largely be due to implicit regularization, and not an inherent limitation of expressive power as often believed. More broadly, they showcase that deep learning architectures considered suboptimal for certain tasks can be greatly improved through a right choice of explicit regularization. Theoretical understanding of implicit regularization may be key to discovering such regularizers.
Theoretical issues in deep networks 表明指数型损失函数中存在隐式的正则化,其优化的结果和一般损失函数优化结果一致,优化收敛结果和梯度流的迹有关,目前还不能证明哪个结果最优(2020)。
The Dawning of a New Erain Applied MathematicsWeinan E关于在DL的新处境下结合历史的工作范式给出的指导性总结(2021)。
redunet_paper白盒神经网络代码。
Theory of Deep Convolutional Neural Networks:Downsampling下采样的数学分析Ding-Xuan Zhou(2020)
Theory of deep convolutional neural networks II: Spherical analysis还有III:radial functions 逼近,(2020)。不过这些工作到底如何,只是用数学转换了一下,理论上没做过多贡献,或者和实际结合没难么紧密,还不得而知。
The Modern Mathematics of Deep Learning(2021)主要是deep laerning的数学分析描述,涉及的问题包括:超参数网络的通用能力,深度在深度模型中的核心作用,深度学习对维度灾难的克服,优化在非凸优化问题的成功,学习的表示特征的数学分析,为何深度模型在物理问题上有超常表现,模型架构中的哪些因素以何种方式影响不同任务的学习中的不同方面。
Topos and Stacks of Deep Neural Networks(2021)每一个已知的深度神经网络(DNN)对应于一个典型的 Grothendieck 的 topos 中的一个对象; 它的学习动态对应于这个 topos 中的一个态射流。层中的不变性结构(如 CNNs 或 LSTMs)与Giraud's stacks相对应。这种不变性被认为是泛化性质的原因,即从约束条件下的学习数据进行推断。纤维代表前语义类别(Culioli,Thom) ,其上人工语言的定义,内部逻辑,直觉主义,经典或线性(Girard)。网络的语义功能是用这种语言表达理论的能力,用于回答输入数据输出中的问题。语义信息的量和空间的定义与香农熵的同源解释相类似。他们推广了 Carnap 和 Bar-Hillel (1952)所发现的度量。令人惊讶的是,上述语义结构被分类为几何纤维对象在一个封闭的Quillen模型范畴,然后他们引起同时局部不变的 dnn 和他们的语义功能。Intentional type theories (Martin-Loef)组织这些对象和它们之间的纤维化。信息内容和交换由 Grothendieck's derivators分析。
Visualizing the Emergence of Intermediate Visual Patterns in DNNs(2021,NIPS)文章设计了一种神经网络中层特征的可视化方法,使得能 (1)更直观地分析神经网络中层特征的表达能力,并且展示中层特征表达能力的时空涌现; (2)量化神经网络中层知识点,从而定量地分析神经网络中层特征的质量; (3)为一些深度学习技术(如对抗攻击、知识蒸馏)提供新见解。
神经网络的博弈交互解释性(知乎)。上交大张拳石团队研究论文整理而得,作为博弈交互解释性的体系框架(不怎么稳固)。
Advancing mathematics by guiding human intuition with AI(2021,nature)机器学习和数学家工作的一个有机结合,主要利用机器学习分析众多特征和目标变量的主要相关因子,加强数学家的直觉,该论文得到了两个漂亮的定理,一个拓扑,一个表示论。可参考回答。
🔥A New Perspective of Entropy(2022) 通过莱布尼兹微分法则(Leibniz rule)将信息熵,抽象代数,拓 扑学联系起来。该文章是一个零基础可阅读的综述,具体参考Entropy as a Topological Operad Derivation (2021.7,Tai-Danae Bradley.)
minerva(2022)google提出的解题模型,在公共高等数学等考试中比人类平均分高.[测试地址](https://minerva-demo. github.io/#category=Algebra&index=1).
🔥An automatic theorem proving project菲尔兹获得者数学家高尔斯关于 自动证明数学定理的项目进展How can it be feasible to find proofs?(2022, W.T. Gowers).
GRAND: Graph Neural Diffusion (2021)该网站包含了一些相似论文资料,[项目地址graph-neural-pde](https://github.com/twitter-research /graph-neural-pde),其优化版本GRAND++.(2022).有博文介绍图神经网络的困境,用微分几何和代数拓扑解决仅供参 考.
Weinan È-A Mathematical Perspective on Machine Learning(2022.icm),room1最后一排,鄂维南在icm的演讲视频.
contrastive learning证明包括InfoNCE在内的一大类对比学习目标函数,等价于一个有两类变量(或者说两类玩家)参与的交替优化(或者说游戏)过程.
可解释性:Batch Normalization未必客观地反应损失函数信息2022,张拳石等.
Homotopy Theoretic and Categorical Models of Neural Information Networks该工作第一作者俄罗斯数学家Yuri Manin,2020工作,2022年8月arxiv有更新。ncatlab有讨论。博文讲解。
Deep learning via dynamical systems: An approximation perspective动力系统逼近。论文见。
群论角度群论角度去理解的一系列视频,群论视角,2014年出现过,视频系统讲解,2022年。
Constructions in combinatorics via neural networks作者Adam Zsolt Wagner通过神经网络和强化学习构建了一系列反例,推翻了几个组合学的猜想,2021年。
不动点2023这篇文章主要研究任意深度的一维神经网络中的固定点问题。首先,文章介绍了一种新的方法,通过代数拓扑理论来研究神经网络中的固定点。然后,文章证明了任意深度的一维神经网络在某些情况下一定存在固定点。特别地,当网络中的激活函数为sigmoid函数时,网络在存在足够多的神经元时必定存在固定点。此外,文章还证明了某些特殊情况下,任意深度的一维神经网络中的固定点是稠密的,即在网络参数的空间中,存在无限多的参数可以使得网络的输出为固定值。这项研究具有深入探究神经网络理论的意义,有助于深入理解神经网络在不同条件下的表现和性质。后面内容是直接输入题目,chatgpt总结的。
Overparameterized ReLU Neural Networks Learn the Simplest Model: Neural Isometry and Phase Transitions2023,这是一篇关于深度学习理论的论文,研究了过参数化的ReLU神经网络的训练和泛化性能,以及其学习的模型复杂度。研究表明,即使神经网络的参数数量极高,它们也能够学习出非常简单的模型,这与传统的统计智慧相矛盾。本文采用了凸优化和稀疏恢复的视角,提出了神经同构和相变的概念,来解释神经网络学习简单模型的原因。 本文的主要贡献包括以下几个方面:
总之,本文通过理论分析和数值实验,证明了过参数化的ReLU神经网络能够学习最简单的模型,这为深度学习的理论研究和实际应用提供了重要的启示。(问chatgpt论文题目给的回复)
FAST COMPUTATION OF PERMUTATION EQUIVARIANT LAYERS WITH THE PARTITION ALGEBRA 2023.1, 该论文主要介绍了一种快速计算置换等变层的方法,该方法使用了分区代数。
Omnigrok: Grokking Beyond Algorithmic Data2022.10. Grokking 是算法数据集的一种不寻常现象,在过度拟合训练数据后很久就会发生泛化,这种现象仍然难以捉摸。我们的目标是通过分析神经网络的损失情况来理解 grokking,将训练和测试损失之间的不匹配确定为 grokking 的原因。我们将此称为“LU 机制”,因为训练和测试损失(针对模型权重范数)通常分别类似于“L”和“U”。这种简单的机制可以很好地解释 grokking 的许多方面:数据大小依赖性、权重衰减依赖性、表示的出现等。在直观图片的指导下,我们能够在涉及图像、语言和分子的任务上诱导 grokking。在相反的方向,我们能够消除算法数据集的 grokking。我们将算法数据集的 grokking 的戏剧性归因于表征学习。
Grokking modular arithmetic2023.1 我们提出了一个简单的神经网络,它可以学习模块化算术任务并表现出泛化的突然跳跃,称为“grokking”。具体来说,我们提出(i)完全连接的两层网络,在没有任何正则化的情况下,在普通梯度下降下使用 MSE 损失函数表现出对各种模块化算术任务的 grokking; (ii) 证据表明 grokking 模块化算法对应于学习其结构由任务确定的特定特征图; (iii) 权重的解析表达式——以及特征图——解决一大类模块化算术任务; (iv) 证明这些特征图也可以通过普通梯度下降法和 AdamW 找到,从而建立网络学习表示的完整可解释性。
Progress measures for grokking via mechanistic interpretability2023.2神经网络可解释性方面研究。研究表明,grokking不是突然的转变,而是源于权重中编码的结构化机制的逐渐放大,随后是记忆组件的删除。
awesome-deep-phenomena 2022.5, 神经网络表现出的各种现象的研究git整理。
Deep Learning for Mathematical Reasoning (DL4MATH)DL和数学相关的资料git整理。
PCAST Working Group on Generative AI Invites Public Input2023.5.13. 陶哲轩将主持美国总统科技顾问委员会(PCAST)成立的一个生成式人工智能工作组的会议。
🔥CRATE 白盒ai 训练进展.知乎上有人讨论, 该文章拼凑比较多,且论文和代码相差十万八千里。 知乎参考。(2023)
An Ambiguity Measure for Recognizing the Unknowns in Deep Learning自华为香港研究中心的学者,给出了模型对未知量(类)的模糊性度量框架。该模糊度量能够判断未知量和已知模型所能判断的范围的相关性大小。(2023)
flow_matching(2025)meta在扩散模型中的流模型的基础理论研究与实践。
Harmonic Loss Trains Interpretable AI Models(2025)在本文中,我们引入了谐波损失作为训练神经网络和大型语言模型(LLMs)的标准交叉熵损失的替代方案。谐波损失通过其尺度不变性和设计上的有限收敛点(可解释为类别中心),实现了更好的可解释性和更快的收敛。我们首先在算法、视觉和语言数据集上验证了谐波模型的性能。通过广泛的实验,我们证明了使用谐波损失训练的模型在以下方面优于标准模型:(a) 增强可解释性,(b) 泛化所需的训练数据更少,(c) 减少“顿悟”(grokking)现象。此外,我们将使用谐波损失训练的 GPT-2 模型与标准 GPT-2 模型进行比较,表明谐波模型能够生成更具可解释性的表示。展望未来,我们认为谐波损失有潜力成为数据可用性有限的领域或对可解释性和可靠性要求极高的高风险应用中的重要工具,为更稳健、更高效的神经网络模型铺平道路。(grok译)
懒得分类了,随便新加了一类
39 commits