学习过程中的笔记梳理与总结
可以在gitbook中观看,效果更佳:Introduction - Study (gitbook.io)
gitbook教程:
https://blog.csdn.net/weixin_41024483/article/details/100090621
book sm自动生成目录SUMMARY
手动整理的目录
[TOC]
线性回归的值域是实数域,通过逻辑斯蒂回归模型的定义式可以将线性函数转换为概率$P(Y=1|x)=\frac{exp(w^Tx)}{1+exp(w^Tx)}$
输出Y=1的对数几率是由输入x的线性函数表示的模型:$log\frac{P(Y=1|x)}{(1-P(Y=1|x))}=w^Tx$
一个事件的几率(odds)是指该事件发生的概率与该事件不发生的概率的比值。
极大似然估计法估计模型参数,等价于最小化交叉熵损失函数,用梯度下降法及拟牛顿法学习
优点
LR中的连续特征为什么要离散化
H(Y|X)
&=-\sum_{i=1}^np(x_i,y_i)logp(y_i|x_i) \
&=\sum_{i=1}^np(x_i)H(Y|x_i) \
&=-\sum_{i=1}^np(x_i)\sum_{j=1}^mp(y_j|x_i)logp(y_j|x_i)
\end{aligned} $$
二类分类的线性分类模型
输入为实例的特征向量,输出为实例的类别,取+1和-1二值
判别模型
旨在求出将训练数据进行线性划分的分离超平面,导入基于误分类的损失函数,利用梯度下降法对损失函数进行极小化,求得感知机模型。
模型简单而易于实现,分为原始形式和对偶形式
决策树学习通常包括3 个步骤:特征选择、决策树的生成和决策树的修剪。
主要优点是模型具有可读性,分类速度快。
设有联合概率分布P(Y),由无向图G表示,结点表示随机变量,边表示随机变量之间的依赖关系。如果联合概率分布P(Y)满足成对、局部或全局马尔可夫性,就称此联系和概率分布为概率无向图模型,或马尔可夫随机场。
成对马尔可夫性:u和v是两个没有边连接的结点,其他所有结点为O。给定随机遍历组Yo的条件下随机变量Yu和Yv是条件独立的
局部马尔可夫性:W是与v有边连接的所有结点,O是其他结点。给定随机变量组Yw的条件下随机变量Yv与随机变量组Yo是独立的
全局马尔可夫性:结点集合A,B是在无向图G中被结点集合C分开的任意结点集合。给定随机变量组Yc条件下随机变量组YA和YB是条件独立的
成对的、局部的、全局的马尔可夫性定义是等价的。
更关心如何求其联合概率分布,希望将整体的联合概率写成若干子联合概率的乘积的形式(因子分解)。
概率无向图模型的联合概率分布可以写作图中所有最大团C上的函数的乘积形式。
生成式有向图模型
隐马尔可夫模型:隐藏的马尔可夫链随机生成不可观测的状态随机序列,再由各个状态生成一个观测从而产生观测随机序列
由初始概率分布(向量π)、状态转移概率分布(矩阵A)以及观测概率分布(矩阵B)确定。A,B,π称为HMM的三要素
两个基本假设:齐次马尔可夫性假设(t的状态只依赖于t-1的状态),观测独立性假设(t的观测只依赖于t的状态)
可以用于标注,状态对应着标记。标注问题是给定观测的序列预测其对应的标记序列。可以假设标注问题的数据是由隐马尔可夫模型生成的。这样我们可以利用隐马尔可夫模型的学习与预测算法进行标注。
3个基本问题:
https://zhuanlan.zhihu.com/p/33397147 #td
优点
缺点
不适合以下场景
与BERT相比
在BERT的基础上
提出了新的预训练任务和框架,把生成式的Masked language model(MLM)预训练任务改成了判别式的Replaced token detection(RTD)任务,判断当前token是否被语言模型替换过。
该模型由两部分组成,分别是generator以及discriminator,两个都是transformer的encoder结构,只是两者的size不同
构建适当的Prompt,使得下游任务的形式跟预训练任务更贴近
Prompt的做法,从任务形式来说可以分为两种:
过拟合的解决方法
欠拟合的解决方法
https://zhuanlan.zhihu.com/p/72038532
梯度消失
梯度爆炸
Jupyter Notebook
81.8%
Python
11.9%
HTML
5.0%
学习过程中的笔记梳理与总结
可以在gitbook中观看,效果更佳:Introduction - Study (gitbook.io)
gitbook教程:
https://blog.csdn.net/weixin_41024483/article/details/100090621
book sm自动生成目录SUMMARY
手动整理的目录
[TOC]
线性回归的值域是实数域,通过逻辑斯蒂回归模型的定义式可以将线性函数转换为概率$P(Y=1|x)=\frac{exp(w^Tx)}{1+exp(w^Tx)}$
输出Y=1的对数几率是由输入x的线性函数表示的模型:$log\frac{P(Y=1|x)}{(1-P(Y=1|x))}=w^Tx$
一个事件的几率(odds)是指该事件发生的概率与该事件不发生的概率的比值。
极大似然估计法估计模型参数,等价于最小化交叉熵损失函数,用梯度下降法及拟牛顿法学习
优点
LR中的连续特征为什么要离散化
H(Y|X)
&=-\sum_{i=1}^np(x_i,y_i)logp(y_i|x_i) \
&=\sum_{i=1}^np(x_i)H(Y|x_i) \
&=-\sum_{i=1}^np(x_i)\sum_{j=1}^mp(y_j|x_i)logp(y_j|x_i)
\end{aligned} $$
二类分类的线性分类模型
输入为实例的特征向量,输出为实例的类别,取+1和-1二值
判别模型
旨在求出将训练数据进行线性划分的分离超平面,导入基于误分类的损失函数,利用梯度下降法对损失函数进行极小化,求得感知机模型。
模型简单而易于实现,分为原始形式和对偶形式
决策树学习通常包括3 个步骤:特征选择、决策树的生成和决策树的修剪。
主要优点是模型具有可读性,分类速度快。
设有联合概率分布P(Y),由无向图G表示,结点表示随机变量,边表示随机变量之间的依赖关系。如果联合概率分布P(Y)满足成对、局部或全局马尔可夫性,就称此联系和概率分布为概率无向图模型,或马尔可夫随机场。
成对马尔可夫性:u和v是两个没有边连接的结点,其他所有结点为O。给定随机遍历组Yo的条件下随机变量Yu和Yv是条件独立的
局部马尔可夫性:W是与v有边连接的所有结点,O是其他结点。给定随机变量组Yw的条件下随机变量Yv与随机变量组Yo是独立的
全局马尔可夫性:结点集合A,B是在无向图G中被结点集合C分开的任意结点集合。给定随机变量组Yc条件下随机变量组YA和YB是条件独立的
成对的、局部的、全局的马尔可夫性定义是等价的。
更关心如何求其联合概率分布,希望将整体的联合概率写成若干子联合概率的乘积的形式(因子分解)。
概率无向图模型的联合概率分布可以写作图中所有最大团C上的函数的乘积形式。
生成式有向图模型
隐马尔可夫模型:隐藏的马尔可夫链随机生成不可观测的状态随机序列,再由各个状态生成一个观测从而产生观测随机序列
由初始概率分布(向量π)、状态转移概率分布(矩阵A)以及观测概率分布(矩阵B)确定。A,B,π称为HMM的三要素
两个基本假设:齐次马尔可夫性假设(t的状态只依赖于t-1的状态),观测独立性假设(t的观测只依赖于t的状态)
可以用于标注,状态对应着标记。标注问题是给定观测的序列预测其对应的标记序列。可以假设标注问题的数据是由隐马尔可夫模型生成的。这样我们可以利用隐马尔可夫模型的学习与预测算法进行标注。
3个基本问题:
https://zhuanlan.zhihu.com/p/33397147 #td
优点
缺点
不适合以下场景
与BERT相比
在BERT的基础上
提出了新的预训练任务和框架,把生成式的Masked language model(MLM)预训练任务改成了判别式的Replaced token detection(RTD)任务,判断当前token是否被语言模型替换过。
该模型由两部分组成,分别是generator以及discriminator,两个都是transformer的encoder结构,只是两者的size不同
构建适当的Prompt,使得下游任务的形式跟预训练任务更贴近
Prompt的做法,从任务形式来说可以分为两种:
过拟合的解决方法
欠拟合的解决方法
https://zhuanlan.zhihu.com/p/72038532
梯度消失
梯度爆炸
Jupyter Notebook
81.8%
Python
11.9%
HTML
5.0%