Py学习  »  机器学习算法

机器学习实战(13)—— 回归分析原理部分

人工智能爱好者社区 • 5 年前 • 436 次点击  

👇点击关注公众号👇

第一时间获取人工智能干货内容


回归分析


线性回归是研究单一因变量和一个或以上自变量之间的关系


线性回归的主要用处:


预测:用已知的自变量来预测因变量

因果分析:自变量作为因变量发生的原因(正负相关)


简单线性回归


数学模型:


其中,y为因变量,x为自变量,为回归系数,是截距。



最小二乘法(OLS)

找出残差平方和最小的一条线


残差


残差平方和


薪资会无限增加么?


多项式线性回归

多元线性回归

为自变量

 y 为因变量

为回归系数

为截距


回归模型的评估


我们需要验证数据之间是否相关,如果不相关,应该接近0


但事实上所做的线性回归,我们期望它不接近于零(y随着x的变化而变化)


于是我们需要做使用回归系数的显著性检验(t检验)


线性关系显著性假设检验


原假设 H0 :  = 0              备择假设 H1:

若原假设正确,则:

其中, 和 都是由最小二乘法求得


线性关系显著性假设检验


计算


给出显著性水平,查 t 分布表得到临界值

比较判断:


,则拒绝 H0 ,接受 H1


,则拒绝 H1,接受 H0


线性关系显著性假设检验


coef:回归系数(正相关、负相关)

std err:标准偏差

t:假设的 t

P>|t|:t 发生的几率,越大则原假设成立可能越大



假设显著性标准为0.05

Bedrooms自变量的 t = 2.658,计算出P为0.009

则因为P<0.05

则推翻原假设

验证Bedrooms变量和因变量关系显著


多元回归模型线性关系显著性假设检验


H0:

HA :  至少有一个 


使用 F 统计,F 越大表示自变量和因变量越相关,同时比较 P 值与显著性标准


多元回归模型预测准确度


残差平方和 SSE  

整体平方和 SST  

yi:真实值                  

:预测值

yavg:平均值


多元回归模型线性关系显著性假设检验


R Squared(拟合优度,越大越好):回归可以解释的变化比例,可作为自变量预测因变量准确度的指标

 SSE=0时,R2最大    SSE=SST时,R2为0



自变量越多,R2越大,考虑模型复杂度,对复杂性进行惩罚 ,所以引入Adjusted R2


AIC(Akaike information criterion)赤池信息量


考虑拟合的优良性(避免过拟合)


AIC越小越好


赤池信息量找出可以最好的解释数据但包含最少自变量的模型


这就是回归分析的主要内容了,你学会了么?


—— 推 荐 阅 读 ——
假如,人工智能也去摆地摊
作为一个乘风破浪的程序员,我每天除了疯就是浪
程序员最卑微的瞬间
Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/115142