本书标签: 明星同人  乡村  学霸笔记   

第7035篇《数学之光:全红婵儿的清华之路》

红婵清华北大学霸笔记铺

第559篇《数学之光:全红婵儿的清华之路》

桌面上摊开的草稿纸上,留存着最小二乘法算出回归直线的演算痕迹。全红婵指尖轻按着纸面,心底生出一个疑问。同样依靠最小二乘准则求出回归方程,两套不一样的样本数据,都可以得到一条回归直线,可是两条直线贴合数据的优劣程度并不相同。仅仅算出\hat{y}=\hat{b}x+\hat{a}并不代表工作就此收尾。有的直线能够大体贴合散点排布走向,残差整体偏小;有的直线即便依照公式算得出来,各个点位偏离直线很远,模型参考价值很低。她在纸上写下几组观测值和预报值,拿真实数值减去预报数值,得到一个个残差数字。零散的残差单独拿出来很难评判整体的拟合水准,需要一套完整的评判体系,去衡量回归模型适配样本数据的程度,残差分析便承担起这项任务。

淡淡的光晕在桌边缓缓铺展开来,伯努利的身影浮现在微光当中,视线扫过纸上罗列的一组组残差数字,语速平缓而厚重。

最小二乘法只是保证在现有计算规则之下残差平方和达到最小。平方和数值本身大小,会随着样本数据量级发生改变。样本整体数值偏大,残差平方和自然而然随之变大,只依靠平方和没有办法横向比对两套模型的拟合效果。残差图、决定系数R^2应运而生。残差图以自变量x或者预报值\hat{y}作为横坐标,残差\hat{e}_i=y_i-\hat{y}_i作为纵坐标描点绘图。透过残差图排布形态,可以直观判断模型是否合适。决定系数R^2将拟合效果归一到0至1的区间之内,方便定量评判优劣。很多学习者只会机械背诵R^2越靠近1拟合效果越好,却不清楚R^2的由来。总偏差可以拆分为两部分,能够被回归直线解释的偏差,还有无法解释的随机偏差。理解偏差拆分逻辑,决定系数的含义才会清晰明了。残差分析不是可有可无的附加步骤,它是一元线性回归模型完整流程当中必不可少的一环。求出回归方程,检验相关性,再经由残差分析评价拟合质量,整套流程才算闭环。

全红婵轻轻点头摆正课本,循着教材编排顺序拆解知识点。本节承接一元线性回归方程,完善统计建模的完整链条。倘若跳过拟合效果检验,直接使用回归方程开展预测,很容易采信一套适配度很差的模型,得出毫无意义的预估结果。边界意识同样不能松懈,残差分析评判的是样本内部的拟合情况,无法保证样本之外的数据依旧遵从这套线性关系。她定下心神,笔尖落在空白笔记本上,逐层搭建完整知识框架。

知识点精讲

一、残差与残差图

残差定义\hat{e}_i=y_i-\hat{y}_i。

y_i是样本观测真实值,\hat{y}_i是代入回归方程算出的预报值。每一组样本点,对应一个残差。

将点(x_i,\hat{e}_i)或是(\hat{y}_i,\hat{e}_i)绘制在平面直角坐标系当中,得到的散点图称作残差图。

时空智者留下哲思评述。残差承载着模型没有解释掉的随机误差。理想状态之下,线性模型适配样本时,残差应当没有固定规律,散乱地分布在横轴上下两侧,没有持续走高或是走低的趋势。如果残差排布呈现出曲线形态、持续递增、持续递减的走势,就意味着变量之间或许并不适合用直线模型来描述,潜藏非线性关联。残差图是一份直观的体检报告,暴露出一元线性模型存在的缺陷。

全红婵在笔记侧边记下四种典型排布形态。

第一种,残差随机散落于横轴上下,没有明显规则,波动范围大致稳定。说明一元线性回归模型适配当前样本。

第二种,残差顺着横坐标增大持续向上偏移,整体不断变大。线性模型没有捕捉到数据递增之外的潜在规律,直线拟合不足。

第三种,残差先负后正,或是先正后负,点位排布呈现抛物线轮廓。变量之间大概率具备二次相关关系,选用曲线模型会更加合适。

第四种,前期残差波动幅度很小,往后离散程度不断扩大。误差并不稳定,存在异方差问题,直线模型可靠性下降。

二、总偏差平方和,残差平方和,回归平方和

针对n组样本数据,\bar{y}代表y的样本均值。

总偏差平方和S_{总}=\sum_{i=1}^{n}(y_i-\bar{y})^2,刻画全部观测值整体的波动总量。y的观测值之所以互不相同,由两类因素造成。第一类因素,x变化带来y的规律性变动,可以被回归直线解释;第二类因素,随机扰动带来的浮动,无法由线性模型解释。

能够被回归模型解释的波动总量称作回归平方和S_{回}=\sum_{i=1}^{n}(\hat{y}_i-\bar{y})^2。

不能够被模型解释的部分,残差平方和S_{残}=\sum_{i=1}^{n}(y_i-\hat{y}_i)^2=\sum_{i=1}^{n}\hat{e}_i^2。

三者恒成立等式S_{总}=S_{回}+S_{残}。

总波动等于可解释波动加上不可解释的随机波动。

全红婵将等式抄写下来。总偏差平方和固定不变时,残差平方和越小,回归平方和就越大,代表模型可以解释的波动占比越高,直线贴合样本的程度越好。单单看S_{残}的绝对数值没有意义。一组数据整体数值庞大,残差平方和天然偏大,不能够直接拿来和小数值样本的残差平方和对比优劣。需要计算比值,得到决定系数。

三、决定系数R^2

R^2=1-\frac{S_{残}}{S_{总}}

取值范围R^2∈[0,1]。

R^2越接近于1,\frac{S_{残}}{S_{总}}越趋近于0。残差平方和占总偏差平方和的比例很小,观测值的波动当中,可以被回归直线解释的部分占比很高,模型拟合效果越好。

R^2越靠近于0,残差平方和占总偏差平方和比重偏大,线性模型能够解释的波动很少,直线拟合效果很差。

伯努利缓缓开口,要分清相关系数r和决定系数R^2之间的联系与差别。在线性模型当中R^2=r^2。r带有正负符号,符号标记相关方向;R^2恒大于等于零,只用来评判拟合的好坏,不体现相关方向。不能把二者混为一谈。r衡量线性相关的强弱,R^2站在回归模型的角度,衡量直线对数据波动的解释能力。两套工具出发点并不一样。即便数值上存在平方关系,含义不可等同。

全红婵标记重点区分条目。r有正负,判断方向与线性相关强弱;R^2≥0,只评价拟合效果好坏。R^2越大,不代表变量之间因果关系越强,仅仅代表线性模型适配样本的程度更高。依旧不能由拟合效果直接推导因果。

四、残差分析完整操作流程

第一步,借助最小二乘法求出回归直线方程\hat{y}=\hat{b}x+\hat{a}。

第二步,把每一个x_i代入回归方程,算出对应的预报值\hat{y}_i。

第三步,逐个计算残差\hat{e}_i=y_i-\hat{y}_i。

第四步,绘制残差图,观测残差点分布形态。散乱无规则分布在横轴两侧,没有趋势,模型形态合适;出现明显曲线、单向偏移趋势,直线模型不合适。

第五步,计算总偏差平方和、残差平方和,求出决定系数R^2。

第六步,综合残差图形态与R^2数值给出完整结论。

答题标准表述示例:R^2≈0.94,十分接近1,残差随机分布在横轴两侧,无明显规律,一元线性回归模型对该组样本拟合效果较好。

如果R^2≈0.32,同时残差呈现抛物线排布。表述为:决定系数偏小,残差图展现明显曲线趋势,一元线性回归模型拟合效果较差,可以考虑选用非线性模型。

五、模型评价的边界

残差分析基于现有的样本数据开展评价。R^2趋近于1,只说明在样本区间内部,直线能够很好适配观测数据。不代表超出样本区间之后,线性关系依旧成立。高R^2不能够为大范围外推预测提供背书。就算拟合效果再好,向外推演依旧要保持谨慎。

另外,高决定系数不等于模型具备实际意义。样本量过少的时候,少量几组数据很容易得到很高的R^2,结论可信度很低。依靠残差分析得出的评判结果,建立在足量样本的基础之上。

伯努利说道,整套统计流程的完整链条由此成型。采集成对样本数据,绘制散点图,计算相关系数检验线性相关性,符合条件则用最小二乘法求回归直线,开展残差分析评价拟合效果,合格之后在样本区间内做预报。步骤顺序不能随意调换,跳过任意一环,得出的结论都会存在漏洞。

题型突破

题型一 残差概念基础辨析选择题

例题,关于残差\hat{e}_i说法正确的是

A残差就是随机误差e

B残差等于y_i-\bar{y}

C残差为观测值减去预报值\hat{e}_i=y_i-\hat{y}_i

D残差必定大于零

解析随机误差e是客观存在却无法观测的量,残差是依靠样本算出来的估计量,A错误。y_i-\bar{y}是观测值和均值的偏差,B错。残差可以为正数,可以为负数,也可以等于零,D错误。选C。

要点,残差是计算所得的估计值,不等同于真实随机误差。

题型二 根据残差图形态判断模型适配度

例题,给出四张残差图。图一残差点无序散布在横轴上下,波动幅度大体稳定;图二残差随着x增大持续向上攀升;图三残差点排布形成开口向上的抛物线;图四残差先聚拢在横轴周边,后续离散程度不断变大。

下述判断合理的是

A图二适合使用一元线性回归模型

B图一适合选用一元线性回归模型

C图三线性模型拟合效果最好

D图四可以直接大范围外推预测

解析图一残差随机分布,无明显趋势,适配直线模型,B正确。图二单向偏移、图三曲线排布,直线模型不合适。图四误差波动不断放大,模型不稳定,不宜外推。答案选B。

题型三 决定系数R^2基础运算题

例题,一组样本总偏差平方和S_{总}=800,残差平方和S_{残}=120,求决定系数R^2。

解析R^2=1-\frac{120}{800}=1‑0.15=0.85。R^2=0.85。数值靠近1,拟合效果较好。

变式题,两套模型甲、乙处理同一组样本。模型甲残差平方和210,模型乙残差平方和160。对比两套模型拟合效果。同一组样本总偏差平方和不变,乙残差平方和更小,R^2更大,乙拟合效果优于甲。

要点,只有针对同一组样本,才可以单凭残差平方和大小比较模型优劣。样本不同,总偏差平方和不一样,残差平方和没有横向对比意义。

题型四 r与R^2关系判断题

例题,一组数据相关系数r=‑0.9,则决定系数R^2等于多少。

解析R^2=r^2=0.81。

判断命题:r越小,R^2越小。命题错误。r=‑0.9相较于r=0.4,r数值更小,但是R^2更大。R^2由r的平方决定,只和|r|相关。

题型五 回归建模完整流程大题

例题,采集六组成对数据,绘制散点图观察到点位大致沿一条直线排布,计算得到相关系数r≈0.93,具备较强正线性相关关系。借助最小二乘法求出回归直线方程。计算残差,绘制残差图,残差点随机分布于横轴两侧。算出总偏差平方和752,残差平方和98。求出R^2≈1‑\frac{98}{752}≈0.87。给出完整结论。

参考答案:相关系数显示变量具备较强线性相关关系,R^2≈0.87接近1,残差图无明显排布趋势,一元线性回归模型拟合效果较好,可以在样本x取值区间内使用回归方程开展预报。样本区间之外谨慎外推。

易错清单

易错点一 将残差等同于真实随机误差e。随机误差不可观测,残差经由样本计算得到,是估计量。

易错点二 不同样本之间直接依靠残差平方和大小比对拟合效果。总偏差平方和不一样时,该对比方式无效,需要算出R^2。

易错点三 认为R^2=1代表变量之间存在函数关系。样本点位全部贴合直线时R^2等于1,只是针对当前样本呈现出函数形态,不代表总体一定是确定性函数。

易错点四 混淆相关系数r与决定系数R^2的功能。依靠R^2判断相关方向,忽略R^2恒非负,无法体现正负相关。

易错点五 残差图出现明显曲线趋势,依旧强行使用直线模型,忽视模型形态的缺陷。

易错点六 R^2接近1就无限制向外推预测,忽略线性趋势存在有效区间。

易错点七 答题只给出R^2数值就草草收尾,没有结合残差图形态综合评价模型,作答不够完整。

学习心得感悟

晚风从窗外徐徐吹入,掀动薄薄的稿纸。全红婵放下笔,目光落在决定系数公式之上,心中生出绵长的思索。求出回归直线并不意味着探寻的结束,残差便是模型遗留下来的缝隙。没有一套模型可以把现实里全部波动尽数收纳,总会剩下一部分无法解释的随机偏差。不必强求将所有变化都纳入规则当中,接纳合理的残差,是统计思维里重要的一课。

R^2给了衡量拟合程度的标尺,标尺同样有局限。高数值只代表在观测样本当中适配度良好,不能证明这套规律放之四海皆准。再好的模型都有着自身的适用边界。世间提炼出来的规则大多是近似描摹,而非绝对真理。

残差图带来另一种启示。数据不会刻意迎合直线。当散点排布呈现出弯曲的走向,固执地选用直线去概括全部变化,只会得到一套漏洞百出的模型。要学会依据现实样貌选择适配的工具,而不是强迫现实适配既定的公式。

微光慢慢消散,伯努利的话语沉淀在心间。你搭建模型去梳理纷乱的数据,同时也要学会检验模型。工具帮你归纳趋势,残差提醒你还有被忽略的部分。不要沉醉于一条拟合良好的直线,便认定把握住了全部事实。看见主线,也看见主线之外散落的偏差,评判模型,保留审慎,才是完整的思考方式。

全红婵合上笔记本,目光望向课本下一节。独立性检验将会开启统计全新板块,由变量的相关关系过渡到分类变量之间的关联性判断。她收拢演算草稿,将笔记本放进帆布书包,缓步走出自习室。

互动区互动环节:《红婵清华北大学霸笔记铺》涵盖初高中各科笔记、真题、方法技巧、学习心得感悟及趣味故事等,在手机上随时可翻看,是你的行走课堂,专门为初高中学生打造《红婵清华北大学霸笔记铺》互动环节内容。 免费为收藏关注的同学设计笔记,把你的要求发在评论区,例如 给我设计一篇初中八年级英语上册第3单元的学习笔记。设计完成后编号放在红婵儿清华北大学霸笔记铺的专栏里,你可自行提取。另外你有好的设计笔记,请在评论区留言,我们在学霸笔记铺设专题专栏为你发布,欢迎你的参与!让我们共同打造最实用的学霸笔记库

章末备注:文中公式和算式的代码(乱码)可用任一款ai软件(豆包)解锁,即将内容复制并粘贴至豆包对话框确认即可