学习笔记|正态分布|图形法|偏度和峰度|非参数检验法|《小白爱上SPSS》课程:SPSS第三讲 | 正态分布怎么检验?看这篇文章就够了

目录

  • 学习目的
  • 软件版本
  • 原始文档
  • 为什么要假设它服从正态分布呢?
  • t检验
  • 一、图形法
  • 1、频数分布直方图
    • 解读
  • 2、正态Q-Q图
    • 操作
    • 解读
  • 3、正态P-P图
    • SPSS实战操作
    • 解读
  • 二、偏度和峰度
    • 解读:
  • 三、非参数检验法
    • 注意事项
  • 四、规范表达
  • 五、小结
  • 划重点

学习目的

SPSS第三讲 | 正态分布怎么检验?看这篇文章就够了

软件版本

IBM SPSS Statistics 26。

原始文档

《小白爱上SPSS》课程
#统计原理

为什么要假设它服从正态分布呢?

一方面,是由于正态分布非常普通平凡,所以假设一个随机事件服从正态分布,比假设其他分布的成功率更高。
另一方面,是因为正态分布能够指明探索的方向。比如,如果我们验证后发现,这个随机事件不服从正态分布,那它就一定不满足正态分布背后的中心极限定理。而不满足中心极限定理,我们就能知道——要么是它的影响因素不够多,要么是各种影响因素不相互独立,要么是某种影响因素的影响力太大等等…这时候,接下来的研究也就有了明确的方向。

t检验

正态分布是很多连续型数据比较分析的大前提,比如t检验、方差分析、相关分析以及线性回归等,均要求数据服从正态分布或近似正态分布。
但大多数人进行统计时容易忽略这一重要前提,导致统计效能下降和假阴性风险增加。
为此,在系统讲解推断性统计方法之前,本课程将呈现三种正态分布的检验方法,让我们一次性掌握正态分布的检验方法。

一、图形法

一提到正态分布,我们自然会想到一个钟型形状。如下图。特点是“中间多,两端少”。
在这里插入图片描述
那么,怎么检验一组数据是否服从正态分布呢?先呈现个案例。
案例:25名青少年数据如下表,请判断该组数据的身高是否服从正态?
导入数据,命令行:

GET FILE='E:\E盘备份\recent\小白爱上SPSS\小白数据\第三讲 正态分布.sav'. 

在这里插入图片描述
案例分析:身高数据明显属于连续型变量,可进行正态检验。

1、频数分布直方图

SPSS实战操作
第一步:【图形】→【旧对话框】→【直方图】
第二步:弹出直方图,将待分析变量移入【变量】框内,勾选显示正态曲线,本次我们考察“身高”数据,其他参数不用设置,直接【确定】命令执行。确定后,呈现如下直方图。
在这里插入图片描述
命令行:

GRAPH 			/*绘图*//HISTOGRAM(NORMAL)=身高.	/*直方图(正态)*/

解读

观察直方图的分布形状是否为一个倒扣“钟”型的对称形状,如果接近或相似,则可认为数据服从正态分布。
本例中,“身高”数据频数分布直方图的形状比较接近于倒扣的“钟形”,左右两边具有对称性,可认为该数据为正态分布数据。
执行:GRAPH /HISTOGRAM(NORMAL)=年龄. 显示“年龄”变量的直方图:
在这里插入图片描述
明显与正态曲线不重合。

2、正态Q-Q图

简介:Q-Q图反映了变量的实际分布与理论分布的符合程度,可以用来考察数据是否服从某种分布类型。若数据服从正态分布,则数据点应与理论直线基本重合。

操作

第一步:【分析】→【描述统计】→【QQ图】
第二步:将待分析的连续数据变量,如:身高,移入【变量】框内,软件默认是检验【正态分布】,其他参数不用设置,直接【确定】命令执行。
在这里插入图片描述
确定后,呈现如下Q-Q图。
在这里插入图片描述
命令行:
···
PPLOT
/VARIABLES=身高 /核心变量,其他行为可选参数,有默认或初始值/
/NOLOG
/NOSTANDARDIZE
/TYPE=Q-Q
/FRACTION=BLOM
/TIES=MEAN
/DIST=NORMAL.
···

解读

观察Q-Q图上的点能否分布在一条直线上,分布在一条直线上则说明近似或服从正态分布。
本例中,身高绝大多数的点能分布在一条直线上,直线趋势明显,可认为该连续数据服从正态分布。

3、正态P-P图

简介:P-P图反映了变量的实际累积概率与理论累积概率的符合程度,可以用来考察数据是否服从某种分布类型。若数据服从正态分布,则数据点应与理论直线基本重合。与Q-Q图意义相似。

SPSS实战操作

第一步:【分析】→【描述统计】→【P-P图】
第二步:将待分析的连续数据变量移入【变量】框内,本例检测“身高”数据的正态分布,软件默认是检验【正态分布】,其他参数不用设置,直接【确定】命令执行。
命令行:
···
PPLOT
/VARIABLES=身高 /核心变量,其他行为可选参数,有默认或初始值/
/TYPE=P-P
/DIST=NORMAL.
···
在这里插入图片描述

解读

观察P-P图上的点能否分布在理论分布的直线上,若基本分布在直线上则说明近似或服从正态分布。
本例中,“身高”的绝大多数的点能分布在一条直线上,直线趋势明显,可认为该连续数据服从正态分布。

二、偏度和峰度

简介:
[偏度]主要用于判定数据的对称性,整体数据偏左还是偏右,见下图。
在这里插入图片描述
当偏度S≈0时,可认为分布是对称的,服从正态分布;
当偏度S>0时,分布为右偏,即拖尾在右边,峰尖在左边,也称为正偏态;
当偏度S<0时,分布为左偏,即拖尾在左边,峰尖在右边,也称为负偏态;
注意:数据分布的左偏或右偏,指的是数值拖尾的方向,而不是峰的位置。
[峰度]是用于判定数据分布的陡缓程度,见下图。
在这里插入图片描述
当峰度K≈0时,可认为分布的峰态合适,服从正态分布(不胖不瘦);
当峰度K>0时,分布的峰态陡峭(高尖);
当峰度K<0时,分布的峰态平缓(矮胖);
了解偏度和峰度这两个统计量的含义很重要,是检验数据正态分布的重要指标。
实际上,我们收集到很难能满足S≈0,K≈0, 因此,可采用K与S系数来检验,检验公式如下。
在这里插入图片描述
其中,SS和SK均为S系数和K系数的标准误。在α=0.05的情况下,Z值的绝对值大于1.96时,可认为K系数或S系数显著不等于0,即样本数据非正态。
SPSS实战操作
第一步:【分析】→【描述统计】→【描述】
第二步:将“身高”选入【变量】框中,点击【选项】,勾选“平均值”、“标准差”、“峰度”和“偏度”。
在这里插入图片描述
第三步:点击“继续”、“确定”,得到计算结果。
命令行:
···
DESCRIPTIVES VARIABLES=身高
/STATISTICS=MEAN STDDEV KURTOSIS SKEWNESS. /统计指标=平均值 标准差 峰度 偏度/
···
在这里插入图片描述

解读:

①计算偏度系数:
手算:
在这里插入图片描述
②计算峰度系数:
手算:
在这里插入图片描述
由以上结果可知,偏度系数和峰度系数的绝对值均小于1.96,可以认为该组样本数据符合正态分布。
需注意:当样本量过大(超过100)时,采用峰度和偏度系数会对正态性的情况有所偏误,此时,可以直接尝试采用图示法(直方图、P-P、Q-Q)的方法进行检验会更直观。

三、非参数检验法

简介:正态性检验属于非参数检验,原假设为“样本来自的总体与正态分布无显著性差异”,只有P>0.05才能接受原假设,即数据符合正态分布。
常见的正态性检验有Kolmogorov-Smirnov检验(即柯尔莫戈洛夫-斯米诺夫检验,简称K-S检验)和Shapiro-Wilk检验(即夏皮-威尔克检验,简称S-W检验),K-S检验适用于大样本数据,S-W检验适用于小样本数据,当检验结果的p值小于0.05,则认为数据不满足正态性。
SPSS实战操作
第一步:【分析】-【描述统计】-【探索】 打开探索对话框。
第二步:本例我们想分别检验男女两组的身高是否服从正态分布,故将身高选入【因变量】列表,将性别选入【因子列表】
点击 【图】 --勾选“直方图”“含检验的正态图”
点击【继续】–【确定】,得到探索性分析结果。输出结果有很多图表,我们只解释正态性检验结果。
在这里插入图片描述
命令行:

EXAMINE VARIABLES=身高 BY 性别 /PLOT BOXPLOT NPPLOT /*若无此行,则不输出正态性检验表*//COMPARE GROUPS /STATISTICS DESCRIPTIVES /CINTERVAL 95 /MISSING LISTWISE /NOTOTAL.

结果解读:
当数据量≤50时,倾向于以夏皮洛-威尔克(S-W)检验结果为准;
当数据量>50时,倾向于以柯尔莫戈洛夫-斯米诺夫(K-S)检验结果为准;
当数据量>5000时,SPSS只会显示K-S检验结果。
本例中,我们比较25例男女中学生身高差异,需要分别看这两组的身高分布情况,上表显示,两组的样本量(可参考自由度那一列数值)均小于50,故以夏皮洛-威尔克(S-W)检验结果为准.
两组检验的p值(即显著性那一列)分别为0.690、0.771,均大于0.05,说明这两组身高均符合正态分布,故认为身高满足正态性。

注意事项

在使用S-W和K-S检验时需注意,当样本量较少的时候,检验结果不够敏感,即使数据分布有一定的偏离也不一定能检验出来;而当样本量较大的时候,检验结果又会太过敏感,只要数据稍微有一点偏离,P值就会<0.05,检验结果倾向于拒绝原假设,认为数据不服从正态分布。
所以,如果样本量足够多,即使检验结果P<0.05,数据来自的总体也可能是服从正态分布的。为此,我们要结合图直方图、P-P、Q-Q的图示法灵活使用。

四、规范表达

本次测量样本为25名,故采用夏皮洛-威尔克(S-W)检验,将SPSS输出结果整理为三线表,如下表1。
表1 身高的S-W正态性检验结果
在这里插入图片描述
从上表可知,男女生的正态性检验结果的统计分别为0.956和0.959,P值分别为0.690、0.771,均大于0.05。
同时结合直方图、P-P图和Q-Q图,可认为男生和女生的身高都服从正态分布。

五、小结

正态分布的检验方法包括图示法、偏度和峰度、非参数检验方法。
图形法检验正态分布往往是有效的,是实际应用中较为普遍的方式,是对正态分布显著性检验(如偏度和峰度的Z值、S-W及K-S检验)的有力辅助手段。
在实际的应用中,往往会出现明明直方图显示分布很对称,但参数检验的结果P值却<0.05,拒绝原假设认为不服从正态分布。
此时建议不要太刻意追求正态性检验的P值,一定要参考直方图、P-P图等图形工具来帮助判断。因此正态性检验三种方法均有重要实用意义。
很多统计学方法,如T检验、方差分析等,与其说要求数据严格服从正态分布,不如说“数据分布不要太偏态”更为合适。
小白学习完本节课内容之后,赶紧回去对40名大侠的数据进行正态性检验(第二讲数据),结果发现大侠们的身高、体重服从正态分布,而成绩不服从正态分布。
身高正态性检验(命令行):

EXAMINE VARIABLES=身高/PLOT BOXPLOT NPPLOT /*若无此行,则不输出正态性检验表*//COMPARE GROUPS /STATISTICS DESCRIPTIVES /CINTERVAL 95 /MISSING LISTWISE /NOTOTAL.

身高检验结果:
在这里插入图片描述
在这里插入图片描述
体重正态性检验(命令行):

EXAMINE VARIABLES=体重/PLOT BOXPLOT NPPLOT /*若无此行,则不输出正态性检验表*//COMPARE GROUPS /STATISTICS DESCRIPTIVES /CINTERVAL 95 /MISSING LISTWISE /NOTOTAL.

体重检验结果:
在这里插入图片描述
在这里插入图片描述
成绩正态性检验(命令行):

EXAMINE VARIABLES=成绩/PLOT BOXPLOT NPPLOT /*若无此行,则不输出正态性检验表*//COMPARE GROUPS /STATISTICS DESCRIPTIVES /CINTERVAL 95 /MISSING LISTWISE /NOTOTAL.

成绩检验结果:
在这里插入图片描述
在这里插入图片描述

于是,大侠们的身高和体重采用平均数、标准差来描述,而成绩采用中位数和四分位距来描述。
小白把上次的描述性结果呈送给主任,主任看后,满意地点点头。
然后,转过头对小白说:“小白,我想了解下今年这些大侠们的体重是否超标了?如果超标,就要加强训练,减脂减重,你能比较出来吗?”
小白这时比较淡定了,因为他非常清楚,《小白爱上SPSS》课程下一讲,将开启假设检验,讲解差异比较的T检验。
所以,搬好小板凳,等待开课就好了!

划重点

1、正态分布的检验方法包括图示法、偏度和峰度、非参数检验方法。
2、实际应用不必太刻意追求偏峰度的Z值和S-W及K-S检验的P值,需要结合直方图、P-P图和Q-Q图来判断。
3、对于统计方法,与其说要求数据严格服从正态分布,不如说“数据分布不要太偏态”更为合适。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.rhkb.cn/news/175499.html

如若内容造成侵权/违法违规/事实不符,请联系长河编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

Shopee流量和销量不佳?或许你没有掌握正确的引流方法

很多卖家做了很久&#xff0c;但是发现流量和销量都没怎么增长&#xff0c;今天陈哥就分享一下如何正确的引流。 以下是一些有效的引流策略&#xff1a; 1. 站内引流&#xff1a;选择高性价比的潮流商品&#xff0c;根据目标客户群和重点品类进行选品。优化商品名称和描述&am…

Power BI 傻瓜入门 18. 让您的数据熠熠生辉

本章内容包括&#xff1a; 配置Power BI以使数据增量刷新发现使用Power BI Desktop and Services保护数据集的方法在不影响性能和完整性的情况下管理海量数据集 如果有更新的、更相关的数据可用&#xff0c;旧数据对组织没有好处。而且&#xff0c;老实说&#xff0c;如果数据…

设计模式_观察者模式

观察者模式 介绍 设计模式定义案例问题堆积在哪里解决办法观察者是行为型设计模式 多个对象 观察 1个对象小强考试完 成绩公布了 家长/同学得知成绩后 做出不同反应一个一个通知很麻烦 先通知谁 也有讲究的 信息发布方 抽象出一个信息管理类 负责管理监听者 类图 代码 Obse…

学习视频剪辑:如何从指定时段快速抽出视频图片!高效技巧分享

随着数字媒体的普及&#xff0c;越来越多的人开始接触视频剪辑。在视频剪辑过程中&#xff0c;有时候我们需要从指定时段快速抽出视频图片。这不仅可以帮助我们提高剪辑效率&#xff0c;还可以让我们的视频更加丰富多彩。本文将分享一些高效技巧&#xff0c;帮助你轻松实现从指…

尚未解决:use_python()和use_virtualenv()的使用

reticulate包为Python和R之间的互操作性提供了一套全面的工具。该包包含以下功能&#xff1a; 以多种方式从R调用Python&#xff0c;包括RMarkdown、获取Python脚本、导入Python模块以及在R会话中交互使用Python。 R和Python对象之间的转换&#xff08;例如&#xff0c;R和Pan…

Three.js 开发引擎的特点

Three.js 是一个流行的开源 3D 游戏和图形引擎&#xff0c;用于在 Web 浏览器中创建高质量的三维图形和互动内容。以下是 Three.js 的主要特点和适用场合&#xff0c;希望对大家有所帮助。北京木奇移动技术有限公司&#xff0c;专业的软件外包开发公司&#xff0c;欢迎交流合作…

​CRM中的大客户销售是什么?​

对企业来说&#xff0c;大客户可能贡献了大部分的销售业绩。什么样的客户可以被认定为是大客户&#xff1f;大客户销售与普通销售有何区别&#xff1f;针对大客户又该采取什么样的销售策略呢&#xff1f;从回答这几个问题开始&#xff0c;我们来说说CRM中的大客户销售是什么&am…

【Postgres】Postgres常用命令

文章目录 1、导出数据库某张表2、导入某张表到数据库3、查看数据库占用磁盘页数情况4、查看数据库大小5、查看数据表大小6、查看索引大小7、对数据库中表索引按照大小排序8、对数据库中表按照大小排序9、回收空间&#xff08;建议先回收指定表&#xff09;10、设置主键自增序列…

【linux】文件系统+软硬连接+动静态库

文件系统软硬连接动静态库 1.理解文件系统1.1磁盘的物理结构1.2磁盘的存储结构1.3磁盘的逻辑结构1.4文件系统 2.软硬链接2.1什么是软硬链接2.2软硬链接的作用 3.动静态库3.1什么是库3.1静态库和静态链接3.2动态库和动态链接3.2.1通过环境变量找到动态库路径3.2.2把动态库拷贝到…

从零开始学习PX4源码0(固件下载及编译)

目录 文章目录 目录摘要1.重点学习网址2.固件下载1.下载最新版本固件2.下载之前版本固件 摘要 本节主要记录从零开始学习PX4源码1(固件下载)的过程&#xff0c;欢迎批评指正&#xff01;&#xff01;&#xff01; 下载固件主要分为两个版本&#xff0c;之前稳定版本和最新官网…

Flutter PopupMenuButton下拉菜单

下拉菜单是移动应用交互中一种常见的交互方式,可以使用下拉列表来展示多个内容标签,实现页面引导的作用。在Flutter开发中,实现下拉弹框主要有两种方式,一种是继承Dialog组件使用自定义布局的方式实现,另一种则是使用官方的PopupMenuButton组件进行实现。 如果没有特殊的…

python读取Excel到mysql

常见问题&#xff1a; 1.数据库密码有特殊字符 使用urllib.parse.quote_plus 编译密码 mysql_engine create_engine((f"mysqlpymysql://root:%s10.0.0.2:3306/mydb")%urllib.parse.quote_plus("passaaaa")) 2.设置字段类型 设置特定类型&#xff0c;和指…

Java 使用 poi 和 aspose 实现 word 模板数据写入并转换 pdf 增加水印

本项目所有源码和依赖资源都在文章顶部链接&#xff0c;有需要可以下载使用 1. 需求描述 从指定位置读取一个 word 模板获取业务数据并写入该 word 模板&#xff0c;生成新的 word 文档将新生成的 word 文档转换为 pdf 格式对 pdf 文档添加水印 2. 效果预览 word 模板 带水印的…

Redis文件事件模型

Redis是事件驱动的程序&#xff0c;并基于Reactor模式开发了自己的网络事件处理器&#xff0c;被称之为文件处理器(File Event Handler)。 文件处理器通过I/O多路复用程序来同时监听多个Socket&#xff0c;并根据Socket目前执行的任务来关联不同的事件处理器。当被监听的Socket…

GIT文件夹上面的状态(对钩或红色感叹号)不显示,解决

换了新电脑&#xff0c;GIT代码上传啥的都正常&#xff0c;但是文件中文件图标状态不显示&#xff0c;搜了一下已找到解决方法&#xff0c;实测有效。 第一步 winr&#xff0c;输入regedit.exe&#xff0c;打开注册表 第二步 找到以下路径 “ HKEY_LOCAL_MACHINE–>SOFTWA…

pytorch 笔记:KLDivLoss

1 介绍 对于具有相同形状的张量 ypred​ 和 ytrue&#xff08;ypred​ 是输入&#xff0c;ytrue​ 是目标&#xff09;&#xff0c;定义逐点KL散度为&#xff1a; 为了在计算时避免下溢问题&#xff0c;此KLDivLoss期望输入在对数空间中。如果log_targetTrue&#xff0c;则目标…

AI时代:ChatGPT让程序员插上翅膀

程序员开发新模式&#xff1a;一本专注于帮助程序员在AI时代实现晋级、提高效率的图书。书中介绍了如何使用 ChatGPT 来完成高质量代码编写、文档编写、软件设计等各个环节&#xff0c;并通过实战案例展示了 ChatGPT在实际项目开发中的应用方法。 1.开发新模式&#xff1a;让程…

靶机DC系列 DC:1

DC:1 文章目录 DC:1信息收集端口IP信息网页信息 漏洞利用shell提权 信息收集 端口IP信息 使用arp-scan获得靶机ip 使用nmap对端口进行详细扫描 可以看到该目标机开放了三个端口 有ssh、http、rpcbind服务 其中rpcbind是拥有该漏洞可使攻击者在远程rpcbind绑定主机上分配任意…

第09章_子查询

第09章_子查询 讲师&#xff1a;尚硅谷-宋红康&#xff08;江湖人称&#xff1a;康师傅&#xff09; 官网&#xff1a;http://www.atguigu.com 子查询指一个查询语句嵌套在另一个查询语句内部的查询&#xff0c;这个特性从MySQL 4.1开始引入。 SQL 中子查询的使用大大增强了…