【读书笔记-数据挖掘概念与技术】离群点检测


1   离群点和离群点分析

1.2    离群点的类型

a.全局离群点

显著偏离数据集中的其余对象,最简单的一类离群点。

检测方法:找到一个合适的偏离度量

b.情境离群点

离群点的值依赖于情境。分为情境属性(定义对象的情境)和行为属性(定义对象的特征)

c.集体离群点

数据对象的子集形成集体离群点,如果这些对象作为整体显著偏离整个数据集。

1.3   离群点检测的挑战

正常数据与异常数据的界限不明显;

离群点≠噪声


2   离群点检测方法

两大类:

        a.根据用于分析的数据样本是否具有领域专家提供的,可以用来构建离群点检测模型的标号,对离群点检测方法进行分类:

2.1   监督、半监督、无监督

a.监督方法:

专家标记出正常对象,对其建模构造分类器,不与正常对象模型匹配的其他对象都视为离群点

挑战:类不平衡问题;捕获尽可能多的离群点比把正常对象武当离群点更重要

b.无监督方法:

没有标记,假定“正常对象在某种程度上是聚类的”。

中心思想:先找出簇,然后,不属于任何簇的对象都被检测为离群点。

两个问题:不属于任何簇的对象可能是噪声,而不是离群点;先找出簇,在找出离群点的开销可能太大。

c.半监督方法



b.根据各方法关于正常对象和离群点的假定,对各方法分组:

3   统计学方法

统计学:假定正常的数据对象由一个统计模型产生,正常对象出现在该随机模型的高概率区域中,而低概率区域中的对象是离群点。

参数方法:

基于正态分布的一元离群点检测:

a.最大似然检测一元离群点;

b.grubb检验(最大标准残差检验);

多元离群点:(核心思想:把多元离群点检测任务转换成一元离群点检测问题)

a.马哈拉诺比斯距离检测多元离群点;

b.X²统计量的多元离群点检测;

使用混合参数分布

a.假定正常的数据对象被多个正态分布产生;

b.使用多个簇检测多元离群点;

非参数方法:

直方图检测离群点

缺点:很难选择一个合适的箱尺寸,箱太小,容易被误识别为离群点;箱太大,离群点容易被误认为正常。

为了解决这个问题,可以采用核密度估计来估计数据的概率密度分布。把每个观测对象看作一个周围区域中的高概率密度指示子。一个点上的概率密度依赖于该点到观测对象的距离。使用核函数对样本点对其邻域内的影响建模。核函数是一个非负实数值可积函数。


4   基于邻近性的方法

假定一个对象是离群点,如果它在特征空间中的最近邻也远离它,即该对象与它的最近邻性显著地偏离数据集中的其他对象与他们的近邻之间的近邻性

基于距离的离群点检测和嵌套循环方法——考察对象给定半径的邻域

基于网格的方法——CELL

基于密度的离群点检测——考察对象和它邻近的密度


5   基于聚类的方法

假定正常数据对象属于大的稠密的簇,而离群点属于小的或稀疏的簇,或者不属于簇。

  • 使用到最近簇的距离的基于聚类的离群点检测;
  • 通过基于聚类的离群点检测进行入侵检测;——CBLOF
  • 检测小簇中的离群点;

优点:

无监督

缺点:

有效性依赖于所使用的聚类方法,开销大


6   基于分类的方法

点是有标号的,可用于构建分类器:如用svm来构建决策边界


7   挖掘情境离群点和集体离群点

7.1   情境离群点--->传统的离群点检测

7.2   关于情境对正常行为建模

7.3   挖掘集体离群点

  • 识别结构单元
  • 直接对结构单元的期望行为进行建模

8   高维数据中的离群点检测

挑战:

  • 离群点的解释
  • 数据的稀疏性
  • 数据子空间
  • 于维度的可伸缩性

8.1   扩充的传统离群点检测

eg.HilOut算法

思想:高维规约到低维,使用传统的离群点检测方法

降维可采用PCA主成份分析

8.2   发现子空间中的离群点

8.3   高维离群点建模

eg.可以算角度

时间: 2024-10-07 10:39:17

【读书笔记-数据挖掘概念与技术】离群点检测的相关文章

【读书笔记-数据挖掘概念与技术】数据立方体技术

基本概念: 基本单元:基本方体的单元 聚集单元:非基本方体的单元 冰山立方体:部分物化的立方体 最小支持度(最小支持度阀值):部分物化的最小阀值(说白了就是限定了一个范围) ∵冰山立方体仍有大量不感兴趣的单元需要计算 ∴引入--闭覆盖--一个单元没有后代或者它的后代的度量值与其不同 法2:只预计算涉及少数维的立方体,这些方体形成的数据立方体的立方体外壳 计算的一般策略:四种优化技术 1.    排序.散列和分组 2.    同时聚集和缓存中间结果 3.    当存在多个子女方体时,由最小的子女聚

【读书笔记-数据挖掘概念与技术】数据仓库与联机分析处理(OLAP)

之前看了认识数据以及数据的预处理,那么,处理之后的数据放在哪儿呢?就放在一个叫"数据仓库"的地方. 数据仓库的基本概念: 数据仓库的定义--面向主题的.集成的.时变的.非易失的 操作数据库系统VS数据仓库--为什么需要使用数据仓库分析数据(OLAP  VS  OLTP) 数据仓库体系结构--三层体系结构:底层(数据仓库服务器)--中间层(OLAP服务器)--顶层(前段工具) 三种数据仓库模型 企业模型 数据集市(只针对某一部门) 虚拟仓库 元数据库--关于数据的数据 理解OLAP,数据

【读书笔记-数据挖掘概念与技术】数据预处理

数据预处理的目的:提高数据质量,数据质量的三要素:准确性.完整性.一致性. 数据预处理的任务: 数据清理 数据集成 数据规约 数据变换 数据清理--填充缺失的值.光滑噪声.识别离群点.纠正数据中的不一致 缺失值: 忽略元组 人工填写缺失值 使用一个全局常量 使用属性的中心度量 使用与给定元组属同一类的所有样本的属性均值或中位数 使用最可能的值(最流行) 噪声数据 分箱 回归 离群点分析 数据集成--合并来自多个数据存储的数据 实体识别问题 冗余和相关分析 元组重复 数据值冲突的监测与处理 数据规

【读书笔记-数据挖掘概念与技术】高级聚类分析

1   基于概率模型的聚类 例子: a.评论产品,一个评论可能设计多种产品,如一个评论谈论摄像机与计算机的兼容性,怎么办?该评论与这两个簇相关,而并不互斥地属于任何一个簇. b.用户在购买商品时,检索的信息中既订购了一部数据相机,并且同时比较了多种笔记本电脑,怎么办?这种会话应该在某种程度上数据这两个簇. 1.1   模糊簇 这节的例子还不错. 1.2   基于概率模型的聚类 对象以概率的方法参与多个簇. 混合模型假定观测对象集是来自多个概率簇的实例的混合. 以单变量高斯混合模型为例,假定每个簇

【读书笔记-数据挖掘概念与技术】认识数据

属性分类: 标称属性(定性) 二元属性(定性) 序数属性(定性) 数值属性(定量) 标称属性--"与名称相关",它的值是一些符号或事物的名称. eg.头发颜色(黑色.棕色.淡黄色.红色) 婚姻状况(单身.已婚.离异.丧偶) 二元属性--标称属性的一种,只有两个类别或状态:0或1(布尔属性). 有对称与非对称之分,对称--两种状态具有同等价值并且携带相同的权重eg.性别 非对称--其状态的结果不是同样重要eg.化验结果(阴性0.阳性1) 序数属性--它的值之间具有有意义的序或秩评定,但相

【读书笔记-数据挖掘概念与技术】挖掘频繁模式、关联和相关性:基本概念和方法

频繁模式:频繁出现的模式(可以是项集.子序列或子结构) 基本概念 支持度:support 置信度:confidence 关联规则:association 找出所有的频繁项集:出现次数≥最小支持计数 由频繁项集产生强关联的规则(定义最小支持度和最小置信度) 频度(支持度计数):出现的次数 频繁项集:项集I的相对支持度满足预定义的最小支持度阈值 闭频繁项集:不存在真超项集Y使得Y与X在D中具有相同的支持度计数 X是D中的极大频繁项集:X是D中的极大频繁项集或极大项集,如果X是频繁的,并且不存在超项集

【读书笔记-数据挖掘概念与技术】分类:基本概念

数据分类的两个阶段:学习阶段(构造分类模型)和分类阶段(使用模型预测给定数据的类标号)和分类阶段(使用模型预测给定数据的类标号). 决策树归纳 构造一颗树,从根到叶子节点的路径,该叶子节点就存放着该元组的预测类. 决策树分类器的构造不需要任何领域知识和参数设置,因此适合于探测式知识发现.决策树可以处理高维数据. 分裂节点时,关于选择什么样的度量标准,主要分为三类: 1.ID3:信息增益: 2.C4.5:信息增益率: 3.基尼系数: 如何防止过拟合? 树剪枝:剪掉最不靠谱的分支: 方法:a)先剪枝

【读书笔记-数据挖掘概念与技术】数据挖掘的发展趋势和研究前沿

复杂的数据类型 数据挖掘的其他方法 关于数据挖掘基础的观点: 可视和听觉数据挖掘 数据可视化 数据挖掘结构可视化 数据挖掘过程可视化 交互式可视数据挖掘 数据挖掘的应用

【读书笔记-数据挖掘概念与技术】高级模式挖掘

模式挖掘是一个比频繁挖掘模式更一般的术语,因为前者还涵盖了稀有模式和负模式.然而,在没有歧义时,两者可以互换地使用. 模式挖掘路线图 分类 基本模式 基于模式所涉及的抽象层 基于规则或模式所涉及的维数 基于规则或模式中所处理的值类型 基于挖掘选择性模式的约束或标准 基于所挖掘的数据类型和特征 多层.多维空间中的模式挖掘 挖掘多层关联规则 对于所有层使用一致的最小支持度--一致支持度 在较低层使用递减的最小支持度--递减支持度 使用基于项或基于分组的最小支持度--基于分组的支持度 挖掘多维关联规则