数据分析师课|新公布的6个数据挖掘中数据选择重要性,这些内容你真的很清楚吗
开始数据挖掘时,你可能会问“我需要多少数据?”或“在清理数据或设置数据格式时,我是否应了解一些特殊要求?”
具体而言,刚接触数据挖掘的人通常会遇到与 Excel 数据有关的问题,如需要在列中一致地设置数据格式、清除缺失值或对数字装箱。本节还会列出特定模型类型的数据要求。
1、数据挖掘中数据选择重要性——选择数据
选择分析数据可能是数据挖掘过程中最重要的部分,甚至比算法选择更重要。原因在于,数据挖掘通常不是由假设驱动,而是由数据驱动。数据挖掘可以接收数据并发现新关联(否则完全无法发现任何模式),而不是提前选择和测试变量(传统统计建模可能会这样做)。数据的质量和数量可能会显著影响结果。
一般而言,请遵守以下规则:
获取尽可能干净的数据。
尝试任何模型之前执行数据事件探查。需要先理解数据,然后才能发现其中的含义。至少:
使用外接程序中的工具查找最大值和最小值、最常见的值和平均值。
填写缺失值。外接程序(以及一些算法)可提供用于输入缺失值的工具。
尽可能更正错误的数据。数据挖掘项目经常充当新数据质量方案的推动力。
尝试生成测试模型,通过这种方式查找数据问题。举例来说,在查看结果时,您可能会发现,销售预测所依据的数据因货币换算错误存在异常。
尝试将数据转换为不同格式,或尝试将数字存入桶。转换数据时,经常会出现模式。
例如,呼叫中心的服务级别可能会受星期几影响,如果仅使用日期时间值,则不会看到这种模式。如果以 10 天周期生成(而不是以每周或每天为单位),预测效果可能更好。
将数字置于合适的箱中,减少要分析的值的数量。
创建多个版本的数据,生成多个模型。
2、数据挖掘中数据选择重要性——我需要多少数据?
经验法则是,对于最简单的模型类型和方案,数据行数不小于 50-100 行。例如,如果使用 Na?ve Bayes 模型预测单个属性,并且数据集格式正确,使用 50-100 行数据就可能生成相当准确的预测。
对于关联模型,需要的数据通常多得多 – 如果分析很多属性(如产品间的关联),千行数据都可能不够。如果数据集太大或太小,通过将行合为类别有时可以获得更好的结果。例如,可以对产品分类,而不是分析各个产品间的关联。
如果数据集大小合理,应更注重数据质量而不是添加越来越多的数据。达到一定数据量后,会发现统计上有效的所有模式,添加更多数据不会提高其有效性。相反,添加更多数据,有时可能引入意外关联。
3、数据挖掘中数据选择重要性——离散数值与连续数值
“离散”列包含数目有限的值。例如,文本通常被视为离散值。
离散值有一些重要属性。例如,如果将数字视为离散值,则它们之间不隐含任何顺序,您无法对数字计算平均值或总和。电话区号就是离散数值数据,不会用来执行数学运算。
离散值有时候称作类别值,因为您可以按离散值对一组数据进行分组,而对于按无限序列排列的数值,则不能按其对数据进行分组。
如果值是明确分开并且不可能有小数值或小数值没有用时,您也可以确定将数字视为离散值。
“连续”数值数据可包含无限个小数值。收入列即为连续属性列的示例。如果您指定某一列为数值,则该列中的每个值都必须是数值,只有 null 除外。请注意,在 Excel 中,可以考虑时间戳以及可转换为 SQL Server 数据类型的任何其他日期时间表示形式。
4、数据挖掘中数据选择重要性——将数字转换为分类变量
因为列包含数值并不意味着您应该将它们视作连续数值。“离散化”对分析提供许多好处。好处之一是缩小了问题空间。另一好处是数字有时不适合表示结果。
例如,一个家庭的孩子数既可视为连续值,也可视为离散值。因为家庭中不可能有 2.5 个孩子,有 3 个或更多孩子的家庭的行为方式可能与有 2 个孩子的家庭非常不同,所以将此数字视为类别可以获得更好的结果。但是,如果要生成回归模型或由于其他原因需要平均值(如每个家庭 1.357 个孩子),则可使用连续数字数据类型。
如果创建一个包含连续数据的挖掘模型,之后又希望将列视为离散的,则是不可能的。两个数据集必须以不同的方式处理,作为单独的挖掘结构在后端进行处理。如果不确定数据的正确处理方式,应创建单独的模型以不同方式处理数据。在任何情况下,这都是获得有关数据的不同观点(可能还有不同结果)的好方法。
5、数据挖掘中数据选择重要性——将数字转换为文本
诸如男性和女性之类的应该是离散的非常常见的值表示为数值数据(如使用标签 1 和 2)。通常执行此编码是为了简化数据输入或者节省数据库的存储空间,不过此编码可能导致值的性质和意义不明确。此外,由于离散值以数字形式存储,当您在应用程序之间移动数据时,可能会遇到数据类型转换错误,这些值可能被计算或被视为连续值。若要避免此类问题,应该在开始数据挖掘之前,将数值标签转换回离散的文本标签。
6、数据挖掘中数据选择重要性——对数字装箱
尽管从原则上来说,所有数值都是无限的并因此是连续的,但在您对信息进行建模时,可能会发现将可用值“离散化”或“装箱”可能更有效。
您可以通过许多方式将数据装箱:
指定数目有限的存储桶并且让算法对存储桶中的值进行排序。
通过创建某些分组集合(具有业务上的意义或者易于使用),自己预先对值进行分组。使用此方法,您常常会丧失值的真正分布,但范围更易于用户读取。
让算法确定存储桶的最佳数目以及值的分布。这是大多数工具中的默认行为,但您可以在“数据挖掘”工具栏向导中重写这些默认行为。
将值逼近中心平均值或代表值。
以上就是有关于数据挖掘中数据选择重要性的相关内容,以及相应的解析,不论你是已经入职数据分析师岗位的新人,还是打算进入数据分析岗位的小白,以上的内容都或多或少会对大家有所帮助,环球网校的小编在这里祝大家的数据分析师职业道路顺利。
最新资讯
- 数据分析汇总报告有哪些组成?这才是数据分析师能力的体现2020-07-17
- 什么是EOI框架?这对于数据分析师竟然这么重要2020-07-17
- 如何进行业务核心数据分析?这对于数据分析师来说竟如此重要2020-07-16
- 有哪些数据分析实践的概念?不会这个的数据分析师都转行了2020-07-13
- 数据的分析思路是什么?正确的分析思路可以帮助数据分析师进步2020-07-10
- 什么是数据回归分析方法?这才是数据分析师要用到的利器2020-07-10
- 数据相关的分析方法是什么?这三种才是数据分析师的救星2020-07-10
- 高级数据分析方法是什么?这才是数据分析师进阶的必备技能2020-07-09
- 提出数据假设的方法是什么?这才是数据分析师应该明白的东西2020-07-09
- 如何找出数据优化指标?优秀的数据分析师都在这样思考2020-07-09