当前位置: 首页 > 数据分析师 > 数据分析师学习教程 > 数据分析师课|新公布的3个企业机器学习的步骤,这是数据分析师不得不知的知识

数据分析师课|新公布的3个企业机器学习的步骤,这是数据分析师不得不知的知识

更新时间:2020-04-10 09:48:00 来源:环球网校 浏览60收藏12
摘要 在茫茫的数据发展长河中,人们慢慢掌握了数据处理的方法,其中重要的处理方法之一就是对数据的分析,所以出现了数据分析师这一处理数据的职业,有很多刚入职成为数据分析师的新人都会有数据分析的问题,今天就来讲讲企业机器学习的步骤。

1、企业机器学习的步骤——表示

在表示这一步当中,我们需要建立起数据,还有实际问题的抽象模型。所以,这里面就包括了两个方面,一方面我们要对要解决的这个实际的问题进行抽象化处理。比方说我们要设计一个算法,判断一个邮件它到底是不是一封垃圾邮件,那么得到的结果无外乎两种,要么是,要么不是。这样一个问题如果对它做抽象,实际上就是个二分分类问题。是,我们可以把它定义成 0,不是,可以把它定义成 1。所以,这个问题最终要解决的是什么呢?输出一个 0 或者 1 的结果。当然把 0 和 1 的意义调过来也可以,用 1 代表是垃圾邮件,0 代表不是,也是可以的。所以,在表示的过程当中,我们要解决的问题就是把我们面临的真实世界当中的一些物理问题给它抽象化,抽象成一个数学问题。抽象出来这个数学问题之后,我们要进一步去解决它,还要对这个数据进行表示。

对于问题抽象完了以后,我们还要对数据进行抽象。在判定这个邮件到底是不是垃圾邮件的时候,我们要怎么判断呢?要根据它的特征进行判断,看一看这个邮件里的关健字是否有关于推销的,或者关于产品的一些关键字。这些特征,这些关键字,我们就要把它表示成一个特征,表示成一个向量,或者表示成其他的形式。表示成向量也好,表示成其他形式也好,都是对这个数据做出了抽象。

在表示阶段,我们需要建立的是数据,还有问题的抽象模型。把这个模型建立出来,然后去寻找合理的算法。

K- 近邻算法 。在机器学习当中,我们常见的有 K- 近邻算法。K- 近邻算法在我们的专栏中没有提到,因为它太简单了。它实际上就是,找到一个样本点和这个样本点最近的几个邻居,最近的这 K 个邻居。按照少数服从多数的原则,对它进行分类,这就是 K- 近邻算法。

回归模型 。除此之外,还有线性回归,这样的统计学习方法。我建立一个线性回归模型,当然,对二分类我们可以建立逻辑回归模型。

决策树 。还有像决策树这样的方法。决策树它不依赖于数据,它完全是自顶向下的一个设计。线性回归也好,逻辑回归也好,它是从数据反过来去推导模型,而决策树直接去用模型判定数据,两个方向不太一样。

SVM 支持向量机 。最后,还有 SVM 支持向量机这样的纯数学方法。所以说表示的部分,我们需要把问题和数据进行抽象,这个时候我们就要用到抽象的工具。

2、企业机器学习的步骤——评价

给定了模型之后,我们如何评价这个模型的好坏呢?这个时候就需要设定一个目标函数,来评价这个模型的性质。

设定目标函数

目标函数的选取也可以有多种形式。像对于我们说到的垃圾邮件这种问题,我们可以定义一个错误率。比方说一个邮件它原本不是垃圾邮件,但是我这个算法误判成了垃圾邮件,这就是一个错例。所以呢,错误率在分类问题当中是个常用的指标,或者说常用的目标函数。

最小均方误差和最大后验概率

那么在回归当中呢,我们会使用最小均方误差这样一个常用目标函数,尤其是在线性回归里。除此之外呢,还有最大后验概率,一些其他的指标。

3、企业机器学习的步骤——优化

有了目标函数以后,我们要求解这个目标函数在模型之下的一个最优解,这个模型能够获取到的最小错误率,或者最小均方误差是多少呢?我们要求出一个特定的值。没有这个值的话,你如何评价不同的模型它到底是好是坏呢?所以说优化这个步骤它的作用是求解目标函数在模型之下的一个最优解,看看这个模型在解决这个问题的时候,最好能达到什么样的程度。

总结来说,多明戈斯教授总结到的机器学习的三个步骤,包括了表示、评价、优化这样三个步骤,在这三个步骤当中我们会用到不同的数学公式来分别解决这三个问题。

以上就是有关于企业机器学习的步骤的相关内容,以及相应的解析,不论你是已经入职数据分析师岗位的新人,还是打算进入数据分析岗位的小白,以上的内容都或多或少会对大家有所帮助,环球网校的小编在这里祝大家的数据分析师职业道路顺利。

分享到: 编辑:环球网校

资料下载 精选课程 老师直播 真题练习

数据分析师资格查询

数据分析师历年真题下载 更多

数据分析师每日一练 打卡日历

0
累计打卡
0
打卡人数
去打卡

预计用时3分钟

数据分析师各地入口
环球网校移动课堂APP 直播、听课。职达未来!

安卓版

下载

iPhone版

下载

返回顶部