数据分析师课|新公布的大数据系统与平台的分析,这些内容你真的注意到了吗
为了支持大规模的数据处理与分析任务,全新的数据存储系统需要能够容纳和支持高效数据吞吐、高可伸缩性和高容错性。传统的数据库OLTP面向交易型需求而设计,无法满足大数据统计分析类的查询需求和应用。当前的大数据系统更加强调读写效率、数据容量以及系统的可扩展性。具体来说,将数据分割成块,并将每块复制多份后分散到不同物理机器上存储,用冗余的数据块来防止因个别机器损坏对数据完整性的影响。数据的冗余保存不但提高了系统的可靠性,同时也可以提高了系统在数据读取时的并发性能。另外,为降低成本,现代的大数据系统运行在价格相对低廉的普通服务器上;这些机器通过高速网络连接,实现高效的数据传输。
大数据系统与平台的分析之一就是,处理和分析大数据涉及大量的计算,催生了很多分布式NoSQL数据处理系统。在计算模型上,MapReduce的推出给大数据并行处理带来了革命性的影响。在MapReduce基础上进一步提出了新的计算模型Spark。Spark充分利用在内存中计算的优势,并且大大优化了原来MapReduce中Shuffle所带来的效率问题。经过几年的发展,Spark已经替代MapReduce成为业界最为重要的大数据处理框架,并且发展了非常丰富的应用生态。
此外,基于流 (Streaming) 的计算模型被开发出来以支持不断变化和更新的大数据应用。在流计算模型中,为了达到更实时的更新,每到达一个数据事件的时候就进行一次处理。Spark Streaming、Storm、Flink都是比较流行的流计算平台。
在支持对大数据进行在线交互式的查询和分析方面,来自不同领域的技术正在快速融合,共同构建更加实时高效的大数据交互查询平台。以ElasticSearch为代表的一类技术,借鉴搜索系统的索引构架和技术,对大规模非结构化和半结构化数据进行分块、索引来支持快速查询。以Spark Kylin为代表的另一类技术则将传统的数据立方体技术推广到大数据领域,通过将预先计算的部分数据立方体缓存起来,大大提高了运行时的查询速度。
大数据系统与平台的分析之一就是,随着技术的发展,对数据进行高语义级别的自动分析变得越来越重要。自动分析技术往往需要频繁计算在不同查询条件下的聚合结果,一个分析查询可能涉及成百上千次简单的聚合查询。这就对查询性能提出了更高的要求。为了解决这个问题,同时也考虑到大数据分析中绝大多数任务对数据的完整性不太敏感这一特点,学术界又提出了BlinkDB、BigIN4等技术和系统,希望利用通过采样或者预计算得到的部分数据来对用户的查询结果进行估计,从而达到快速计算的目的。其中BlinkDB试图利用分层采用的方法来减少估计的误差,而BigIN4则试图通过贝叶斯估计方法来优化用户查询的估计误差。

以上就是有关于大数据系统与平台的分析的相关内容,以及相应的解析,不论你是已经入职数据分析师岗位的新人,还是打算进入数据分析岗位的小白,以上的内容都或多或少会对大家有所帮助,环球网校的小编在这里祝大家的数据分析师职业道路顺利。
最新资讯
- 数据分析汇总报告有哪些组成?这才是数据分析师能力的体现2020-07-17
- 什么是EOI框架?这对于数据分析师竟然这么重要2020-07-17
- 如何进行业务核心数据分析?这对于数据分析师来说竟如此重要2020-07-16
- 有哪些数据分析实践的概念?不会这个的数据分析师都转行了2020-07-13
- 数据的分析思路是什么?正确的分析思路可以帮助数据分析师进步2020-07-10
- 什么是数据回归分析方法?这才是数据分析师要用到的利器2020-07-10
- 数据相关的分析方法是什么?这三种才是数据分析师的救星2020-07-10
- 高级数据分析方法是什么?这才是数据分析师进阶的必备技能2020-07-09
- 提出数据假设的方法是什么?这才是数据分析师应该明白的东西2020-07-09
- 如何找出数据优化指标?优秀的数据分析师都在这样思考2020-07-09