目录
大数据
大数据特点(5V)
大数据处理框架
Hadoop
发展历史及hadoop特点
核心组件
HDFS
MapReduse
YARN
大数据
字面理解:大量的数据,生活中每时每刻都在产生数据。
深层理解:海量数据的获取,分析,处理。让没有意义的数据变为有价值的数据。数据量超过传统数据库处理的能力,因而产生大数据技术。
-
大数据的大没有标准,TB~PB
-
大数据不仅仅大
-
大数据的标准可变
体现:问卷调查,获得信息;微博热搜,展示实时热点信息。
大数据特点(5V)
-
volume,数据量大,PB、EB、ZB级别
-
velocity,速度快,有效的时间内处理数据才有价值
-
variety,种类多(结构化、半结构化、非结构化数据处理)
-
value,数据价值密度低,海量信息中有用的少
-
veracity,数据的质量高
volume,数据量大,PB、EB、ZB级别
velocity,速度快,有效的时间内处理数据才有价值
variety,种类多(结构化、半结构化、非结构化数据处理)
value,数据价值密度低,海量信息中有用的少
veracity,数据的质量高
例如:淘宝推荐,网易云推荐,抖音及快手视频推荐。
应用方向:
医疗大数据(提醒服药)
金融大数据(广告推荐)
交通大数据(传感器)
教育大数据(改善教学)
商业大数据(沃尔玛案例,啤酒和尿布的捆绑消费)
大数据处理框架
hadoop
可靠,高效,可扩展方式存储、管理大数据。提供数据挖掘管理方案。
大数据管理分析平台,开源,编程模式,分布式处理,数据仓库。
缺点:不能实时数据展示。
storm
流式数据,分布式流计算平台。
spark
基于内存计算的开源的集群计算系统,使用scala语言,源码短小精悍,负载方面优越。
弹性分布式数据集,数据集丢失可重建。
就业方向:
数据首席官
数据科学家
开发工程师
运维工程师
Hadoop
包括HDFS、MapReduse(Map、Reduce)
开源分布式计算平台。
HDFS高容错性,高伸缩性,高性能。部署在硬件上,形成分布式系统,负责数据分布式存储。只能读不能修改。
MapReduse分布式编程模型,并行应用程序。
-
是一个框架
-
适合处理大规模数据
-
被部署在一个集群上
发展历史及hadoop特点
2002至今。轻松架构分布式计算平台,开发运行处理海量数据的应用程序。
-
高可靠性,防止部分宕机的损坏,个别不影响整体
-
高扩展性,节点很容易扩展
-
高效性,处理速度快,节点间动态处理,并发执行
-
高容错性,每一个节点都备份
-
低成本,开源,依赖于社区服务
-
可构建在廉价的机器上
核心组件
了解组件用途
HDFS
分布式文件系统(多个独立计算机组成的系统)
集群数据存储与读取,一个主节点领导多个从节点。层次型文件组织结构:文件保存到目录。
一个master(NameNode,SecondDary NameNode),多个slave(DataNode),主从式特点。通过网络通信协作完成功能的分布式系统。
文件系统,表示用于存储数据,数据自动分布在不同节点上。
1、 多机(分布在多个集群节点上的文件系统)
2、数据以数据块的形式存储在各个节点,且存储副本
3、从多个节点读取文件数据块
NameNode存储元数据fsimage,以及处理客户端发出的请求edits
SecondDary NameNode备份主节点数据,将新fsimage取代原fsimage
DataNode存放真正的数据,文件以数据块形式存储。
MapReduse
分布式计算框架(Map映射、Reduce规约)
大规模数据集并行运算编程模型。
核心思想:传递键值对(本质)
分布式文件系统中读取数据,分割,map映射,键值对处理shuffle/sort,reduce处理,输出。
YARN
集群资源管理器(Resource Manger,Node Manger,APP Mstr)
Resource Manger资源监控分配管理
Node Manger节点维护
APP Mstr程序调度协调
公司应用情况:
开源高效云计算基础框架,搜索引擎服务,处理海量数据,数据挖掘,机器学习,科学计算。
如:阿里巴巴,腾讯等公司。



