- 大数据的数据量现在已经达到了哪个级别?( ) PB
- 狭义的Hadoop是一个适合大数据分布式存储和分布式计算的平台,不包括下面哪个组件?(Hbase ) HBase HDFS MapReduce Yarn
- XML文件属于非结构化数据。 F 半结构化数据
- 平台化构架不是大数据发展的主流趋势。 F
- 对于GFS架构,下面哪个说法是错误的?A
A. GFS Master节点管理所有的文件系统所有数据块。
B. GFS存储的文件都被分割成固定大小的块,每个块都会被复制到多个块服务器上(可靠性)。块的冗余度默认为3。
C. GFS Master还管理着系统范围内的活动,比如块服务器之间的数据迁移等
D. GFS Master与每个块服务器通信(发送心跳包),发送指令,获取状态 - Hadoop版本演进过程中,Hadoop2.0比Hadoop1.0有了很多的优化,下面哪项不属于Hadoop2.0?B
A. 加入HDFS的 NameNode Federation和YARN
B. YARN基于cgroup的内存和磁盘IO隔离
C. 支持NameNode HA
D. Wire-compatibility特性 - NOSQL数据存储不需要固定的表结构,但是通常一样存在连接操作。 F
- 三次信息化浪潮的各自标志为 个人计算机、 互联网、大数据
- 请描述 Hadoop 副本冗余存储策略(机架感知)。
默认为副本数为3
第一个副本:放置在上传文件的数据节点;如果是集群外提交,则随机挑选一台磁盘不太满. CPU不太忙的节点。
第二个副本:放置在与第一个副本不同的机架的节点上。
第三个副本:与第二个副本相同机架的其他节点上。
更多副本:随机节点
第二章 Hadoop环境设置
16.端口50070默认是Hadoop哪个服务的端口? NameNode
18. Hadoop完全分布模式配置免密登录是要?主节点和从节点任意两个节点之间免密登录
20. Hadoop的配置目录在哪里? $HADOOP_HOME/etc/Hadoop
21. 把公钥追加到授权文件的命令是? ssh-copy-id
22. 下面哪个目录保存了Hadoop集群的命令(比如启动Hadoop)? sbin
23. 安装Hadoop时,发现50070对应的页面无法打开,可以通过下面哪个命令查看某个端口(TCP或UDP)是否在监听? netstat
24. 安装Hadoop集群时,在哪个文件指定从机是哪些机器? slaves
29. 安装Hadoop时,配置项”dfs.replication”是配置在文件core-site.xml F 应该是配置在hdfs-site.xml
36. 修改~/.bashrc文件保存后,修改的内容能立即生效 F
40. 安装Hadoop,执行hadoop格式化的命令是: hdfs namenode -format
5. 在一台操作系统为Ubuntu16.04机器部署Hadoop伪分布式环境。实现下面功能需要输入什么Linux命令?
(1)查看是否安装了openssh-server dpkg -l |grep openssh-server
(2)查看机器主机名 hostname
(3)检查Hadoop进程是否存在 jps
(4)查看SSH服务的22端口是否在监听(Listen) netstat -an |grep 22
6. 在三台操作系统为Ubuntu16.04机器(机器名分别是node1. node2. node3)部署Hadoop完全分布式环境,三台机器已经实现免密码登录。实现下面功能需要输入什么Linux命令?
(1)从node1,通过ssh登录到node2 ssh node2
(2)在node2上运行命令,将node1的/home/hadoop/hadoop-2.7.3 拷贝到/home/hadoop下 scp -r node1:/home/hadoop/hadoop-2.7.3 /home/hadoop
(3)查看当前机器的磁盘使用量 df 或df -h
7. 做Hadoop免密登录时,运行ssh-copy-id -i ~/.ssh/id_rsa.pub node1 出现错误,提示“ssh: connect to host machineB port 22: Connection refused”,请你分析问题的原因. 并描述问题的解决思路。
1)可能是openssh-server没有安装好。采用sudo dpkg -l |grep openssh-server确认。
(2)如果已经安装好,再检查服务是否启动。通过netstat -an |grep 22确认端口
(3)再检查node1的配置的IP是否正确,即检查/etc/hosts文件。
8. Hadoop有哪三种安装模式. 三种安装模式的特点. 用途是什么?
包括:单机模式. 伪分布模式. 完全分布式模式。
(1)单机模式,特点:没有分布式文件系统HDFS ,MapReduce处理的是本地Linux的文件数据。用途:一般仅用于本地MapReduce程序的调试。
(2)伪分布模式: 特点:具备Hadoop的主要功能。用途:常用于调试程序
(3)完全分布式模式。特点:在多台机器上运行,是真正的分布式环境。用途:常用于生产。



