Hadoop之HDFS
一、Hadoop介绍
Hadoop 分为三部分 : HDFS 、Yarn、MapReduce(有点过时了)
Hadoop生态圈:除了hadoop技术以外,还有hive、zookeeper、flume、sqoop、datax、azkaban,ds ,kettle 等一系列技术。
Hadoop的三个版本:
Apache 版本(开源版本) 3.3.6 非常的新了
Cloudera 版本--商⽤版(道格·卡丁) CDH
Hortonworks --hadoop的代码贡献者在这家公司非常的多。
二、HDFS的本地模式
hdfs: 分布式文件管理系统
海量数据存储的终极解决方案:整出来一个平台,这个平台的服务器可以无限扩展。
HDFS : 解决海量数据的存储问题 1p = 1024 T
Yarn : 计算的资源基础,所有的MR任务需要运行在Yarn上。
MapReduce:解决计算问题,它是一个计算框架(需要写代码的)
HDFS三种模式:本地模式,伪分布模式,全分布模式
hadoop-3.3.6.tar.gz 下载地址,清华镜像(首选)
https://mirrors.tuna.tsinghua.edu.cn/apache/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz1、上传 2、解压 tar -zxvf hadoop-3.3.6.tar.gz -C /opt/installs/ 3、重命名 cd /opt/installs/ mv hadoop-3.3.6/ hadoop 4、开始配置环境变量 vi /etc/profile.d/myenv.sh 添加如下代码: export HADOOP_HOME=/opt/installs/hadoop export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin 5、刷新配置文件 source /etc/profile 6、验证hadoop命令是否可以识别 hadoop version至此hadoop本地模式安装成功,下面我们使用一下hadoop这个软件(案例WordCount): 词频统计
词频统计就是我们大数据中的HelloWorld! 在 /home 下创建了一个文件 wc.txt 命令: touch wc.txt 需要统计的词如下: hello world spark flink hello laoyan 2025 laowang hello taihu taiyang hello 接着使用自动的wordCount工具进行统计: hadoop jar /opt/installs/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar wordcount /home/wc.txt /home/output解析:
1、hadoop jar 执行某个jar包(其实就是java代码)
2、/opt/installs/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar 这个是jar的地址
3、/home/wc.txt 要统计的文件
4、/home/output 统计结果放哪里
执行完命令后,可以看到成功生成了两个文件,并且分析的结果在part-r-00000文件里
注:如果统计的结果文件夹已经存在,会报错。
上面总结一下:
数据在本地磁盘上 /home/wc.txt 计算的结果也是在本地磁盘上 /home/ouput