Hadoop之HDFS
2026/8/1 2:19:51 网站建设 项目流程

一、Hadoop介绍

Hadoop 分为三部分 : HDFS 、Yarn、MapReduce(有点过时了)

Hadoop生态圈:除了hadoop技术以外,还有hive、zookeeper、flume、sqoop、datax、azkaban,ds ,kettle 等一系列技术。

Hadoop的三个版本:

Apache 版本(开源版本) 3.3.6 非常的新了

Cloudera 版本--商⽤版(道格·卡丁) CDH

Hortonworks --hadoop的代码贡献者在这家公司非常的多。

二、HDFS的本地模式

hdfs: 分布式文件管理系统

海量数据存储的终极解决方案:整出来一个平台,这个平台的服务器可以无限扩展。

HDFS : 解决海量数据的存储问题 1p = 1024 T

Yarn : 计算的资源基础,所有的MR任务需要运行在Yarn上。

MapReduce:解决计算问题,它是一个计算框架(需要写代码的)

HDFS三种模式:本地模式,伪分布模式,全分布模式

hadoop-3.3.6.tar.gz 下载地址,清华镜像(首选)

https://mirrors.tuna.tsinghua.edu.cn/apache/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz
1、上传 2、解压 tar -zxvf hadoop-3.3.6.tar.gz -C /opt/installs/ 3、重命名 cd /opt/installs/ mv hadoop-3.3.6/ hadoop 4、开始配置环境变量 vi /etc/profile.d/myenv.sh 添加如下代码: export HADOOP_HOME=/opt/installs/hadoop export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin 5、刷新配置文件 source /etc/profile 6、验证hadoop命令是否可以识别 hadoop version

至此hadoop本地模式安装成功,下面我们使用一下hadoop这个软件(案例WordCount): 词频统计

词频统计就是我们大数据中的HelloWorld! 在 /home 下创建了一个文件 wc.txt 命令: touch wc.txt 需要统计的词如下: hello world spark flink hello laoyan 2025 laowang hello taihu taiyang hello 接着使用自动的wordCount工具进行统计: hadoop jar /opt/installs/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar wordcount /home/wc.txt /home/output

解析:

1、hadoop jar 执行某个jar包(其实就是java代码)

2、/opt/installs/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar 这个是jar的地址

3、/home/wc.txt 要统计的文件

4、/home/output 统计结果放哪里

执行完命令后,可以看到成功生成了两个文件,并且分析的结果在part-r-00000文件里

注:如果统计的结果文件夹已经存在,会报错。

上面总结一下:

数据在本地磁盘上 /home/wc.txt 计算的结果也是在本地磁盘上 /home/ouput

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询