
一、Hadoop介绍Hadoop 分为三部分 HDFS 、Yarn、MapReduce(有点过时了)Hadoop生态圈除了hadoop技术以外还有hive、zookeeper、flume、sqoop、datax、azkaban,ds kettle 等一系列技术。Hadoop的三个版本Apache 版本开源版本 3.3.6 非常的新了Cloudera 版本--商⽤版道格·卡丁 CDHHortonworks --hadoop的代码贡献者在这家公司非常的多。二、HDFS的本地模式hdfs: 分布式文件管理系统海量数据存储的终极解决方案整出来一个平台这个平台的服务器可以无限扩展。HDFS 解决海量数据的存储问题 1p 1024 TYarn : 计算的资源基础所有的MR任务需要运行在Yarn上。MapReduce解决计算问题它是一个计算框架需要写代码的HDFS三种模式本地模式伪分布模式全分布模式hadoop-3.3.6.tar.gz 下载地址清华镜像首选https://mirrors.tuna.tsinghua.edu.cn/apache/hadoop/common/hadoop-3.3.6/hadoop-3.3.6.tar.gz1、上传 2、解压 tar -zxvf hadoop-3.3.6.tar.gz -C /opt/installs/ 3、重命名 cd /opt/installs/ mv hadoop-3.3.6/ hadoop 4、开始配置环境变量 vi /etc/profile.d/myenv.sh 添加如下代码 export HADOOP_HOME/opt/installs/hadoop export PATH$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin 5、刷新配置文件 source /etc/profile 6、验证hadoop命令是否可以识别 hadoop version至此hadoop本地模式安装成功下面我们使用一下hadoop这个软件案例WordCount: 词频统计词频统计就是我们大数据中的HelloWorld! 在 /home 下创建了一个文件 wc.txt 命令 touch wc.txt 需要统计的词如下 hello world spark flink hello laoyan 2025 laowang hello taihu taiyang hello 接着使用自动的wordCount工具进行统计 hadoop jar /opt/installs/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar wordcount /home/wc.txt /home/output解析1、hadoop jar 执行某个jar包其实就是java代码2、/opt/installs/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.3.6.jar 这个是jar的地址3、/home/wc.txt 要统计的文件4、/home/output 统计结果放哪里执行完命令后可以看到成功生成了两个文件并且分析的结果在part-r-00000文件里注如果统计的结果文件夹已经存在会报错。上面总结一下数据在本地磁盘上 /home/wc.txt 计算的结果也是在本地磁盘上 /home/ouput