从零开始学习Hadoop大数据(一)

发布时间:2026/7/22 10:02:09
从零开始学习Hadoop大数据(一) 文章目录前言一、Hadoop是什么二、Hadoop在大数据时代的地位与转型三、组件介绍四、基于CentOS-7搭建虚拟集群五、初步配置Xshell总结正文前言在大数据时代处理海量数据已成为企业和研究机构面临的重要挑战。Hadoop作为Apache基金会旗下的开源分布式计算框架已成为大数据处理领域的事实标准。本系列文章将带领您从零开始系统学习Hadoop的核心知识与实践应用。一、Hadoop是什么Hadoop是一个开源的分布式计算框架主要用于存储和处理大规模数据集。它由Apache软件基金会开发其设计灵感来源于Google的MapReduce和Google File System论文。Hadoop的核心优势在于高可靠性、高扩展性和高容错性能够在廉价的硬件集群上稳定运行。如今Hadoop已发展成为大数据生态系统的基石。Hadoop的主要特点包括高可靠性数据自动在多个节点间复制防止数据丢失高扩展性可以轻松扩展到数千个节点高容错性能够自动处理节点故障低成本可以在普通硬件上运行二、Hadoop在大数据时代的地位与转型Hadoop 是“大数据”时代的核心驱动力之一它让企业用廉价的硬件搭建大规模数据处理平台成为可能。包括雅虎、Facebook、百度、淘宝等众多公司都曾是早期重要的使用者或贡献者。虽然如今的大数据领域也涌现了像Spark基于内存计算速度更快这样更年轻的竞争者但 Hadoop 的HDFS和YARN依然作为很多现代大数据平台的基础设施扮演着“数据底座”的角色。许多企业尤其是数据体量极大、以离线批处理为核心需求的场景仍然依赖着 Hadoop 生态。学习和理解 Hadoop依然是理解当代大数据处理架构的一条重要路径。三、组件介绍三大组件1. HDFS分布式文件系统HDFSHadoop Distributed File System是Hadoop的存储组件它将大文件分割成多个块默认128MB并将这些块分布存储在集群的不同节点上。HDFS的主要功能定位是数据存储拥有高容错、高吞吐适合存储超大文件。2. MapReduce分布式计算框架MapReduce是Hadoop的计算框架采用分而治之的思想将计算任务分为Map和Reduce两个阶段。MapReduce的主要功能是数据处理将大任务拆分为小任务并行计算处理3. YARN资源管理器YARNYet Another Resource Negotiator是Hadoop 2.0引入的资源管理框架负责集群资源的管理和作业调度。YARN的主要组件ResourceManager全局资源管理器NodeManager每个节点上的资源管理器ApplicationMaster每个应用程序的管理器Container资源分配的基本单位其他组件1.Hive数据仓库将 SQL 语句转换为 MapReduce 任务执行降低开发门槛。2.HBaseNoSQL 数据库基于 HDFS 的分布式列式数据库支持对海量数据进行实时、随机的读写访问。3.ZooKeeper协调服务解决分布式环境下的数据管理问题如配置维护、集群管理、分布式同步等。4.Sqoop数据迁移用于在 Hadoop(HDFS/Hive) 和关系型数据库如 MySQL之间高效传输数据。5.Flume日志采集一个高可用的日志收集、聚合和传输系统擅长处理源源不断的流式数据。四、基于CentOS-7搭建虚拟集群要说明的是CentOS现在已经停更小编只是用来学习使用。1. 首先建立三至五台虚机机小编使用的是VMware Workstation Pro 17.0作为一个集群虚拟机集群使用镜像“CentOS-7-x86_64-DVD-1511.iso”搭建虚机机并进行初始化操作在输入vi /etc/sysconfig/network-scripts/ifcfg-eno16777736进入编辑界面后按i进入编辑模式将ONBOOT 的参数改为YES后ESC退出编辑输入“wq”保存。五、初步配置Xshell1. 然后查看虚拟机的网络地址通过地址连接Xshell可以在Xshell中查看自己对应的版本号。接下来的指令皆在Xshell中完成所以不再赘述。接下来进入hosts文件编辑在文件末尾添加集群虚拟机的IP地址保存后用ping指令进行验证最好两两之间都要相互ping一下进行验证如果输出结果一直有传输代表没有问题。没问题后可以打开Windows里System32/drivers/etc/host文件将虚拟机地址写到文件末尾在控制面板中尝试连接本地与虚拟机。2. 在linux系统中防火墙是默认开启的但防火墙有时会影响我们的连接操作所以要将防火墙关闭输入firewall-cmd --state后显示not running则成功关闭注意要使用指令systemctl disable firewalld配合使用不然每次重新开机后防火墙都会重新启动。总结Hadoop作为Apache基金会旗下的开源分布式系统基础架构其核心设计源于Google的GFS与MapReduce思想主要通过HDFS、MapReduce和YARN三大组件解决海量数据的存储与计算问题实现了“化整为零、并行处理”的目标。在大数据时代尽管内存计算引擎Spark等新技术的涌现对Hadoop MapReduce形成了挑战但HDFS和YARN凭借其高容错与高吞吐特性依然是众多现代大数据平台不可或缺的“数据底座”尤其在离线批处理场景中地位稳固。报告后续基于CentOS-7系统完成了虚拟集群的搭建并初步配置了Xshell以实现远程连接管理为后续深入进行大数据组件部署与实战操作奠定了基础。总而言之理解Hadoop的架构思想是进入大数据领域的重要一步。