成功加入购物车
全新正版。出版社原装塑封新书。
余明辉 、张良均 著 / 人民邮电出版社 / 2018-02 / 平装
售价 ¥ 18.00 4.5折
定价 ¥39.80
品相 全新
优惠 满包邮
延迟发货说明
上书时间2024-05-12
卖家超过10天未登录
Hadoop大数据开发基础
本书以任务为导向,较为全面地介绍了Hadoop大数据技术的相关知识。全书共6章,具体内容包括Hadoop介绍、Hadoop集群的搭建及配置、Hadoop基础操作、MapReduce编程入门、MapReduce进阶编程、项目案例:电影网站用户性别预测。本书的2~5章包含了实训与课后练习,通过练习和操作实践,帮助读者巩固所学的内容。
本书可以作为高校大数据技术类专业的教材,也可作为大数据技术爱好者的自学用书。
张良均,信息系统项目管理师,泰迪杯全国大学生数据挖掘竞赛的发起人。华南师范大学、广东工业大学兼职教授,广东省工业与应用数学学会理事。兼有大型高科技企业和高校的工作经历,主要从事大数据挖掘及其应用的策划、研发及咨询培训。全国计算机技术与软件专业技术资格(水平)考试继续教育和CDA数据分析师培训讲师。发表数据挖掘相关论文数二十余篇,已取得国家发明专利12项,主编图书《神经网络实用教程》《数据挖掘:实用案例分析》《Python数据分析与挖掘》等多本畅销图书,主持并完成科技项目9项。获得SAS、SPSS数据挖掘认证及Hadoop开发工程师证书,具有电力、电信、银行、制造企业、电子商务和电子政务的项目经验和行业背景。
一章 Hadoop介绍 11.1 Hadoop概述 11.1.1 Hadoop简介 11.1.2 Hadoop的发展历史 21.1.3 Hadoop的特点 31.2 Hadoop核心 41.2.1 分布式文件系统——HDFS 41.2.2 分布式计算框架——MapReduce 71.2.3 集群资源管理器——YARN 91.3 Hadoop生态系统 121.4 Hadoop应用场景 14小结 15二章 Hadoop集群的搭建及配置 16任务2.1 安装及配置虚拟机 172.1.1 创建Linux虚拟机 172.1.2 设置固定IP 252.1.3 远程连接虚拟机 272.1.4 虚拟机在线安装软件 292.1.5 任务实现 32任务2.2 安装Java 322.2.1 在Windows下安装Java 332.2.2 在Linux下安装Java 352.2.3 任务实现 36任务2.3 搭建Hadoop完全分布式集群 362.3.1 修改配置文件 362.3.2 克隆虚拟机 412.3.3 配置SSH免密码登录 432.3.4 配置时间同步服务 442.3.5 启动关闭集群 462.3.6 监控集群 47小结 50实训 50实训1 为Hadoop集群增加一个节点 50实训2 编写Shell脚本同步集群时间 51课后练习 51第3章 Hadoop基础操作 53任务3.1 查看Hadoop集群的基本信息 543.1.1 查询集群的存储系统信息 553.1.2 查询集群的计算资源信息 58任务3.2 上传文件到HDFS目录 593.2.1 了解HDFS文件系统 593.2.2 掌握HDFS的基本操作 623.2.3 任务实现 65任务3.3 运行MapReduce任务 673.3.1 了解Hadoop官方的示例程序包 673.3.2 提交MapReduce任务给集群运行 68任务3.4 管理多个MapReduce任务 713.4.1 查询MapReduce任务 723.4.2 中断MapReduce任务 74小结 76实训 77实训1 统计文件中所有单词的平均长度 77实训2 查询与中断MapReduce任务 77课后练习 78第4章 MapReduce编程入门 80任务4.1 使用Eclipse创建MapReduce工程 814.1.1 下载与安装Eclipse 814.1.2 配置MapReduce环境 824.1.3 新建MapReduce工程 84任务4.2 通过源码初识MapReduce编程 864.2.1 通俗理解MapReduce原理 864.2.2 了解MR实现词频统计的执行流程 884.2.3 读懂官方提供的WordCount源码 89任务4.3 编程实现按日期统计访问次数 944.3.1 分析思路与处理逻辑 944.3.2 编写核心模块代码 954.3.3 任务实现 97任务4.4 编程实现按访问次数排序 994.4.1 分析思路与处理逻辑 994.4.2 编写核心模块代码 1004.4.3 任务实现 102小结 104实训 104实训1 获取成绩表的高分记录 104实训2 对两个文件中的数据进行合并与去重 105课后练习 107第5章 MapReduce进阶编程 110任务5.1 筛选日志文件并生成序列化文件 1115.1.1 MapReduce输入格式 1115.1.2 MapReduce输出格式 1135.1.3 任务实现 113任务5.2 Hadoop Java API读取序列化日志文件 1155.2.1 FileSystem API管理文件夹 1155.2.2 FileSystem API操作文件 1195.2.3 FileSystem API读写数据 1215.2.4 任务实现 123任务5.3 优化日志文件统计程序 1245.3.1 自定义键值类型 1245.3.2 初步探索Combiner 1285.3.3 浅析Partitioner 1305.3.4 自定义计数器 1325.3.5 任务实现 134任务5.4 Eclipse提交日志文件统计程序 1375.4.1 传递参数 1375.4.2 Hadoop辅助类ToolRunner 1395.4.3 Eclipse自动打包并提交任务 140小结 144实训 144实训1 统计全球每年的高气温和低气温 144实训2 筛选气温在15~25℃之间的数据 145课后练习 146第6章 项目案例:电影网站用户性别预测 151任务6.1 认识KNN算法 1526.1.1 KNN算法简介 1526.1.2 KNN算法原理及流程 152任务6.2 数据预处理 1546.2.1 获取数据 1546.2.2 数据变换 1556.2.3 数据清洗 1606.2.4 划分数据集 163任务6.3 实现用户性别分类 1676.3.1 实现思路 1676.3.2 代码实现 169任务6.4 评价分类结果的准确性 1796.4.1 评价思路 1796.4.2 实现分类评价 1806.4.3 寻找优K值 184小结 188参考文献 189
展开全部
图2
配送说明
...
相似商品
为你推荐
开播时间:09月02日 10:30