惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

The GitHub Blog
The GitHub Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Microsoft Security Blog
Microsoft Security Blog
J
Java Code Geeks
S
SegmentFault 最新的问题
Apple Machine Learning Research
Apple Machine Learning Research
N
Netflix TechBlog - Medium
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园_首页
宝玉的分享
宝玉的分享
Google DeepMind News
Google DeepMind News
B
Blog RSS Feed
Hugging Face - Blog
Hugging Face - Blog
量子位
Blog — PlanetScale
Blog — PlanetScale
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
阮一峰的网络日志
阮一峰的网络日志
D
Docker
罗磊的独立博客
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
云风的 BLOG
云风的 BLOG
IT之家
IT之家
MyScale Blog
MyScale Blog
Microsoft Azure Blog
Microsoft Azure Blog

Hadoop

请教一下 Hadoop 在生产环境可以通过 Docker 安装吗? hadoop zookeeper 菜鸡初学者对 Hadoop 云端架构的一些疑惑 请问 hadoop 多块磁盘只部署一个 datanode 好还是每块磁盘各部署一个 datanode 求助: Hadoop 中使用 Hbase 异常 有个选修课作业需要写一个关于 hadoop 技术的论文综述,有哪些比较重要的方面可以写 大佬们, 请问自学 hadoop 系列, 有什么教程或者资料吗? 突然接到甲方的一个需求,要求从 hadoop 集群回到单机.... 有什么部署 Hadoop 的主流方法么 爬虫每天传一次到 hdfs 能用 flume 吗? 关于 Hadoop3 的 HADOOP_MAPRED_HOME 请教一下存储的问题 PayPal 上海招大数据研发工程师啦! 大文件通过 Mapreduce 切分存入 hbase Hadoop 读取 10 万个文件初始化过程很慢有方便的解决办法么? 公司要做个数仓,单机 hadoop 是否没什么意义,但是又想自己动手做一下。求给建议! 求助: hadoop 的 wordcount 一直是挂起状态 ACCEPTED: waiting for AM container to be allocated, launched and register with RM. 大数据环境中压缩格式用什么比较好? 有什么好的办法可以用 Flink/Spark 高效率并行处理大量大小不一的压缩数据 请教从外部访问用 docker 搭建的 hadoop 集群的问题? 请教: hadoop 不会将大表格分割为 block 关于分布式系统的学习 springboot 整合 spark, 集群方式启动需要怎么配置呢? 关于 zookeeper 集群 leader 节点的选举问题? 如何从 afs 上下载数据 如何使用代码获取两个 Namenode 的节点信息? SQOOP 导出数据到 MYSQL 报错 请教, CDH 集群管理工具, centos 普通用户可以安装吗?还是必须使用 root 用户 关于 HDFS 小文件归档有什么好办法吗? 请教 9 台机器的 hadoop 集群角色分配问题
自建 5 个节点的 Hadoop 集群,以及完成 MapReduce 作业
trafficMGR · 2019-01-09 · via Hadoop

集群规划和搭建过程

搭建过程和配置文件专门用 VuePress 记录了一下:前往日志

  • 集群单个节点的配置:1VCPUs 2GB 5Mbps , 内存分配策略:参考了 Linode 的 2GB 节点配置教程

  • 服务器用的廉价的阿里云的轻量应用服务器学生版,几个同学一人一台,拼凑了一个拥有 5 个节点的集群。

数据处理

任务

使用 Hive 导入社交用户数据 CSV 文件,使用 SQL 塞选出用户表中的共同爱好、共同好友。

Map Reduce 作业问题

在这个集群上做简单的 Map 和 Reduce 作业是极其缓慢的,从 0% 跳到 100%可能会经历数十分钟,效率堪忧。由于各个节点是同学自己买的,不能走 VPC 内网互通,只好用公网互通。👈怀疑问题会出现在这里

Hadoop job information for Stage-1: number of mappers: 1; number of reducers: 1
2019-01-09 19:56:25,499 Stage-1 map = 0%,  reduce = 0%
INFO  : Hadoop job information for Stage-1: number of mappers: 1; number of reducers: 1
INFO  : 2019-01-09 19:56:25,499 Stage-1 map = 0%,  reduce = 0%
2019-01-09 19:57:26,238 Stage-1 map = 0%,  reduce = 0%
INFO  : 2019-01-09 19:57:26,238 Stage-1 map = 0%,  reduce = 0%
2019-01-09 19:58:26,818 Stage-1 map = 0%,  reduce = 0%
INFO  : 2019-01-09 19:58:26,818 Stage-1 map = 0%,  reduce = 0%
2019-01-09 19:59:27,374 Stage-1 map = 0%,  reduce = 0%
INFO  : 2019-01-09 19:59:27,374 Stage-1 map = 0%,  reduce = 0%
2019-01-09 20:00:27,878 Stage-1 map = 0%,  reduce = 0%

...

2019-01-09 20:17:32,700 Stage-1 map = 100%,  reduce = 0%, Cumulative CPU 1.69 sec
INFO  : 2019-01-09 20:17:32,700 Stage-1 map = 100%,  reduce = 0%, Cumulative CPU 1.69 sec
2019-01-09 20:18:33,218 Stage-1 map = 100%,  reduce = 0%, Cumulative CPU 1.69 sec
INFO  : 2019-01-09 20:18:33,218 Stage-1 map = 100%,  reduce = 0%, Cumulative CPU 1.69 sec

测试

使用相同的 SQL 语句换做在 E-MapReduce 上能很块跑出结果(加钱世界可及)。

还未结束

  • Q1: 同样的 2G 内存节点,在本地虚拟机上就能正常运行,不会在 MapReduce 作业上卡数十分钟