惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Attack and Defense Labs
Attack and Defense Labs
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
The Last Watchdog
The Last Watchdog
B
Blog
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
Google DeepMind News
Google DeepMind News
The GitHub Blog
The GitHub Blog
博客园_首页
N
News and Events Feed by Topic
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Security Archives - TechRepublic
Security Archives - TechRepublic
Y
Y Combinator Blog
Vercel News
Vercel News
T
Troy Hunt's Blog
L
LINUX DO - 最新话题
H
Hacker News: Front Page
云风的 BLOG
云风的 BLOG
Hugging Face - Blog
Hugging Face - Blog
www.infosecurity-magazine.com
www.infosecurity-magazine.com
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
aimingoo的专栏
aimingoo的专栏
Recorded Future
Recorded Future
Jina AI
Jina AI
人人都是产品经理
人人都是产品经理
Microsoft Azure Blog
Microsoft Azure Blog
Last Week in AI
Last Week in AI
T
The Exploit Database - CXSecurity.com
T
The Blog of Author Tim Ferriss
S
Schneier on Security
Project Zero
Project Zero
MyScale Blog
MyScale Blog
博客园 - 聂微东
F
Fortinet All Blogs
AWS News Blog
AWS News Blog
W
WeLiveSecurity
L
LangChain Blog
N
Netflix TechBlog - Medium
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
T
Tailwind CSS Blog
Scott Helme
Scott Helme
S
Secure Thoughts
A
Arctic Wolf
The Register - Security
The Register - Security
C
Check Point Blog
Security Latest
Security Latest
O
OpenAI News
S
Securelist
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Blog — PlanetScale
Blog — PlanetScale
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events

Hadoop

请教一下 Hadoop 在生产环境可以通过 Docker 安装吗? - V2EX hadoop zookeeper - V2EX 菜鸡初学者对 Hadoop 云端架构的一些疑惑 - V2EX 请问 hadoop 多块磁盘只部署一个 datanode 好还是每块磁盘各部署一个 datanode - V2EX 求助: Hadoop 中使用 Hbase 异常 - V2EX 有个选修课作业需要写一个关于 hadoop 技术的论文综述,有哪些比较重要的方面可以写 - V2EX 大佬们, 请问自学 hadoop 系列, 有什么教程或者资料吗? - V2EX 突然接到甲方的一个需求,要求从 hadoop 集群回到单机.... - V2EX 有什么部署 Hadoop 的主流方法么 - V2EX 爬虫每天传一次到 hdfs 能用 flume 吗? - V2EX 关于 Hadoop3 的 HADOOP_MAPRED_HOME - V2EX 请教一下存储的问题 - V2EX PayPal 上海招大数据研发工程师啦! - V2EX 大文件通过 Mapreduce 切分存入 hbase - V2EX Hadoop 读取 10 万个文件初始化过程很慢有方便的解决办法么? - V2EX 公司要做个数仓,单机 hadoop 是否没什么意义,但是又想自己动手做一下。求给建议! - V2EX 求助: hadoop 的 wordcount 一直是挂起状态 ACCEPTED: waiting for AM container to be allocated, launched and register with RM. - V2EX 大数据环境中压缩格式用什么比较好? - V2EX 有什么好的办法可以用 Flink/Spark 高效率并行处理大量大小不一的压缩数据 - V2EX 请教从外部访问用 docker 搭建的 hadoop 集群的问题? - V2EX 请教: hadoop 不会将大表格分割为 block - V2EX 关于分布式系统的学习 - V2EX springboot 整合 spark, 集群方式启动需要怎么配置呢? - V2EX 关于 zookeeper 集群 leader 节点的选举问题? - V2EX 如何从 afs 上下载数据 - V2EX 如何使用代码获取两个 Namenode 的节点信息? - V2EX SQOOP 导出数据到 MYSQL 报错 - V2EX 请教, CDH 集群管理工具, centos 普通用户可以安装吗?还是必须使用 root 用户 - V2EX 关于 HDFS 小文件归档有什么好办法吗? - V2EX 请教 9 台机器的 hadoop 集群角色分配问题 - V2EX cloudera agent 启动失败 - V2EX MapReduce 应用在本地调试正常,集群上跑不动 - V2EX spark 的 shuffle 算子一定会产生宽依赖吗? - V2EX spark graphx 怎么实现类似 QQ 好友推荐功能? neo4j 一条语句实现 - V2EX 自建 5 个节点的 Hadoop 集群,以及完成 MapReduce 作业 - V2EX 请教 hadoop 配置文件中配置项的作用域 - V2EX yarn 可以监控 hadoop 或者 spark 的服务吗? - V2EX 有很多 xml 文件,如何按照文件去并行,而不是一个大文件切分成小块来做并行计算呢? - V2EX 请教关于 HDFS DELEGATION TOKEN 过问题。 - V2EX 关于 Spark 读取预分区 Hbase 问题 - V2EX [腾讯岗位] 大数据开发工程师(深圳) - V2EX Apache Kylin 在 left outer join 后为何不支持+-*/运算啊? - V2EX 美资电商 Coupang(韩国电商巨头)在上海办公室招 Chief Architect(大数据方向) - V2EX hadoop or spark 大数据去重(10 亿) - V2EX 请教个 hadoop 指令问题 - V2EX 请问这个 hadoop 指令是什么意思啊 - V2EX 想请教一下从 oozie 调用 hadoop 遇到的问题 - V2EX Hadoop security - V2EX 大家经常去哪些大数据的论坛或者网站学习呢? - V2EX
大量 zip 压缩包,每一个都很小, 10M 以内,如何利用 MapReduce 实现快速解压呢? - V2EX
dhairoot · 2018-11-15 · via Hadoop

这是一个创建于 2768 天前的主题,其中的信息可能已经有所发展或是发生改变。

大量 zip 压缩包,每一个都很小,10M 以内,如何利用 MapReduce 实现快速解压呢?

ym1ng

1

ym1ng      2018 年 11 月 15 日

自己写 InputFormat (别问我怎么写有没有资料啥的,逃~

Vamposine

4

Vamposine      2018 年 11 月 15 日 via iPhone   ❤️ 1

你这个瓶颈是磁盘 io 吧

dawncold

5

dawncold      2018 年 11 月 15 日

如果你只是想解压这些 zip 文件的话,多开几个进程或者线程,和 CPU 个数差不多,一个个解压就挺快吧?当然如果有很多资源可用,确实可以搞分布式解压,就行 mapreduce 一样?

Valyrian

7

Valyrian      2018 年 11 月 15 日

多开几个进程同时解
为什么要扯到 mapreduce 上去

dhairoot

9

dhairoot      2018 年 11 月 15 日

@dawncold 现在的情况是总共有 16T 文件,通过手动的把文件分开放在不同电脑上,开多线程去解压就已经非常耗时了,所以才想通过上传到 hdfs,利用 MapReduce 解压,。但是目前发现解压速度太慢了,完全不知道因为什么。

dawncold

10

dawncold      2018 年 11 月 15 日

@dhairoot 这个不好说呢,分布式解压也得看你有多少资源可以被用起来,是有闲置的资源吗,还是解压速度已经够好了只是达不到心理预期?

AnyISalIn

11

AnyISalIn      2018 年 11 月 15 日

MapReduce 肯定没有本地多线程解压快的

hearfish

12

hearfish      2018 年 11 月 15 日

不同压缩格式的解压速度是不一样的,先看看你的压缩格式能支持多快的速度吧

surfire91

14

surfire91      2018 年 11 月 15 日

这个没必要 MapReduce 吧,你这个全是小任务,就多进程 /线程来好了,效率肯定比 MapReduce 高。

cyhulk

15

cyhulk      2018 年 11 月 15 日

forkjoinpool

est

16

est      2018 年 11 月 15 日

你是说 hdfs 上有大量 zip 文件,还是说你本地硬盘上有很多小 zip 文件想用 mapreduce 加速?

如果是后者。。。

dhairoot

17

dhairoot      2018 年 11 月 15 日 via Android

@est hdfs 上和本地上的文件是一样的

dhairoot

18

dhairoot      2018 年 11 月 15 日 via Android

@dawncold 我现在测试在本地多线程解压,但是因为都是小文件,每秒 io 次数很多,但是读写速度只能达到 10mb/s

mmtromsb456

19

mmtromsb456      2018 年 11 月 15 日   ❤️ 1

要考虑磁盘的 IOPS 吧..小文件多线程并发解压应该算个低队列深度 IO.你先确认下 IOPS 到达你的 SSD 瓶颈没有.而不是看读写速度

20015jjw

20

20015jjw      2018 年 11 月 15 日 via Android

为啥要 mapreduce.~

est

21

est      2018 年 11 月 15 日

@dhairoot 完全不一样。hdfs 的 io 成本很高。解压效率应该不是瓶颈。。纯粹是你小文件 open() 的瓶颈。

atomstar

22

atomstar      2018 年 11 月 15 日

处理 zip 里面的数据可以用 mr,但是就解压 zip,为什么要和 mr 扯上关系呢