

























1 kex0916 2018 年 11 月 24 日spark 读取的话可以自己实现分区切分的规则,也可以采用自己实现 FileInputFormat 将 isSplitable 设置成 false,然后使用 hadoop rdd api. |
3 kex0916 2018 年 11 月 25 日不能保证每台机器上都能至少起一个 executor,最好还是放到 hdfs 这种分布式文件系统上 |
4 ls2995 2018 年 11 月 28 日我跟你的任务咋这么一致呢,我是大概 8T 的 zip 文件在 hdfs 上,里面也都是 xml,我需要解压后再在集群上做解析存到 hbase,我解压就是看你发的那个链接写出来的,但是性能确实不太好,你最后是怎么解决的? |
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。