惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
Security Latest
Security Latest
博客园_首页
宝玉的分享
宝玉的分享
人人都是产品经理
人人都是产品经理
罗磊的独立博客
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Jina AI
Jina AI
爱范儿
爱范儿
小众软件
小众软件
IT之家
IT之家
Hugging Face - Blog
Hugging Face - Blog
博客园 - 三生石上(FineUI控件)
博客园 - 聂微东
博客园 - Franky
S
SegmentFault 最新的问题
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
大猫的无限游戏
大猫的无限游戏
Apple Machine Learning Research
Apple Machine Learning Research
量子位
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
月光博客
月光博客
NISL@THU
NISL@THU
博客园 - 司徒正美
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
AWS News Blog
AWS News Blog
有赞技术团队
有赞技术团队
V
Visual Studio Blog
雷峰网
雷峰网
C
Cybersecurity and Infrastructure Security Agency CISA
美团技术团队
The Cloudflare Blog
P
Privacy & Cybersecurity Law Blog
Latest news
Latest news
S
Securelist
C
CERT Recently Published Vulnerability Notes
C
CXSECURITY Database RSS Feed - CXSecurity.com
P
Palo Alto Networks Blog
Last Week in AI
Last Week in AI
V
V2EX
Know Your Adversary
Know Your Adversary
酷 壳 – CoolShell
酷 壳 – CoolShell
T
Threat Research - Cisco Blogs
T
Tailwind CSS Blog
J
Java Code Geeks
I
Intezer
Recent Commits to openclaw:main
Recent Commits to openclaw:main
博客园 - 【当耐特】
Schneier on Security
Schneier on Security

Hadoop

请教一下 Hadoop 在生产环境可以通过 Docker 安装吗? - V2EX hadoop zookeeper - V2EX 菜鸡初学者对 Hadoop 云端架构的一些疑惑 - V2EX 请问 hadoop 多块磁盘只部署一个 datanode 好还是每块磁盘各部署一个 datanode - V2EX 求助: Hadoop 中使用 Hbase 异常 - V2EX 有个选修课作业需要写一个关于 hadoop 技术的论文综述,有哪些比较重要的方面可以写 - V2EX 大佬们, 请问自学 hadoop 系列, 有什么教程或者资料吗? - V2EX 突然接到甲方的一个需求,要求从 hadoop 集群回到单机.... - V2EX 有什么部署 Hadoop 的主流方法么 - V2EX 爬虫每天传一次到 hdfs 能用 flume 吗? - V2EX 关于 Hadoop3 的 HADOOP_MAPRED_HOME - V2EX 请教一下存储的问题 - V2EX PayPal 上海招大数据研发工程师啦! - V2EX 大文件通过 Mapreduce 切分存入 hbase - V2EX Hadoop 读取 10 万个文件初始化过程很慢有方便的解决办法么? - V2EX 公司要做个数仓,单机 hadoop 是否没什么意义,但是又想自己动手做一下。求给建议! - V2EX 求助: hadoop 的 wordcount 一直是挂起状态 ACCEPTED: waiting for AM container to be allocated, launched and register with RM. - V2EX 大数据环境中压缩格式用什么比较好? - V2EX 有什么好的办法可以用 Flink/Spark 高效率并行处理大量大小不一的压缩数据 - V2EX 请教从外部访问用 docker 搭建的 hadoop 集群的问题? - V2EX 请教: hadoop 不会将大表格分割为 block - V2EX 关于分布式系统的学习 - V2EX springboot 整合 spark, 集群方式启动需要怎么配置呢? - V2EX 关于 zookeeper 集群 leader 节点的选举问题? - V2EX 如何从 afs 上下载数据 - V2EX 如何使用代码获取两个 Namenode 的节点信息? - V2EX SQOOP 导出数据到 MYSQL 报错 - V2EX 请教, CDH 集群管理工具, centos 普通用户可以安装吗?还是必须使用 root 用户 - V2EX 关于 HDFS 小文件归档有什么好办法吗? - V2EX 请教 9 台机器的 hadoop 集群角色分配问题 - V2EX cloudera agent 启动失败 - V2EX MapReduce 应用在本地调试正常,集群上跑不动 - V2EX spark 的 shuffle 算子一定会产生宽依赖吗? - V2EX spark graphx 怎么实现类似 QQ 好友推荐功能? neo4j 一条语句实现 - V2EX 自建 5 个节点的 Hadoop 集群,以及完成 MapReduce 作业 - V2EX 请教 hadoop 配置文件中配置项的作用域 - V2EX yarn 可以监控 hadoop 或者 spark 的服务吗? - V2EX 大量 zip 压缩包,每一个都很小, 10M 以内,如何利用 MapReduce 实现快速解压呢? - V2EX 请教关于 HDFS DELEGATION TOKEN 过问题。 - V2EX 关于 Spark 读取预分区 Hbase 问题 - V2EX [腾讯岗位] 大数据开发工程师(深圳) - V2EX Apache Kylin 在 left outer join 后为何不支持+-*/运算啊? - V2EX 美资电商 Coupang(韩国电商巨头)在上海办公室招 Chief Architect(大数据方向) - V2EX hadoop or spark 大数据去重(10 亿) - V2EX 请教个 hadoop 指令问题 - V2EX 请问这个 hadoop 指令是什么意思啊 - V2EX 想请教一下从 oozie 调用 hadoop 遇到的问题 - V2EX Hadoop security - V2EX 大家经常去哪些大数据的论坛或者网站学习呢? - V2EX
有很多 xml 文件,如何按照文件去并行,而不是一个大文件切分成小块来做并行计算呢? - V2EX
dhairoot · 2018-11-23 · via Hadoop

  • xml
  • 文件
  • 并行
  • 分成

    10 条回复    2018-12-09 23:20:40 +08:00

    kex0916

    1

    kex0916      2018 年 11 月 24 日

    spark 读取的话可以自己实现分区切分的规则,也可以采用自己实现 FileInputFormat 将 isSplitable 设置成 false,然后使用 hadoop rdd api.

    dhairoot

    2

    dhairoot      2018 年 11 月 25 日 via Android

    @kex0916 文件都是本地的,每台电脑有一部分,这样的也可以吗

    kex0916

    3

    kex0916      2018 年 11 月 25 日

    不能保证每台机器上都能至少起一个 executor,最好还是放到 hdfs 这种分布式文件系统上

    ls2995

    4

    ls2995      2018 年 11 月 28 日

    我跟你的任务咋这么一致呢,我是大概 8T 的 zip 文件在 hdfs 上,里面也都是 xml,我需要解压后再在集群上做解析存到 hbase,我解压就是看你发的那个链接写出来的,但是性能确实不太好,你最后是怎么解决的?

    dhairoot

    7

    dhairoot      2018 年 12 月 7 日 via Android

    @ls2995 我后来就是在每一台电脑上分别跑处理程序

    ls2995

    8

    ls2995      2018 年 12 月 8 日

    @dhairoot 我用 spark 实现了,但是性能不是很好,我们公司要求有点高,集群性能不太好吧还要求速度,所以分别跑不太现实,而且每周还会来 3T 左右的 zip 文件,必须要尽快解压分析入库,现在正写 spark 解析 xml 呢,有点烦躁