惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园_首页
N
Netflix TechBlog - Medium
V
Visual Studio Blog
博客园 - Franky
小众软件
小众软件
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Apple Machine Learning Research
Apple Machine Learning Research
博客园 - 三生石上(FineUI控件)
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
宝玉的分享
宝玉的分享
量子位
大猫的无限游戏
大猫的无限游戏
人人都是产品经理
人人都是产品经理
V
V2EX
The Cloudflare Blog
月光博客
月光博客
Last Week in AI
Last Week in AI
雷峰网
雷峰网
WordPress大学
WordPress大学
博客园 - 【当耐特】
博客园 - 聂微东
IT之家
IT之家
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻

Hadoop

请教一下 Hadoop 在生产环境可以通过 Docker 安装吗? hadoop zookeeper 菜鸡初学者对 Hadoop 云端架构的一些疑惑 请问 hadoop 多块磁盘只部署一个 datanode 好还是每块磁盘各部署一个 datanode 求助: Hadoop 中使用 Hbase 异常 有个选修课作业需要写一个关于 hadoop 技术的论文综述,有哪些比较重要的方面可以写 大佬们, 请问自学 hadoop 系列, 有什么教程或者资料吗? 突然接到甲方的一个需求,要求从 hadoop 集群回到单机.... 有什么部署 Hadoop 的主流方法么 爬虫每天传一次到 hdfs 能用 flume 吗? 关于 Hadoop3 的 HADOOP_MAPRED_HOME 请教一下存储的问题 PayPal 上海招大数据研发工程师啦! 大文件通过 Mapreduce 切分存入 hbase Hadoop 读取 10 万个文件初始化过程很慢有方便的解决办法么? 公司要做个数仓,单机 hadoop 是否没什么意义,但是又想自己动手做一下。求给建议! 求助: hadoop 的 wordcount 一直是挂起状态 ACCEPTED: waiting for AM container to be allocated, launched and register with RM. 大数据环境中压缩格式用什么比较好? 有什么好的办法可以用 Flink/Spark 高效率并行处理大量大小不一的压缩数据 请教从外部访问用 docker 搭建的 hadoop 集群的问题? 请教: hadoop 不会将大表格分割为 block 关于分布式系统的学习 springboot 整合 spark, 集群方式启动需要怎么配置呢? 关于 zookeeper 集群 leader 节点的选举问题? 如何从 afs 上下载数据 如何使用代码获取两个 Namenode 的节点信息? SQOOP 导出数据到 MYSQL 报错 请教, CDH 集群管理工具, centos 普通用户可以安装吗?还是必须使用 root 用户 关于 HDFS 小文件归档有什么好办法吗? 请教 9 台机器的 hadoop 集群角色分配问题
关于 Spark 读取预分区 Hbase 问题
Nirlan · 2018-09-28 · via Hadoop

RT.

我有一张预分区的 Hbase 表, split key 是 000| 001| ... 199|这样,200 个分区.

我的 rowkey 是这样设计的 001|20180928001122+ 业务 ID + 6 位随机数

这样设计的话避免了 Spark 读取时数据倾斜啊,插入时数据热点问题.

但是我想用 Spark 读取某一天的数据,还想用 scan 操作的话,貌似很难实现.

比如我的 startrow=001|2018092800 + 0000 + 0000 + 000000 endrow=001|2018092899 + 0000 + 0000 +000000

我想读取完这一天的数据,难道得循环 200 个 region 吗?

单机多线程的话是可以这么做的,但是我想用 spark 分布式环境来操作.

我查阅了 TableSnapshotScanner 类,对其 regions 属性不甚理解,望高手给个思路(给个 demo 最好了...