惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
H
Help Net Security
Jina AI
Jina AI
V
V2EX
G
Google Developers Blog
B
Blog
GbyAI
GbyAI
U
Unit 42
爱范儿
爱范儿
腾讯CDC
Engineering at Meta
Engineering at Meta
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 三生石上(FineUI控件)
宝玉的分享
宝玉的分享
小众软件
小众软件
D
DataBreaches.Net
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - Franky
博客园 - 聂微东
The Cloudflare Blog
I
InfoQ
Microsoft Azure Blog
Microsoft Azure Blog
Hugging Face - Blog
Hugging Face - Blog
大猫的无限游戏
大猫的无限游戏

Hadoop

请教一下 Hadoop 在生产环境可以通过 Docker 安装吗? hadoop zookeeper 菜鸡初学者对 Hadoop 云端架构的一些疑惑 请问 hadoop 多块磁盘只部署一个 datanode 好还是每块磁盘各部署一个 datanode 求助: Hadoop 中使用 Hbase 异常 有个选修课作业需要写一个关于 hadoop 技术的论文综述,有哪些比较重要的方面可以写 大佬们, 请问自学 hadoop 系列, 有什么教程或者资料吗? 突然接到甲方的一个需求,要求从 hadoop 集群回到单机.... 有什么部署 Hadoop 的主流方法么 爬虫每天传一次到 hdfs 能用 flume 吗? 关于 Hadoop3 的 HADOOP_MAPRED_HOME 请教一下存储的问题 PayPal 上海招大数据研发工程师啦! 大文件通过 Mapreduce 切分存入 hbase Hadoop 读取 10 万个文件初始化过程很慢有方便的解决办法么? 公司要做个数仓,单机 hadoop 是否没什么意义,但是又想自己动手做一下。求给建议! 求助: hadoop 的 wordcount 一直是挂起状态 ACCEPTED: waiting for AM container to be allocated, launched and register with RM. 大数据环境中压缩格式用什么比较好? 有什么好的办法可以用 Flink/Spark 高效率并行处理大量大小不一的压缩数据 请教从外部访问用 docker 搭建的 hadoop 集群的问题? 请教: hadoop 不会将大表格分割为 block 关于分布式系统的学习 springboot 整合 spark, 集群方式启动需要怎么配置呢? 关于 zookeeper 集群 leader 节点的选举问题? 如何从 afs 上下载数据 如何使用代码获取两个 Namenode 的节点信息? SQOOP 导出数据到 MYSQL 报错 请教, CDH 集群管理工具, centos 普通用户可以安装吗?还是必须使用 root 用户 关于 HDFS 小文件归档有什么好办法吗? 请教 9 台机器的 hadoop 集群角色分配问题
hadoop or spark 大数据去重(10 亿)
engineer9 · 2018-07-30 · via Hadoop

现有一些社交数据如下,

id from to
1   A   B
2   A   C
3   B   A
4   C   A

去重复后如下,

id from to
1   A   B
2   A   C

尝试的解决方案:
1、采用 bloomfilter 去重,由于 bloomfilter 本身算法问题,会丢失一些数据;
2、使用数据库查询然后写入到新表,速度有点慢。
3、使用 BerkeleyDB ?
4、使用 hadoop 或者 spark 解决,网上找到的方式几乎都是使用 group by 或者 distinct 但这并不适合我这个场景,如何解决呢?
头大。。。新手上路。。。