惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Microsoft Azure Blog
Microsoft Azure Blog
GbyAI
GbyAI
P
Proofpoint News Feed
Engineering at Meta
Engineering at Meta
Recent Announcements
Recent Announcements
L
LangChain Blog
B
Blog
阮一峰的网络日志
阮一峰的网络日志
Microsoft Security Blog
Microsoft Security Blog
博客园 - 【当耐特】
M
MIT News - Artificial intelligence
D
Docker
WordPress大学
WordPress大学
J
Java Code Geeks
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
The GitHub Blog
The GitHub Blog
博客园 - 叶小钗
Last Week in AI
Last Week in AI
Stack Overflow Blog
Stack Overflow Blog
有赞技术团队
有赞技术团队
MyScale Blog
MyScale Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
MongoDB | Blog
MongoDB | Blog
博客园 - Franky

Hadoop

请教一下 Hadoop 在生产环境可以通过 Docker 安装吗? hadoop zookeeper 菜鸡初学者对 Hadoop 云端架构的一些疑惑 请问 hadoop 多块磁盘只部署一个 datanode 好还是每块磁盘各部署一个 datanode 求助: Hadoop 中使用 Hbase 异常 有个选修课作业需要写一个关于 hadoop 技术的论文综述,有哪些比较重要的方面可以写 大佬们, 请问自学 hadoop 系列, 有什么教程或者资料吗? 突然接到甲方的一个需求,要求从 hadoop 集群回到单机.... 有什么部署 Hadoop 的主流方法么 爬虫每天传一次到 hdfs 能用 flume 吗? 关于 Hadoop3 的 HADOOP_MAPRED_HOME 请教一下存储的问题 PayPal 上海招大数据研发工程师啦! 大文件通过 Mapreduce 切分存入 hbase Hadoop 读取 10 万个文件初始化过程很慢有方便的解决办法么? 求助: hadoop 的 wordcount 一直是挂起状态 ACCEPTED: waiting for AM container to be allocated, launched and register with RM. 大数据环境中压缩格式用什么比较好? 有什么好的办法可以用 Flink/Spark 高效率并行处理大量大小不一的压缩数据 请教从外部访问用 docker 搭建的 hadoop 集群的问题? 请教: hadoop 不会将大表格分割为 block 关于分布式系统的学习 springboot 整合 spark, 集群方式启动需要怎么配置呢? 关于 zookeeper 集群 leader 节点的选举问题? 如何从 afs 上下载数据 如何使用代码获取两个 Namenode 的节点信息? SQOOP 导出数据到 MYSQL 报错 请教, CDH 集群管理工具, centos 普通用户可以安装吗?还是必须使用 root 用户 关于 HDFS 小文件归档有什么好办法吗? 请教 9 台机器的 hadoop 集群角色分配问题 cloudera agent 启动失败
公司要做个数仓,单机 hadoop 是否没什么意义,但是又想自己...
yellowmarlboro · 2020-05-25 · via Hadoop

背景

  • 在之前公司轻微接触过 hive,es 等(之前公司是分布式,机器还不少),不过本职是抓数据入 kafka 以及部分从 MySQL,MongoDB 之类的数据库做数据处理,一般只是给研究部门用。所以对于数仓之类的操作也只是见同事用,自己操作次数为个位数,各种工具的概念也只是一知半解,我觉得这样的就称之为不会。

  • 现公司是传统公司,在一个互联网部门,并且各种氛围个人觉得较老套,技术流程什么的相对不那么'互联网'(不过好处就是项目不那么着急,准时上下班)。所以整个公司就只有一台 linux 服务器(都用 Windows 服务器),还是我申请来的..不过没那么重要了,有的 linux 用就很满足了(来之后一直在用 windows,还不是特别习惯)。

需求

  • 领导想要把公司各个业务的数据汇一起,做个数据仓库,短期需求就是各个业务部门从这里取数据,只取历史速度要求不高。长期希望做一些大数据应用。

  • 数据量的话,目前业务大多使用 sqlserver 和 oracle,也没什么问题(明天问一下 dba )。大概不是很大。

想法和问题

  • 想自己动手搭起来但是苦于几个问题:

    1.有无必要用 hadoop 生态的东西,而且是单机,没必要的话我也想自己试着动手(反正项目也不急,而且之前的工作太简单了,觉得太无聊了。项目用什么技术领导也不懂也无所谓),或者有没有其他的工具?

    2.一直主要用 python,java 只知皮毛,当然能借此学 java 进步一下也可。但是有没有 python 比较紧密的工具?

总之就是想用这个机会学习动手点新东西而且做好,但是这个架构什么的对我来说还是比较难,所以想得到各位大佬的建议