惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

小众软件
小众软件
A
About on SuperTechFans
博客园 - Franky
Engineering at Meta
Engineering at Meta
Recent Announcements
Recent Announcements
云风的 BLOG
云风的 BLOG
B
Blog
Microsoft Security Blog
Microsoft Security Blog
L
LangChain Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
U
Unit 42
Martin Fowler
Martin Fowler
Y
Y Combinator Blog
Stack Overflow Blog
Stack Overflow Blog
博客园 - 叶小钗
Vercel News
Vercel News
Apple Machine Learning Research
Apple Machine Learning Research
The Cloudflare Blog
Last Week in AI
Last Week in AI
腾讯CDC
Microsoft Azure Blog
Microsoft Azure Blog
爱范儿
爱范儿
V
V2EX
G
Google Developers Blog

博客园 - 南国故人(Wall)

oozie配置安装与原理 Livy原理详解 阿里(蚂蚁金服)招聘 Zeppelin原理简介 Spark job server原理初探 SparkSQL UDF使用方法与原理详解 使用Intellij加载Spark源代码 如何修改Git commit的信息 Namenode HA原理详解 Spark Shuffle 堆外内存溢出问题与解决(Shuffle通信原理) Spark SQL 代码简要阅读(基于Spark 1.1.0) RDD原理与详解 Spark详解 Spark Streaming 执行流程 Namenode HA原理详解 Spark架构与作业执行流程简介 Spark 开发环境搭建 YARN Application执行流程 [NM 状态机2] Container状态机详解
CarbonData编译与安装
南国故人(Wall) · 2016-08-15 · via 博客园 - 南国故人(Wall)

 原文连接 http://xiguada.org/carbondata_compile/ 

CarbonData是啥?

CarbonData is a fully indexed columnar and Hadoop native data-store for processing heavy analytical workloads and detailed queries on big data. In customer benchmarks, CarbonData has proven to manage Petabyte of data running on extraordinarily low-cost hardware and answers queries around 10 times faster than the current open source solutions (column-oriented SQL on Hadoop data-stores).

编译安装

  本想迅速试用一下,不过官网居然没有现成编译好的工程,没办法,只能自己编译一个。

安装需要三步(当然还需要jdk7或jdk8,,maven 3.3以上)

- 下载 Spark 1.5.0 或更新的版本。

- 下载并安装 Apache Thrift 0.9.3,并确认加到系统路径。

- 下载 Apache CarbonData code 并编译。

1 Spark可以直接下载,解压后设置PATH可执行spark-submit。

2 安装thrift前需要安装依赖,我的虚拟机啊ubuntu下安装依赖的命令如下。

sudo apt-get install libboost-dev libboost-test-dev libboost-program-options-dev libevent-dev automake libtool flex bison pkg-config g++ libssl-dev

然后到thrift下编译安装

./configure

sudo make

sudo make install

3 编译CarbonData

mvn -DskipTests -Pspark-1.6 -Dspark.version=1.6.2 clean package

4 进入bin目录,修改carbon-spark-sql 文件中的 /bin/spark-submit,改为spark-submit

5 生成sample.csv文件

cd carbondata

cat > sample.csv << EOF

id,name,city,age

1,david,shenzhen,31

2,eason,shenzhen,27

3,jarry,wuhan,35

EOF

6 执行

./carbon-spark-sql

spark-sql> create table if not exists test_table (id string, name string, city string, age Int) STORED BY 'carbondata'

spark-sql> load data inpath '../sample.csv' into table test_table

spark-sql> select city, avg(age), sum(age) from test_table group by city

执行结果

shenzhen      29.0     58

wuhan          35.0     35

看起来和执行SparkSQL一样,CarbonData这中间做了啥,有啥效果呢?后面继续分析。