惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

人人都是产品经理
人人都是产品经理
aimingoo的专栏
aimingoo的专栏
Y
Y Combinator Blog
B
Blog
D
Docker
C
Check Point Blog
A
About on SuperTechFans
云风的 BLOG
云风的 BLOG
F
Fortinet All Blogs
Stack Overflow Blog
Stack Overflow Blog
Recent Announcements
Recent Announcements
MongoDB | Blog
MongoDB | Blog
WordPress大学
WordPress大学
Jina AI
Jina AI
罗磊的独立博客
月光博客
月光博客
博客园 - Franky
L
LangChain Blog
H
Help Net Security
Google DeepMind News
Google DeepMind News
Microsoft Security Blog
Microsoft Security Blog
小众软件
小众软件
T
Tailwind CSS Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻

Spark

求助广大网友 真的深入了解开源项目是动手实现--《Spark Core 精简版》 求助几个 Spark 问题 spark 做内容推荐,希望大佬给一些思路上的指导 有没有不错的 SparkStreaming+Kafka 的开源项目可以用来入门和进阶? spark 大数据离线分析 爬虫存到 csv 有的列是长度不固定的 list 请问应该怎么存到 hive?直接存 list 吗?该怎么分析呢? PayPal 招 资深大数据工程师 啦 - 技术栈: Spark, Scala, Java , Python 等 关于 Spark Task 的疑问 有没有在滴滴或者其他网约车公司的同学,请教一个数据量的问题 spark 作业求助,剔除空值大于三的行 spark 有用 kotlin 写代码的吗? 现在写 spark 程序,都是用 scala 吗 spark 核心构件之 Dependency 宽窄依赖 spark 内存管理的实现 spark 源码研究 spark straming。submit Python 脚本报错。 CPython, PyPy 和 Scala 在 Spark 平台上的性能对比 Spark/Scala 的细节讨论:在 map task 里的 map 会得到如何的处理? SPARK 文档查询好费劲 Apache Spark 之间的共享项目配置文件问题 疑问:spark对于迭代运算场景很有优势,那对于迭代不严重的计算场景呢? First Steps with Spark – Screencast #1
Spark 解析复杂 xml,数据如何映射到多表中
bluehtt · 2021-09-01 · via Spark

需求:利用 Spark 解析 xml 文件,xml 结构最大深度有 8 层,数据有复杂的关联关系,处理后会插入到 20 多张表中。由于使用工具解析后的 DataFrame 结构过长,简单截取了一部分如下:

simple dataFrame

目前没有好的思路,就是获取每一列元素依次遍历提取出所有需要的元素,但是想到要遍历 8 层眼泪都要流下来了:

// 层层对象遍历
val identifiers = row.get(0).asInstanceOf[Row].get(0).asInstanceOf[Row].get(0).asInstanceOf[Row].get(0)
// 解析数组
println(identifiers.asInstanceOf[mutable.WrappedArray[AnyRef]](0))

就以图示中的结构来说,数据不算复杂,但是完整的结构实在是令人神伤,贴了图恐怕会占据整个页面。另外最终要插入的 20 多张表中十几张是关联表。 初次使用 Spark 处理数据,求大家给点意见和思路,万分感谢!