惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

H
Help Net Security
腾讯CDC
爱范儿
爱范儿
Google DeepMind News
Google DeepMind News
V
V2EX
Blog — PlanetScale
Blog — PlanetScale
Engineering at Meta
Engineering at Meta
GbyAI
GbyAI
量子位
F
Fortinet All Blogs
G
Google Developers Blog
T
The Blog of Author Tim Ferriss
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Hugging Face - Blog
Hugging Face - Blog
Last Week in AI
Last Week in AI
T
Tailwind CSS Blog
J
Java Code Geeks
S
SegmentFault 最新的问题
D
Docker
博客园 - 司徒正美
The GitHub Blog
The GitHub Blog
Jina AI
Jina AI
M
MIT News - Artificial intelligence
博客园 - 【当耐特】

博客园 - 肥仔鱼Liam

天数智芯--天垓150S 华为泰山鲲鹏服务器实测 Cloud Data AI Manager 是一个用于管理、监控和操作企业级数据湖和大数据解决方案的全面平台。 1天支持智普 GLM-5.2:华为昇腾 910B双机推理保姆级教程(命令操作) 华为HUAWEI昇腾910B下千问Qwen3.6-27B的推理加速实践 Hadoop(CDH6、CDP7)在Qwen3.7大模型训练中的作用,(含部署、运行操作步骤) 【华为昇腾910B】在AI大模型推理速度与GPU显卡选择 (华为昇腾Ascend、鲲鹏Kunpeng)今天紧缩投资环境下计算软件企业的困境和应对策略 AI看图能力可能是“演出来的”:它在没看图时,也能答对80% GPUStack 在华为昇腾 800I A2 服务器上的保姆级部署指南 OpenClaw(养龙虾) +关于Hadoop hive的Skills(Cloudera CDH、CDP) 2026年OpenClaw(养龙虾)+ 钉钉对接:保姆级全链路操作指南 OpenClaw + 企业微信对接:2026年保姆级全链路操作指南 “AI+消费”:第四届北京人工智能产业创新发展大会----深度融合与场景重塑--全景洞察 中国信通院人工智能报告审查项目(AI大模型)专题汇报 智谱GLM-5 1 day适配华为昇腾(国产),744B模型单机高效推理,全量保姆配置过程 华为昇腾300T A2训练、微调Qwen过程,带保姆式命令,麒麟操作系统+鲲鹏CPU AI大模型时代:谁在摧毁2025年中国的企业软件产业?白嫖,开源,外包,招标,数科,AI... AI语言大模型时代 Cloudera CDP(华为CMP 鲲鹏版)对自有知识的保 张文宏:拒绝把ai引入医院病历系统 Cloudera CDH5、CDH6、CDP7现状及替代方案(附下载) 基于Hadoop生态构建的企业级大数据平台的排行榜 国内Cloudera CDH、CDP、Hadoop大数据平台的排行榜 AI手机的“简单替换陷阱”与Hadoop、Cloudera CDP 7大数据底座的关系探析 Hadoop 实战:从Hive、Impala(Cloudera CDH、CDP)海量数据到 AI 决策的落地方法 从海量数据到 AI 决策的落地方法 Hadoop大数据在2025-2026年和AI智能问数平台的规划与实践
Iceberg 在hadoop大数据数据湖领域这么火
肥仔鱼Liam · 2025-12-17 · via 博客园 - 肥仔鱼Liam

Iceberg 在hadoop大数据数据湖领域这么火

Apache Iceberg 在 Hadoop 大数据和数据湖领域“爆火”,并非偶然,而是因为它精准解决了传统 Hadoop 生态(尤其是 Hive)在构建现代数据湖时的核心痛点,同时顺应了 云原生、AI 驱动、开放湖仓一体(Lakehouse 的技术演进趋势。

以下是 Iceberg 走红的 五大关键原因(结合技术本质与行业实践):

🔥 一、彻底解决 Hive 表的“三大顽疾”

传统 Hive 表在数据湖场景下面临严重问题,而 Iceberg 提供了优雅解法:

Hive 痛点

Iceberg 解决方案

1. 元数据强耦合 HDFS NameNode
→ 小文件爆炸导致 NameNode 内存耗尽

✅ 元数据独立存储
• 使用可扩展的 metadata 文件(JSON/Avro)
• 支持 S3、OSS 等对象存储,摆脱 HDFS 依赖

2. ACID 事务缺失
→ 并发写入易脏读、写冲突

✅ 完整 ACID 事务支持
• 基于快照(Snapshot)+ 乐观锁
• Spark/Flink 多引擎并发安全写入

3. 分区管理僵化
→ 修改分区需重写全表

✅ 隐式分区 + 分区演化(Partition Evolution
• 自动隐藏分区字段
• 可在线变更分区策略(如从 dt 改为 hour)

💡 举例:某电商公司用 Hive 每天新增 10 万小文件,NameNode 频繁 OOM;迁移到 Iceberg 后,元数据由对象存储托管,NameNode 压力下降 90%。

🚀 二、为 AI/大模型时代提供“高质量数据燃料”

大模型训练对数据湖提出新要求,Iceberg 天然契合:

AI 数据需求

Iceberg 能力

数据版本可追溯
(用于实验复现、审计)

✅ Time Travel(时间旅行)
• SELECT * FROM table FOR TIMESTAMP AS OF '2025-06-01'
• 支持回滚到任意历史快照

高效增量处理
(避免全量扫描)

✅ 增量读取(Incremental Read
• Flink/Spark 只读取新快照的变更文件
• CDC 场景性能提升 5–10 倍

结构灵活演进
(特征工程频繁改 schema)

✅ Schema Evolution
• 安全支持 ADD/DROP/RENAME 列
• 兼容旧快照查询

📌 Netflix(Iceberg 创始者)直言:没有 Iceberg,我们无法支撑每天 PB 级的机器学习数据管道。”

☁️ 三、拥抱云原生,打破厂商锁定

Hadoop 时代绑定 HDFS,而 Iceberg 设计之初就面向云:

  • 存储计算分离:数据存在 S3/OSS/ADLS,计算用 Spark/Flink/K8s
  • 开放表格式(Open Table Format
    • 同一张表可被 Spark、Flink、Trino、Presto、Hive、Doris 等多引擎读写
    • 避免被单一厂商(如 Databricks Delta Lake)锁定
  • 成为事实标准
    AWS Athena、Google BigQuery、Snowflake、Cloudera、华为 MRS、阿里云 EMR 全面支持 Iceberg

✅ 2025 年,Iceberg v3 规范正式确立,进一步巩固其作为 数据湖通用语言” 的地位。

⚙️ 四、企业级能力补齐 Hadoop 最后一公里

Iceberg 不只是格式,更是生产级数据湖平台基石

企业需求

Iceberg 支持

高性能查询

• 文件级索引(即将支持)
• Z-Order 排序优化

数据治理

• 行级删除(Row-Level Delete)
• GDPR 合规擦除

流批一体

• Flink 实时写入 + Spark 批处理共用同一表

灾备与共享

• 快照复制(Replication)实现跨集群同步

🏢 国内实践:华为、字节、腾讯、移动等均将 Iceberg 作为核心数据湖格式,替代 Hive 原生表。

🌐 五、强大的开源生态与巨头背书

  • 创始团队:Netflix(2018 年开源)
  • 顶级贡献者:Apple、AWS、Google、Snowflake、Dremio、Cloudera、阿里、腾讯
  • 社区活跃度:GitHub Star 超 8k,月均 PR 200+,CNCF 孵化项目(2024年进入毕业阶段)

💬 行业共识:“Delta Lake 是 Databricks 的,Hudi 是 AWS 的,只有 Iceberg 是真正中立的。”

总结:为什么 Iceberg 这么火?

Iceberg = Hive 的现代化重生 + 云原生数据湖的通用标准 + AI 时代的可靠底座。

它既兼容 Hadoop 生态存量(Hive Metastore、YARN),又引领未来架构(对象存储、多引擎、湖仓一体),让企业在不推倒重来的前提下,平滑升级到新一代数据基础设施。

正如 TechTarget 2025 年评价:

“Apache Iceberg 已从‘有前景的表格式’转变为现代数据湖屋架构的核心支柱。”

 Iceberg Replication