惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - Franky
N
Netflix TechBlog - Medium
宝玉的分享
宝玉的分享
Google DeepMind News
Google DeepMind News
腾讯CDC
G
Google Developers Blog
Martin Fowler
Martin Fowler
Microsoft Security Blog
Microsoft Security Blog
Recent Announcements
Recent Announcements
爱范儿
爱范儿
Engineering at Meta
Engineering at Meta
Microsoft Azure Blog
Microsoft Azure Blog
A
About on SuperTechFans
aimingoo的专栏
aimingoo的专栏
有赞技术团队
有赞技术团队
Jina AI
Jina AI
人人都是产品经理
人人都是产品经理
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
M
MIT News - Artificial intelligence
罗磊的独立博客
博客园 - 三生石上(FineUI控件)
美团技术团队
WordPress大学
WordPress大学
阮一峰的网络日志
阮一峰的网络日志

博客园 - 肥仔鱼Liam

天数智芯--天垓150S 华为泰山鲲鹏服务器实测 Cloud Data AI Manager 是一个用于管理、监控和操作企业级数据湖和大数据解决方案的全面平台。 1天支持智普 GLM-5.2:华为昇腾 910B双机推理保姆级教程(命令操作) 华为HUAWEI昇腾910B下千问Qwen3.6-27B的推理加速实践 Hadoop(CDH6、CDP7)在Qwen3.7大模型训练中的作用,(含部署、运行操作步骤) 【华为昇腾910B】在AI大模型推理速度与GPU显卡选择 (华为昇腾Ascend、鲲鹏Kunpeng)今天紧缩投资环境下计算软件企业的困境和应对策略 AI看图能力可能是“演出来的”:它在没看图时,也能答对80% GPUStack 在华为昇腾 800I A2 服务器上的保姆级部署指南 OpenClaw(养龙虾) +关于Hadoop hive的Skills(Cloudera CDH、CDP) 2026年OpenClaw(养龙虾)+ 钉钉对接:保姆级全链路操作指南 OpenClaw + 企业微信对接:2026年保姆级全链路操作指南 “AI+消费”:第四届北京人工智能产业创新发展大会----深度融合与场景重塑--全景洞察 中国信通院人工智能报告审查项目(AI大模型)专题汇报 智谱GLM-5 1 day适配华为昇腾(国产),744B模型单机高效推理,全量保姆配置过程 华为昇腾300T A2训练、微调Qwen过程,带保姆式命令,麒麟操作系统+鲲鹏CPU AI大模型时代:谁在摧毁2025年中国的企业软件产业?白嫖,开源,外包,招标,数科,AI... AI语言大模型时代 Cloudera CDP(华为CMP 鲲鹏版)对自有知识的保 张文宏:拒绝把ai引入医院病历系统 Cloudera CDH5、CDH6、CDP7现状及替代方案(附下载) 基于Hadoop生态构建的企业级大数据平台的排行榜 国内Cloudera CDH、CDP、Hadoop大数据平台的排行榜 AI手机的“简单替换陷阱”与Hadoop、Cloudera CDP 7大数据底座的关系探析 Hadoop 实战:从Hive、Impala(Cloudera CDH、CDP)海量数据到 AI 决策的落地方法 从海量数据到 AI 决策的落地方法 Hadoop大数据在2025-2026年和AI智能问数平台的规划与实践
Iceberg 在hadoop大数据数据湖领域这么火
肥仔鱼Liam · 2025-12-17 · via 博客园 - 肥仔鱼Liam

Iceberg 在hadoop大数据数据湖领域这么火

Apache Iceberg 在 Hadoop 大数据和数据湖领域“爆火”,并非偶然,而是因为它精准解决了传统 Hadoop 生态(尤其是 Hive)在构建现代数据湖时的核心痛点,同时顺应了 云原生、AI 驱动、开放湖仓一体(Lakehouse 的技术演进趋势。

以下是 Iceberg 走红的 五大关键原因(结合技术本质与行业实践):

🔥 一、彻底解决 Hive 表的“三大顽疾”

传统 Hive 表在数据湖场景下面临严重问题,而 Iceberg 提供了优雅解法:

Hive 痛点

Iceberg 解决方案

1. 元数据强耦合 HDFS NameNode
→ 小文件爆炸导致 NameNode 内存耗尽

✅ 元数据独立存储
• 使用可扩展的 metadata 文件(JSON/Avro)
• 支持 S3、OSS 等对象存储,摆脱 HDFS 依赖

2. ACID 事务缺失
→ 并发写入易脏读、写冲突

✅ 完整 ACID 事务支持
• 基于快照(Snapshot)+ 乐观锁
• Spark/Flink 多引擎并发安全写入

3. 分区管理僵化
→ 修改分区需重写全表

✅ 隐式分区 + 分区演化(Partition Evolution
• 自动隐藏分区字段
• 可在线变更分区策略(如从 dt 改为 hour)

💡 举例:某电商公司用 Hive 每天新增 10 万小文件,NameNode 频繁 OOM;迁移到 Iceberg 后,元数据由对象存储托管,NameNode 压力下降 90%。

🚀 二、为 AI/大模型时代提供“高质量数据燃料”

大模型训练对数据湖提出新要求,Iceberg 天然契合:

AI 数据需求

Iceberg 能力

数据版本可追溯
(用于实验复现、审计)

✅ Time Travel(时间旅行)
• SELECT * FROM table FOR TIMESTAMP AS OF '2025-06-01'
• 支持回滚到任意历史快照

高效增量处理
(避免全量扫描)

✅ 增量读取(Incremental Read
• Flink/Spark 只读取新快照的变更文件
• CDC 场景性能提升 5–10 倍

结构灵活演进
(特征工程频繁改 schema)

✅ Schema Evolution
• 安全支持 ADD/DROP/RENAME 列
• 兼容旧快照查询

📌 Netflix(Iceberg 创始者)直言:没有 Iceberg,我们无法支撑每天 PB 级的机器学习数据管道。”

☁️ 三、拥抱云原生,打破厂商锁定

Hadoop 时代绑定 HDFS,而 Iceberg 设计之初就面向云:

  • 存储计算分离:数据存在 S3/OSS/ADLS,计算用 Spark/Flink/K8s
  • 开放表格式(Open Table Format
    • 同一张表可被 Spark、Flink、Trino、Presto、Hive、Doris 等多引擎读写
    • 避免被单一厂商(如 Databricks Delta Lake)锁定
  • 成为事实标准
    AWS Athena、Google BigQuery、Snowflake、Cloudera、华为 MRS、阿里云 EMR 全面支持 Iceberg

✅ 2025 年,Iceberg v3 规范正式确立,进一步巩固其作为 数据湖通用语言” 的地位。

⚙️ 四、企业级能力补齐 Hadoop 最后一公里

Iceberg 不只是格式,更是生产级数据湖平台基石

企业需求

Iceberg 支持

高性能查询

• 文件级索引(即将支持)
• Z-Order 排序优化

数据治理

• 行级删除(Row-Level Delete)
• GDPR 合规擦除

流批一体

• Flink 实时写入 + Spark 批处理共用同一表

灾备与共享

• 快照复制(Replication)实现跨集群同步

🏢 国内实践:华为、字节、腾讯、移动等均将 Iceberg 作为核心数据湖格式,替代 Hive 原生表。

🌐 五、强大的开源生态与巨头背书

  • 创始团队:Netflix(2018 年开源)
  • 顶级贡献者:Apple、AWS、Google、Snowflake、Dremio、Cloudera、阿里、腾讯
  • 社区活跃度:GitHub Star 超 8k,月均 PR 200+,CNCF 孵化项目(2024年进入毕业阶段)

💬 行业共识:“Delta Lake 是 Databricks 的,Hudi 是 AWS 的,只有 Iceberg 是真正中立的。”

总结:为什么 Iceberg 这么火?

Iceberg = Hive 的现代化重生 + 云原生数据湖的通用标准 + AI 时代的可靠底座。

它既兼容 Hadoop 生态存量(Hive Metastore、YARN),又引领未来架构(对象存储、多引擎、湖仓一体),让企业在不推倒重来的前提下,平滑升级到新一代数据基础设施。

正如 TechTarget 2025 年评价:

“Apache Iceberg 已从‘有前景的表格式’转变为现代数据湖屋架构的核心支柱。”

 Iceberg Replication