惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
DataBreaches.Net
IT之家
IT之家
博客园_首页
博客园 - 【当耐特】
V
V2EX
Apple Machine Learning Research
Apple Machine Learning Research
G
Google Developers Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Recent Announcements
Recent Announcements
F
Fortinet All Blogs
GbyAI
GbyAI
腾讯CDC
H
Hackread – Cybersecurity News, Data Breaches, AI and More
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
I
InfoQ
H
Help Net Security
T
Tailwind CSS Blog
B
Blog RSS Feed
Martin Fowler
Martin Fowler
人人都是产品经理
人人都是产品经理
The Cloudflare Blog
博客园 - 叶小钗
雷峰网
雷峰网
量子位

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
DuckLake 1.0:具有SQL目录元数据的数据湖格式
作者:Renato Lo · 2026-05-09 · via InfoQ - 促进软件开发领域知识与创新的传播

DuckDB Labs最近正式发布 DuckLake 1.0,这是一种全新数据湖格式,其核心设计是将表元数据存储在 SQL 数据库中,而非散落在对象存储的大量文件里。该版本是首个 DuckDB 扩展形式的实现,支持目录级的增量小幅更新、优化的排序与分区能力,并兼容 Iceberg 风格的数据特性。

DuckDB 团队表示,传统数据湖格式采用文件式的元数据,会带来协同逻辑复杂、元数据操作缓慢、对象存储产生大量小文件等问题。Apache Iceberg、Delta Lake、Apache Hudi 均主要把元数据以文件形式存放在对象存储中,仅在上层额外添加目录服务,而DuckLake选择直接把元数据存入 SQL 数据库。

一年前官方曾发布“DuckLake宣言(DuckLake manifesto)”,提出湖仓元数据应当统一存放在数据库中,而非分散在对象存储的众多文件里。团队撰文称:

距离首次发布规范草案已过去了近一年的时间,现在,我们正式宣布 DuckLake v1.0 发布。这是可投入生产环境的正式版本,保证向后兼容。DuckLake v1.0 包含稳定的技术规范、功能完备且高性能的参考实现(DuckDB ducklake 扩展),以及未来版本的发展路线图。

DuckLake 1.0 新增了多项能力,全面优化湖仓运维与查询性能:包含数据内联能力,可处理小规模插入、更新、删除而无需生成新文件;支持排序表以加速过滤类查询;针对高基数(high-cardinality)列提供桶分区;增强地理数据类型支持;兼容 Iceberg 风格的向量删除。

关于数据内联(data inlining),该团队指出:

数据内联是 DuckLake 的标志性特性。该能力可直接在目录数据库中完成小规模增删改操作,从根源避免小文件泛滥的问题。DuckLake v1.0 已经完整支持更新与删除操作的全量内联,该功能默认开启,默认阈值为 10 行数据。

Reddit的热门讨论帖中,用户 SutMinSnabel4 提问:

能否为 SMB 协议提供第一等的原生支持?我指的不是本地挂载文件系统(这是要依赖操作系统的),而是要能完美适配传统企业 Windows 环境,兼容 DFS、Kerberos 等全套组件,同时也要能在 macOS、Linux 上正常运行……大量企业本地部署环境仍高度依赖 SMB 协议。

Hacker News 平台上,数据平台工程师 Alexander Dahl评论说

令人振奋!性能测试数据看起来完胜 Iceberg。有没有人已经在真实业务负载中落地试用呢?

目前 DuckLake 已提供适配 Apache DataFusion、Apache Spark、Trino 及 Pandas 的客户端。MotherDuck 同时推出了托管式的 DuckLake 服务,管理目录数据库与底层存储。

DuckLake v1.1 后续计划支持跨目录的变体内联、多删除向量 Puffin 文件等功能改进。根据路线图,DuckLake v2.0 将引入数据集的 Git 式分支能力,并内置基于角色的权限管理。

开源仓库awesome-ducklake汇总了 DuckLake 各类实战用例与开发库。DuckLake 1.0 已在GitHub开源,采用 MIT 开源许可证。

原文链接:

 DuckLake 1.0: Data Lake Format with SQL Catalog Metadata