惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

爱范儿
爱范儿
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
WordPress大学
WordPress大学
Y
Y Combinator Blog
I
InfoQ
美团技术团队
罗磊的独立博客
B
Blog RSS Feed
GbyAI
GbyAI
小众软件
小众软件
IT之家
IT之家
Engineering at Meta
Engineering at Meta
Blog — PlanetScale
Blog — PlanetScale
V
V2EX
Last Week in AI
Last Week in AI
酷 壳 – CoolShell
酷 壳 – CoolShell
Jina AI
Jina AI
MyScale Blog
MyScale Blog
博客园 - 聂微东
Microsoft Security Blog
Microsoft Security Blog
博客园 - 【当耐特】
Apple Machine Learning Research
Apple Machine Learning Research
The GitHub Blog
The GitHub Blog
T
The Blog of Author Tim Ferriss

News Hacker | 极客洞察

Rockstar GTA 6 团队组工会:薪酬透明、灵活工时、反 crunch 古罗马公寓:日常、城市规划与沉浸式体验 AI时代的专家价值:验证、经验与大学角色 Chad Whitacre 退 tech 转离线:Home Depot、印刷杂志、东正教社区 本地 Git remote:共享、隔离与 GitHub 误解 AI只该做琐事,别替代人情与创作 AISlop:检测 AI 生成代码坏味道的多语言 CLI 英国低价值采购系统:每月零申报的官僚负担 郁金香狂热:泡沫神话与理性争议 用 LLM 写代码,也要让人比模型更累 AI会重演前端“失去的十年”吗? AI 编程提产却压缩思考,工程质量与协作承压 Cloudflare 多 agent AI 代码评审引发成本与流程争议 500K AI电影“戛纳首映”被质疑只是公关噱头 8×H200跑2B模型到3k tok/s,“标准GPU”标题引争议 防水夹克演化:材料回潮、帽兜变迁与AI争议 意大利人与荷兰人教学时共享手势本能 Claude Code 隐藏配置考古:文档滞后、版本易碎与自动执行争议 大众汽车用 client assertion 阻断 Home Assistant 接入 Zot 支持 Claude Opus 4.8,评论聚焦 Claude Code 计费与 harness 神秘 Hy3 LLM 在 OpenRouter 霸榜:便宜、刷量与隐私争议 佛州 Blue Origin New Glenn 静态点火爆炸,堪比 N1 联网汽车监控升级:数据售卖、监管失灵与断网自保 Blue Origin New Glenn静态点火爆炸,发射台损毁恐延一年 住宅建造为何难规模化:地段、法规、偏好与收入 十种基础云:观云分类、光学现象与云计算误会 据称被 Shopify 收购后,Garnix 关停并开源 Bot Company疑借Airbnb私测家务机器人,致房屋受损 Coalton:Common Lisp 上的静态类型 Lisp,讨论集中在上手与类型建模 ktx:面向 data agents 的开源可执行上下文层,自动生成语义层与业务 wiki
Streambed:把 Postgres WAL 直写 Iceberg on S3,并兼容 psq...
2026-06-01 · via News Hacker | 极客洞察

🎯 讨论背景

这条 Show HN 介绍了 Streambed:一个把 Postgres 的 WAL 通过 logical replication 直接流到 S3 上的 Apache Iceberg(面向数据湖的开放表格式)里的工具,并用嵌入式 DuckDB(轻量分析引擎)让它还能通过 psql 查询。作者说自己曾是 Cloudflare(大型网络基础设施公司)Postgres 团队的技术负责人,起因是 BI 和 dashboard 团队需要跑长查询,传统做法不是再开一份 read replica,就是把数据 ETL 到别的分析库里。评论区把它放进更大的 ELT/CDC 讨论中:有人提到 pg_lake、DuckLake、Debezium、ingestr 和 AWS Zero ETL 等替代方案,也有人提醒真正做分析通常仍然需要数据转换、分层和建模。

📌 讨论焦点

同类工具对比与试用意愿

不少人把 Streambed 和 pg_lake、DuckLake、Debezium + Iceberg + DuckDB 这类方案放在一起比较。有人说 pg_lake 的 pushdown 能力不足,跑 OLAP 查询会变贵;也有人因为 DuckLake 需要脱离 PG-first 工作流而放弃。尽管如此,大家对“把 Postgres append-only 表直接送到 Iceberg on S3”这个方向很感兴趣,表示会去试,并把它看成同一赛道里的新选择。

[来源1] [来源2]

少组件架构与作者动机

作者解释这套方案来自 Cloudflare 内部的真实需求:BI 和 dashboard 团队需要跑长分析查询,而现成做法通常是再加一层 read replica,或者先 ETL 到分析数据库。Streambed 的目标是尽量少组件,所以直接作为 Postgres 的 logical replication subscriber,抓 WAL 变更后写入 Iceberg on S3,再通过嵌入式 DuckDB 提供查询。作者也承认这条链路有很多 edge cases,目前还很早期。

[来源1]

ELT/建模与分析转换不可省

有人指出,把 WAL 可靠地复制到 S3 和 Iceberg 本身就已经很难,但这并不等于不需要 ETL。更准确地说,这类方案更像 ELT:先把数据落到分析存储里,再按真实业务需要做转换、分层、索引和 schema 设计。评论里还提到 AWS Zero ETL、variant type 和 schema-on-read 能降低门槛,但真正想做靠谱分析平台,后续的数据工程工作并不会消失。

[来源1] [来源2] [来源3] [来源4] [来源5]

查询接口、CDC 实现与性能问题

围绕 Postgres-compatible 查询接口,讨论重点其实不是“必须用 psql”,而是 BI 和 dashboard 团队能否像查 Postgres replica 一样直接查分析数据。也有人认为如果已经采用 Iceberg,通常本来就有其他 query engine,所以这个接口更像是调试或兼容层;作者则补充说这是为了满足既有 Postgres 工作流。与此同时,评论区还追问 CDC 在 Go 里的可靠实现、以及吞吐量和端到端延迟等性能指标,说明大家更关心这套链路能否在生产里稳定跑。

[来源1] [来源2] [来源3]

📚 术语解释

CDC: Change Data Capture,持续捕获数据库变更并同步到下游系统的技术。

WAL: Write-Ahead Log,Postgres 记录变更的写前日志,常用于恢复和复制。

logical replication: Postgres 的逻辑复制机制,可按行/事务流式传输变更数据。

Iceberg: Apache Iceberg,一种面向数据湖的开放表格式,适合大规模分析查询。

ELT: 先 Extract 和 Load,再在目标系统里 Transform 的数据处理流程。

DuckDB: 嵌入式分析型数据库,适合在本地或文件数据上直接跑 SQL 分析。