惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
Tailwind CSS Blog
C
CERT Recently Published Vulnerability Notes
P
Proofpoint News Feed
Vercel News
Vercel News
博客园 - 三生石上(FineUI控件)
IT之家
IT之家
Help Net Security
Help Net Security
月光博客
月光博客
N
News and Events Feed by Topic
Cloudbric
Cloudbric
博客园 - 司徒正美
L
LangChain Blog
Recent Commits to openclaw:main
Recent Commits to openclaw:main
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
T
Tenable Blog
The Register - Security
The Register - Security
The Hacker News
The Hacker News
I
InfoQ
The Last Watchdog
The Last Watchdog
MyScale Blog
MyScale Blog
Schneier on Security
Schneier on Security
WordPress大学
WordPress大学
小众软件
小众软件
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
宝玉的分享
宝玉的分享
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
K
Kaspersky official blog
L
LINUX DO - 热门话题
N
News | PayPal Newsroom
F
Fortinet All Blogs
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
S
Security @ Cisco Blogs
Recorded Future
Recorded Future
大猫的无限游戏
大猫的无限游戏
H
Help Net Security
Google Online Security Blog
Google Online Security Blog
S
Schneier on Security
C
Cisco Blogs
N
News and Events Feed by Topic
V2EX - 技术
V2EX - 技术
Latest news
Latest news
PCI Perspectives
PCI Perspectives
T
The Blog of Author Tim Ferriss
P
Palo Alto Networks Blog
T
Tor Project blog
Project Zero
Project Zero
云风的 BLOG
云风的 BLOG
Webroot Blog
Webroot Blog
Attack and Defense Labs
Attack and Defense Labs
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 谷歌开源“Agent Skill 超级工具箱”,云、库、引擎、AI全线打通,开发者狂喜 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了! 从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓 全链路支撑大模型国产化“Day 0适配”,商汤大装置构建全栈能力底座 凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了 HashiCorp Vault 2.0 发布:引入新身份联邦机制,迈入 IBM 生命周期体系 Yelp 实现超 1,000 个 Cassandra 节点零停机升级 写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾? 基于 Apache Camel 编排智能体与多模态 AI 管道 面向智能体与人类用户的AI记忆系统:架构设计与核心场景实践|AICon上海 Anthropic 推出 Managed Agents,简化 AI 代理部署流程 阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒 讯飞联合清华团队押注量子AI:不看营收、不设KPI,一群“无人区”科学家,抢夺下代AI算力入口 小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek Cortex Code 入门指南:面向数据工程师的实践路径 | 技术实践 openJiuwen社区首发Team Skills,定义Coordination Engineering新范式 用 Snowflake Cortex Agents 释放结构化数据的最大价值 | 技术实践 Grafana 利用 Kafka 对 Loki 进行了架构重构,并发布了一款命令行工具,旨在将可观测性引入编码代理 ClickHouse重构全文索引:对象存储上跑出高性能 Full-Text Search 可观测性和遥测技术如何提升软件工程实践 Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB Agent 的下一站:基于长期记忆系统 EverOS 的自我演进|AICon上海 同一赛道,四种收费:Agent 控制层(Harness)开始分裂 Cloudflare Sandboxes 正式发布,为 AI 代理提供持久化隔离环境 Agent 的“记忆断片”困局,该怎么破?_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选视频 数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图 摩尔线程最新财报:研发占比超86%,万卡级大规模智算集群落地 当云区域失效:地缘动荡环境下的高可用重构 Slack 重构通知系统,设置参与度提升 5 倍 智能体工程的隐性技术债务 “我把所有模型都换成了DeepSeek V4”:月账单将降 90%,效果还更好 阿里云智能集团高级技术专家刘少伟已确认出席AICon上海站,并分享如何构建企业 Agent 的自动化行动架构 构建生产就绪的 tRPC API:Apollo Federation 的 TypeScript 替代方案 Anthropic推出面向Claude Code的基于智能体的代码审查功能 北京车展直击:斑马智能甩出车载Agent短剧,比亚迪率先落地,AI让智能座舱又热起来了 Snowflake 作为智能体运行时:从静态管道迈向自主数据系统 | 技术实践 Snowflake 上的本体体系:基于 Cortex Code 能力实现从架构到部署 | 技术实践 Cloudflare 公布 MCP 架构方案,应对企业面临的安全与治理风险 复杂的项目管理怎么做到「AI 友好」?飞书项目用「开放」给出答案 Snowflake Cortex Code 的规范驱动开发:将 SDLC 方法论引入 AI 辅助工作流 | 技术实践 Copilot 不让注册了:从“随便用”到“全面限”,agent 把原有订价模型顶穿了 当互联网用AI卷效率时,这家公司先问了一连串“能不能” Meta 开始记录员工每一次点击:AI 要接管工作,先监控会工作的人 Meta“Token榜”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱 智源FlagOS完成DeepSeek-V4-Flash在八款芯片Day0适配,实现三重技术突破 DeepSeek V4 重磅开源!首次打通华为Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 李志飞的“新实验”:当超级个体撞上真实组织 GPT-5.5 登顶时刻,Anthropic 亲口承认 Claude 变笨了!网友群嘲:太敷衍 那些没空写的小需求,龙虾真能做吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从 Pandas 到生产:使用任意 IDE 进行可扩展的 ML 数据管道与分布式处理 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 pnpm 11 候选版本发布,带来 ESM 分发、供应链默认设置以及新的存储格式 银行业PDF表格提取方案重构:基于Java的分层方案 GPT-5.5 赢了 Opus 4.7 和 Mythos?奥特曼晒黄仁勋内部信:英伟达全员用上 Codex! Cloudflare 推出 Think:一款面向 AI 代理的持久化运行时 1850亿美元天价支出、75%代码由AI生成!谷歌正式宣告:全面转向智能体工作流 xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签! Pulumi 新增对 Bun 运行时的全面支持 姚顺雨腾讯模型首秀!不卷参数只做 “听话打工人”,Hy3 preview登场 | 附实测 老板让你“忽悠”投资人,你敢发给龙虾吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 Gemini CLI 引入子代理机制,实现任务委派与并行代理工作流 清华系团队星工聚将完成数千万天使轮融资,轮式机器人拿下头部制造企业亿级大单 Pretext.js 绕过 DOM 布局重排,实现 120 FPS 的高级交互体验 靠“AI 云”爆红的 Vercel,栽在一个第三方AI工具手里!IPO前夕遭黑,200万美元赎金谈崩? 高能研讨会|端侧 AI 正在重写实时感知效率上限_AI&大模型_王玮_InfoQ精选视频 2050大会看这篇就够了|报名、交通食宿指引大全 Java 近期资讯:OpenJDK JEP、Jakarta EE 12、Spring Framework、Micrometer、Camel、JBang 金融智能的架构编排:基于 Snowflake Cortex Agents 实现结构化与非结构化数据统一分析 | 技术实践 在AK大神爆火的任务里,摸清国产AI真实水平 百灵Ling-2.6-flash 正式发布:高 Token 效率,以 1/10 消耗实现 SOTA 级 Agent 能力 当 PM 懂AI,当技术懂产品:AI 时代产品力的双向进化|PM x AI产品力领航者大会即将开幕 为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体 获奖名单公布|2026主题征文第一期|分享你最有价值的龙虾场景与核心 Skill_热门活动_InfoQ写作社区官方_InfoQ写作社区
日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践
潘丹 · 2026-04-30 · via InfoQ - 促进软件开发领域知识与创新的传播

作者|潘丹,度小满金融在线存储统一项目负责人

前言

本文所述这套基于 OceaBase 的海量数据入库服务,不仅仅是为了数据迁移,而是根据新存储引擎特点定制的一套高性能、高可用的架构方案。

背景源于我司海量稀疏型存储引擎正在从 Eggroll 迁移到 OceanBase。原架构下,海量数据入库依托 Hadoop 集群的 MapReduce 能力,通过提高离线资源可大幅提升入库吞吐。但迁移到 OceanBase 后,问题来了——OceanBase 原生提供的入库方式是一个本地脚本,没有分布式调度、没有弹性伸缩、没有高可用保障,显然扛不住日均数百亿级别的数据入库需求。

我们面临的核心挑战可以归结为一个问题:如何在 OceanBase 生态中重建一套海量数据入库能力?

答案不是在脚本上缝缝补补。我们选择了自研入库服务——基于 Kubernetes 构建一套具备分布式调度、弹性伸缩、高可用能力的入库引擎,彻底跨越从”能入库”到”高效稳定地入库”的鸿沟。

这里有个关键核心:不只是“换个数据库写入”,而是重建一条入库流水线。

我们迁移的目标不只是“把数据从 A 搬到 B”,还要在新的技术底座上重建入库能力栈,部分架构及核心流程如下图所示。

图片

破局之路:三个痛难点问题逐一击破

痛点一:原生入库脚本的”单兵作战”困局

OceanBase 原生的数据入库 obloader 本质是一个”单机脚本”——输入是本地文件,输出是入库结果。该工具可应对小规模数据场景,一旦面对生产环境中较大数据规模的场景,三个致命短板暴露无遗。

一是远程文件”两段式”搬运。生产环境的数据通常存储在远程对象存储 DGS 上,而原生脚本只认本地文件。这意味着每次入库前必须先将文件下载到本地,再执行脚本导入——多了一次完整的 I/O 搬运。既浪费时间,又占用本地磁盘空间,大批量场景下甚至可能撑爆磁盘。

二是海量文件”各自为战”。当一次入库任务涉及几千个文件时,原生脚本毫无调度能力可言。脚本之间无法协调——谁先跑、谁后跑、并发跑多少、某个失败了怎么办?全靠人工盯着。想提高吞吐就多开几个脚本,想降低压力就手动关闭几个脚本,依赖“人肉调度”。

三是稳定性”裸奔”。纯脚本方式没有进程守护、没有故障恢复、没有重试机制。一旦脚本异常退出,入库任务就中断了,需要人工介入排查和重新执行。在 7×24 小时的生产环境中,这种脆弱性是不可接受的。

解决思路:从“脚本”到“服务”的升级

我们的策略很明确,不在脚本上缝缝补补,而是把入库能力从”脚本”升级为”服务”。具体从三个维度重构。

  • 远程直读,消灭中转。入库服务直接对接对象存储,支持 DGS 协议远程读取文件,省去”先下载再导入”的中间环节。数据从对象存储到 OceanBase,一步到位。

  • 统筹调度,收放自如。面对几千个文件的批量入库任务,通过平台统一调度——分批提交、并发控制、失败重试,一切自动化。需要加速时调高并发,需要降压时动态限流。吞吐量不再靠”多开脚本”,而是靠策略。

  • 平台多实例,高可用。入库管理平台以多实例方式部署,天然具备高可用能力。单节点故障时自动切换,任务中断后自动恢复。稳定性从”听天由命”变成了工程保障。

下图展现了我们在并行执行多个入库任务时,其中一个任务从“脚本”到“服务”的可视化数据。除了任务完成状态外,还显示了执行耗时、任务配置等。

图片

痛点二:从"能跑"到"能打"——入库服务的生产级架构挑战

痛点一解决了平台层的问题,但一个能在生产环境中真正扛住压力的入库服务,远不止任务的平台管理。要达到生产可用的标准,至少还要跨过以下三道门槛。

  • 分布式处理能力:海量数据入库不是单机能扛得住的,必须支持多节点协同并行处理。但分布式不是简单地”多起几个进程”一-任务怎么拆分、怎么分发、节点之间如何协调、进度如何汇总,都需要一套完整的调度机制。

  • 资源弹性能力:入库任务的负载波动很大,日常不是每时每刻都需要执行入库任务,在不需要执行任务时,工作节点可以释放节点以节约资源;在出现紧急需求时需要通过增加并发能力提高入库吞吐。如果资源是静态分配的,要么平时浪费、要么高峰扛不住,“旱涝不均”始终是个问题。

  • 任务高可用能力:在长时间运行的大批量入库过程中,节点故障是必然事件而非偶然事件。一旦某个节点挂掉,正在执行的任务不能就此丢失,必须有自动恢复和断点续行的能力,否则一次故障就可能让数小时的入库工作前功尽弃。

解决思路:Master-Worker 架构+Kubernetes 弹性底座

我们设计了一套 Master-Worker 分层架构(如下图所示),将”调度决策”和”任务执行”彻底解耦,再借助 Kubernetes 的平台能力补齐弹性和容错短板。

图片

1.Master-Worker 分层架构。

  • Master 节点:常驻调度,统揽全局。Master 作为常驻节点,负责任务的拆分、分发和进度追踪。当一批入库任务到达时,Master 将其拆解为细粒度的子任务,按策略分配给各个 Worker 节点。它不干活,只”派活”和”盯活” 

  • Worker 节点:按需启动,用完即走。Worker 节点并不常驻,只有在领取到任务后才启动并执行入库操作,处理完毕后释放资源。这种”按需创建、用完销毁”的模式,天然避免了资源空耗。

2.主节点高可用,Active-Standby 双活保障。

Master 节点采用 Active-Standby 模式部署。Active 节点负责实时调度,Standby 节点实时同步状态。一旦 Active 节点故障,Standby 立即接管,整个调度链路不中断。

3.弹性伸缩,Kubernetes 按需分配资源。

借助 Kubernetes 的资源调度能力,Worker 容器可以根据当前任务量动态扩缩。高峰时批量拉起数十个 Worker 并行处理,低谷时自动缩容,让资源跟着负载走,而不是负载迁就资源。

图片

痛点三:架构重构后的"性能断崖"——400 亿数据入库的速度之战

原 Eggroll 集群的入库架构,堪称”教科书级”的分治设计——整个流程被拆成两个阶段:

  • CPU 密集型计算阶段。通过 Hadoop 集群的 MapReduce 分布式生成底层存储引擎格式的文件。这个阶段的瓶颈是 CPU 算力,而 MapReduce 天然支持水平扩展,理论上可以通过堆资源无限提速。

  • 高吞吐写入阶段。将生成好的文件直接拷贝到存储引擎指定的目录。这个阶段不涉及任何计算,写入速度的上限就是磁盘硬件的物理带宽。

两阶段解耦,各自独立优化,因此原架构的入库效率极高。

但迁移到 OceanBase 后,游戏规则变了(见下图)。OceanBase 的旁路写入是一个不可拆分的整体过程——数据的格式转换、编码压缩、SSTable 文件生成、磁盘写入,全部在 OceanBase 引擎内部一气呵成。这意味着 CPU 计算和磁盘 I/O 被绑定在了一起,无法再通过”分阶段各个击破”的方式来分别优化。原来拆成两步能分别调优的事情,现在揉成了一步,性能调优的抓手一下子少了很多。

图片

实测数据印证了这个挑战:原架构下 400 亿条数据入库约 2+小时完成,平均吞吐约 400 万条/秒。迁移后如果不做针对性优化,这个性能基线面临严重下滑的风险。

解决思路:三管齐下,“既然拆不开,就整体拉满”

既然无法像原架构那样分阶段优化,我们转换思路——从并发模型、硬件适配、内核升级三个维度同时发力,把”一体化”流程的整体性能推到极致。

  • 并发模型重构:从”单线程”到”多线程分块”,400 亿数据分布在上千个文件中,原方案是每个文件分配一个进程、且仅用单线程处理。优化后,每个文件仍然独立一个进程,但内部改为多线程分块并行处理。相当于从”一个人从头读到尾”变成”多人分段同时读”,单文件的处理速度大幅提升。

  • 硬件选型重配:让资源比例”对症下药”,原机型的 CPU、内存、磁盘配比并不适合 OceanBase 旁路写入这种”计算+I/O 混合密集型”场景。我们调整为新机型,并针对性地改配 SSD 磁盘,同时提高入库计算所需的 CPU 和内存资源,让硬件配比真正匹配负载特征。

  • 内核升级:释放调度红利,将操作系统内核升级到最新。新内核采用了更先进的任务调度器,能够更高效地分配 CPU 时间片, 在多核高并发场景下显著提升调度效率。这是一次”免费的午餐”——不改业务代码,仅靠内核升级就能吃到底层优化的红利。

图片

三管齐下后,400 亿数据入库时间从 2 小时+压缩至 1 小时+,平均吞吐提升至约 800 万条/秒,峰值可达 1000 万条/秒。性能翻倍,不是靠堆机器,而是靠”把每一层都拧紧” 。

价值与收益

图片

思考与展望

回头看这段从 Eggroll 迁移到 OceanBase 的⼊库服务建设历程,最深的感受是: 迁移从来不只是"换个数据库",⽽是在新的技术底座上重建⼯程能⼒。我们没有简单的加固脚本,⽽是选择了⼀条更难但更正确的路——⼊库服务⼯程化的⽅式解决问题。 从脚本到服务、从单机到分布式、从 Hadoop 到 Kubernetes,每⼀步都是在为系统注⼊确定性。

接下来,我们计划将这套⼊库服务进⼀步标准化和平台化,沉淀为基础设施的⼀部分,同时将业务⽆关的基础框架开源,回馈 OceanBase 社区。