惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Martin Fowler
Martin Fowler
Jina AI
Jina AI
J
Java Code Geeks
Microsoft Security Blog
Microsoft Security Blog
Recent Announcements
Recent Announcements
I
InfoQ
L
LangChain Blog
The Cloudflare Blog
IT之家
IT之家
博客园 - 叶小钗
Apple Machine Learning Research
Apple Machine Learning Research
B
Blog
A
About on SuperTechFans
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Last Week in AI
Last Week in AI
Blog — PlanetScale
Blog — PlanetScale
罗磊的独立博客
云风的 BLOG
云风的 BLOG
Microsoft Azure Blog
Microsoft Azure Blog
Engineering at Meta
Engineering at Meta
F
Fortinet All Blogs
博客园 - 聂微东
美团技术团队
博客园_首页

博客园 - 大汪的数据之路

外企的问卷调查 10 Tips On How To Be Exceptional In Anything You Do(在所做的任何事情上变得卓越的10个方法) 企业网络环境全景解析——面向AI智能数据分析场景的数据工程师指南 数据虚拟化技术解析:从概念到实践 数据虚拟化:从“搬运数据”到“连接数据”的范式革命 数据运维值班预警自动化 数据“搬砖”实战经验 星环大数据使用体验 vibe coding使用体验 基于SQL实现分组的文字排序聚合 数据码农马年大吉 字符串分割并展开成表格的SQL实现方法 BI报表及可视化分析类工具使用经验总结(下) BI报表及可视化分析类工具使用经验总结(上) 基于Python实现自动化微信通知和预警 Chat2DB测试体验 常用数据管理工具与平台汇总 OneID系统建设实践总结 网易有数BI使用总结 网易NDH大数据平台使用经验 版本管理总结 程序自动化vs人工手动处理 SQL开发总结 数据团队运维值班任务简介 Python环境安装、管理与部署 windows获取kerberos认证 SQL动态长度行列转置 ODI Scenario 场景 Oracle KEEP 分析函数
数据平台使用经验
大汪的数据之路 · 2025-08-09 · via 博客园 - 大汪的数据之路

工作十余年以来,在多个行业,不同背景的公司中从事数据开发、架构、运维等相关的岗位,深度使用或者测试过各种类型的数据平台(包括传统关系型数据库、大数据平台、图数据库、嵌入式数据库、时序数据库等)。以下是按照使用时间整理的各数据平台使用经验。

1、SQL Server

  微软的产品,可应对数据规模在千万级左右的数据仓库。使用专用TSQL进行数据开发,与Windows系统高度融合(可直接调度windows shell命令),结合SSIS,SSRS等可完整实现各类数据应用及服务。在一家专注做CRM企业级数据服务的外企中广泛使用。

2、Netezza

  IBM的MPP数据产品,后来更名为PureData System for Analytics (PDA)。曾在国内金融和电信行业广泛使用,一体机架构,性能强大,轻松处理亿级数据规模,缺点是价格昂贵(据说几百万一台)。当时是在一家澳洲头部保险项目中使用到该数据库。

3、Redshift

  AWS的云数据仓库产品,MPP架构,性能强大,由于是云产品,部署和运维比较方便,可满足PB级数据仓库服务。当时是在一个数据迁移项目中使用到该产品,项目要求将数据从Netezza迁移到Redshift(应该是从成本的角度做的考量)。虽然该项目涉及到保险客户资料信息,数据较为敏感,但是AWS的安全还是得到了认可。

4、Oracle

  在旅游OTA、不动产投资运营、券商金融等各类行业场景中,被广泛作为数据仓库进行使用。其性能稳定、功能强大。通过组建RAC,可达到近乎线性的性能扩展能力。基于PLSQL,支持函数、存储过程、包,可方便实现复杂业务逻辑,并且自带调度功能。通过DBLINK可以方便的在多台Oracle实例间进行跨实例查询,使用非常方便。支持事务,支持小数据量的手工补录写操作(通过select for update 可以非常便捷的进行小数据量的更新)。

5、MySQL

  搭建方便,运维简单,其免费开源版被广泛用于各类系统中,如大数据平台与报表之间的缓存层。除了数据类系统,作为元数据库,被广泛的集中在各类系统中,如报表的元数据库(网易BI),Hive的元数据库,各类小型OLTP应用系统。

6、网易NDH大数据平台

  基于开源Hadoop平台搭建的商业化系统,全家桶,包含数据采集、数据服务、数据质量、调度运维等多种功能。无需额外安装客户端,直接基于网页端编写SQL。支持Hive、Impala、Spark三种SQL查询引擎。

7、ClickHouse

  作为报表的加速层使用,列式存储,单表访问速度极快(多表关联性能相对较弱),比较适合基于数据集市的大宽表进行多为查询。可基于docker进行安装部署。

8、海量Vastbase

  作为国产数据库,从OpenGauss发展而来,而OpenGauss来自PostgreSQL,因此海量数据库SQL语法原生支持PG。其内置的各类系统表与PG高度类似,如pg_tables。python代码也可直接使用PG的psycopg2包来连接海量数据库。此外,其还支持多种数据库的兼容格式,如可额外兼容MySQL的语法(比如MySQL中的日期函数DATE_FORMAT),因此很适合从其他数据库迁移过来的项目。据大模型搜索,最有特点的是:同一个实例下的不同数据库还可选择兼容不同的数据库(通过设置兼容模式),比如数据库A兼容Oracle,数据库B兼容SQL Server,数据库C兼容MySQL。由于这三款基本是最主流的关系型数据库,因此理论上海量可以适应大多数数据库信创迁移的任务。目前其价格非常便宜,对预算有限的中小型公司有很大的吸引力。

9、达梦DaMeng

  国产数据库的龙头之一。类似海量数据库,通过设置兼容模式,可兼容主流常见的数据库,如:

  • 兼容模式值参考

    • 0:不兼容

    • 1:兼容 SQL92 标准

    • 2:兼容 ORACLE

    • 3:兼容 MS SQL SERVER

    • 4:兼容 MYSQL

    • 5:兼容 DM6

    • 6:兼容 TERADATA

    • 7:兼容 PG (PostgreSQL)

数据开发者可以使用DBeaver客户端(版本要相对新一些,比如25.2)来进行连接,进行日常的SQL开发。也可以使用达梦自己推出的客户端(SQLark)。脚本类程序可以通过安装dmPython包,基于python访问DM数据库。达梦数据库价格略高,适合中大型企业。

10、SQLite

  作为轻量级的嵌入式数据库,使用极其便捷。常用于中小型网站后台以及移动端/嵌入式设备。  

  优点: 

    极致轻量与零配置:完整的SQLite库可以小于400KiB,无需安装和管理,集成即可用。
    单一文件,极致便携:整个数据库是一个单独的、跨平台的磁盘文件,备份和迁移如同复制文件一样简单。
    读操作性能卓越:对于本地读密集型任务,SQLite通常比客户端/服务器数据库更快,因为它避免了网络和进程间通信的延迟。

  缺点:

    并发写入能力弱:最主要的瓶颈。一次只允许一个进程写入,其他写入操作会被临时阻塞。读取可以并发。。
    功能集相对有限:功能有所取舍,如不支持存储过程、触发器、某些复杂连接等。同时宽松的动态类型系统有助于快速开发,但在迁移到其他数据库时,可能隐藏数据类型不匹配的问题。

11、DuckDB

  为“嵌入式分析处理”而生。专为在本地环境中进行高效、大规模的数据分析而设计。列式存储,支持标准 SQL 和丰富的分析功能(窗口函数等),可直接查询 CSV、Parquet、JSON 等文件,以及内存中的 Pandas DataFrame。目前生态系统尚处发展初期。