惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
大猫的无限游戏
大猫的无限游戏
博客园 - 聂微东
Jina AI
Jina AI
The Cloudflare Blog
V
Visual Studio Blog
博客园_首页
量子位
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 【当耐特】
爱范儿
爱范儿
博客园 - 三生石上(FineUI控件)
小众软件
小众软件
博客园 - 司徒正美
阮一峰的网络日志
阮一峰的网络日志
Last Week in AI
Last Week in AI
V
V2EX
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 叶小钗
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
WordPress大学
WordPress大学
宝玉的分享
宝玉的分享
T
Tailwind CSS Blog
博客园 - Franky

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
从数据源到数据可视化的全链路解析
余田 · 2023-09-13 · via 人人都是产品经理

有时候,企业中存留的大量数据之间没有很好的连接,数据无法被很好地使用,会导致数据无法支撑企业的经营决策。这个时候,我们可以怎样解决数据使用难的问题呢?本文作者便拆解了相应案例,一起来看看作者的解决方案。

在传统IT架构下,产生了大量分散的数据,这些数据像烟囱一样垂直林立,彼此之间无法连接,无法很好的支撑企业的经营决策,也无法应对快速变化的前端业务。本案例引入“数据工厂”,链接数据源头和上层应用,对企业实际的生产过程进行跟踪和监控,对关键性指标进行不同维度的可视化展示和预警,让各层级管理人员,能够更加直观的了解企业现状,及时发现问题和定位问题,提高企业执行过程中的预警决策能力。

一、企业数据使用难

某客户在数字化流程建设过程中发现某些业务线操作步骤过多、耗时过长、风险较高,客户规划出近百个质效指标,期望能对质效指标数据进行全方位分析,最终通过可视化平台展现指标数据。经过现场调研,发现客户的数据存在如下问题:

1. 数据孤岛严重

客户有很多烟囱式林立的系统,系统间数据不互通,且底层数据存储架构多源、异构。

2. 数据标准不统一

客户数据繁杂,不同的业务线对指标的定义不同,且存在部门壁垒。

3. 开发资源不到位

数据生产链路长,且没有专业的技术人员应对数据开发,针对数据需求,仅用excel做基础分析,分析效率低。

4. 数据质量良莠不齐

各系统起步建设时间不同,数据落地的硬性要求不同,导致数据完整度和准确率偏低。

5. 数据不能重复利用

分析结果不共享,每次分析重新取数,不能重复使用。

二、如何解决数据使用难

由于客户既有系统繁多且孤立、数据繁杂、数据分析口径不统一、数据质量良莠不齐等原因,传统的BI系统已无法解决企业面临的数据使用难、数据质量差、不能重复使用的问题;

我们决定引入“数据工厂”,统一数据源,解决客户质效指标的落地建设,并把加工后的数据输出给可视化系统使用。

三、数据工厂

数据工厂需要有数据集成、数据治理及数据服务能力,通过数据采集能力形成统一的元数据和业务数据存储中心;在存储中心进行数据的清洗、转换后,按照业务维度对数据进行归类建模;最后通过数据服务实现对上游应用的数据开放共享。

1. 数据集成

数据集成用于将外部数据源的数据(元数据、业务数据)集成进统一存储中心,进行统一纳管,解决数据分散和数据效率问题。元数据采集任务采集源端表表名、表结构、存储位置等,并在存储中心进行标准化定义,消除后续建模等活动字段不统一问题。业务数据采集任务一般会把客户数据集成入贴源层(ODS)模型数据表中。

2. 数据建模

① 贴源层是数据建模的第一层,不做清洗、转换,异常和错误数据处理,将不同来源的数据整合到数据工厂,保证源系统和贴源层数据一致性,便于问题排查。

② 整合层用于数据的清洗、转换,异常和错误数据的处理。

③ 明细模型设计包含维度表和事实表的构建。事实表通过主/外键实现与维度表的关联。事实表的设计是为了度量业务过程,通过各种维度和度量来确定业务事实。事实表一般为业务明细数据,便于数据的聚合和多维分析,后续的指标设计都要基于事实表进行。

④ 指标设计包含原子指标、衍生指标和复合指标的构建,具体构建策略,详见文章《聊聊业务指标到技术指标的落地转化》。

⑤ 汇总事实模型围绕某一主题(维度)进行建模,包含维度属性、衍生指标和复合指标,在数仓架构中位于汇总明细层。

⑥ 数据应用层面向业务定制,给数据产品或数据分析提供结果数据或指标数据。在实际业务中,经过DWS聚合汇总统计的数据往往需要再次加工计算,才能被前端报表、分析图表或仪表盘等使用,应用层解决了汇总表数据再次计算使用的问题。

3. 模型计算

上述建模和指标设计仅仅创建了模型的计算逻辑,业务数据还沉在贴源层表,没有完成向下计算。离线计算任务用于模型的数据逻辑计算,可根据模型自动生成编排好的、可执行的数据计算任务,并通过计算任务中心进行调度配置、运行和监控,通过任务状态、拓扑图和实例日志及时判断任务运行情况。

4. 数据服务

数据开发人员根据数据规模和已知的应用场景,使用上述创建的贴源层表、维度表、事实表和汇总表,在数据服务平台快速定义数据API,完成接口的测试、上线,并注册至API市场。应用开发人员可以在API市场找到想要的API数据,发起API请求权限申请。审批通过后,数据应用就完成了数据对接,同一接口可被不同的应用调用。

四、BI分析平台

通过数据工厂的API服务或者连接到指定数据库,BI分析平台获取到表和数据,映射成逻辑表,直接对加工后的数据表做数据集管理和处理,仪表板引用这些数据集,通过拖拉拽方式制作图表,帮助用户快速分析数据并洞察业务趋势,从而实现业务的改进与优化。

本文从解决方案角度宏观描述了从数据源到数据可视化的全链路过程,并说明了数据工厂各模块实现的功能及模块间的流转,后续文章会逐步细化各模块的设计,期望能对大家有所帮助。

专栏作家

余田,人人都是产品经理专栏作家,数据产品经理,《用户至上-用户研究方法与实践》译者。

本文原创发布于人人都是产品经理,未经作者许可,禁止转载。

题图来自 Unsplash,基于CC0协议。

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。