惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Apple Machine Learning Research
Apple Machine Learning Research
aimingoo的专栏
aimingoo的专栏
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 聂微东
Engineering at Meta
Engineering at Meta
N
Netflix TechBlog - Medium
Blog — PlanetScale
Blog — PlanetScale
大猫的无限游戏
大猫的无限游戏
Vercel News
Vercel News
D
DataBreaches.Net
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
WordPress大学
WordPress大学
L
LangChain Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
F
Fortinet All Blogs
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
J
Java Code Geeks
Recent Announcements
Recent Announcements
Jina AI
Jina AI
G
Google Developers Blog
腾讯CDC
博客园_首页
博客园 - 【当耐特】

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
工具建设:数据分析工具如何提高查询速度
暮雪云然 · 2024-08-13 · via 人人都是产品经理

面对庞大的数据量,如何优化查询效率,提供快速且准确的数据分析结果,是数据产品经理需要深入思考的问题。本文将探讨几种提高大数据查询效率的策略,帮助提升用户体验,并为数据产品的设计与优化提供指导。

最近面试一个同学的时候,聊到了他负责的大数据取数平台。平台的主要是提供给业务、分析师等使用,支持他们在现成报表没有相关数据时,快速查询和分析自己想要的数据。

例如对dau做各种维度下钻分析,来定位数据出现波动的原因。或者在业务复盘的时候,查询某种口径下各个业务线带来的收入。

这位同学主要负责产品设计以及推广,但当问到如何提高查询效率,以便给到用户更好的查询体验时,能聊出来的东西就比较少了。

其实作为数据产品,尤其是偏工具的数据产品,应该对工具的逻辑有基本了解,这样可以帮助自己更好的进行产品设计和规划。

这篇就和大家聊一聊,当面对大数据量时,我们有哪些方案来进行优化,从而给到用户更好的体验。

一、冷热数据

很多时候业务整体的数据量很大,但常用的热数据很可能只是其中一部分。我们可以基于实际的使用需要,只支持部分数据的查询,从而减少数据量,提高查询效率。

例如,对于视频APP来说,曝光相关的数据量通常都比较大,大家经常会查询一些IP的“曝光 -> 点击 -> 播放”的链路数据。

可是对业务的实际查询情况做进一步分析就会发现,日常需要关注并查询的IP多数都是最近比较热的IP,并不是所有的IP都需要做类似查询。

这时就可以只支持这些比较热的IP的查询,当真的有用户需要查询其它IP的时候,再把数据加载进来。

二、抽样加速

在实际的数据使用过程中,有些分析不需要获得非常准确的数据结果,而是可以接受一定的误差。

例如一个应用的dau每天都在大几千万,我们要分析一下最近一个月dau的变化趋势。这时其实就不需要非常精确,每天的结果存在十几或者几十的误差,对最终分析没有什么影响。这时就可以对数据进行抽样,既满足的业务需求,又加快了查询速度,节省了存储资源。

三、预聚合

相信大家一定知道28法则,在使用数据的时候同样也存在类似的情况。例如一个指标有A、B、C、D、E一共5个维度,但使用的时候并不是每种维度组合都会用到,可能一般只会用到ABC和ABCD的组合。

这种情况下我们就可以进行预聚合,提前把ABC和ABCD的结果计算好,而不是用户选择之后从头开始计算,从而大大提高查询速度。

我们很多的报表就是这种情况,用户每次来查询的情况相对固定,使用预聚合就可以大幅提高效率。

除了以上常见的一些方式外,还有一些其它的方式,例如bucket加速、任务拆分等等。总之,对于一个查询工具来说,查询速度对用户的体验影响非常打。作为数据产品,要明白查询的基本原理,并且能结合业务实际情况给出可行的产品方案

本文由 @暮雪云然 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务