惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - Franky
Apple Machine Learning Research
Apple Machine Learning Research
月光博客
月光博客
Vercel News
Vercel News
Recent Announcements
Recent Announcements
B
Blog RSS Feed
Y
Y Combinator Blog
M
MIT News - Artificial intelligence
MongoDB | Blog
MongoDB | Blog
酷 壳 – CoolShell
酷 壳 – CoolShell
雷峰网
雷峰网
D
Docker
Jina AI
Jina AI
IT之家
IT之家
人人都是产品经理
人人都是产品经理
L
LangChain Blog
G
Google Developers Blog
Google DeepMind News
Google DeepMind News
MyScale Blog
MyScale Blog
博客园 - 叶小钗
The GitHub Blog
The GitHub Blog
The Cloudflare Blog
A
About on SuperTechFans
Hugging Face - Blog
Hugging Face - Blog

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
什么是“软数据”?
成于念 · 2025-04-09 · via 人人都是产品经理

软数据,那些不易量化、依赖主观判断的信息,如消费者信心指数和专家预测,与硬数据如GDP增长率和失业率形成鲜明对比。本文深入剖析软数据的来源、特点及其在数据分析中的关键作用,探讨如何将这些易变、主观的信息转化为可信赖的洞察。

由比尔恩门编写的《数据湖仓》这本书中,除了提到数据湖仓是下一代数据仓库和数据湖,目的是满足复杂多变的现代信息系统的需求。还提到了数据质量的重要性,通过检查输入错误、解决键的非兼容性问题以及维护良好的文档编制来提高数据的质量和可信度。

进入到数据湖仓的数据本质上来说都是可信的,如果数据不真实不准确,理论来说就不应该把这些数据存入到数据湖仓中。

这里面就提到一个概念,如果我们接触到结构化数据、文本数据和物联网生成的数据时,通常不会对数据的真实性产生质疑,这部分数据容易量化、约定俗成的、且有固定的计算公式的数据就统称为“硬数据”(hard data)

当然,除了这部分可信的数据外,绝大部分数据是需要进行真实性的确认,我们就称为“软数据”(soft data)。软数据是指那些不易量化、没有固定计算公式、主要依赖于主观判断和观察得到的信息和数据。这些数据通常来自调查问卷、专家评估、媒体报道等,与硬数据相对,后者主要包括官方统计数据、财务报表等具体的数字信息。比尔恩门认为软数据主要是指来自电子表格、互联网或政府的数据。这部分数据需要对其真实性、完整性进行确认,确认完成后才能存入湖仓的基础数据中。

从书中去理解什么是软数据确实有点费劲,原因就是太多的名词导致我们在概念上容易混淆,其次是这些名词定义如果没有普及拉通的前提下,很容易鸡同鸭讲,无法让对方理解你到底在表达什么意思。那么接下来我就尝试着理解一下,比尔恩门对于软数据来源的定义:

1,电子表格数据。我们经常会将电子表格数据作为导入导出,初始化到系统中去。但是,我们并不能确定电子表格里面的数据是否真实可靠,因为填写的过程中,你并不清楚填写的人到底有没有填写对应正确的填写内容。

其次,电子表格还存在一个问题,就是没有可用可靠的元数据。虽然表格包含列和行,但是很难对表格的上下文情景进行关联。比方说1977,是一个数字,但是它到底代表1977年,还是1977个,还是1977万……所以,表格里面的1977如果缺少了上下文情景,则毫无意义。所以我们在提取文本数据的时候,通过文本ETL,一个关键点就是能否获取数据的上下文情境。

2,互联网数据。则更是五花八门了,虽然现在对于互联网数据以及规避了很多涉及到个人隐私的问题,但是大部分我们获取到互联网的数据都是一次性的,如果互联网数据进行了更新,那么这部分数据的时效性则无法保证。互联网的数据由于没有准确的来源,或者由于带有很强的个人主观性,往往就会被其他人质疑。

3,政府数据。政府数据为什么也被纳入到“软数据”里面了呢?政府数据一般都应该是可信的数据,但是我理解比尔恩门想要表达的就是这类数据,实际也存在一定的欺骗性,或者说这类数据也有可能失真。

比方说披露的某企业的资产现金流在某季度大幅的增长,我们如果知识单方面看到这些数据,或许会认为该企业的生产经营状况相比较之前是有所增长的。虽然这个结果也是真实的,但是往往我们忽略了整个财报隐藏的一些问题。或许该企仅仅只是通过变卖固定资产,变卖手头上的一些资产导致的现金流增长,实际的主营业务收入还是持续下降的。

从我们对待数据的真实性角度来看,在数据进入湖仓之前,都应该进行确认,它们的可信度。从“软数据”到“硬数据”的过程,一定是去伪存真的过程。

  • 软数据是如何进行计算的,究竟进行了哪些计算?
  • 在收集和计算的过程中,选择了哪些数据,排除了哪些数据?
  • 什么时候收集的数据,数据什么时候获取的?又计划在什么时候更新的?
  • 在互联网上找到的数据,它的来源是什么?
  • 谁进行了计算?在哪里进行了计算?

最后可以举一个简单的例子,对软数据和硬数据进行一个概念上的定义。一个股市的投资者和分析师通常会结合软数据和硬数据来做出决策。例如,在评估股市趋势时,除了关注公司的财报数据(硬数据),也会参考市场情绪、行业趋势等(软数据)。

总之,软数据虽然存在局限性,但在数据分析中扮演着重要的角色。理解软数据的特点和局限性,能帮助我们更好地解读数据,做出决策。

本文由人人都是产品经理作者【老司机聊数据】,微信公众号:【老司机聊数据】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。