惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
大猫的无限游戏
大猫的无限游戏
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 叶小钗
月光博客
月光博客
Last Week in AI
Last Week in AI
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
人人都是产品经理
人人都是产品经理
阮一峰的网络日志
阮一峰的网络日志
罗磊的独立博客
IT之家
IT之家
美团技术团队
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Hugging Face - Blog
Hugging Face - Blog
博客园_首页
S
SegmentFault 最新的问题
宝玉的分享
宝玉的分享
博客园 - Franky
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Jina AI
Jina AI
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
The Cloudflare Blog
博客园 - 司徒正美
爱范儿
爱范儿

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
多模态项目里,人真正的价值:把“感觉”翻译成模型能学的东西
青蓝色的海 · 2025-12-25 · via 人人都是产品经理

多模态项目的真正挑战始于数据质量筛选之后——当人类审美与AI认知逻辑产生本质冲突时,如何将主观的『好看』『有感觉』翻译成模型能理解的『对称构图』『柔和光影』?本文深度剖析标签拆解与结构化描述两大核心环节,揭示多模态训练中那些比数据规模更关键的『产品级决策』。

当一批多模态数据通过了质量筛选,终于被判定为“能用”,很多人会松一口气,以为难的部分已经过去了。

但在真实项目中,真正考验人的阶段,往往是从这里才开始的。

因为接下来要做的事,不再是判断对错,而是回答一个更抽象的问题:

模型,应该从这些画面、视频和声音里,学到什么?

为什么“好看 / 不好看”对模型来说毫无意义

人看一张图时,很容易下判断:“这张图好看。”“这张构图很乱。”“这个画面很有情绪。”

但如果你把这些评价原封不动地丢给模型,它是完全学不到东西的。

因为对模型来说:

  • “好看”不是特征
  • “有感觉”不是信息
  • “高级”也不是可计算的信号

模型只认识结构化、稳定、可重复的模式

这也是为什么,多模态项目一定会走向两个看似“很细碎”的工作:标签拆解,以及结构化描述

标签,不是为了分类,是为了“拆感知”

在多模态项目中,标签最容易被误解成“整理数据用的工具”。

但实际上,它承担的是另一件事:把人类的整体感受,拆成模型可以逐个学习的维度。

一张图在人眼里是一个整体,但在模型眼里,它更像是:

  • 色彩倾向
  • 构图方式
  • 拍摄角度
  • 光影关系
  • 景别与空间
  • 风格线索

这些维度本来是人类“下意识就能分辨”的东西,而标签的作用,就是把这些下意识显性化

当模型看到足够多“相同维度 + 不同内容”的样本,它才有可能真正学会:什么是“对称构图”,什么是“柔和光影”,什么是“商业摄影感”。

描述不是写作文,而是在“替模型看画面”

相比标签,描述这件事更容易被写歪。

很多新手在写多模态描述时,会不自觉进入一种状态:像在给人写说明,而不是在给模型传递信息。

于是描述变得很长、很满,但信息密度反而很低。

而成熟的多模态描述,关注的不是“好不好读”,而是:

  • 画面里谁是核心
  • 哪些细节是稳定特征
  • 哪些是可忽略的背景噪声
  • 风格与技术特征在哪里
  • 所以描述才会被强制拆成固定结构:主体 → 修饰 → 细节 → 风格 / 技术形式。

不是因为这样“规范”,而是因为模型需要被反复喂同一种信息结构,才能形成稳定认知。

视频为什么一定要有“镜头运动”?

在视频多模态任务里,有一个非常典型的区别:静态描述远远不够。

如果你只描述画面里“有什么”,却不告诉模型“画面是怎么变化的”,模型学到的只是“视频版图片”。

但视频真正的价值,在于:

  • 动作的先后
  • 人物的进出
  • 视角的转移
  • 情绪的推进

这些信息,全部藏在镜头运动和时间维度里。

所以在视频描述中,镜头如何移动、画面如何切换,往往比单个物体是什么更重要。这是多模态从“看见”,走向“理解过程”的关键一步。

这一阶段,其实是在做一件“翻译工作”

如果把多模态项目拆解来看,你会发现一个很有意思的事实:

人在这一阶段做的,不是标注,而是翻译。

把:

  • 感觉 → 结构
  • 审美 → 维度
  • 经验 → 规则

翻译成模型能稳定吸收的信息形式。

这也是为什么,这一阶段非常依赖人的判断力,而不是单纯的执行力。你不是在完成任务,而是在不断做选择:哪些信息值得留下,哪些应该被忽略。

为什么说这是多模态项目里最“像产品”的部分

在这个阶段,你会频繁遇到没有标准答案的问题:

  • 这个背景信息要不要写进描述?
  • 情绪算不算核心特征?
  • 风格重要,还是内容重要?

这些问题,本质上都不是技术问题,而是产品判断

因为它们都在决定:

模型最终会把注意力放在哪些地方。

也正是在这里,多模态项目开始明显区分出不同水平的团队——不是看谁标得更快,而是看谁更清楚模型最终要被用来做什么

写在最后:多模态不是在“喂数据”,而是在“教感知”

如果说数据质量阶段是在帮模型“过滤世界”,那么标签和描述阶段,就是在教模型如何理解这个世界

你给它什么结构,它就学会用什么方式看世界。你忽略什么,它就永远意识不到什么。

这也是为什么,多模态项目从来不只是规模竞赛。真正拉开差距的,是:人是否真的理解自己在教模型什么。

共勉!棒棒,你最棒!

本文由 @青蓝色的海 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自unsplash,基于CC0协议