惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园_首页
爱范儿
爱范儿
罗磊的独立博客
V
V2EX
量子位
Last Week in AI
Last Week in AI
Hugging Face - Blog
Hugging Face - Blog
博客园 - 司徒正美
Jina AI
Jina AI
博客园 - 叶小钗
小众软件
小众软件
博客园 - 【当耐特】
Y
Y Combinator Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
T
Tailwind CSS Blog
博客园 - 聂微东
Microsoft Security Blog
Microsoft Security Blog
美团技术团队
P
Proofpoint News Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
有赞技术团队
有赞技术团队
MongoDB | Blog
MongoDB | Blog
Recent Announcements
Recent Announcements
酷 壳 – CoolShell
酷 壳 – CoolShell

博客园_首页

Linux实操--组管理、权限管理和定时任务 Java + EasyExcel 实现单个接口导出多个Excel Mem0 源码解析系列(二):提示词工程的深度剖析 Openclaw TaskFlow究竟是什么?和普通Skill技能有什么区别 博文阅读密码验证 - 博客园 嘉立创开源:应该是全网MicroPython教程最多的开发板 Hermes Agent 集成实践:从协议到生产 2026年AI编程工具横评:Cursor、Codex、Claude Code、Zed、Windsurf Java程序员必看的RAG入门教程 2026 AI效率神器:Superpowers + Claude Code 保姆级教程 本地大模型部署全攻略:从 0 到 1 玩转 Ollama 【从0到1构建一个ClaudeAgent】内存管理-上下文压缩 .NET 高级开发 | 设计、实现一个事件总线框架 电子小白入门之NE555 3. WorkBuddy:隐藏玩法,一键召唤专家,让 AI 以"专家身份"给你干活 和AI一起搞事情#3:Claude Teammate 游戏开发翻车实录 【OpenClaw】通过 Nanobot 源码学习架构---(7)Memory C# .NET 周刊|2026年3月3期 我在 Debian 11 上把 K8s 单机搭起来了,过程没你想的那么顺(/opt 目录版) 深度学习进阶(七)Data-efficient Image Transformer CLI+Skill搭建浏览器AI自动化框架,告别一切重复枯燥任务 告别Token账单无底洞:OpenClaw本地部署,重塑企业数据主权的唯一解 FastAPI+Vue:文件分片上传+秒传+断点续传,这坑我帮你踩平了! SBTI 爆火后,我做了个程序员版的 CBTI。。已开源 + 附开发过程 多模态检索开始进入工程期:用 Sentence Transformers 搭建可落地的 Multimodal RAG 100多行代码实现一个最简单的Agent(用ReAct) Claude Code 通关手册(八):推荐 5 个 Hooks,代码质量提升 3 倍 老板:“有人截图了!”。安全部门:“收到,马上查暗水印!” - why技术 技术之外,皆是人间 C#/.NET/.NET Core技术前沿周刊 | 第 69 期(2026年4.01-4.12)
"CREAD: A Classification-Restoration Framework with ...
绵满 · 2026-05-09 · via 博客园_首页

快手视频观时预测的工作 CREAD,发表于 AAAI 2024,深入分析了分桶策略,在理论上是一篇很棒的工作

背景

观看时长预测本质上是个回归问题,但它的标签分布通常极其长尾:大量样本集中在很短的时长(比如 3 秒内占 30%),而长时长的样本非常稀疏。这种不平衡性让直接做回归很难,模型容易被头部样本带偏,对尾部样本预测不准。

核心矛盾在于:连续值回归难,那就离散化转分类。但现有的分桶方法(比如等宽、等频)都很 heuristic,没有仔细研究过分桶这个动作本身会引入什么误差。本文分析分桶引入的误差主要有两种:

  • 学习误差:桶太窄,桶内样本就少,分类器学不准

  • 复原误差:桶太宽,从离散的桶还原成连续值时,近似精度就低(用桶的右端点代表整个桶,太糙了)

等宽分桶会导致学习误差大;等频分桶会导致复原误差大。那能不能自适应地分桶,让两种误差在理论上达到一个最优的平衡?这就是 CREAD 的出发点

方法

CREAD 框架包含三个模块:

  • 离散化模块:把连续的观看时长 y,通过一组阈值 \([t_1, t_2, ..., t_M]\) 分成多个区间,通过 EAD 来找这些阈值(见后面讲解)

  • 分类模块:训练 M 个二分类器,第 m 个分类器负责预测 "观看时长 y 是否大于阈值 \(t_m\)",输出概率 \(\phi_m\)。这样,一段连续的时间就被一串概率序列 \([\phi_1, \phi_2, ..., \phi_M]\) 表示了。

  • 复原模块:把分类器输出的概率序列,通过期望公式还原成最终的预测时长 ŷ 。原理是预测值是分布期望的近似,等于 "每个区间宽度 × 时长超过该区间右侧阈值的概率" 之和

模型训练的损失函数由三部分组成:标准的分类交叉熵损失、让预测时长 ŷ 更准的复原损失(用的是 Huber Loss),还有一个很关键的序关系正则项。这个正则项强制让输出的 M 个概率满足单调递减的先验(\(\phi_1 > \phi_2 > ... > \phi_M\),因为一个视频的观看时长超过更大阈值的概率肯定更小),保证了预测的物理意义

误差自适应离散化 (EAD)

论文在这里深刻剖析了离散化带来的两种误差,并推导出了它们的误差上界:

  • 还原误差的上界 \(\overline{V}_b\)\(V_b \leq \overline{V}_b \propto A_b(\mathcal{D})\)
    其中 \(A_b(\mathcal{D}) = \underbrace{\sum_m \left[\Psi(t_m) - \Psi(t_{m-1})\right]^2}_{\text{受样本分布影响的项}} \cdot \underbrace{\sum_m (t_m - t_{m-1})^2}_{\text{桶宽平方和}}\)

  • 学习误差的上界 \(\overline{V}_w\)\(V_w \leq \overline{V}_w \propto A_w(\mathcal{D})\)
    其中 \(A_w(\mathcal{D}) = \underbrace{\sum_m \left[\Psi(t_m) - \Psi(t_{m-1})\right]^2}_{\text{受样本分布影响的项}} \cdot \underbrace{\sum_m \frac{(t_m - t_{m-1})^2}{\Psi(t_m) - \Psi(t_{m-1})}}_{\text{宽度的平方除以样本比例}}\)

为了让两种误差的上界最小,EAD 的做法是将它们组合成一个总损失函数 \(J(\mathcal{D})\),并通过优化这个损失来找到最佳划分:

\[\min_{\mathcal{D}} \; J(\mathcal{D}) = A_w(\mathcal{D}) + \beta \cdot A_b(\mathcal{D}) \qquad (21) \]

这就是 EAD 的目标函数了,\(\beta\) 连接了等宽与等频:当 \(\beta \to 0\) 时,EAD 退化为等频划分;当 \(\beta \to \infty\) 时,EAD 退化为等宽划分。EAD 通过调整 \(\beta\),在这两种极端方法之间找到了一个自适应于数据分布的最优点

然而,直接求解高维的 \(J(\mathcal{D})\) 很困难,论文提出了一个巧妙的思路:用一个统一的公式把等宽、等频以及所有可能的中间策略全部表达出来。具体而言, EAD 引入一个校准函数 \(\gamma\),将阈值表示为:

\[t_m = \Psi^{-1}\!\left[\gamma\!\left(\frac{m}{M}\right)\right] \]

如果把 \(\gamma\) 参数化为一个连续函数族 \(\gamma(z; \alpha)\),比如 \(\gamma(z; \alpha) = \frac{1-e^{-\alpha z}}{1-e^{-\alpha}}\),那么 \(\alpha \to 0\) 就是等频,\(\alpha\) 很大就是等宽,\(\alpha\) 在中间则对应某种自适应策略

最终 EAD 通过人工设定超参数 \(\beta\) 并网格搜索 \(\alpha\)(给定一个\(\beta\),遍历不同的 \(\alpha\) 值,选择使得 \(J(\mathcal{D})\) 最小的 \(\alpha\) 值)

实验

实验还是比较全面的,离线实验和在线实验都达到了最佳效果,同时也测试了一些超参数和分桶数量的影响

总结

CREAD 这篇工作解决的问题和解决的方式在理论上都是合理的,我看下来不足之处主要在于又加了比较关键的超参数,\(\alpha,\beta\) 完全决定的分桶的方式,可以说是这篇工作的核心,但是确是人工设定超参+网格搜索遍历,难免不够优雅