惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
Docker
Apple Machine Learning Research
Apple Machine Learning Research
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 三生石上(FineUI控件)
月光博客
月光博客
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
WordPress大学
WordPress大学
Hugging Face - Blog
Hugging Face - Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
M
MIT News - Artificial intelligence
腾讯CDC
B
Blog RSS Feed
H
Help Net Security
J
Java Code Geeks
有赞技术团队
有赞技术团队
Y
Y Combinator Blog
博客园_首页
Last Week in AI
Last Week in AI
博客园 - 【当耐特】
博客园 - Franky
B
Blog
MongoDB | Blog
MongoDB | Blog
博客园 - 叶小钗
Martin Fowler
Martin Fowler

V2EX

我用 AI 写代码,但终端管理反而成了累赘——于是我做了 codux [调研] 各位在公司都用什么 ide 和 agent 写代码? 老运维 share 一个运维平台 看到有公司考核 token 指标,很好奇大家上个月的 AI 账单是多少 GLM-Coding 调用持续报错: z.ai 的 Lite 套餐几乎无法使用,官方 Pro/Max 是否稳定? 现在还有什么渠道可以稳定安全地使用 Claude 吗? 上海漕河泾内推,本组有 2 个 hc,一个后端,一个前端,预算都是 20k 左右,不打卡,氛围好 如果 V2EX 上有一组不永久保存聊天记录(比如只保存 7 天或者 24 小时)的聊天室,那么会开启哪些有用或者有趣的可能? gemini cli 貌似挂了,一直返回 403 第一次在自媒体上赚到钱 收集了最近在使用的低价 GPT, Gemini,邮箱等 AI 会员的小店合集 讨论个大实话:现在企业还在说 AI 编程提效 20%, 30%的,真的太落后,没用懂 AI。因为包括很多前沿公司,已经狂奔到提效 200%-500%的情况 [招聘][远程][币安] 前端/后端/QA/iOS/Android 至少 3 年以上经验 目前有大量 HC 欢迎投递 Chatgpt Pro 用量用不完的可以开这些设置 面试的时候好像遇到钓鱼了,给各位避个坑 cursor 年续费 22 号到期, 自动续费是否还是老的计次套餐呢 被两件破事毁掉的一下午,琐碎的内耗消磨人的精力 使用 Planet 存储 Codex 的会话或者重要信息 如果业务部门领导不要你开发功能,而是要求你教会它用 claude code 开发功能,你会怎么做? 分享一个 MacOS 接绿联 CM818 USB 转 DP 转接器使用感受 我的 HR 朋友 10 年老 Java ,非全大专,大家帮忙看看简历 开源了一个 AI 口语练习工具,音素级发音评分,完全免费可自部署 V2EX 上有哪些你觉得很有趣、印象深刻的妹纸? 字节为啥不出个国内版 Vercel? 有在大马的朋友吗? 问个运营商问题 你们在有领导的公司大群发过的最大胆的消息是什么 公司裁员,目前没有工作。想试试摆摊,做一个移动鲜啤打酒车 我的硬盘 Memblaze Pblaze 5 Linux 下不识别,给 Linux 内核提交了补丁, AI 说有望被合并 只有我一个人觉得 codex 不好用?
各位大佬,现在有 LLM,本地自建今日头条可行了
summerLast · 2025-12-23 · via V2EX

信息来源通过 RSS 等信息抓取手段

用 chat 模型理解用户的行为画像

用 Embedding 模型对文章进行嵌入和检索

用 ranker 模型对文章在其所在分类质量进行打分

思路是这样,rss 抓来的内容=>用 chat 模型进行分类、标签和总结=> ranker 模型对该文章在其所在分类的内容质量进行评级=> 评级高的进行 Embedding 嵌入

后面根据用户的互动行为用 chat 模型进行建用户画像 根据用户画像通过 U2I 去检索文章混合 TF-IDF 关键字匹配兜底,对内容进行推荐分发

为了方便理解,我让 ai 根据刚才的描述画了一个文字版架构流程图

内容处理

┌──────────────┐
│   RSS / 抓取  │
│ (Feed / Web) │
└──────┬───────┘
       │ 原始文章
       ▼
┌────────────────────┐
│ 内容预处理 Pipeline │
│ - 去噪 / 去重       │
│ - 正文抽取          │
│ - 语言检测          │
└──────┬─────────────┘
       │ 清洗后文本
       ▼
┌───────────────────────────────┐
│ Chat Model (内容理解)          │
│ - 分类( Category )              │
│ - 标签( Tags )                  │
│ - 摘要( Summary )               │
│ - 关键词 / 主题(可选)         │
└──────┬────────────────────────┘
       │ 结构化内容
       ▼
┌─────────────────────────────────────┐
│ Ranker Model (分类内质量评估)        │
│ - 输入:文章 + 分类 + 标签            │
│ - 输出:质量分数 / 等级( A/B/C/D )   │
└──────┬──────────────────────────────┘
       │
       ├───────────────┐
       │ 高质量内容     │ 低质量内容
       │ (>= 阈值)      │ (< 阈值)
       ▼               ▼
┌──────────────────┐   ┌────────────────────┐
│ Embedding Pipeline│   │ 冷存 / 低频曝光     │
│ - 向量化          │   │ - 搜索兜底          │
│ - 向量索引        │   │ - 长尾内容池        │
└─────────┬────────┘   └────────────────────┘
          │
          ▼
┌──────────────────────┐
│ 向量库 / 检索索引     │
│ (ANN / pgvector 等)  │
└──────────────────────┘

用户侧画像与推荐流程

┌──────────────┐
│ 用户行为采集 │
│ - 点击       │
│ - 阅读时长   │
│ - 收藏 / 分享│
│ - 跳过       │
└──────┬───────┘
       │ 行为序列
       ▼
┌──────────────────────────────┐
│ Chat Model (用户画像理解)     │
│ - 兴趣主题                   │
│ - 偏好分类                   │
│ - 阅读深度 / 新鲜度偏好       │
│ - 显式 + 隐式偏好             │
└──────┬───────────────────────┘
       │ 用户画像(结构化)
       ▼
┌─────────────────────────────────────┐
│ User → Item 召回( Recall )            │
│                                     │
│ ① 向量召回( U2I Embedding )          │
│   - 用户画像向量                     │
│   - 文章向量                         │
│                                     │
│ ② 关键词召回(兜底)                │
│   - TF-IDF / BM25                    │
│   - 用户兴趣关键词                   │
└──────┬──────────────────────────────┘
       │ 候选文章集合
       ▼
┌──────────────────────────────┐
│ 排序 / 混排(可扩展)          │
│ - 质量分( Ranker )             │
│ - 相似度分                     │
│ - 新鲜度 / 多样性              │
└──────┬───────────────────────┘
       ▼
┌──────────────┐
│ 内容分发展示 │
└──────────────┘

花了两个月的时间改进与验证,结论是本地自建推荐系统已经在技术上具备可行性了

感兴趣的可以自行验证,或在这个https://github.com/weekend-project-space/ifeed 的基础上进行验证