惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
V
Visual Studio Blog
IT之家
IT之家
博客园 - 聂微东
The Cloudflare Blog
月光博客
月光博客
阮一峰的网络日志
阮一峰的网络日志
S
SegmentFault 最新的问题
Apple Machine Learning Research
Apple Machine Learning Research
酷 壳 – CoolShell
酷 壳 – CoolShell
爱范儿
爱范儿
H
Help Net Security
博客园 - 叶小钗
V
V2EX
WordPress大学
WordPress大学
J
Java Code Geeks
Hugging Face - Blog
Hugging Face - Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园_首页
C
Check Point Blog
B
Blog
D
DataBreaches.Net
美团技术团队
罗磊的独立博客

Spark

求助广大网友 真的深入了解开源项目是动手实现--《Spark Core 精简版》 求助几个 Spark 问题 有没有不错的 SparkStreaming+Kafka 的开源项目可以用来入门和进阶? Spark 解析复杂 xml,数据如何映射到多表中 spark 大数据离线分析 爬虫存到 csv 有的列是长度不固定的 list 请问应该怎么存到 hive?直接存 list 吗?该怎么分析呢? PayPal 招 资深大数据工程师 啦 - 技术栈: Spark, Scala, Java , Python 等 关于 Spark Task 的疑问 有没有在滴滴或者其他网约车公司的同学,请教一个数据量的问题 spark 作业求助,剔除空值大于三的行 spark 有用 kotlin 写代码的吗? 现在写 spark 程序,都是用 scala 吗 spark 核心构件之 Dependency 宽窄依赖 spark 内存管理的实现 spark 源码研究 spark straming。submit Python 脚本报错。 CPython, PyPy 和 Scala 在 Spark 平台上的性能对比 Spark/Scala 的细节讨论:在 map task 里的 map 会得到如何的处理? SPARK 文档查询好费劲 Apache Spark 之间的共享项目配置文件问题 疑问:spark对于迭代运算场景很有优势,那对于迭代不严重的计算场景呢? First Steps with Spark – Screencast #1
spark 做内容推荐,希望大佬给一些思路上的指导
laobaozi · 2022-03-02 · via Spark

公司准备做一个推荐功能,从文章库中根据用户阅读记录推荐相关的文章。这个文章库保存了所有子公司的文章,更新频率比较高,所以没有使用计算两两相似度的方式。
目前使用 spark 做 demo 实现如下:
1. submit 应用时传递用户 id
2. 将该用户的最后阅读的 5 篇文章合并为一条长内容
3. 获取最新的 500 篇文章
4. 用长内容与最新的 500 条生成一个 DateFrame 做余弦相似度计算,得到最相似的 topN
5. 定时或者实时触发 submit
虽然能跑,但是总感觉哪里不对。同时对如何实现批量为户计算推荐内容也没有好思路,难道传用户 id 数组然后是循环跑上述流程吗