惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
SegmentFault 最新的问题
J
Java Code Geeks
V
V2EX
Blog — PlanetScale
Blog — PlanetScale
博客园 - 司徒正美
Hugging Face - Blog
Hugging Face - Blog
F
Fortinet All Blogs
aimingoo的专栏
aimingoo的专栏
B
Blog
A
About on SuperTechFans
有赞技术团队
有赞技术团队
月光博客
月光博客
Microsoft Azure Blog
Microsoft Azure Blog
阮一峰的网络日志
阮一峰的网络日志
腾讯CDC
美团技术团队
大猫的无限游戏
大猫的无限游戏
爱范儿
爱范儿
N
Netflix TechBlog - Medium
C
Check Point Blog
Recent Announcements
Recent Announcements
博客园 - Franky
博客园 - 叶小钗
T
Tailwind CSS Blog

月光博客

AI编程从零开始:环境配置到开发调试-月光博客 母亲被保健品诈骗-月光博客 向身体低头,向岁月妥协:我的高血压“还债日记” -月光博客 月光博客电子书:《信息安全指南》 谷歌发布2025年度搜索排行榜 中国2025社会热点大事记 2025年十大流行语发布 7天3次,骗子骗走我母亲95万元 “技术男”设三重安全墙,母亲95万存款还是被骗走了 电信诈骗后的复盘:母亲的95万元,是怎么从手机银行里消失的 母亲被电信诈骗95万元的全过程 阿根廷警察被谷歌街景相机拍到裸照 网信办开展“清朗·整治恶意挑动负面情绪问题”专项行动 翟欣欣敲诈勒索案一审获刑12年 《绝命毒师》影评:力工觉醒后的梭哈至死 《人工智能生成合成内容标识办法》正式施行 用AI分析你的财务信息 腾讯子公司实习HR怒怼求职者后被开除 OpenAI发布最强模型GPT-5,免费向所有用户开放 用AI解构你的日记 用AI分析你的游戏偏好 用AI分析你的观影偏好 用AI分析你的听歌偏好 《白鹿原》人物分析:乱世浮沉中的人性剖析 乌托邦的捷径:让AI治理“失败国家” 苹果AI的“路径错误”:为什么它在大模型时代掉队了? 《暗黑破坏神3》第35赛季开荒指南 我对特朗普的看法 欧·亨利十大经典小说鉴赏 HBO电视剧《最后生还者》第二季影评
UGC社区类产品系列1:违规内容的处理
投稿 · 2013-04-15 · via 月光博客

景德镇是一个文明和谐的国度,而我们时刻要保持互联网环境的干净。但对于UGC社区类产品,内容是用户创造的,平台只能即时发现及时处理。倘若不干不净的信息被网警盯上了,可能不会向你打任何招呼,直接拔掉网线了。

所以,在景德镇干产品,你还得学会一件事:如何快速高效处理违规信息。

按照内容传播环节,扼杀在摇篮里是最保险的,即提交后自动处理。但总有漏网之鱼还是没法被干掉,那就只能在传播中解决掉。

提交后如何识别并自动处理

如何自动识别和处理,需要搞清楚内容包含的信息载体元素和发布内容的行为模式。

信息载体上,内容可分为文字、图片、音频、视频,其中对文字的处理手段最成熟,即关键词、URL等特殊文本信息过滤,图片、音频、视频,恶意URL链接地址识别。这个过程时间极短,系统只能通过词库或者二维模型做简单运算并给出是否发布成功的提示,不能做过多运算。如BBS、CMS都采用此过滤法处理。

传播中如何识别和处理

行为模式上,对用户所处地理位置(IP识别、地域识别)、访问方式(登录行为方式停留时间、是否立即发布后离开)、内容发布行为(发布频率、提交速度如何)、账号资料(昵称、邮箱是否有无规律;是否间隔更换账号登录、账户之间是否同一批次注册等)、社交关系(是否与马甲账号关联、是否有真实社交关系存在、是否参与互动),通过这些维度建立模型进行用户过滤(是否禁用账号),内容过滤。这个过程需要系统强大的运算,故在发布后进行处理。比如搜搜问问违规问答发布后几分钟被清理,就是采用的此方法。

对机器无法识别处理的内容,比如一些文字内容中关键词隐喻(正话反说、哑谜等手法)、拆分(如装13)等处理手法,机器没法识别,可采用用户举报功能。系统通过收集用户反馈,对内容进行协同过滤。比如新浪微博大多数内容的有举报功能。

但也有特殊情况,内容发布的时候不违法规则,但发布后造成了不良影响被判为违规内容了。这时候通常采用系统管理员立即进行人工清理。如新浪微博李开复事件禁言三天。

对违规内容处理手段

对违规内容,一般采用前台清理后台数据保留的做法,严肃的,数据全部清理。又或者采用仅发布者可见,其他用户不可见。或者内容排序垫底靠后不靠前显示,让违规内容直接淹没掉。

看完你会发现处理违规内容的过程,其实和推荐引擎的工作原理挺相似的。最开始一层过滤需要快速响应,类似推荐引擎的冷启动,第二层、和第三层过滤,就需要采用离线数据模型和在线隐性行为模型(系统对用户交互产生的数据反馈分析)和显性行为模型(其他用户举报的反馈数据分析)结合分析过滤掉。

本文虽然写的有点硬,但还是较好理解。主要分享的是一种思路,处理此类问题的方式。产品同学在具体工作实践中,可以结合自己的产品找出维度建立过滤层级模型使用。

来源:投稿,作者Gauin,微信公众账号Gauin’s Blog,原文链接

UGC社区类产品系列1:违规内容的处理