惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
Tailwind CSS Blog
博客园 - Franky
博客园 - 司徒正美
Stack Overflow Blog
Stack Overflow Blog
GbyAI
GbyAI
Y
Y Combinator Blog
Microsoft Azure Blog
Microsoft Azure Blog
Blog — PlanetScale
Blog — PlanetScale
博客园 - 叶小钗
罗磊的独立博客
The GitHub Blog
The GitHub Blog
H
Help Net Security
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Engineering at Meta
Engineering at Meta
Martin Fowler
Martin Fowler
Spread Privacy
Spread Privacy
Google DeepMind News
Google DeepMind News
AWS News Blog
AWS News Blog
N
Netflix TechBlog - Medium
T
The Exploit Database - CXSecurity.com
云风的 BLOG
云风的 BLOG
小众软件
小众软件
aimingoo的专栏
aimingoo的专栏
Cyberwarzone
Cyberwarzone
T
Threatpost
T
Threat Research - Cisco Blogs
Recent Announcements
Recent Announcements
T
Tor Project blog
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Last Week in AI
Last Week in AI
L
Lohrmann on Cybersecurity
量子位
V
V2EX
V
Vulnerabilities – Threatpost
L
LINUX DO - 热门话题
www.infosecurity-magazine.com
www.infosecurity-magazine.com
P
Proofpoint News Feed
I
Intezer
Schneier on Security
Schneier on Security
雷峰网
雷峰网
B
Blog RSS Feed
Jina AI
Jina AI
爱范儿
爱范儿
Attack and Defense Labs
Attack and Defense Labs
Google DeepMind News
Google DeepMind News
M
MIT News - Artificial intelligence
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
P
Palo Alto Networks Blog
美团技术团队
博客园 - 【当耐特】

自然语言处理

Humanize-Text 4 步把 AI 文本变成人类写作: DeepSeek×2 + Google + Niutrans cpu/gpu 高性能中英粤文本转语音 TTS 有人能编译跑通 seamlessM4t 吗? - V2EX 上海某私募 招聘量化研究员(算法模型,深度学习算法,语音算法, nlp, cv,强化学习等方向) 如何快速接入一个有 MCP 能力的 LLM? - V2EX 有朋友正在学习 nlp 吗? - V2EX 国内的翻译平台似乎有一个普遍的 bug - V2EX [请教] [可有偿] 请问有没有懂自然语言处理的大佬,想请教几个问题 - V2EX 高质量数据集对模型开发和 fine-tune 的重要性 - V2EX 请教下本地部署的语音转文字应用 - V2EX 有没有什么语法检查的模型啊? - V2EX 我是国内的 NLP 从业者,大模型这一波风吹过来了,在公司做大模型感觉前途未卜的样子 [求助]kaggle 中训练模型遇到的一些问题 - V2EX 请问有哪些文章改写润色的开源实现啊 - V2EX 有没有文本内容标注的成熟项目。 - V2EX NLP 有没有这样的模型,比如搜索 fetch 请求,自动帮你把 fetch/xhr/request 的数据相关性较高的内容展示出来的 GPT 用于知识图谱构建的 NER 和 RE - V2EX 深度学习如何运用到区块链中? - V2EX Vecuna 7b 部署与实践 - V2EX 请教一下此类场景在 NLP 中属于哪个功能分支,可否通过 NLP 相关模型实现 - V2EX 如何根据浏览记录关键词对用户做聚类分析? - V2EX 诚招语言模型训练实习生 - V2EX 有什么办法能获取一个城市下的地名? - V2EX 博客根据文章内容跑自然语言分析自动识别关键字,有什么廉价的实现方法吗? - V2EX 使用 NLP 从书中提取各个角色的台词 - V2EX Feishu(飞书) 聊天机器人应用 - 定制对话,实现知识库、信息查询、意图识别、多轮对话 - V2EX Snowboy 离线唤醒 2021 年开始就停止维护,有没有其他大厂的产品可以替代使用? - V2EX 2070s 跑不了 gpt2 - V2EX 深度学习工程师, 80-200W,杭州,幻方 AI Lab - V2EX [周三(10.21)分享日] 百度 AI 语音识别应用与场景案例分享 - V2EX nlp 求教,例如这段文字,如何通过机器学习做到是新冠相关的新闻? - V2EX 主题模型使用经验 - V2EX 工作么找不到,大家来聊聊你用 Sentiment analysis 做过哪些有趣的事 - V2EX 有检测合同合法性的实战教程么? - V2EX 针对中文无监督文本切分的优质路子有哪些? - V2EX Bert 实践遇坑 - V2EX 抓到了一个 ML 新闻训练爬虫网站? - V2EX 求推荐好的知识图谱研究领域的相关教程、书籍或视频教程? - V2EX 一款语料处理 Python 辅助工具,能自动计算标注偏移量,各位看看是否有帮助 - V2EX 自然语言处理实习生 - V2EX [百度智能驾驶事业群车联网] 求自然语音处理架构师,负责车联网负载智能语音助手语义产品的架构和算法整体设计, base 深圳,简历至 linmiaoxuan@baidu.com - V2EX 三篇关于 BERT/ERNIE 源码解析的博文 - V2EX 有将自然语言转为对应命令的服务或开源项目吗 - V2EX 关于短信内容二分类,请指点一下 - V2EX V 站的中分分词怎么能做到如此之快的 - V2EX 中文分词在线接口 API 需求调查 - V2EX 电商环境下如何定义两个类别是否相似 - V2EX Poplar - 基于 Web 技术的 NLP 文本标注工具 - V2EX 求 [自然语言处理算法工程师]18-30K 坐标北京朝阳 硕士及以上 - V2EX MicroTokenizer: 一个面向教学的微型中文分词引擎 - V2EX
请教一个 NLP 的问题 - V2EX
Braisdom · 2021-08-02 · via 自然语言处理

  • 冷却
  • 排序
  • 锦囊
  • 定律

    22 条回复    2023-08-29 10:37:44 +08:00

    Morriaty

    3

    Morriaty      2021 年 8 月 2 日

    @Braisdom #2 from jieba.analyse import extract_tags,不过你别指望提取的效果能有多好🐶

    murmur

    5

    murmur      2021 年 8 月 2 日

    以前类似东西叫命名实体识别,实际上所谓的 AI 都是靠人,你这一堆东西我自己看都不靠谱,NLP 能干嘛

    单一文章是没法造词的,得热,得权威,两个有一个才可以造词

    xingshu1990

    6

    xingshu1990      2021 年 8 月 2 日

    百度搜索了一下 python 分词 ,看了一下 python TF IDF 执行的内容,包括题主说的关键词,只不过还加载自己训练过的词库,所以分词还没准确。

    xingshu1990

    7

    xingshu1990      2021 年 8 月 2 日

    @xingshu1990 错了 搜索关键词是:python 提取关键词 中间涉及到的是 textrank tf-idf (还有一种是 TF IWF ) LDA

    Braisdom

    8

    Braisdom      2021 年 8 月 2 日

    @xingshu1990 textrank, pagerank, positionrank 我都试过了,英文的还行,中文的比较差。下面是我根据句法分析得出的结果:
    ```
    ['牛顿冷却定律', '在', '得到', ' ', 'APP', ' ', '的', '实践', '背景', '介绍', '「', '得到', '锦囊', '」', '产品', '刚', '上线', '时', ',', '该', '版块', '首页', '的', '最', '热', '排序', '暴露', '了', '两个', '问题', ':', '分页', '时', '数据', '重复', '和', '最', '热', '榜单', '被', '霸屏', ',', '本文', '将', '围绕', '解决', '这', '两个', '问题', '来', '展开', ',', '介绍', '下', '如何', '参考', '牛顿冷却定律', '来', '优化', '最', '热', '内容', '的', '排序', '。', '“', '牛顿冷却定律', '”', '本质', '上', '它', '描述', '了', '高于', '周围', '温度', '的', '物体', '会', '向外', '散热', ',', '并', '逐渐', '降温', '的', '过程', ',', '同时', '单位', '时间', '内', '散热', '与', '周围', '温差', '会', '成正比', '关系', '。', '通过', '建立', '”', '温度', '”', '与', '”', '时间', '”', '之间', '的', '函数', '关系', ',', '构建', '一个', '”', '指数式衰减', '”', '(', ' ', 'Exponential decay', ' ', ')', '的', '过程', '。', '如果', '我们', '把', '”', '热文', '排名', '”', '想象', '成', '一个', '”', '自然', '冷却', '”', '的', '过程', ',', '那么', '如下', '的', '场景', '是', '成立', '的', ':', '任一', '时刻', ',', '网站', '中', '所有', '的', '文章', ',', '都', '有', '一个', '”', '当前', '温度', '”', ',', '温度', '最高', '的', '文章', '就', '排', '在', '第一位', '。', '随着', '时间', '流逝', ',', '所有', '文章', '的', '温度', '都', '逐渐', '”', '冷却', '”', '。', '一', '、', '最', '热', '榜单', '暴露', '的', '问题', ' ', '2020', ' ', '年', ' ', '1', ' ', '月初', ',', '得到', ' ', 'App', ' ', '的', '新产品', '「', '得到', '锦囊', '」', '正式', '上线', '。', '产品', '刚', '上线', '时', ',', '版块', '首页', '的', '最', '热', '排序', '模块', ',', '暴露', '出', '了', '两个', '问题', ':', '分页', '时', '数据', '重复', '和', '最', '热', '榜单', '被', '霸屏', ',', '本文', '将', '围绕', '解决', '这', '两个', '问题', '来', '展开', '。', '排序', '规则', '与', '朴素', '的', '实现', '方案', '产品', '需求', '定义', '的', '最', '热', '排序', '规则', '是', ':', '按照', '问题', '的', '总', '查看', '量', '来倒序排列', ',', '且', '有', '分页', '和', '查询', '条件', '。', '服务端', '对于', '这种', '场景', ',', '最', '简单', '高效', '的', '实现', '方式', ',', '就是', '利用', ' ', 'sql', ' ', '的', ' ', 'query', ' ', '语句', '了', ',', '于是', '我们', '就', '直接', ' ', '[', 'order by', ' ', '{', '问题', '的', '查看', '量', '}', ' ', 'desc', ']', ' ', '来', '实现', '了', '。', '总', '查看', '数', ' ', '=', ' ', '获得', '查看', '权益', '的', '用户数', ' ', '=', ' ', '购买', '数', ' ', '+', ' ', '赠一得', '一', '领取', '数', '这个', '简单', '朴素', '的', '实现', '方式', ',', '在', '加上', '缓存', '策略', ',', '使得', '我们', '用', '较小', '的', '成本', '就', '满足', '了', '产品', '需求', ',', '也', '应对', '了', '较高', '的', '流量', '。']
    ['nz', 'd', 'v', 'w', 'nz', 'w', 'u', 'vn', 'n', 'v', 'w', 'v', 'n', 'w', 'n', 'd', 'v', 'n', 'w', 'r', 'q', 'n', 'u', 'd', 'a', 'vn', 'v', 'u', 'm', 'n', 'w', 'v', 'n', 'n', 'vn', 'c', 'd', 'a', 'n', 'p', 'n', 'w', 'n', 'd', 'v', 'v', 'r', 'm', 'n', 'v', 'v', 'w', 'v', 'q', 'r', 'v', 'nz', 'v', 'v', 'd', 'a', 'n', 'u', 'vn', 'w', 'w', 'nz', 'w', 'n', 'f', 'r', 'v', 'u', 'v', 'f', 'n', 'u', 'n', 'v', 'd', 'v', 'w', 'c', 'd', 'v', 'u', 'n', 'w', 'd', 'n', 'n', 'f', 'v', 'p', 'f', 'n', 'v', 'v', 'n', 'w', 'p', 'v', 'w', 'n', 'w', 'c', 'w', 'n', 'w', 'f', 'u', 'n', 'n', 'w', 'v', 'm', 'w', 'nz', 'w', 'w', 'w', 'ORG', 'w', 'w', 'u', 'n', 'w', 'c', 'r', 'p', 'w', 'n', 'vn', 'w', 'v', 'v', 'm', 'w', 'ad', 'v', 'w', 'u', 'n', 'w', 'c', 'v', 'u', 'n', 'v', 'v', 'u', 'w', 'r', 'n', 'w', 'n', 'f', 'r', 'u', 'n', 'w', 'd', 'v', 'm', 'w', 'TIME', 'n', 'w', 'w', 'n', 'a', 'u', 'n', 'd', 'v', 'p', 'm', 'w', 'p', 'n', 'v', 'w', 'a', 'n', 'u', 'n', 'd', 'd', 'w', 'v', 'w', 'w', 'm', 'w', 'd', 'a', 'n', 'v', 'u', 'n', 'w', 'm', 'w', 'q', 'w', 'm', 'w', 'TIME', 'w', 'v', 'w', 'nz', 'w', 'u', 'n', 'w', 'v', 'n', 'w', 'ad', 'v', 'w', 'n', 'd', 'v', 'n', 'w', 'n', 'n', 'u', 'd', 'a', 'vn', 'n', 'w', 'v', 'v', 'u', 'm', 'n', 'w', 'v', 'n', 'n', 'vn', 'c', 'd', 'a', 'n', 'p', 'n', 'w', 'n', 'd', 'v', 'v', 'r', 'm', 'n', 'v', 'v', 'w', 'vn', 'n', 'c', 'a', 'u', 'vn', 'n', 'n', 'n', 'v', 'u', 'd', 'a', 'vn', 'n', 'v', 'w', 'p', 'n', 'u', 'a', 'vn', 'n', 'v', 'w', 'c', 'v', 'vn', 'c', 'vn', 'n', 'w', 'n', 'p', 'r', 'n', 'w', 'd', 'a', 'a', 'u', 'vn', 'n', 'w', 'v', 'v', 'w', 'n', 'w', 'u', 'w', 'nz', 'w', 'n', 'xc', 'w', 'c', 'r', 'd', 'ad', 'w', 'w', 'nz', 'w', 'w', 'n', 'u', 'vn', 'n', 'w', 'w', 'n', 'w', 'w', 'v', 'v', 'u', 'w', 'd', 'v', 'n', 'w', 'w', 'w', 'v', 'v', 'n', 'u', 'n', 'w', 'w', 'w', 'v', 'n', 'w', 'w', 'w', 'v', 'm', 'v', 'n', 'r', 'a', 'a', 'u', 'vn', 'n', 'w', 'p', 'v', 'vn', 'n', 'w', 'v', 'r', 'p', 'a', 'u', 'n', 'd', 'v', 'u', 'n', 'n', 'w', 'd', 'v', 'u', 'a', 'u', 'n', 'w']
    细粒度: [(('牛顿冷却定律', '在'), 'ADV_V'), ((None, '得到', 'APP'), 'SVO'), (('得到', '背景'), 'ATT_N'), (('实践', '背景'), 'ATT_N'), (('背景', '介绍'), 'ATT_N'), ((None, '得到', '锦囊'), 'SVO'), ((None, '得到', '上线'), 'SVO'), (('介绍', '得到'), 'ATT_N'), (('产品', '上线', None), 'SVO'), (('刚', '上线'), 'ADV_V'), (('得到', '时'), 'ATT_N'), (('该', '版块'), 'ATT_N'), (('版块', '首页'), 'ATT_N'), (('最', '热'), 'ADV_V'), (('首页', '排序'), 'ATT_N'), (('热', '排序'), 'ATT_N'), (('排序', '暴露', '问题'), 'SVO'), (('时', '暴露'), 'ADV_V'), (('两个', '问题'), 'ATT_N'), (('分页', '时'), 'ATT_N'), (('时', '重复'), 'ADV_V'), (('时', '霸屏'), 'ADV_V'), (('数据', '重复'), 'ATT_N'), (('数据', '霸屏'), 'ATT_N'), (('霸屏',), 'Phrase'), (('最', '热'), 'ADV_V'), (('热', '榜单'), 'ATT_N'), ((None, '霸屏', '榜单'), 'SVO'), ((None, '围绕', '解决'), 'SVO'), ((None, '解决', '问题'), 'SVO'), (('这', '问题'), 'ATT_N'), (('两个', '问题'), 'ATT_N'),...
    ```

    Braisdom

    9

    Braisdom      2021 年 8 月 2 日

    词性、还可以,句法分析就差太多了,我在想是不是自己按词性进行组合,单纯分析词性,同义词比较差,只能结合句法分析,

    Braisdom

    12

    Braisdom      2021 年 8 月 2 日

    @zyx199199 感谢,我用 spacy 做英文短语挖掘还行,中文的太弱了
    原文:
    ```
    ObjectiveSQL is an ORM framework in Java based on ActiveRecord pattern, which encourages rapid development and clean, codes with the least and convention over configuration.
    If your project focuses on data analysis based on relation database, and a lot of arithmetic expressions in SQL statement. ObjectiveSQL will help you write expressions conveniently and safely using Java syntax
    ```
    解析结果:
    ```
    0.1476792292949645 1 activerecord pattern
    0.14671762416303413 1 java syntax
    0.14428737286880544 1 rapid development
    0.13810946085925754 1 configuration
    0.1346420067987634 3 java
    0.1256596948856068 4 objectivesql
    0.11204090834509414 1 activerecord
    0.11121633331630836 1 orm
    0.10988850573204359 1 convention
    0.10555338794853333 1 codes
    0.09950835257874349 1 sql statement
    0.09622020612487797 1 arithmetic expressions
    0.0881090251048002 1 relation database
    0.08001718286200812 1 an orm framework
    0.07570218212468754 1 expressions
    0.06679224022078173 1 sql
    0.05478959497093751 1 data analysis
    0.03418629755285734 1 a lot
    0.014509931733698266 1 your project
    0.0 1 you
    0.036164045333862305
    ```

    yzc27

    13

    yzc27      2021 年 8 月 2 日

    NER(命名实体识别),用 bert 训练试下。不过前提肯定是要有已经标注好的训练数据。

    Braisdom

    16

    Braisdom      2021 年 8 月 2 日

    测试了一下,效果不错:

    '''
    Text summarization is one of the newest and most exciting fields in NLP, allowing for developers to quickly find meaning and extract key words and phrases from documents. RaRe Technologies’ newest intern, Ólavur Mortensen, walks the user through text summarization features in Gensim.
    '''

    这样的一段英文,解析出来的结果:

    Text summarization
    exciting fields
    key words
    newest intern
    text summarization
    text summarization features
    summarization features

    takes: 0.019918203353881836

    Braisdom

    17

    Braisdom      2021 年 8 月 2 日

    调整了一下,非常完善的英文短语提取:

    ```
    Software engineering is one of the most popular branches of computer science and has taken over the world in the digitization era. Software engineers are required in almost every field these days. With the easy accessibility of computers and smartphones, the importance of software engineering has become more pronounced.
    Since software engineering is an advanced field of the IT industry, there are very few institutes that offer bachelor courses in this field. One can pursue B.Tech in CSE or IT and go on to pursue M.Tech in software engineering. Aspiring software engineers can find all about the courses and eligibility criteria below.
    About Software Engineering:
    Software engineering is a branch of computer science engineering (CSE), therefore, there are very few colleges that offer software engineering bachelor degree. Most of the institutes in India provide software engineering specialization at the masters’ level.
    M.Tech in software engineering is one of the most popular courses amongst computer science engineers. You can prepare for GATE exam and apply for these courses through GATE score.
    The courses cover advanced software development models and programming concepts that are the elementary parts of developing software. Software engineering also comprises the study of the different levels of the software development process.
    Eligibility Criteria for Software Engineering:
    ```

    提取的短语如下:

    ```
    Software engineering
    branches of computer
    branches of computer science
    computer science
    digitization era
    Software engineers
    accessibility of computers
    importance of software
    importance of software engineering
    software engineering
    software engineering
    bachelor courses
    software engineering
    software engineers
    branch of computer
    branch of computer science
    computer science
    branch of computer science engineering
    computer science engineering
    science engineering
    software engineering
    software engineering bachelor
    engineering bachelor
    software engineering bachelor degree
    engineering bachelor degree
    bachelor degree
    software engineering
    software engineering specialization
    engineering specialization
    software engineering
    courses amongst computer
    courses amongst computer science
    computer science
    courses amongst computer science engineers
    computer science engineers
    science engineers
    software development
    software development models
    development models
    programming concepts
    Software engineering
    software development
    software development process
    development process

    takes: 0.05262303352355957
    ```

    Braisdom

    19

    Braisdom      2021 年 8 月 3 日

    测试了一下,中文处理也非常不错,spacy 的中文分词不是特别理想,需要补充,但基本可用。

    测试文本:
    ```
    DDParser 是百度自然语言处理部基于大规模标注数据研发的依存句法分析工具。其训练数据不仅覆盖了多种输入形式的数据,如键盘输入 query 、语音输入 query 等,还覆盖了多种场景的数据,如新闻、论坛等。该工具易用性高,支持一键安装及预测。
    ```

    解析出的短语如下:
    ```
    百度
    百度自然
    百度自然语言
    自然语言
    百度自然语言处理部
    自然语言处理部
    语言处理部
    数据研发
    依存句法
    句法分析
    依存句法分析
    句法分析工具
    分析工具
    依存句法分析工具
    训练数据
    多种输入
    输入形式
    多种输入形式
    多种场景
    易用性
    键安装
    ```

    rpman

    20

    rpman      2021 年 8 月 30 日

    @Braisdom 你想找的是一个符合你期待的 NER(命名实体识别)或者 KPE(关键词抽取)
    但这种东西。。你不用数据来训模型,怎么能让模型符合你的期待呢

    Braisdom

    21

    Braisdom      2021 年 9 月 1 日

    @rpman 我已经找到方法了,但不是特别理想,我并不是想要找到实现,短语的组合也很多,穷举也很累。