惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

F
Full Disclosure
Recorded Future
Recorded Future
T
Tenable Blog
S
Securelist
C
CERT Recently Published Vulnerability Notes
T
Threatpost
S
Schneier on Security
A
Arctic Wolf
The Hacker News
The Hacker News
C
CXSECURITY Database RSS Feed - CXSecurity.com
Know Your Adversary
Know Your Adversary
P
Privacy International News Feed
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
The Register - Security
The Register - Security
Cisco Talos Blog
Cisco Talos Blog
AWS News Blog
AWS News Blog
K
Kaspersky official blog
T
True Tiger Recordings
T
Threat Research - Cisco Blogs
V
Vulnerabilities – Threatpost
P
Palo Alto Networks Blog
T
The Exploit Database - CXSecurity.com
小众软件
小众软件
B
Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Microsoft Azure Blog
Microsoft Azure Blog
Cyberwarzone
Cyberwarzone
C
Cybersecurity and Infrastructure Security Agency CISA
T
Tor Project blog
Spread Privacy
Spread Privacy
Malwarebytes
Malwarebytes
P
Proofpoint News Feed
F
Fox-IT International blog
F
Fortinet All Blogs
P
Privacy & Cybersecurity Law Blog
G
GRAHAM CLULEY
量子位
Latest news
Latest news
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 叶小钗
Project Zero
Project Zero
T
Tailwind CSS Blog
N
Netflix TechBlog - Medium
Martin Fowler
Martin Fowler
IntelliJ IDEA : IntelliJ IDEA – the Leading IDE for Professional Development in Java and Kotlin | The JetBrains Blog
IntelliJ IDEA : IntelliJ IDEA – the Leading IDE for Professional Development in Java and Kotlin | The JetBrains Blog
I
Intezer
博客园_首页
腾讯CDC
H
Hackread – Cybersecurity News, Data Breaches, AI and More
D
Darknet – Hacking Tools, Hacker News & Cyber Security

自然语言处理

Humanize-Text 4 步把 AI 文本变成人类写作: DeepSeek×2 + Google + Niutrans cpu/gpu 高性能中英粤文本转语音 TTS 有人能编译跑通 seamlessM4t 吗? 上海某私募 招聘量化研究员(算法模型,深度学习算法,语音算法, nlp, cv,强化学习等方向) 如何快速接入一个有 MCP 能力的 LLM? 有朋友正在学习 nlp 吗? 国内的翻译平台似乎有一个普遍的 bug [请教] [可有偿] 请问有没有懂自然语言处理的大佬,想请教几个问题 高质量数据集对模型开发和 fine-tune 的重要性 请教下本地部署的语音转文字应用 有没有什么语法检查的模型啊? 我是国内的 NLP 从业者,大模型这一波风吹过来了,在公司做大模型感觉前途未卜的样子 [求助]kaggle 中训练模型遇到的一些问题 请问有哪些文章改写润色的开源实现啊 有没有文本内容标注的成熟项目。 NLP 有没有这样的模型,比如搜索 fetch 请求,自动帮你把 fetch/xhr/request 的数据相关性较高的内容展示出来的 GPT 用于知识图谱构建的 NER 和 RE 深度学习如何运用到区块链中? Vecuna 7b 部署与实践 请教一下此类场景在 NLP 中属于哪个功能分支,可否通过 NLP 相关模型实现 如何根据浏览记录关键词对用户做聚类分析? 诚招语言模型训练实习生 有什么办法能获取一个城市下的地名? 博客根据文章内容跑自然语言分析自动识别关键字,有什么廉价的实现方法吗? 请教一个 NLP 的问题 使用 NLP 从书中提取各个角色的台词 Feishu(飞书) 聊天机器人应用 - 定制对话,实现知识库、信息查询、意图识别、多轮对话 Snowboy 离线唤醒 2021 年开始就停止维护,有没有其他大厂的产品可以替代使用? 2070s 跑不了 gpt2 深度学习工程师, 80-200W,杭州,幻方 AI Lab [周三(10.21)分享日] 百度 AI 语音识别应用与场景案例分享 nlp 求教,例如这段文字,如何通过机器学习做到是新冠相关的新闻? 主题模型使用经验 工作么找不到,大家来聊聊你用 Sentiment analysis 做过哪些有趣的事 有检测合同合法性的实战教程么? 针对中文无监督文本切分的优质路子有哪些? Bert 实践遇坑 抓到了一个 ML 新闻训练爬虫网站? 求推荐好的知识图谱研究领域的相关教程、书籍或视频教程? 一款语料处理 Python 辅助工具,能自动计算标注偏移量,各位看看是否有帮助 自然语言处理实习生 [百度智能驾驶事业群车联网] 求自然语音处理架构师,负责车联网负载智能语音助手语义产品的架构和算法整体设计, base 深圳,简历至 linmiaoxuan@baidu.com 三篇关于 BERT/ERNIE 源码解析的博文 有将自然语言转为对应命令的服务或开源项目吗 关于短信内容二分类,请指点一下 V 站的中分分词怎么能做到如此之快的 电商环境下如何定义两个类别是否相似 Poplar - 基于 Web 技术的 NLP 文本标注工具 求 [自然语言处理算法工程师]18-30K 坐标北京朝阳 硕士及以上 MicroTokenizer: 一个面向教学的微型中文分词引擎
中文分词在线接口 API 需求调查
proofreading · 2019-02-25 · via 自然语言处理
KalaSearch

5

KalaSearch      2020 年 9 月 5 日

我觉得切词 API 的需求应该还是大的,主要是极多情况下大家的主要业务也不是分词本身,所以一味追求分词准确度没有意义,还不如用一个效果“合理”的 API

合理的定义当然非常主观,但对多数人来说,分词的作用就是做搜索。我们的经验中,要把分词琢磨清楚再把搜索琢磨清楚还是很不容易的。

ES 有不少分词用的插件,但要比较各种分词的效果(索引分词效果和搜索分词效果)会需要比较多的上下文知识。通常 Analyzer 和 Query analyzer 必须用同样的分词器,但也会造成有的时候某个词就是搜不出来的情况。

所以如果是做搜索,且预算允许的话,自荐下我们做的卡拉搜索,啥也不用配置,接上 API 瞬间开搜,后台直接控制排序算法也很方便(灵感来自于 Algolia,算是个跟 ES 很不一样的独创吧)。

速度在我们的 benchmark 上比优化过的 ES 还快 10 倍左右,欢迎试用