惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

雷峰网
雷峰网
L
LangChain Blog
GbyAI
GbyAI
F
Fortinet All Blogs
腾讯CDC
Last Week in AI
Last Week in AI
A
About on SuperTechFans
J
Java Code Geeks
Microsoft Azure Blog
Microsoft Azure Blog
博客园 - Franky
B
Blog
D
Docker
G
Google Developers Blog
月光博客
月光博客
博客园 - 三生石上(FineUI控件)
S
SegmentFault 最新的问题
Apple Machine Learning Research
Apple Machine Learning Research
酷 壳 – CoolShell
酷 壳 – CoolShell
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
T
Tailwind CSS Blog
宝玉的分享
宝玉的分享
U
Unit 42
Blog — PlanetScale
Blog — PlanetScale
B
Blog RSS Feed

Elasticsearch

es 过亿数据查询咨询 DocKit 首个稳定版 v1.0 - 更现代化的开源 NoSQL 桌面客户端 支持 DynamoDB, Elasticsearch 和 OpenSearch 大家好 Manticore Search 团队征询社区意见 欢迎反馈 ElasticSearch 查询时如果不确定字段名如何进行搜索? es 适合模糊查询吗? opensearch data 节点,分片数均匀,磁盘存储不均匀, CPU 有些很高有些很低 关于 Elasticsearch 和 springboot 版本的依赖关系 IK 分词器里自带的.dic 文件会被默认加载吗 ‌Elasticsearch 怎么检索 oss 里面的文件 CVE-2023-31419 es 漏洞除了升级版本还有其他解决方式吗? 请教个 es 向量查询的问题 ES 新人请教大佬精确查询的问题 一个月写了一个 ES GUI 客户端(笑) 现在用 ES 还推荐通过分词插件的方式对 query 和 doc 进行处理吗? 旧的 elasticsearch 集群能直接加到新的吗? elasticsearch-analysis-ik 远程扩展词典最佳实践是? 有没有精通 es 搜索的,可付费咨询 es 相似度查询 商城项目中 ES 搜索怎么进行分词优化? 基于 casdoor 的 ELK 开源登录认证解决方案: elk-auth-casdoor 请教一个 ElasticSearch 相关的业务问题 elasticsearch 查询、新增、更新数据都时快时慢怎么办? 请教 ES 怎么实现如下聚合查询: 按某关键字分组,每个分组找到最近的一条记录,筛选这条"最近记录"中状态字段为"特定状态" 除了 kibana 还有哪些可视化的 es 镜像恢复方案? 请教下各位大佬,如何在固定的 index 实施 ILM? es8.11.x 是否可以可视化接入 LDAP 呢? es 比如京东搜索商品的时候,如果输入是数字直接搜索,会直接按照分词查询还是通过正则等其他方式进行搜索了 请教并发问题(Elasticsearch 请求高峰) 关于 elasticsearch 机器的选择 elasticsearch 从 5.x 版本后就不允许使用 _id 字段进行排序了. 想问问新版本有什么办法?
大量短记录字段的模糊查询如何实现? es 的分词器如何实现多...
31415926535x · 2024-07-02 · via Elasticsearch

针对按月分片每月近 1ooow 的记录,其中有一个字段是 姓名 (中文居多,存在一部分繁日英,长度在[2, 50]左右,大部分都是 3 个字符)

现在业务侧要求尽量实现:

  • 1 、针对原纪录的全模糊查询,即只要输入的字符串是某个姓名的子序列,就将其捞出来; 例如,对于输入的 "张 aた" 是要匹配到 "张三 abきたない",因为不涉及到原字符的转换,这里直接使用了 1gram+match_phrase_prefix 来实现了

  • 2 、(目前遇到的问题) ,现在想要针对中简繁、日文、汉语等汉字系支持对应拼音、罗马音的模糊搜索, 例如,对于输入的 "张 san a ki t" 是要能够 匹配到 "张三 abきたない" 的; 即实际上要做到分词结果是 "张三 abきたない: 张 三 z h a n g s a n a b き た な い k i t a n a i" 的实现(当然这个我不是很确定是否是唯一解,只是认为如果能够达到这样的分词结果那就能满足我现在的搜索要求了)

我的问题是,如何实现这样的分词器呢?

  • 如果使用 pinyin+1gram 分词器(即不考虑日语等),好像分词结果是 " 张 三 zhang san a b き た な い" ,而我输入的字符串因为无法确定是否中英文,所以默认是打散的,"张 san a ki t" 分词结果是 "张 s a n a k i t" ,从而无法匹配到
  • 如果使用 icu_transform 等,貌似没法保留原字符串(或者这种场景下的自定义分词器该如何实现呢)

先感谢 dalao 们回复