博客
关于我
强烈建议你试试无所不能的chatGPT,快点击我
ElasticSearch速学 - IK中文分词器远程字典设置
阅读量:5291 次
发布时间:2019-06-14

本文共 739 字,大约阅读时间需要 2 分钟。

前面已经对”“有了简单的了解: 

这里写图片描述

但是可以发现不是对所有的词都能很好的区分,比如: 

这里写图片描述 
逼格这个词就没有分出来。

词库

实际上IK分词器也是根据一些词库来进行分词的,我们可以丰富这个词库。 

IK分词器(IK Analysis for Elasticsearch)给了我们一个基本的配置: 
 
这里写图片描述

修改我们es实例中ik插件的配置:

cd elasticsearch-5.3.0/plugins/ik/config/

这里写图片描述

main.dic是住词库,stopword是停用词库(把一些错误的分词加入进来,之后不会再被分词了);custom目录中是我们的自定义词库。 

这些词库都是本地词库。可以参考配置文档来设置。

热更新 IK 分词使用方法

官方文档: 

 
这里写图片描述

我们来配置一下:

#进入es实例找到ik插件的配置文件elasticsearch-5.3.0/plugins/ik/config#编辑配置文件vi IKAnalyzer.cfg.xml

内容:

IK Analyzer 扩展配置
custom/mydict.dic;custom/single_word_low_freq.dic
custom/ext_stopword.dic
http://10.211.55.13/api/DictApi/GetDictionary

/api/DictApi/GetDictionary:

 

转载于:https://www.cnblogs.com/a-du/p/7600474.html

你可能感兴趣的文章
MySQL开启远程连接权限
查看>>
tomcat7.0.27的bio,nio.apr高级运行模式
查看>>
SAP HANA 三大特点
查看>>
C#预处理器命令
查看>>
苹果手表:大方向和谷歌一样,硬件分道扬镳
查看>>
ccf 出现次数最多的数
查看>>
单例模式
查看>>
Competing Consumers Pattern (竞争消费者模式)
查看>>
HDUOJ ------1398
查看>>
cf--------(div1)1A. Theatre Square
查看>>
Android面试收集录15 Android Bitmap压缩策略
查看>>
Tomcat 报错的解决方法:The APR based Apache Tomcat Native library which allows optimal
查看>>
最长公共子串问题(LCS)
查看>>
TortoiseSVN is locked in another working copy
查看>>
PHP魔术方法之__call与__callStatic方法
查看>>
ubuntu 安装后的配置
查看>>
Html学习_简易个人网页制作
查看>>
angular中ng-bind指令小案例
查看>>
jqery总结
查看>>
Lodop获取客户端主网卡ip地址是0.0.0.0
查看>>