热烈祝贺台州维博网络的站长论坛隆重上线!(2012-05-28)    热烈庆祝伟大的祖国60周年生日 点击进来我们一起为她祝福吧(2009-09-26)    站长论坛禁止发布广告,一经发现立即删除。谢谢各位合作!.(2009-08-08)    热烈祝贺台州网址导航全面升级,全新版本上线!希望各位一如既往地支持台州网址导航的发展.(2009-03-28)    台州站长论坛恭祝各位新年快乐,牛年行大运!(2009-01-24)    台州Link正式更名为台州网址导航,专业做以台州网址为主的网址导航!(2008-05-23)    热烈祝贺台州Link资讯改名为中国站长资讯!希望在以后日子里得到大家的大力支持和帮助!(2008-04-10)    热烈祝贺台州Link论坛改名为台州站长论坛!希望大家继续支持和鼓励!(2008-04-10)    台州站长论坛原[社会琐碎]版块更名为[生活百科]版块!(2007-09-05)    特此通知:新台州站长论坛的数据信息全部升级成功!">特此通知:新台州站长论坛的数据信息全部升级成功!(2007-09-01)    台州站长论坛对未通过验证的会员进行合理的清除,请您谅解(2007-08-30)    台州网址导航|上网导航诚邀世界各地的网站友情链接和友谊联盟,共同引领网站导航、前进!(2007-08-30)    禁止发广告之类的帖,已发现立即删除!(2007-08-30)    希望各位上传与下载有用资源和最新信息(2007-08-30)    热烈祝贺台州站长论坛全面升级成功,全新上线!(2007-08-30)    
便民网址导航,轻松网上冲浪。
台州维博网络专业开发网站门户平台系统
您当前的位置: 首页 » MySQL/MSSQL编程 » MySQL全文索引与中文分词总结及一般的关键词搜索流程

MySQL全文索引与中文分词总结及一般的关键词搜索流程

论坛链接
  • MySQL全文索引与中文分词总结及一般的关键词搜索流程
  • 发布时间:2008-03-20 18:43:27    浏览数:17560    发布者:superadmin    设置字体【   
这两天查阅了大量的关于MySQL全文索引与中文分词的相关资料,总结如下

MySQL不支持中文的全文索引
如果要让MySQL支持中文索引,只能重新编译源码,比较好用的是hightman,或者等MySQL的下一个版本
如果要支持中文分词,php可以使用SCWS作为扩展,有钱的话,可以使用海量公司的产品

MySQL从版本3就开始支持全文索引,但是现在都是5了,还是不支持中文/韩文/日文,一个很重要的原因是没有一个公开的权威的字典,而且还有版权方面的原因。

上面说的SCWS中文分词技术,我在windows下实验了一下,速度还是挺理想的,而且正确率也挺高,值得一试。

下面来看看DISCUZ的搜索是如何实现的

在输入框输入待搜索的字符串,执行查询,检查searchindex表是否有该关键字的相关记录,如果有,继续查看是否过期,如果过期,则清除该行数据,如果没有过期,则取出该行信息作为搜索结果。如果没有相关记录,则新建一行,通过执行"like"查询,检索thread表的subject字段,如果匹配则取出fid,tid等相关信息插入到searchindex里。

其中最耗费资源的是那个Like查询,如果是全文搜索的话,那更不得了,因为同时有两个"like",所以很多大站,都关闭了全文搜索。

一种相对来说比较节约服务器资源又不影响速度的方法是建立索引,通过对用户输入的标题自动分为几个关键词,添加到一个专门的表里(索引表),当用户更新该内容的同时更新索引表。

比如,用户输入的标题是:我们的祖国是花园。筛选出关键字:我们、祖国、花园,添加到索引表,如果已经存在同名关键词,则添加id,假设已经存在了祖国这个关键词,对应的id为4,我们当前的id为10

keywords ids
我们 10
祖国 4,10
花园 10

这样如果用户搜索祖国,那我们就不用执行select like了,直接找id为4和10的文章就行了。

可能更新起来会稍显麻烦
娱乐休闲专区A 影视预告B 音乐咖啡C 英语阶梯D 生活百科
网页编程专区E AMPZF HTMLG CSSH JSI ASPJ PHPK JSPL MySQLM AJAX
Linux技术区 N 系统管理O 服务器架设P 网络/硬件Q 编程序开发R 内核/嵌入
管理中心专区S 发布网址T 版主议事U 事务处理