查看: 24265|回复: 0
打印 上一主题 下一主题

MySQL全文索引与中文分词总结及一般的关键词搜索流程

[复制链接]
跳转到指定楼层
1#
发表于 2008-3-20 18:43:27 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
台州网址导航
这两天查阅了大量的关于MySQL全文索引与中文分词的相关资料,总结如下

MySQL不支持中文的全文索引
如果要让MySQL支持中文索引,只能重新编译源码,比较好用的是hightman,或者等MySQL的下一个版本
如果要支持中文分词,php可以使用SCWS作为扩展,有钱的话,可以使用海量公司的产品

MySQL从版本3就开始支持全文索引,但是现在都是5了,还是不支持中文/韩文/日文,一个很重要的原因是没有一个公开的权威的字典,而且还有版权方面的原因。

上面说的SCWS中文分词技术,我在windows下实验了一下,速度还是挺理想的,而且正确率也挺高,值得一试。

下面来看看DISCUZ的搜索是如何实现的

在输入框输入待搜索的字符串,执行查询,检查searchindex表是否有该关键字的相关记录,如果有,继续查看是否过期,如果过期,则清除该行数据,如果没有过期,则取出该行信息作为搜索结果。如果没有相关记录,则新建一行,通过执行"like"查询,检索thread表的subject字段,如果匹配则取出fid,tid等相关信息插入到searchindex里。

其中最耗费资源的是那个Like查询,如果是全文搜索的话,那更不得了,因为同时有两个"like",所以很多大站,都关闭了全文搜索。

一种相对来说比较节约服务器资源又不影响速度的方法是建立索引,通过对用户输入的标题自动分为几个关键词,添加到一个专门的表里(索引表),当用户更新该内容的同时更新索引表。

比如,用户输入的标题是:我们的祖国是花园。筛选出关键字:我们、祖国、花园,添加到索引表,如果已经存在同名关键词,则添加id,假设已经存在了祖国这个关键词,对应的id为4,我们当前的id为10

keywords ids
我们 10
祖国 4,10
花园 10

这样如果用户搜索祖国,那我们就不用执行select like了,直接找id为4和10的文章就行了。

可能更新起来会稍显麻烦
分享到:  QQ好友和群QQ好友和群 QQ空间QQ空间 腾讯微博腾讯微博 腾讯朋友腾讯朋友
收藏收藏 转播转播 分享分享 分享淘帖
台州维博网络(www.tzweb.com)专门运用PHP+MYSQL/ASP.NET+MSSQL技术开发网站门户平台系统等。
您需要登录后才可以回帖 登录 | 注册

本版积分规则

网站推广
关于我们
  • 台州朗动科技(Tzweb.com)拥有多年开发网站平台系统门户手机客户端等业务的成功经验。主要从事:政企网站,系统平台,微信公众号,各类小程序,手机APP客户端,浙里办微应用,浙政钉微应用、主机域名、虚拟空间、后期维护等服务,满足不同企业公司的需求,是台州地区领先的网络技术服务商!

Hi,扫描关注我

Copyright © 2005-2025 站长论坛 All rights reserved

Powered by 站长论坛 with TZWEB Update Techonolgy Support

快速回复 返回顶部 返回列表