热烈祝贺台州朗动科技的站长论坛隆重上线!(2012-05-28)    热烈庆祝伟大的祖国60周年生日 点击进来我们一起为她祝福吧(2009-09-26)    站长论坛禁止发布广告,一经发现立即删除。谢谢各位合作!.(2009-08-08)    热烈祝贺台州网址导航全面升级,全新版本上线!希望各位一如既往地支持台州网址导航的发展.(2009-03-28)    台州站长论坛恭祝各位新年快乐,牛年行大运!(2009-01-24)    台州Link正式更名为台州网址导航,专业做以台州网址为主的网址导航!(2008-05-23)    热烈祝贺台州Link资讯改名为中国站长资讯!希望在以后日子里得到大家的大力支持和帮助!(2008-04-10)    热烈祝贺台州Link论坛改名为台州站长论坛!希望大家继续支持和鼓励!(2008-04-10)    台州站长论坛原[社会琐碎]版块更名为[生活百科]版块!(2007-09-05)    特此通知:新台州站长论坛的数据信息全部升级成功!">特此通知:新台州站长论坛的数据信息全部升级成功!(2007-09-01)    台州站长论坛对未通过验证的会员进行合理的清除,请您谅解(2007-08-30)    台州网址导航|上网导航诚邀世界各地的网站友情链接和友谊联盟,共同引领网站导航、前进!(2007-08-30)    禁止发广告之类的帖,已发现立即删除!(2007-08-30)    希望各位上传与下载有用资源和最新信息(2007-08-30)    热烈祝贺台州站长论坛全面升级成功,全新上线!(2007-08-30)    
便民网址导航,轻松网上冲浪。
台州维博网络专业开发网站门户平台系统
您当前的位置: 首页 » ASP/ASP.NET编程 » 脏字典过滤:用正则表达式来过滤脏数据

脏字典过滤:用正则表达式来过滤脏数据

论坛链接
  • 脏字典过滤:用正则表达式来过滤脏数据
  • 发布时间:2010-02-27 14:35:24    浏览数:7708    发布者:superadmin    设置字体【   
方法一:使用正则表达式

1//脏字典数据存放文件路径
2 private static string FILE_NAME="zang.txt";
3 //脏数据字典表,如:脏数据一|脏数据二|脏数据三
4 public static string dirtyStr="";
5
6 public ValidDirty()
7 {
8 if (HttpRuntime.Cache["Regex"]==null)
9 {
10 dirtyStr=ReadDic();
11 //用于检测脏字典的正则表达式


12 Regex validateReg= new Regex("^((?!"+dirtyStr+").(?<!"+dirtyStr+"))*$",RegexOptions.Compiled|RegexOptions.ExplicitCapture);
13 HttpRuntime.Cache.Insert("Regex" ,validateReg,null,DateTime.Now.AddMinutes(20) ,TimeSpan.Zero);
14 }
15
16 }
17 private string ReadDic()
18 {
19 FILE_NAME=Environment.CurrentDirectory+"\\"+FILE_NAME;
20
21 if (!File.Exists(FILE_NAME))
22 {
23 Console.WriteLine("{0} does not exist.", FILE_NAME);
24 return "";
25 }
26 StreamReader sr = File.OpenText(FILE_NAME);
27 String input="";
28 while (sr.Peek() > -1)
29 {
30 input += sr.ReadLine() ;
31 }
32
33 sr.Close();
34 return input;
35
36 }
37
38
39 public bool ValidByReg(string str)
40 {
41 Regex reg=(Regex)HttpRuntime.Cache["Regex"];
42 return reg.IsMatch(str) ;
43
44 }


感觉这种方法的执行效率不是很高,简单的测试了一下 1000字的文章,脏字典有800多个关键字

测试了一下是 1.238秒,大家有没有更好的方法,请不吝赐教!

方法二:普通循环查找方法

public bool ValidGeneral(string str)
{

if(!File.Exists(FILE_NAME))
{
Console.WriteLine("文件路径或者文件路径不存在错误信息") ;
return false;
}
else
{
StreamReader objReader = new StreamReader(FILE_NAME,System.Text.Encoding.GetEncoding("gb2312"));
string sLine="";
ArrayList arrText = new ArrayList();

while (sLine != null)
{
sLine = objReader.ReadLine();
if (sLine != null)
arrText.Add(sLine);

}
objReader.Close();


foreach (string sOutput in arrText)
{
string[] strArr=sOutput.Split('|');

for (int i = 0; i < strArr.Length; i++)
{
if (str.IndexOf(strArr)!=-1)
{
return false;
}

}

}
return true;

}

}


以下是测试的方法,有什么问题还大家请指出!

1DateTime t1 =DateTime.Now;
2 string str="213";
3 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
4 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
5 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
6 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
7 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
8 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
9 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
10 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
11 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
12 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
13 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
14 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
15 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
16 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
17 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
18 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
19 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
20 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
21 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
22 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
23 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
24 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
25 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
26 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
27 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
28 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
29 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
30 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
31 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
32 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
33 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
34 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
35 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
36 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
37 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
38 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
39 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
40 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
41 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
42 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
43 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
44 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
45 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
46 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
47 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
48 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
49 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
50 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
51 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
52 str+="台州站长之家台州站长之家台州站长之家台州站长之家";
53 ValidDirty vd=new ValidDirty() ;
54 Console.WriteLine(vd.ValidByReg(str)) ;
55 DateTime t2 =DateTime.Now;
56 TimeSpan ts=t2-t1;
57 Console.WriteLine(ts.TotalMilliseconds) ;
58 Console.Read() ;


算法

检索文本文件长度 / 耗费时间(ms)

正则算法

10个汉字/ 980
100个汉字/999
1000个汉字/1234

普通算法

10个汉字/ 234
100个汉字/234
1000个汉字/265
娱乐休闲专区A 影视预告B 音乐咖啡C 英语阶梯D 生活百科
网页编程专区E AMPZF HTMLG CSSH JSI ASPJ PHPK JSPL MySQLM AJAX
Linux技术区 N 系统管理O 服务器架设P 网络/硬件Q 编程序开发R 内核/嵌入
管理中心专区S 发布网址T 版主议事U 事务处理