手机浏览 RSS 2.0 订阅 膘叔的简单人生 , 腾讯云RDS购买 | 超便宜的Vultr , 注册 | 登陆
浏览模式: 标准 | 列表2009年09月21日的文章

PHP分词索引

  众所周知,英文是以词为单位的,词和词之间是靠空格隔开,而中文是以字为单位,句子中所有的字连起来才能描述一个意思。例如,英文句子I am a student,用中文则为:“我是一个学生”。计算机可以很简单通过空格知道student是一个单词,但是不能很容易明白“学”、“生”两个字合起来 才表示一个词。把中文的汉字序列切分成有意义的词,就是中文分词,有些人也称为切词。我是一个学生,分词的结果是:我是 一个 学生。
目前主流的中文分词算法有:

1、 基于字符串匹配的分词方法

这种方法又叫做机械分词方法,它是按照一定的策略将待分析的汉字串与一个“充分大的”机器词典中的词条进行配,若在词典中找到某个字符串,则匹配成功 (识别出一个词)。按照扫描方向的不同,串匹配分词方法可以分为正向匹配和逆向匹配;按照不同长度优先匹配的情况,可以分为最大(最长)匹配和最小(最 短)匹配;按照是否与词性标注过程相结合,又可以分为单纯分词方法和分词与标注相结合的一体化方法。常用的几种机械分词方法如下:
1)正向最大匹配法(由左到右的方向);
2)逆向最大匹配法(由右到左的方向);
3)最少切分(使每一句中切出的词数最小)。
还可以将上述各种方法相互组合,例如,可以将正向最大匹配方法和逆向最大匹配方法结合起来构成双向匹配法。由于汉语单字成词的特点,正向最小匹配和逆向 最小匹配一般很少使用。一般说来,逆向匹配的切分精度略高于正向匹配,遇到的歧义现象也较少。统计结果表明,单纯使用正向最大匹配的错误率为1/169, 单纯使用逆向最大匹配的错误率为1/245。但这种精度还远远不能满足实际的需要。实际使用的分词系统,都是把机械分词作为一种初分手段,还需通过利用各 种其它的语言信息来进一步提高切分的准确率。
一种方法是改进扫描方式,称为特征扫描或标志切分,优先在待分析字符串中识别和切分出一些带有明 显特征的词,以这些词作为断点,可将原字符串分为较小的串再来进机械分词,从而减少匹配的错误率。另一种方法是将分词和词类标注结合起来,利用丰富的词类 信息对分词决策提供帮助,并且在标注过程中又反过来对分词结果进行检验、调整,从而极大地提高切分的准确率。
对于机械分词方法,可以建立一个一般的模型,在这方面有专业的学术论文,这里不做详细论述。

2、 基于理解的分词方法

这种分词方法是通过让计算机模拟人对句子的理解,达到识别词的效果。其基本思想就是在分词的同时进行句法、语义分析,利用句法信息和语义信息来处理歧义 现象。它通常包括三个部分:分词子系统、句法语义子系统、总控部分。在总控部分的协调下,分词子系统可以获得有关词、句子等的句法和语义信息来对分词歧义 进行判断,即它模拟了人对句子的理解过程。这种分词方法需要使用大量的语言知识和信息。由于汉语语言知识的笼统、复杂性,难以将各种语言信息组织成机器可 直接读取的形式,因此目前基于理解的分词系统还处在试验阶段。

3、 基于统计的分词方法

从形式上看,词是稳定的字的组合,因此在上下文中,相邻的字同时出现的次数越多,就越有可能构成一个词。因此字与字相邻共现的频率或概率能够较好的反映 成词的可信度。可以对语料中相邻共现的各个字的组合的频度进行统计,计算它们的互现信息。定义两个字的互现信息,计算两个汉字X、Y的相邻共现概率。互现 信息体现了汉字之间结合关系的紧密程度。当紧密程度高于某一个阈值时,便可认为此字组可能构成了一个词。这种方法只需对语料中的字组频度进行统计,不需要 切分词典,因而又叫做无词典分词法或统计取词方法。但这种方法也有一定的局限性,会经常抽出一些共现频度高、但并不是词的常用字组,例如“这一”、“之 一”、“有的”、“我的”、“许多的”等,并且对常用词的识别精度差,时空开销大。实际应用的统计分词系统都要使用一部基本的分词词典(常用词词典)进行 串匹配分词,同时使用统计方法识别一些新的词,即将串频统计和串匹配结合起来,既发挥匹配分词切分速度快、效率高的特点,又利用了无词典分词结合上下文识 别生词、自动消除歧义的优点。

值此,放上收藏的三篇文章和程序
1、yhustc的分词词库(采用sqlite,无词频分析,下载地址为:http://www.neatcn.com/dict/dict.tar.gz,在http://www.neatcn.com/dict/有简单的试用,也可以通过http://www.neatcn.com/dict/test.php?type=json&encode=gbk&contents=xxx等调用返回),

2、dede的分词,(织梦的算法:http://www.dedecms.com/html/chanpinxiazai/20061229/3.html#,该页同时有演示,采用CSV文件)

3、一篇比较老的分词程序:http://www.neatcn.com/show-592-1.shtml

Tags: 分词, yhustc, dedecms

网站性能、安全监控

前两天有人就告诉我,监控宝不错,于是,我就申请了一个帐号,然而不知道是出于岐视还是啥,反正我的YAHOO邮箱并没有收到激活邮件。今天一大早,朋友就发来了使用图片,看上去不出,只是需要打开snmp服务,并添加一个只读帐号。(搞半天,原来是通过这个帐号来对信息进行处理并发送到该网站啊?)

老王说,360还有一个挂马监视中心,欣欣然转贴一下下

网站监控对任何一个严肃的网站而言,都是必不可少的。有实力的网站往往会由专门的运维人员来负责这部分工作,不过对于多数中小网站而言,这部分开支往往是拿不出来了,为了满足这些网站的需求,就有了很多第三方网站提供在线网站监控功能,比如说:360挂马检测中心监控宝等等,你只要注册了,就能用非常Easy的方法打造非常Cool的网站监控。

360挂马监控中心

大小: 39.63 K
尺寸: 500 x 375
浏览: 1371 次
点击打开新窗口浏览全图


监控宝

大小: 46.21 K
尺寸: 500 x 375
浏览: 1379 次
点击打开新窗口浏览全图


这两个网站提供的网站监控选项非常丰富,从木马到CPU,内存,磁盘占用率等等,应有尽有,只要注册了,这一切都能免费使用,并且在网站出现异常的时候会 自动发送电子邮件通知你。看到仅仅是电子邮件通知,很多读者肯定要失望了,毕竟这不能保证我们立刻知道网站发生故障,最好还是通过短信通知,懂技术的站长 们或许已经通过飞信之类的软件实现了这个功能,但至少对我来说,这太复杂了,如果你也是这么想的,接着看下面:

如果你是移动的手机用户,那么就注册一个139.com的邮箱,当有新邮件到达时,会自动给你的手机免费发送一条短信;如果你是联通的手机用户,那么就注册一个m165.com的邮箱,有同样的功能,不过和移动邮箱相比,联通邮箱每个月有几块钱的使用费,虽然不多,但还是感觉有点不爽。手机邮箱的名字缺省是你的手机号,不过为了防止你的手机号被泄露,移动和联通都提供了别名的功能,建议使用。

有了可以免费发短信的手机邮箱后,剩下的就简单了,修改注册360木马监控中心和监控宝时的账号信息,把电子邮件换成你的手机邮箱即可。

当然,你也可以自己写一些监控脚本,一旦发现问题,就往手机邮箱里发邮件,同样也可以得到短信通知。至于如何发邮件,可以自己安装sendmail之类的东西,如果你和我一样讨厌sendmail,可以使用Gmail之类的邮箱通过SMTP发信,恕不详述。

---EOF--

老王说的发邮件、发短信的事情,这个我在之前也有提过。139固然可以提醒,但现在也还有飞信可以使用。网上也有一些飞信的PHP接口。当然还可以购买SP的短信服务,自己通过SP的接口来给自己发短信【如果您能够为我提供一个好的思路,如果被采用了,我将免费赠送1000条短信给您使用(如何利用更大限度的利用短信服务而不会使人反感)】

本人已经有一些思路,为避免冲突,我可以列出一小部分:

1、短信提醒(139邮箱好象已经有类似功能)
2、对于网站主来说,对于安全字或者有人在尝试注入的时候,通过程序发短信
3、如果是论坛用户,在用户量并不特别大的时候,可以考虑短信祝福生日,以加强互动
4、短信订阅站内通知。(这个就需要有限度了。。。)

其实还有一些想法,只是意义不大就不列出来了

Tags: 监控

JavaScript trim函数大赏

极其标悍:http://www.cnblogs.com/rubylouvre/archive/2009/09/18/1568794.html
好象现在的很多用法不是第一种就是第二种,看了下面的测试,才知道原来性能相差这么大?恐怖之极。

司徒正美,博客园作者。。

原文如下:

W3C那帮人的脑袋被驴踢了,直到javascript1.8.1才支持trim函数(与trimLeft,trimRight),可惜现在只有 firefox3.5支持。由于去除字符串两边的空白实在太常用,各大类库都有它的影子。加之,外国人都很有研究精神,搞鼓了相当多实现。

实现1

1.String.prototype.trim = function() {
2.  return this.replace(/^\s\s*/, '').replace(/\s\s*$/, '');
3.}

看起来不怎么样,动用了两次正则替换,实际速度非常惊人,主要得益于浏览器的内部优化。一个著名的例子字符串拼接,直接相加比用Array做成的StringBuffer还快。base2类库使用这种实现。

实现2

1.String.prototype.trim = function() {
2.  return this.replace(/^\s+/, '').replace(/\s+$/, '');
3.}

和实现1很相似,但稍慢一点,主要原因是它最先是假设至少存在一个空白符。Prototype.js使用这种实现,不过其名字为strip,因为Prototype的方法都是力求与Ruby同名。

实现3

1.String.prototype.trim = function() {
2.  return  this.substring(Math.max(this.search(/\S/), 0),this.search(/\S\s*$/) + 1);
3.}

以截取方式取得空白部分(当然允许中间存在空白符),总共调用了四个原生方法。设计得非常巧妙,substring以两个数字作为参数。Math.max以两个数字作参数,search则返回一个数字。速度比上面两个慢一点,但比下面大多数都快。

实现4

1.String.prototype.trim = function() {
2.  return  this.replace(/^\s+|\s+$/g, '');
3.}

这个可以称得上实现2的简化版,就是利用候选操作符连接两个正则。但这样做就失去了浏览器优化的机会,比不上实现3。由于看来很优雅,许多类库都使用它,如JQuery与mootools

实现5

1.String.prototype.trim = function() {
2.  var str = this;
3.  str = str.match(/\S+(?:\s+\S+)*/);
4.  return str ? str[0] : '';
5.}

match是返回一个数组,因此原字符串符合要求的部分就成为它的元素。为了防止字符串中间的空白符被排除,我们需要动用到非捕获性分组 (?:exp)。由于数组可能为空,我们在后面还要做进一步的判定。好像浏览器在处理分组上比较无力,一个字慢。所以不要迷信正则,虽然它基本上是万能 的。

实现6

1.String.prototype.trim = function() {
2.  return this.replace(/^\s*(\S*(\s+\S+)*)\s*$/, '$1');
3.}

把符合要求的部分提供出来,放到一个空字符串中。不过效率很差,尤其是在IE6中。

实现7

1.String.prototype.trim = function() {
2.  return this.replace(/^\s*(\S*(?:\s+\S+)*)\s*$/, '$1');
3.}

和实现6很相似,但用了非捕获分组进行了优点,性能效之有一点点提升。

实现8

1.String.prototype.trim = function() {
2.  return this.replace(/^\s*((?:[\S\s]*\S)?)\s*$/, '$1');
3.}

沿着上面两个的思路进行改进,动用了非捕获分组与字符集合,用?顶替了*,效果非常惊人。尤其在IE6中,可以用疯狂来形容这次性能的提升,直接秒杀火狐。

实现9

1.String.prototype.trim = function() {
2.  return this.replace(/^\s*([\S\s]*?)\s*$/, '$1');
3.}

这次是用懒惰匹配顶替非捕获分组,在火狐中得到改善,IE没有上次那么疯狂。

实现10

01.String.prototype.trim = function() {
02.  var str = this,
03.  whitespace = ' \n\r\t\f\x0b\xa0\u2000\u2001\u2002\u2003\u2004\u2005\u2006\u2007\u2008\u2009\u200a\u200b\u2028\u2029\u3000';
04.  for (var i = 0,len = str.length; i < len; i++) {
05.    if (whitespace.indexOf(str.charAt(i)) === -1) {
06.      str = str.substring(i);
07.      break;
08.    }
09.  }
10.  for (i = str.length - 1; i >= 0; i--) {
11.    if (whitespace.indexOf(str.charAt(i)) === -1) {
12.      str = str.substring(0, i + 1);
13.      break;
14.    }
15.  }
16.  return whitespace.indexOf(str.charAt(0)) === -1 ? str : '';
17.}

我只想说,搞出这个的人已经不是用牛来形容,已是神一样的级别。它先是把可能的空白符全部列出来,在第一次遍历中砍掉前面的空白,第二次砍掉后面的 空白。全过程只用了indexOf与substring这个专门为处理字符串而生的原生方法,没有使用到正则。速度快得惊人,估计直逼上内部的二进制实 现,并且在IE与火狐(其他浏览器当然也毫无疑问)都有良好的表现。速度都是零毫秒级别的。

实现11

01.String.prototype.trim = function() {
02.  var str = this,
03.  str = str.replace(/^\s+/, '');
04.  for (var i = str.length - 1; i >= 0; i--) {
05.    if (/\S/.test(str.charAt(i))) {
06.      str = str.substring(0, i + 1);
07.      break;
08.    }
09.  }
10.  return str;
11.}

实现10已经告诉我们普通的原生字符串截取方法是远胜于正则替换,虽然是复杂一点。但只要正则不过于复杂,我们就可以利用浏览器对正则的优化,改善 程序执行效率,如实现8在IE的表现。我想通常不会有人在项目中应用实现10,因为那个whitespace 实现太长太难记了(当然如果你在打造一个类库,它绝对是首先)。实现11可谓其改进版,前面部分的空白由正则替换负责砍掉,后面用原生方法处理,效果不逊 于原版,但速度都是非常逆天。

实现12

1.String.prototype.trim = function() {
2.  var str = this,
3.  str = str.replace(/^\s\s*/, ''),
4.  ws = /\s/,
5.  i = str.length;
6.  while (ws.test(str.charAt(--i)));
7.  return str.slice(0, i + 1);
8.}

实现10与实现11在写法上更好的改进版,注意说的不是性能速度,而是易记与使用上。和它的两个前辈都是零毫秒级别的,以后就用这个来工作与吓人。

下面是老外给出的比较结果,执行背景是对Magna Carta 这文章(超过27,600字符)进行trim操作。

实现 Firefox 2 IE 6
trim1 15ms < 0.5ms
trim2 31ms < 0.5ms
trim3 46ms 31ms
trim4 47ms 46ms
trim5 156ms 1656ms
trim6 172ms 2406ms
trim7 172ms 1640ms
trim8 281ms < 0.5ms
trim9 125ms 78ms
trim10 < 0.5ms < 0.5ms
trim11 < 0.5ms < 0.5ms
trim12 < 0.5ms < 0.5ms

原文链接:http://blog.stevenlevithan.com/archives/faster-trim-javascript

注意本文非翻译,只是根据其中提到的trim函数实现发表自己的想法,想知道原作者说什么请看原文。

Tags: trim