用户名:
密 码: 记住
您当前的位置:首页 > 网络编程 > php教程

php文章相似度计算similar_text()函数升级

时间:2015-01-23  来源:西部数据  作者:西部数据

有时我们希望调用相关文章时肯定调用相似度高的我先是使用了php的similar_text()函数,但是测试两个相同的标题得出结果只有40%左右啊,下面看实例.

php默认有个函数similar_text()用于计算字符串之间的相似度,该函数也可以计算两个字符串的相似度(以百分比计),不过这个函数感觉对中文计算很不准确比如:

echo similar_text("吉林禽业公司火灾已致112人遇难","吉林宝源丰禽业公司火灾已致112人遇难"); 

这两个新闻标题其实都是一样的,如果使用similar_text()相似对结果为:42,即只相似42%,所以这个感觉很不靠谱,今天刚好收集到一段PHP代码也是用于比较两个字符串的相似度,直接贴出代码:

  1. <?php  
  2. class LCS { 
  3.     var $str1
  4.     var $str2
  5.     var $c = array(); 
  6.     /*返回串一和串二的最长公共子序列 
  7. */ 
  8.     function getLCS($str1$str2$len1 = 0, $len2 = 0) { 
  9.         $this->str1 = $str1
  10.         $this->str2 = $str2
  11.         if ($len1 == 0) $len1 = strlen($str1); 
  12.         if ($len2 == 0) $len2 = strlen($str2); 
  13.         $this->initC($len1$len2); 
  14.         return $this->printLCS($this->c, $len1 - 1, $len2 - 1); 
  15.     } 
  16.     /*返回两个串的相似度 
  17. */ 
  18.     function getSimilar($str1$str2) { 
  19.         $len1 = strlen($str1); 
  20.         $len2 = strlen($str2); 
  21.         $len = strlen($this->getLCS($str1$str2$len1$len2)); 
  22.         return $len * 2 / ($len1 + $len2); 
  23.     } 
  24.     function initC($len1$len2) { 
  25.         for ($i = 0; $i < $len1$i++) $this->c[$i][0] = 0; 
  26.         for ($j = 0; $j < $len2$j++) $this->c[0][$j] = 0; 
  27.         for ($i = 1; $i < $len1$i++) { 
  28.             for ($j = 1; $j < $len2$j++) { 
  29.                 if ($this->str1[$i] == $this->str2[$j]) { 
  30.                     $this->c[$i][$j] = $this->c[$i - 1][$j - 1] + 1; 
  31.                 } else if ($this->c[$i - 1][$j] >= $this->c[$i][$j - 1]) { 
  32.                     $this->c[$i][$j] = $this->c[$i - 1][$j]; 
  33.                 } else { 
  34.                     $this->c[$i][$j] = $this->c[$i][$j - 1]; 
  35.                 } 
  36.             } 
  37.         } 
  38.     } 
  39.     function printLCS($c$i$j) { 
  40.         if ($i == 0 || $j == 0) { 
  41.             if ($this->str1[$i] == $this->str2[$j]) return $this->str2[$j]; 
  42.             else return ""
  43.         } 
  44.         if ($this->str1[$i] == $this->str2[$j]) { 
  45.             return $this->printLCS($this->c, $i - 1, $j - 1).$this->str2[$j]; 
  46.         } else if ($this->c[$i - 1][$j] >= $this->c[$i][$j - 1]) { 
  47.             return $this->printLCS($this->c, $i - 1, $j); 
  48.         } else { 
  49.             return $this->printLCS($this->c, $i$j - 1); 
  50.         } 
  51.     } 
  52.  
  53. $lcs = new LCS(); 
  54. //返回最长公共子序列 
  55. $lcs->getLCS("hello word","hello china"); 
  56. //返回相似度 
  57. echo $lcs->getSimilar("吉林禽业公司火灾已致112人遇难","吉林宝源丰禽业公司火灾已致112人遇难"); 

同样输出结果为:0.90322580645161,明显准确的多,还有一种办法就是利用分词系统我们把标题分词,然后再进行会更准确一些.

来顶一下
返回首页
返回首页
推荐资讯
WiFi太不安全:7岁女孩11分钟内入侵公共网络 WiFi太不安全:7岁女孩11分钟内入侵近期刚刚发布研究说WiFi网络能获得人们手机里多少私人信息,
不服跑个分?人工智能也出现“刷分”乱象 不服跑个分?人工智能也出现“刷分2014年,人工智能领域突然爆发,成为了科研和科技创业的热门
相关文章
    无相关信息
栏目更新
栏目热门