PHP加强版计算字符串相似度的函数similar_text()、levenshtein()

PHP 2014-12-08 10:03:05 转载来源: 网络整理/侵权必删

本文是一个php实现的加强版的计算字符串相似度的函数(similar_text()、levenshtein())，感兴趣的同学参考下。 PHP 原生的similar_text()函数、levenshtein()函数对中文汉字支持不好，我自己写了一个，测试使用正常，推荐给大家，如果有什么问题，请留言 similar_text()中文汉字版 <?php //拆分字符串 function split_str($str) { preg_match_all("/./u", $str, $arr); return $arr[0]; }&nb

本文是一个php实现的加强版的计算字符串相似度的函数(similar_text()、levenshtein())，感兴趣的同学参考下。

PHP 原生的similar_text()函数、levenshtein()函数对中文汉字支持不好，我自己写了一个，测试使用正常，推荐给大家，如果有什么问题，请留言

similar_text()中文汉字版

     <?php 

     //拆分字符串 

     function split_str($str) { 

       preg_match_all("/./u", $str, $arr); 

       return $arr[0]; 

     } 

     //相似度检测 

     function similar_text_cn($str1, $str2) { 

       $arr_1 = array_unique(split_str($str1)); 

       $arr_2 = array_unique(split_str($str2)); 

       $similarity = count($arr_2) - count(array_diff($arr_2, $arr_1)); 

       return $similarity; 

     }

levenshtein()中文汉字版

     <?php 

     //拆分字符串 

     function mbStringToArray($string, $encoding = 'UTF-8') { 

         $arrayResult = array(); 

         while ($iLen = mb_strlen($string, $encoding)) { 

             array_push($arrayResult, mb_substr($string, 0, 1, $encoding)); 

             $string = mb_substr($string, 1, $iLen, $encoding); 

         } 

         return $arrayResult; 

     } 

     //编辑距离 

     function levenshtein_cn($str1, $str2, $costReplace = 1, $encoding = 'UTF-8') { 

         $count_same_letter = 0; 

         $d = array(); 

         $mb_len1 = mb_strlen($str1, $encoding); 

         $mb_len2 = mb_strlen($str2, $encoding); 

         $mb_str1 = mbStringToArray($str1, $encoding); 

         $mb_str2 = mbStringToArray($str2, $encoding); 

         for ($i1 = 0; $i1 <= $mb_len1; $i1++) { 

             $d[$i1] = array(); 

             $d[$i1][0] = $i1; 

         } 

         for ($i2 = 0; $i2 <= $mb_len2; $i2++) { 

             $d[0][$i2] = $i2; 

         } 

         for ($i1 = 1; $i1 <= $mb_len1; $i1++) { 

             for ($i2 = 1; $i2 <= $mb_len2; $i2++) { 

                 // $cost = ($str1[$i1 - 1] == $str2[$i2 - 1]) ? 0 : 1; 

                 if ($mb_str1[$i1 - 1] === $mb_str2[$i2 - 1]) { 

                     $cost = 0; 

                     $count_same_letter++; 

                 } else { 

                     $cost = $costReplace; //替换 

                 } 

                 $d[$i1][$i2] = min($d[$i1 - 1][$i2] + 1, //插入 

                 $d[$i1][$i2 - 1] + 1, //删除 

                 $d[$i1 - 1][$i2 - 1] + $cost); 

             } 

         } 

         return $d[$mb_len1][$mb_len2]; 

         //return array('distance' => $d[$mb_len1][$mb_len2], 'count_same_letter' => $count_same_letter); 

     }

最长公共子序列LCS()

         <?php 

         //最长公共子序列英文版 

         function LCS_en($str_1, $str_2) { 

           $len_1 = strlen($str_1); 

           $len_2 = strlen($str_2); 

           $len = $len_1 > $len_2 ? $len_1 : $len_2; 

           $dp = array(); 

           for ($i = 0; $i <= $len; $i++) { 

             $dp[$i] = array(); 

             $dp[$i][0] = 0; 

             $dp[0][$i] = 0; 

           } 

           for ($i = 1; $i <= $len_1; $i++) { 

             for ($j = 1; $j <= $len_2; $j++) { 

               if ($str_1[$i - 1] == $str_2[$j - 1]) { 

                 $dp[$i][$j] = $dp[$i - 1][$j - 1] + 1; 

               } else { 

                 $dp[$i][$j] = $dp[$i - 1][$j] > $dp[$i][$j - 1] ? $dp[$i - 1][$j] : $dp[$i][$j - 1]; 

               } 

             } 

           } 

           return $dp[$len_1][$len_2]; 

         } 

         //拆分字符串 

         function mbStringToArray($string, $encoding = 'UTF-8') { 

           $arrayResult = array(); 

           while ($iLen = mb_strlen($string, $encoding)) { 

             array_push($arrayResult, mb_substr($string, 0, 1, $encoding)); 

             $string = mb_substr($string, 1, $iLen, $encoding); 

           } 

           return $arrayResult; 

         } 

         //最长公共子序列中文版 

         function LCS_cn($str1, $str2, $encoding = 'UTF-8') { 

           $mb_len1 = mb_strlen($str1, $encoding); 

           $mb_len2 = mb_strlen($str2, $encoding); 

           $mb_str1 = mbStringToArray($str1, $encoding); 

           $mb_str2 = mbStringToArray($str2, $encoding); 

           $len = $mb_len1 > $mb_len2 ? $mb_len1 : $mb_len2; 

           $dp = array(); 

           for ($i = 0; $i <= $len; $i++) { 

             $dp[$i] = array(); 

             $dp[$i][0] = 0; 

             $dp[0][$i] = 0; 

           } 

           for ($i = 1; $i <= $mb_len1; $i++) { 

             for ($j = 1; $j <= $mb_len2; $j++) { 

               if ($mb_str1[$i - 1] == $mb_str2[$j - 1]) { 

                 $dp[$i][$j] = $dp[$i - 1][$j - 1] + 1; 

               } else { 

                 $dp[$i][$j] = $dp[$i - 1][$j] > $dp[$i][$j - 1] ? $dp[$i - 1][$j] : $dp[$i][$j - 1]; 

               } 

             } 

           } 

           return $dp[$mb_len1][$mb_len2]; 

         }

标签: PHP 加强计算字符串相似函数 similar text levenshtein

声明：本文内容来源自网络，文字、图片等素材版权属于原作者，平台转载素材出于传递更多信息，文章内容仅供参考与学习，切勿作为商业目的使用。如果侵害了您的合法权益，请您及时与我们联系，我们会在第一时间进行处理！我们尊重版权，也致力于保护版权，站搜网感谢您的分享！

上一篇: PHP连接MSSQL2008/2005数据库(SQLSRV)方法

上一篇: Facebook斥10亿美元收购应用Instagram

娱乐休闲

工商与经济

电脑与网络

公司与企业

教育与培训

文学

艺术

体育与健身

新闻与媒体

卫生与健康

科学/文化

生活与服务

职业

鲜花/礼品

网上救助

环境保护

石油/天然气

艺术教育/院校

社会学

租房

求医问药

期刊杂志

科技馆/博物馆

天气预报

PHP加强版计算字符串相似度的函数similar_text()、levenshtein()

热门文章

热点

标签列表

分享到:

Copyright @ 2007~2024 All Rights Reserved.

Powered By 站长搜索

PHP加强版计算字符串相似度的函数similar_text()、levenshtein()

猜您喜欢

热门文章

热点

标签列表

分享到:

Copyright @ 2007~2024 All Rights Reserved.

Powered By 站长搜索