茄子在线看片免费人成视频,午夜福利精品a在线观看,国产高清自产拍在线观看,久久综合久久狠狠综合

    <s id="ddbnn"></s>
  • <sub id="ddbnn"><ol id="ddbnn"></ol></sub>

  • <legend id="ddbnn"></legend><s id="ddbnn"></s>

    phpanalysis中文分詞類詳解
    來(lái)源:易賢網(wǎng) 閱讀:2335 次 日期:2014-07-31 10:23:37
    溫馨提示:易賢網(wǎng)小編為您整理了“phpanalysis中文分詞類詳解”,方便廣大網(wǎng)友查閱!

    phpanalysis是目前廣泛使用的中文分詞類,使用反向匹配模式分詞,因此兼容編碼更廣泛,現(xiàn)將其變量與常用函數(shù)詳解如下:

    一、比較重要的成員變量

    $resulttype   = 1        生成的分詞結(jié)果數(shù)據(jù)類型(1 為全部, 2為 詞典詞匯及單個(gè)中日韓簡(jiǎn)繁字符及英文, 3 為詞典詞匯及英文)

                                        這個(gè)變量一般用 setresulttype( $rstype ) 這方法進(jìn)行設(shè)置。

    $notsplitlen  = 5        切分句子最短長(zhǎng)度

    $tolower      = false    把英文單詞全部轉(zhuǎn)小寫

    $differmax    = false    使用最大切分模式對(duì)二元詞進(jìn)行消岐

    $unitword     = true     嘗試合并單字(即是新詞識(shí)別)

    $differfreq   = false    使用熱門詞優(yōu)先模式進(jìn)行消岐

    二、主要成員函數(shù)列表

    1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='') 

    函數(shù)說明:構(gòu)造函數(shù)

    參數(shù)列表:

    $source_charset      源字符串編碼

    $target_charset      目錄字符串編碼

    $load_all            是否完全加載詞典(此參數(shù)已經(jīng)作廢)

    $source              源字符串

    如果輸入輸出都是utf-8,實(shí)際上可以不必使用任何參數(shù)進(jìn)行初始化,而是通過 setsource 方法設(shè)置要操作的文本

    2、public function setsource( $source, $source_charset='utf-8', $target_charset='utf-8' )

    函數(shù)說明:設(shè)置源字符串

    參數(shù)列表:

    $source              源字符串

    $source_charset      源字符串編碼

    $target_charset      目錄字符串編碼

    返回值:bool

    3、public function startanalysis($optimize=true)

    函數(shù)說明:開始執(zhí)行分詞操作

    參數(shù)列表:

    $optimize            分詞后是否嘗試優(yōu)化結(jié)果

    返回值:void

    一個(gè)基本的分詞過程:

    //////////////////////////////////////

    $pa = new phpanalysis();

    $pa->setsource('需要進(jìn)行分詞的字符串');

    //設(shè)置分詞屬性

    $pa->resulttype = 2;

    $pa->differmax  = true;

    $pa->startanalysis();

    //獲取你想要的結(jié)果

    $pa->getfinallyindex();

    ////////////////////////////////////////

    4、public function setresulttype( $rstype )

    函數(shù)說明:設(shè)置返回結(jié)果的類型

    實(shí)際是對(duì)成員變量$resulttype的操作

    參數(shù) $rstype 值為:

    1 為全部, 2為 詞典詞匯及單個(gè)中日韓簡(jiǎn)繁字符及英文, 3 為詞典詞匯及英文

    返回值:void

    5、public function getfinallykeywords( $num = 10 )

    函數(shù)說明:獲取出現(xiàn)頻率最高的指定詞條數(shù)(通常用于提取文檔關(guān)鍵字)

    參數(shù)列表:

    $num = 10  返回詞條個(gè)數(shù)

    返回值:用,分隔的關(guān)鍵字列表

    6、public function getfinallyresult($spword=' ')

    函數(shù)說明:獲得最終分詞結(jié)果

    參數(shù)列表:

    $spword    詞條之間的分隔符

    返回值:string

    7、public function getsimpleresult()

    函數(shù)說明:獲得粗分結(jié)果

    返回值:array

    8、public function getsimpleresultall()

    函數(shù)說明:獲得包含屬性信息的粗分結(jié)果

    屬性(1中文詞句、2 ansi詞匯(包括全角),3 ansi標(biāo)點(diǎn)符號(hào)(包括全角),4數(shù)字(包括全角),5 中文標(biāo)點(diǎn)或無(wú)法識(shí)別字符)

    返回值:array

    9、public function getfinallyindex()

    函數(shù)說明:獲取hash索引數(shù)組

    返回值:array('word'=>count,...) 按出現(xiàn)頻率排序

    10、public function makedict( $source_file, $target_file='' )

    函數(shù)說明:把文本文件詞庫(kù)編譯成詞典

    參數(shù)列表:

    $source_file   源文本文件

    $target_file   目標(biāo)文件(如果不指定,則為當(dāng)前詞典)

    返回值:void

    11、public function exportdict( $targetfile )

    函數(shù)說明:導(dǎo)出當(dāng)前詞典全部詞條為文本文件

    參數(shù)列表:

    $targetfile  目標(biāo)文件

    返回值:void

    更多信息請(qǐng)查看IT技術(shù)專欄

    更多信息請(qǐng)查看網(wǎng)絡(luò)編程
    易賢網(wǎng)手機(jī)網(wǎng)站地址:phpanalysis中文分詞類詳解
    由于各方面情況的不斷調(diào)整與變化,易賢網(wǎng)提供的所有考試信息和咨詢回復(fù)僅供參考,敬請(qǐng)考生以權(quán)威部門公布的正式信息和咨詢?yōu)闇?zhǔn)!

    2026國(guó)考·省考課程試聽報(bào)名

    • 報(bào)班類型
    • 姓名
    • 手機(jī)號(hào)
    • 驗(yàn)證碼
    關(guān)于我們 | 聯(lián)系我們 | 人才招聘 | 網(wǎng)站聲明 | 網(wǎng)站幫助 | 非正式的簡(jiǎn)要咨詢 | 簡(jiǎn)要咨詢須知 | 新媒體/短視頻平臺(tái) | 手機(jī)站點(diǎn) | 投訴建議
    工業(yè)和信息化部備案號(hào):滇ICP備2023014141號(hào)-1 云南省教育廳備案號(hào):云教ICP備0901021 滇公網(wǎng)安備53010202001879號(hào) 人力資源服務(wù)許可證:(云)人服證字(2023)第0102001523號(hào)
    云南網(wǎng)警備案專用圖標(biāo)
    聯(lián)系電話:0871-65099533/13759567129 獲取招聘考試信息及咨詢關(guān)注公眾號(hào):hfpxwx
    咨詢QQ:1093837350(9:00—18:00)版權(quán)所有:易賢網(wǎng)
    云南網(wǎng)警報(bào)警專用圖標(biāo)