中文字幕日韩精品一区二区免费_精品一区二区三区国产精品无卡在_国精品无码专区一区二区三区_国产αv三级中文在线

ThinkPHP 3.2 中文分詞 提取關(guān)鍵字

2016-09-05    分類: 網(wǎng)站建設(shè)

由于業(yè)務(wù)的需求,公司研發(fā)團(tuán)隊(duì)正在基于ThinkPHP為底層框架的CMS系統(tǒng)。今天遇到了提取標(biāo)題中的關(guān)鍵詞這一個(gè)功能,我們?cè)谝黄鹧芯苛撕荛L(zhǎng)時(shí)間。決定用Pscws4中文分詞開源系統(tǒng)。中建出了一些小小的問題,所以委托小編我在此記錄一下,為各位PHPer提供一下參考。

SCWS 中文分詞SCWS 是 Simple Chinese Word Segmentation 的首字母縮寫(即:簡(jiǎn)易中文分詞系統(tǒng))。

這是一套基于詞頻詞典的機(jī)械式中文分詞引擎,它能將一整段的中文文本基本正確地切分成詞。 詞是中文的最小語素單位,但在書寫時(shí)并不像英語會(huì)在詞之間用空格分開, 所以如何準(zhǔn)確并快速分詞一直是中文分詞的攻關(guān)難點(diǎn)。

SCWS 采用純 C 語言開發(fā),不依賴任何外部庫函數(shù),可直接使用動(dòng)態(tài)鏈接庫嵌入應(yīng)用程序, 支持的中文編碼包括 GBK、UTF-8 等。此外還提供了 PHP 擴(kuò)展模塊, 可在 PHP 中快速而方便地使用分詞功能。

分詞算法上并無太多創(chuàng)新成分,采用的是自己采集的詞頻詞典,并輔以一定的專有名稱,人名,地名, 數(shù)字年代等規(guī)則識(shí)別來達(dá)到基本分詞,經(jīng)小范圍測(cè)試準(zhǔn)確率在 90% ~ 95% 之間, 基本上能滿足一些小型搜索引擎、關(guān)鍵字提取等場(chǎng)合運(yùn)用。

網(wǎng)站題目:ThinkPHP 3.2 中文分詞 提取關(guān)鍵字
本文鏈接:http://m.rwnh.cn/news1/46151.html

成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供品牌網(wǎng)站制作電子商務(wù)、定制網(wǎng)站移動(dòng)網(wǎng)站建設(shè)、網(wǎng)站設(shè)計(jì)、標(biāo)簽優(yōu)化

廣告

聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請(qǐng)盡快告知,我們將會(huì)在第一時(shí)間刪除。文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng),如需處理請(qǐng)聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時(shí)需注明來源: 創(chuàng)新互聯(lián)

外貿(mào)網(wǎng)站制作
堆龙德庆县| 穆棱市| 新干县| 曲沃县| 天全县| 图木舒克市| 潮州市| 久治县| 河北省| 广丰县| 惠来县| 从江县| 东辽县| 高雄县| 常山县| 宁波市| 安丘市| 沙洋县| 桃园县| 伊宁县| 乐平市| 普陀区| 子洲县| 边坝县| 三穗县| 福鼎市| 芜湖市| 洞头县| 五莲县| 蓬安县| 丹江口市| 从江县| 武汉市| 新闻| 平陆县| 灯塔市| 贡觉县| 灵川县| 稷山县| 涿鹿县| 绥德县|