一种基于信息熵的中文高频词抽取算法

522

收藏 2018-01-28

摘要：为扩展分词词典，提高分词的准确率，本文提出了一种基于信息熵的中文高频词抽取算法，其结果可以用来识别未登录词并扩充现有词典。我们首先对文本进行预处理，将文本中的噪音字和非中文字符转化为分隔符，这样文本就可以被视为用分隔符分开的中文字符串的集合，然后统计这些中文字符串的所有子串的相关频次信息，最后根据这些频次信息计算每一个子串的信息熵来判断其是否为词。实验证明，该算法不仅简单易行，而且可以比较有效地从文本中抽取高频词，可接受率可达到91．68％。http://www.cqvip.com//QK/96983X/200605/22732901.html

送人玫瑰，手留余香~如您已下载到该资源，可在回帖当中上传与大家共享，欢迎来CDA社区交流学习。（仅供学术交流用。）

扫码加我拉你入群

请注明：姓名-公司-职位

以便审核进群资格，未注明则拒绝

扫码加我 拉你入群

分享

扫码加好友，拉您进群

扫码加我拉你入群