摘要:语料库在自然语言处理(NLP)领域的应用越来越广泛,词类共现频率的统计是其研究内容之一。针对词类共现的计算特点,给出了基于MapReduce编程模型实现的并行方法,即pairs和stripes方法。虽然stripes模式性能明显优于pairs模式,但其在词汇表很大时存在内存溢出问题。针对此缺陷,给出了划分词汇表的解决方法,对输入词汇表进行拆分,此过程可利用MapReduce模型进行预处理。实验结果表明:利用MapReduce的并行性能较好地提高海量语料库中词类共现频率统计的效率和性能。
原文链接:http://www.cqvip.com//QK/98592C/201311/48225186.html
送人玫瑰,手留余香~如您已下载到该资源,可在回帖当中上传与大家共享,欢迎来CDA社区交流学习。(仅供学术交流用。)