Yard中文分词系统

Yard中文分词系统基于改进的正向最大匹配算法和全切分算法,利用双字哈希进行词典组织解决了中文长词切分带来的分词效率低下问题。
本次发布的版本为0.1版能对中文词组进行完美的切分同时利用词组的词频和词性解决了歧义划分的问题,但是对人名、地名、组织名、英文、数字等还不能进行很好的切分,在下一个版本中将解决这些问题。中文词典应用了搜狗实验室提供的互联网词库。纯java编写。本软件为开源软件你可以进行任何修改以适应你的需求,如果你加入了新功能请发送一份副本给我,我们一同完善改进。
我的联系方式:[email protected]
分词精度为多少?朋友们自己去测试吧不会让你失望的!!

 

你可能感兴趣的:(算法,互联网,软件测试,Blog)