修改imdict分词的机制,让其允许附加词库

http://onedear.iteye.com/admin/blogs/673724 这个是修复后的版本,请打开这个连接下载代码

    一直喜欢中科院的分词,但由于共享版有时间限制,虽有破解版,但这样用破解就不爽,在其官网找了一个java版的中科院分词imdict-chinese-analyzer 
下载地址是
    http://ictclas.org/OpenSrcDownCount.asp?PacketId=48&url=down/imdict-chinese-analyzer.zip
用了以后,觉得效果不错,但最大的硬伤是不允许附加词库,但既然源代码都到手了,这种不允许附加的机制当然能改。
最后没有改动源代码,仅仅自己另外写了几个类实现了

使用方式请看附件里面的readme.txt

//不加入默认词库,词库里面没有陆河县这个词,结果是 广东 陆 河 县 onedear
//附加词库后,结果是“广东 陆河县 onedear ”

同时也曾带上词性,但不是很准,所以附件里面的工程就取消了,主要是没有一个很好的算法跟思想,对多义词不知道应如何处理。希望大家能给给意见。

你可能感兴趣的:(算法,asp)