Friso是使用c语言开发的一个开源的中文分词器,使用流行的MMSeg算法实现。完全基于模块化设计和实现,可以很方便的植入到其他程序中,例如:Mysql,PHP等。并且提供了一个php扩展
1。只支持UTF-8编码。【源码无需修改就能在各种平台下编译使用,加载完20万的词条,内存占用稳定为14M】
2。mmseg四种过滤算法,分词准确率达到了98.41%。
3。支持自定义词库。在friso源码附件的dict文件夹下,可以随便添加/删除/更改词库和词库词条,并且对词库进行了分类。
4。词库使用了friso的Java版本jcseg的简化词库。
5。支持中英/英中混合词的识别。例如:卡拉ok, 漂亮mm, c语言,IC卡。
7。很好的英文支持:英文和标点的组合词识别(例如:c++, C#, g++),电子邮件,网址,小数,分数,百分数。
8。支持阿拉伯数字基本单字单位的识别,例如2012年,5吨,120斤。
9。自动英文圆角/半角,大写/小写转换。
10。自动同义词追加, 同义词匹配。
11。自动停止词过滤。
发布于 2017-09-07 04:19:21 | 275 次阅读
发布于 2016-12-26 03:29:26 | 146 次阅读
发布于 2014-07-23 02:48:33 | 285 次阅读