Friso是使用c语言开发的一个开源的中文分词器,使用流行的MMSeg算法实现。完全基于模块化设计和实现,可以很方便的植入到其他程序中,例如:MysqlPHP等。并且提供了一个php扩展

1。只支持UTF-8编码。【源码无需修改就能在各种平台下编译使用,加载完20万的词条,内存占用稳定为14M】
2。mmseg四种过滤算法,分词准确率达到了98.41%。
3。支持自定义词库。在friso源码附件的dict文件夹下,可以随便添加/删除/更改词库和词库词条,并且对词库进行了分类。
4。词库使用了friso的Java版本jcseg的简化词库。
5。支持中英/英中混合词的识别。例如:卡拉ok, 漂亮mm, c语言,IC卡。
7。很好的英文支持:英文和标点的组合词识别(例如:c++, C#, g++),电子邮件,网址,小数,分数,百分数。
8。支持阿拉伯数字基本单字单位的识别,例如2012年,5吨,120斤。
9。自动英文圆角/半角,大写/小写转换。
10。自动同义词追加, 同义词匹配。
11。自动停止词过滤。

Friso 1.6.3 发布,纯 C 开发的中文分词器
Friso-1.6.3 发布了。Friso 是使用 ANSI C 语言开发的一款开源中文分词器,使用流行的 mmseg 算法实现。完全基于模块化设计和实现,可以很方便的植入其他程序中,例如:MySQL,PHP,源码无需修改就能在各种平台下编译使用,同时支持对 UTF-8/GBK 编码的切分。Friso 1.6.3 更新如下:支持 php7 扩展修复 php5 扩展的内存错误

发布于 2017-09-07 04:19:21 | 229 次阅读

Friso 1.6.2 发布,纯 C 开发的中文分词器
Friso-1.6.2 发布了。Friso 是使用 ANSI C 语言开发的一款开源中文分词器,使用流行的 mmseg 算法实现。完全基于模块化设计和实现,可以很方便的植入其他程序中,例如:MySQL,PHP,源码无需修改就能在各种平台下编译使用,同时支持对 UTF-8/GBK 编码的切分。已经有网友将其集成到了mysql做全文检索:http://www.onexsoft.c

发布于 2016-12-26 03:29:26 | 140 次阅读

friso-1.6.1 发布 - C语言高性能中文分词器-检测模式切分
Friso是使用c语言开发的一款开源中文分词器,使用流行的mmseg算法实现。完全基于模块化设计和实现,可以很方便的植入其他程序中,例如:MySQL,PHP,源码无需修改就能在各种平台下编译使用,同时支持对UTF-8/GBK编码的切分.

发布于 2014-07-23 02:48:33 | 278 次阅读


Copyright © 2007-2017 PHPERZ.COM All Rights Reserved   冀ICP备14009818号  版权声明  广告服务