文章详情页

Python jieba结巴分词原理及用法解析

浏览：3日期：2022-07-06 11:58:45

1、简要说明

结巴分词支持三种分词模式，支持繁体字，支持自定义词典

2、三种分词模式

全模式：把句子中所有的可以成词的词语都扫描出来, 速度非常快，但是不能解决歧义

精简模式：把句子最精确的分开，不会添加多余单词，看起来就像是把句子分割一下

搜索引擎模式：在精简模式下，对长词再度切分

# -*- encoding=utf-8 -*-import jiebaif __name__ == ’__main__’: str1 = ’我去北京天安门广场跳舞’ a = jieba.lcut(str1, cut_all=True) # 全模式 print(’全模式:{}’.format(a)) b = jieba.lcut(str1, cut_all=False) # 精简模式 print(’精简模式:{}’.format(b)) c = jieba.lcut_for_search(str1) # 搜索引擎模式 print(’搜索引擎模式:{}’.format(c))

运行

Python jieba结巴分词原理及用法解析

3、某个词语不能被分开

# -*- encoding=utf-8 -*-import jiebaif __name__ == ’__main__’: str1 = ’桃花侠大战菊花怪’ b = jieba.lcut(str1, cut_all=False) # 精简模式 print(’精简模式:{}’.format(b)) # 如果不把桃花侠分开 jieba.add_word(’桃花侠’) d = jieba.lcut(str1) # 默认是精简模式 print(d)

运行

Python jieba结巴分词原理及用法解析

4、某个单词必须被分开

# -*- encoding=utf-8 -*-import jiebaif __name__ == ’__main__’: # HMM参数，默认为True ’’’HMM 模型，即隐马尔可夫模型（Hidden Markov Model, HMM），是一种基于概率的统计分析模型，用来描述一个系统隐性状态的转移和隐性状态的表现概率。在 jieba 中，对于未登录到词库的词，使用了基于汉字成词能力的 HMM 模型和 Viterbi 算法，其大致原理是：采用四个隐含状态，分别表示为单字成词，词组的开头，词组的中间，词组的结尾。通过标注好的分词训练集，可以得到 HMM 的各个参数，然后使用 Viterbi 算法来解释测试集，得到分词结果。 ’’’ str1 = ’桃花侠大战菊花怪’ b = jieba.lcut(str1, cut_all=False, HMM=False) # 精简模式，且不使用HMM模型 print(’精简模式:{}’.format(b)) # 分开大战为大和战 jieba.suggest_freq((’大’, ’战’), True) e = jieba.lcut(str1, HMM=False) # 不使用HMM模型 print(’分开:{}’.format(e))

运行

Python jieba结巴分词原理及用法解析

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持好吧啦网。

Python 编程

上一条：Python Pandas数据分析工具用法实例下一条：Python根据字符串调用函数过程解析

相关文章：

1. WMLScript的语法基础2. 得到XML文档大小的方法3. 轻松学习XML教程4. HTML <!DOCTYPE> 标签5. 详解CSS伪元素的妙用单标签之美6. html清除浮动的6种方法示例7. asp批量添加修改删除操作示例代码8. XML入门精解之结构与语法9. ASP中解决“对象关闭时,不允许操作。”的诡异问题……10. css进阶学习选择符

排行榜

					
					Docker容器如何更新打包并上传到阿里云
IntelliJ IDEA 统一设置编码为utf-8编码的实现
Python协程asyncio模块的演变及高级用法
IntelliJ IDEA设置条件断点的方法步骤
php相对路径转化成绝对路径
python 实现"神经衰弱"翻牌游戏
spring+mybatis实现图书管理系统
phpstudy apache开启ssi使用详解
详解CSS伪元素的妙用单标签之美
得到XML文档大小的方法
asp知识整理笔记4（问答模式）
				

热门标签