Python中文分词工具之结巴分词用法实例总结【经典案例】

小鱼们欢快的闹腾起来，有的甩动着尾巴，有的吐着泡泡，有的扭动着身体，互相追玩，好不热闹。春天来了！你看，融化的冰水把小溪弄醒了。 "丁粳、丁粳 "，它就像大自然的神奇歌手，唱着清脆悦耳的歌，向前奔流……

本文实例讲述了Python中文分词工具之结巴分词用法。分享给大家供大家参考，具体如下：

结巴分词工具的安装及基本用法，前面的文章《Python结巴中文分词工具使用过程中遇到的问题及解决方法》中已经有所描述。这里要说的内容与实际应用更贴近——从文本中读取中文信息，利用结巴分词工具进行分词及词性标注。

示例代码如下：

#coding=utf-8
import jieba
import jieba.posseg as pseg
import time
t1=time.time()
f=open("t_with_splitter.txt","r") #读取文本
string=f.read().decode("utf-8")
words = pseg.cut(string) #进行分词
result="" #记录最终结果的变量
for w in words:
   result+= str(w.word)+"/"+str(w.flag) #加词性标注
f=open("t_with_POS_tag.txt","w") #将结果保存到另一个文档中
f.write(result)
f.close()
t2=time.time()
print("分词及词性标注完成，耗时："+str(t2-t1)+"秒。") #反馈结果

其中t_with_splitter.txt文件内容如下：

是国内专业的网站建设资源、脚本编程学习类网站，提供asp、php、asp.net、javascript、jquery、vbscript、dos批处理、网页制作、网络编程、网站建设等编程资料。

Python2.7.9平台运行后出现如下图所示的错误提示：

查阅相关资料后发现，需要在开头加上：

import sys
reload(sys)
sys.setdefaultencoding( "utf-8" )

最终代码应为：

#coding=utf-8
import jieba
import jieba.posseg as pseg
import time
import sys
reload(sys)
sys.setdefaultencoding( "utf-8" )
t1=time.time()
f=open("t_with_splitter.txt","r") #读取文本
string=f.read().decode("utf-8")
words = pseg.cut(string) #进行分词
result="" #记录最终结果的变量
for w in words:
   result+= str(w.word)+"/"+str(w.flag) #加词性标注
f=open("t_with_POS_tag.txt","w") #将结果保存到另一个文档中
f.write(result)
f.close()
t2=time.time()
print("分词及词性标注完成，耗时："+str(t2-t1)+"秒。") #反馈结果

运行成功：

Editplus打开t_with_POS_tag.txt文件如下图所示：

希望本文所述对大家Python程序设计有所帮助。

到此这篇关于Python中文分词工具之结巴分词用法实例总结【经典案例】就介绍到这了。无论是苦心找寻，还是途中偶遇，那些美好的人与事，都要倍加珍惜，别奢望下一站还有原样的风景，错过的东西或许就是无期。有缘无份是一种托辞，只因我们还不够努力；败事在天亦是一种慰藉，只要是无怨无悔，就算完败也不言放弃。放下了别落泪，转身了莫回首，把苦痛埋心底，让往事吹风里。更多相关Python中文分词工具之结巴分词用法实例总结【经典案例】内容请查看相关栏目，小编编辑不易，再次感谢大家的支持！

全站频道

大家都在搜索：