Python中文分词工具之结巴分词用法实例总结【经典案例】
Python  /  管理员 发布于 7年前   196
本文实例讲述了Python中文分词工具之结巴分词用法。分享给大家供大家参考,具体如下:
结巴分词工具的安装及基本用法,前面的文章《Python结巴中文分词工具使用过程中遇到的问题及解决方法》中已经有所描述。这里要说的内容与实际应用更贴近――从文本中读取中文信息,利用结巴分词工具进行分词及词性标注。
示例代码如下:
#coding=utf-8import jiebaimport jieba.posseg as psegimport timet1=time.time()f=open("t_with_splitter.txt","r") #读取文本string=f.read().decode("utf-8")words = pseg.cut(string) #进行分词result="" #记录最终结果的变量for w in words: result+= str(w.word)+"/"+str(w.flag) #加词性标注f=open("t_with_POS_tag.txt","w") #将结果保存到另一个文档中f.write(result)f.close()t2=time.time()print("分词及词性标注完成,耗时:"+str(t2-t1)+"秒。") #反馈结果其中t_with_splitter.txt文件内容如下:
是国内专业的网站建设资源、脚本编程学习类网站,提供asp、php、asp.net、javascript、jquery、vbscript、dos批处理、网页制作、网络编程、网站建设等编程资料。
Python2.7.9平台运行后出现如下图所示的错误提示:
查阅相关资料后发现,需要在开头加上:
import sysreload(sys)sys.setdefaultencoding( "utf-8" )
最终代码应为:
#coding=utf-8import jiebaimport jieba.posseg as psegimport timeimport sysreload(sys)sys.setdefaultencoding( "utf-8" )t1=time.time()f=open("t_with_splitter.txt","r") #读取文本string=f.read().decode("utf-8")words = pseg.cut(string) #进行分词result="" #记录最终结果的变量for w in words: result+= str(w.word)+"/"+str(w.flag) #加词性标注f=open("t_with_POS_tag.txt","w") #将结果保存到另一个文档中f.write(result)f.close()t2=time.time()print("分词及词性标注完成,耗时:"+str(t2-t1)+"秒。") #反馈结果运行成功:
Editplus打开t_with_POS_tag.txt文件如下图所示:
更多关于Python相关内容可查看本站专题:《Python字典操作技巧汇总》、《Python字符串操作技巧汇总》、《Python常用遍历技巧总结》、《Python数据结构与算法教程》、《Python函数使用技巧总结》及《Python入门与进阶经典教程》
希望本文所述对大家Python程序设计有所帮助。
122 在
学历:一种延缓就业设计,生活需求下的权衡之选中评论 工作几年后,报名考研了,到现在还没认真学习备考,迷茫中。作为一名北漂互联网打工人..123 在
Clash for Windows作者删库跑路了,github已404中评论 按理说只要你在国内,所有的流量进出都在监控范围内,不管你怎么隐藏也没用,想搞你分..原梓番博客 在
在Laravel框架中使用模型Model分表最简单的方法中评论 好久好久都没看友情链接申请了,今天刚看,已经添加。..博主 在
佛跳墙vpn软件不会用?上不了网?佛跳墙vpn常见问题以及解决办法中评论 @1111老铁这个不行了,可以看看近期评论的其他文章..1111 在
佛跳墙vpn软件不会用?上不了网?佛跳墙vpn常见问题以及解决办法中评论 网站不能打开,博主百忙中能否发个APP下载链接,佛跳墙或极光..
Copyright·© 2019 侯体宗版权所有·
粤ICP备20027696号
