Python中文分词工具之结巴分词用法实例总结【经典案例】

这里有新鲜出炉的 Python3 官方中文指南，程序狗速度看过来！

Python 编程语言

Python 是一种面向对象、解释型计算机程序设计语言，由 Guido van Rossum 于 1989 年底发明，第一个公开发行版发行于 1991 年。Python 语法简洁而清晰，具有丰富和强大的类库。它常被昵称为胶水语言，它能够把用其他语言制作的各种模块（尤其是 C/C++）很轻松地联结在一起。

这篇文章主要介绍了 Python 中文分词工具之结巴分词用法, 结合实例形式总结分析了 Python 针对中文文件的读取与分词操作过程中遇到的问题与解决方法, 需要的朋友可以参考下

本文实例讲述了 Python 中文分词工具之结巴分词用法。分享给大家供大家参考，具体如下：

结巴分词工具的安装及基本用法，前面的文章《Python 结巴中文分词工具使用过程中遇到的问题及解决方法》中已经有所描述。这里要说的内容与实际应用更贴近——从文本中读取中文信息，利用结巴分词工具进行分词及词性标注。

示例代码如下：

#coding = utf - 8 import jieba import jieba.posseg as pseg import time t1 = time.time() f = open("t_with_splitter.txt", "r")#读取文本string = f.read().decode("utf-8") words = pseg.cut(string)#进行分词result = ""#记录最终结果的变量
for w in words: result += str(w.word) + "/" + str(w.flag)#加词性标注f = open("t_with_POS_tag.txt", "w")#将结果保存到另一个文档中f.write(result) f.close() t2 = time.time() print("分词及词性标注完成，耗时：" + str(t2 - t1) + "秒。")#反馈结果

其中 t_with_splitter.txt 文件内容如下：

PHPERZ是国内专业的网站建设资源、脚本编程学习类网站，提供asp、php、asp.net、javascript、jquery、vbscript、dos批处理、网页制作、网络编程、网站建设等编程资料。

Python2.7.9 平台运行后出现如下图所示的错误提示：

查阅相关资料后发现，需要在开头加上：

import sys reload(sys) sys.setdefaultencoding("utf-8")

最终代码应为：

#coding = utf - 8 import jieba import jieba.posseg as pseg import time import sys reload(sys) sys.setdefaultencoding("utf-8") t1 = time.time() f = open("t_with_splitter.txt", "r")#读取文本string = f.read().decode("utf-8") words = pseg.cut(string)#进行分词result = ""#记录最终结果的变量
for w in words: result += str(w.word) + "/" + str(w.flag)#加词性标注f = open("t_with_POS_tag.txt", "w")#将结果保存到另一个文档中f.write(result) f.close() t2 = time.time() print("分词及词性标注完成，耗时：" + str(t2 - t1) + "秒。")#反馈结果

运行成功：

Editplus 打开 t_with_POS_tag.txt 文件如下图所示：

希望本文所述对大家 Python 程序设计有所帮助。

来源: http://www.phperz.com/article/17/0714/334320.html

与本文相关文章

暂无,快来抢沙发吧！