最近在使用 Python 的时候遇到过文档中出现控制字符报错的问题。想着总结一下,方便以后需要或这同样遇到问题的朋友,下面这篇文章主要介绍了 Python 处理文本文件中控制字符的解决方法, 需要的朋友可以参考借鉴。
Python 是一种面向对象、解释型计算机程序设计语言,由 Guido van Rossum 于 1989 年底发明,第一个公开发行版发行于 1991 年。Python 语法简洁而清晰,具有丰富和强大的类库。它常被昵称为胶水语言,它能够把用其他语言制作的各种模块(尤其是 C/C++)很轻松地联结在一起。
控制字符
控制字符(Control Character),或者说非打印字符,出现于特定的信息文本中,表示某一控制功能的字符,如控制符:LF(换行)、CR(回车)、FF(换页)、DEL(删除)、BS(退格)、BEL(振铃)等;通讯专用字符:SOH(文头)、EOT(文尾)、ACK(确认)等。
具体控制字符一共有下面两个集合:
七位 ASCII 定义了 33 个代码作为控制字符,它们是 0 到 31、以及 127,(位于 0x00-0x1F 及 0x7F)。
兼容的八位 ISO/IEC 8859-1 加上了从 ISO/IEC 6429 定义的从 128 到 159 的 32 个代码,位于 0x80-0x9F。
控制字符列表:http://ascii-table.com/control-chars.php
Python 解决控制字符的方案:(未一一验证)
方案一:
- strip_control_characters = lambda s: "".join(i
- for i in s
- if 31 < ord(i) < 127)
方案二:
- def strip_control_characters(str_input):
- if str_input:
- import re
- # unicode invalid characters
- RE_XML_ILLEGAL = u'([\u0000-\u0008\u000b-\u000c\u000e-\u001f\ufffe-\uffff])' + \
- u'|' + \
- u'([%s-%s][^%s-%s])|([^%s-%s][%s-%s])|([%s-%s]$)|(^[%s-%s])' % \
- (unichr(0xd800),unichr(0xdbff),unichr(0xdc00),unichr(0xdfff),
- unichr(0xd800),unichr(0xdbff),unichr(0xdc00),unichr(0xdfff),
- unichr(0xd800),unichr(0xdbff),unichr(0xdc00),unichr(0xdfff),
- )
- str_input = re.sub(RE_XML_ILLEGAL, "", input)
- # ascii control characters
- str_input = re.sub(r"[\x01-\x1F\x7F]", "", input)
- return str_input
方案三:
- import re
- def remove_control_chars(s):
- control_chars = ''.join(map(unichr, range(0,32) + range(127,160)))
- control_char_re = re.compile('[%s]' % re.escape(control_chars))
- return control_char_re.sub('', s)
- cleaned_json = remove_control_chars(original_json)
- obj = simplejson.loads(cleaned_json)
总结
来源: http://www.phperz.com/article/17/0310/324836.html