文章详情页

python - 如何正则字符串中的所有汉字

浏览：63日期：2022-06-28 10:06:59

问题描述

这样算吗？121238asdf<img src='https://imgsa.baidu.com/forum/w%3D580/sign=da0493cd90ef76c6d0d2fb23ad14fdf6/e483aa4bd11373f0bddb2e73a40f4bfbf9ed04b1.jpg' height='420'>

字符串如上，类型是’str’，要正则获得汉字。我之前使用[u4e00-u9fa5]结果获得的还是英文，符号跟数字的list。求教导正确姿势。另外说说我哪里写错了..

pattern = re.compile(r’[u4E00-u9FA5]’)print pattern.findall(x[1])

这是我写的...但是返回结果就没有汉字，反而是除汉字外的其他字符。

问题解答

回答1：

我这里假设你需要匹配的文本为s：

pattern = re.compile(ur'[u4e00-u9fa5]')print pattern.findall(s.decode(’utf8’))

这里的decode(’utf8’)是怕s的值为类似x66x77x88这样的Unicode散列。另外，需要注意compile()中ur修饰符，u为Unicode修饰符。

PS：我是从这篇文章得到的启发。

Update

刚才看了下楼下说的，确实用Python 3就不存在输出为Unicode散列的情况了，以下摘自此处

Unicode 字符串

在Python2中，普通字符串是以8位ASCII码进行存储的，而Unicode字符串则存储为16位unicode字符串，这样能够表示更多的字符集。使用的语法是在字符串前面加上前缀 u。

在Python3中，所有的字符串都是Unicode字符串。

回答2：

你用的是python2，uxxxx是unicode字符，匹配后得到的是字节串，print出来是各个字节值。

换python3 就没这个问题了

Python 编程

上一条：python - Django ModelSerializer 如何POST提交非Models中定义、关联表中的字段？下一条：python - 网页title中包含换行，如何用正则表达式提取出来？

相关文章：

1. mysql服务无法启动1067错误，谁知道正确的解决方法？2. 视频 - html5 video的autoplay 在智能手機上不運作？3. python - Django问题 ’WSGIRequest’ object has no attribute ’user’4. mysql输入账号密码后跳出一大堆内容后但却进不了mysql？5. javascript - nodejs中使用request库怎么抓取网页中的图片6. javascript - H5页面无缝轮播7. .......8. javascript - jquery选择的dom元素如何更新？9. 数据库 - mysql boolean型无法插入true10. python - flask jinjia2 中怎么定义嵌套变量

排行榜

					
					mysql输入账号密码后跳出一大堆内容后但却进不了mysql？
java-ee - JAVA Non-static method cannot be referenced
数据库 - mysql boolean型无法插入true
算法 - 如何不用递归 列出 树（多叉） 中根节点到叶节点的所有路径（Java）
javascript - jquery选择的dom元素如何更新？
视频 - html5 video的autoplay 在智能手機上不運作？
mysql服务无法启动1067错误，谁知道正确的解决方法？
如何去实现memcache的gui？
javascript - nodejs统计对应ip地址的对某个接口的请求次数
javascript - nodejs中使用request库怎么抓取网页中的图片
java - Spring boot 改成war后部署到本地的tomcat上,无法访问项目
				

热门标签