python正则表达式---基于re模块
发布日期:2021-08-22 06:43:11 浏览次数:9 分类:技术文章

本文共 3227 字,大约阅读时间需要 10 分钟。

正则表达式是很通用的一套规则,而本文是基于python的re模型的实现,来讲解正则表达式的语法。常见的正则表达式如图:

img_5340e97b9204ced01f6ec36c1fddf4a9.png

我们讲讲python中re模块常用的方法。

1、re.match()(其实,最好用re.search(),能完全替换re.match())

re.match()方法尝试从第一个起始位置匹配一个模型,如果不是起始位置匹配成功的化,返回none

1.1、常规匹配

content = 'Hello 123 4567 World_This is a Regex Demo'result = re.match('^Hello\s\d\d\d\s\d{4}\s\w{10}.*Demo$', content)print(result)print(result.group()) #group()方法返回字符串

1.2、泛匹配

content = 'Hello 123 4567 World_This is a Regex Demo'result = re.match('^Hello.*Demo$$', content)print(result.group())

1.3、匹配目标

content = 'Hello 123 4567 World_This is a Regex Demo'result = re.match('.*(\d{3}\s\d{4}).*', content) #小括号()表示要返回的目标print(result.group(1))

1.4、贪婪匹配,匹配尽可能多的字符

content = 'Hello 1234567 World_This is a Regex Demo'result = re.match('^He.*(\d+).*$', content)print(result.group(1))

1.5、非贪婪匹配,匹配尽可能少的字符,例如看到后面是匹配数字的规则了,就停止前面的匹配

content = 'Hello 1234567 World_This is a Regex Demo'result = re.match('^He.*?(\d+).*$', content)print(result.group(1))

1.6、匹配模式

content = '''Hello 1234567 World_Thisis a Regex Demo'''#如果不使用re.S参数,则只在每一行内进行匹配,如果一行没有,就换下一行重#新开始,不会跨行。而使用re.S参数以后,正则表达式会将这个字符串作为一个整#体,将“\n”当做一个普通的字符加入到这个字符串中,在整体中进行匹配。result = re.match('^He.*?(\d+).*?Demo$', content, re.S)print(result.group(1))'''####1.7、转义```python#尽量使用泛匹配、使用括号得到匹配目标、尽量使用非贪婪模型、有换行符就是要re.Scontent = 'price is $5.00'result = re.match('price is \$5\.00', content)print(result)

2、re.search()

re.search()扫描整个字符串并返回第一个成功的匹配,能用search不用match。

#尽量使用泛匹配、使用括号得到匹配目标、尽量使用非贪婪模型、有换行符就是要re.Scontent = 'Hello 1234567 World_This is a Regex Demo'result = re.match('Hello.*?(\d+).*', content)print(result.group(1))html = '''

经典老歌

经典老歌列表

'''result = re.search('
(.*?)', html, re.S)if result: print(result.group(1), result.group(2))

3、re.findall()

re.findall()以列表的形式返回全部能匹配的子串

results = re.findall('
(.*?)', html, re.S)print(results)

4、re.sub()

re.sub()替换字符串中每一个匹配的子串后返回替换后的字符串

content = 'Hello 1234567 World_This is a Regex Demo'content = re.sub('\d+', 'replacement', content)print(content)

5、re.compile()

re.compile()将正则字符串编译成正则表达式对象,以便于复用该匹配模式

content = 'Hello 1234567 World_This is a Regex Demo'pattern = re.compile('Hello.*Demo')result = re.match(pattern, content)print(result)#下面示范一个取整个文本一段文字的例子content = '''

经典老歌

经典老歌列表

'''result = re.search('
', content, re.S)print(result.group())

6、实战演练

import requestsimport recontent = requests.get('https://book.douban.com/').text#为什么要先截出来一部分,因为如果整个用pattern匹配太慢了。。content = re.search('
    .*?
', content, re.S).group()pattern = re.compile('
(.*?).*?year">(.*?).*?', re.S)results = re.findall(pattern, content)for result in results: url, name, author, date = result author = re.sub('\s', '', author) date = re.sub('\s', '', date) print(url, name, author, date)

结果如下:

img_5101c299d54e984bd66c3aba32f520cb.png

转载地址:https://blog.csdn.net/weixin_33738555/article/details/89590475 如侵犯您的版权,请留言回复原文章的地址,我们会给您删除此文章,给您带来不便请您谅解!

上一篇:02 决策树 - 初识与构建
下一篇:解决Android Studio运行时报Error:java.lang.NullPointerException (no error message)错误

发表评论

最新留言

第一次来,支持一个
[***.219.124.196]2024年03月06日 10时10分15秒

关于作者

    喝酒易醉,品茶养心,人生如梦,品茶悟道,何以解忧?唯有杜康!
-- 愿君每日到此一游!

推荐文章

java httpclient 进度条_如何使用Apache HttpClient 4获取文件上传的进度条? 2019-04-21
下列不属于java语言特点的是_下列选项中,不属于Java语言特点的一项是( )。... 2019-04-21
java中小数的乘法_javascript的小数点乘法除法实例 2019-04-21
kappa一致性检验教程_SPSS在线_SPSSAU_Kappa一致性检验 2019-04-21
linux shell mysql备份_linux shell 备份mysql 数据库 2019-04-21
Java双向链表时间复杂度_链表是什么?有多少种链表?时间复杂度是? 2019-04-21
unity3d能和java系统整合吗_Android与Unity3d的整合 2019-04-21
minecraft666java_我的世界的666的世界 2019-04-21
辽宁师范大学java_辽宁师范大学心理学院 2019-04-21
java程序有连接数据库_Java程序连接数据库 2019-04-21
java reduce.mdn_reduce高级用法 2019-04-21
java shape用法_Java PShape.scale方法代码示例 2019-04-21
java字符串三目_java字符串连接运算符和三目运算符 2019-04-21
java 堆内存 非堆内存_JVM 堆内存和非堆内存 2019-04-21
Java新手写什么demo_通过入门demo简单了解netty使用方法 2019-04-21
java国际化bundle_java语言国际化--ResouceBundle、struts 2019-04-21
java图片延迟加载_jQuery实现图片延迟加载 2019-04-21
java开发加入购物车功能_java web开发——购物车功能实现 2019-04-21
Java虚拟机不能满足_深入理解Java虚拟机--读书笔记1/3 2019-04-21
python 协程 asyncio_python – asyncio.as_completed是否会产生期货或协同程序? 2019-04-21