python正则表达式---基于re模块
(.*?)', html, re.S)if result: print(result.group(1), result.group(2)) ', content, re.S)print(result.group()) (.*?).*?year">(.*?).*?', re.S)results = re.findall(pattern, content)for result in results: url, name, author, date = result author = re.sub('\s', '', author) date = re.sub('\s', '', date) print(url, name, author, date)
发布日期:2021-08-22 06:43:11
浏览次数:9
分类:技术文章
本文共 3227 字,大约阅读时间需要 10 分钟。
正则表达式是很通用的一套规则,而本文是基于python的re模型的实现,来讲解正则表达式的语法。常见的正则表达式如图:
我们讲讲python中re模块常用的方法。
1、re.match()(其实,最好用re.search(),能完全替换re.match())
re.match()方法尝试从第一个起始位置匹配一个模型,如果不是起始位置匹配成功的化,返回none
1.1、常规匹配
content = 'Hello 123 4567 World_This is a Regex Demo'result = re.match('^Hello\s\d\d\d\s\d{4}\s\w{10}.*Demo$', content)print(result)print(result.group()) #group()方法返回字符串
1.2、泛匹配
content = 'Hello 123 4567 World_This is a Regex Demo'result = re.match('^Hello.*Demo$$', content)print(result.group())
1.3、匹配目标
content = 'Hello 123 4567 World_This is a Regex Demo'result = re.match('.*(\d{3}\s\d{4}).*', content) #小括号()表示要返回的目标print(result.group(1))
1.4、贪婪匹配,匹配尽可能多的字符
content = 'Hello 1234567 World_This is a Regex Demo'result = re.match('^He.*(\d+).*$', content)print(result.group(1))
1.5、非贪婪匹配,匹配尽可能少的字符,例如看到后面是匹配数字的规则了,就停止前面的匹配
content = 'Hello 1234567 World_This is a Regex Demo'result = re.match('^He.*?(\d+).*$', content)print(result.group(1))
1.6、匹配模式
content = '''Hello 1234567 World_Thisis a Regex Demo'''#如果不使用re.S参数,则只在每一行内进行匹配,如果一行没有,就换下一行重#新开始,不会跨行。而使用re.S参数以后,正则表达式会将这个字符串作为一个整#体,将“\n”当做一个普通的字符加入到这个字符串中,在整体中进行匹配。result = re.match('^He.*?(\d+).*?Demo$', content, re.S)print(result.group(1))'''####1.7、转义```python#尽量使用泛匹配、使用括号得到匹配目标、尽量使用非贪婪模型、有换行符就是要re.Scontent = 'price is $5.00'result = re.match('price is \$5\.00', content)print(result)
2、re.search()
re.search()扫描整个字符串并返回第一个成功的匹配,能用search不用match。
#尽量使用泛匹配、使用括号得到匹配目标、尽量使用非贪婪模型、有换行符就是要re.Scontent = 'Hello 1234567 World_This is a Regex Demo'result = re.match('Hello.*?(\d+).*', content)print(result.group(1))html = ''' '''result = re.search('
3、re.findall()
re.findall()以列表的形式返回全部能匹配的子串
results = re.findall('(.*?)', html, re.S)print(results)
4、re.sub()
re.sub()替换字符串中每一个匹配的子串后返回替换后的字符串
content = 'Hello 1234567 World_This is a Regex Demo'content = re.sub('\d+', 'replacement', content)print(content)
5、re.compile()
re.compile()将正则字符串编译成正则表达式对象,以便于复用该匹配模式
content = 'Hello 1234567 World_This is a Regex Demo'pattern = re.compile('Hello.*Demo')result = re.match(pattern, content)print(result)#下面示范一个取整个文本一段文字的例子content = ''' '''result = re.search('
6、实战演练
import requestsimport recontent = requests.get('https://book.douban.com/').text#为什么要先截出来一部分,因为如果整个用pattern匹配太慢了。。content = re.search('', content, re.S).group()pattern = re.compile('
结果如下:
转载地址:https://blog.csdn.net/weixin_33738555/article/details/89590475 如侵犯您的版权,请留言回复原文章的地址,我们会给您删除此文章,给您带来不便请您谅解!
发表评论
最新留言
第一次来,支持一个
[***.219.124.196]2024年03月06日 10时10分15秒
关于作者
喝酒易醉,品茶养心,人生如梦,品茶悟道,何以解忧?唯有杜康!
-- 愿君每日到此一游!
推荐文章
下列不属于java语言特点的是_下列选项中,不属于Java语言特点的一项是( )。...
2019-04-21
java中小数的乘法_javascript的小数点乘法除法实例
2019-04-21
kappa一致性检验教程_SPSS在线_SPSSAU_Kappa一致性检验
2019-04-21
linux shell mysql备份_linux shell 备份mysql 数据库
2019-04-21
Java双向链表时间复杂度_链表是什么?有多少种链表?时间复杂度是?
2019-04-21
unity3d能和java系统整合吗_Android与Unity3d的整合
2019-04-21
minecraft666java_我的世界的666的世界
2019-04-21
辽宁师范大学java_辽宁师范大学心理学院
2019-04-21
java程序有连接数据库_Java程序连接数据库
2019-04-21
java reduce.mdn_reduce高级用法
2019-04-21
java shape用法_Java PShape.scale方法代码示例
2019-04-21
java字符串三目_java字符串连接运算符和三目运算符
2019-04-21
java 堆内存 非堆内存_JVM 堆内存和非堆内存
2019-04-21
Java新手写什么demo_通过入门demo简单了解netty使用方法
2019-04-21
java图片延迟加载_jQuery实现图片延迟加载
2019-04-21
java开发加入购物车功能_java web开发——购物车功能实现
2019-04-21
Java虚拟机不能满足_深入理解Java虚拟机--读书笔记1/3
2019-04-21