当前位置：主页 > 查看内容

正则表达式+Python re模块详解

发布时间：2021-04-08 00:00| 有位朋友查看

简介：正则表达式（Regluar Expressions）又称规则表达式，在代码中常简写为REs，regexes或regexp（regex patterns）。它本质上是一个小巧的、高度专用的编程语言。通过正则表达式可以对指定的文本实现匹配测试、内容查找、内容替换、字符串分割等功能。 re模块……

正则表达式（Regluar Expressions）又称规则表达式，在代码中常简写为REs，regexes或regexp（regex patterns）。它本质上是一个小巧的、高度专用的编程语言。通过正则表达式可以对指定的文本实现
匹配测试、内容查找、内容替换、字符串分割等功能。

re模块介绍

Python中的re模块提供了一个正则表达式引擎接口，它允许我们将正则表达式编译成模式对象，然后通过这些模式对象执行模式匹配搜索和字符串分割、子串替换等操作。re模块为这些操作分别提供了模块级别的函数以及相关类的封装。

正则表达式一些小规则

①元字符

②量词

③贪婪和非贪婪匹配

    总是在量词范围内尽量多匹配 - 贪婪
    总是在量词范围内尽量少匹配 - 惰性
    .*?x 匹配任意内容任意次数遇到x就停止
    .+?x 匹配任意内容至少1次遇到x就停止

④转义符问题

    . 有特殊的意义,取消特殊的意义\
    取消一个元字符的特殊意义有两种方法
    在这个元字符前面加 \
     对一部分字符生效,把这个元字符放在字符组里
    [.()+?*]

Python --> re模块

findall
        会优先显示分组内的内容
        *****取消优先显示(?:正则)
search
        只能返回第一个符合条件的项
        得到的结果需要.group取值
        默认获取完整的匹配结果
        通过group(n)取第n个分组中的内容

# search 还是按照完整的正则进行匹配,显示也显示匹配到的第一个内容,但是我们可以通过给group方法传参数
# 来获取具体文组中的内容
ret = re.search('9(\d)(\d)','19740ash93010uru')
print(ret) # 变量 -- > <re.Match object; span=(1, 4), match='974'>
if ret:
  print(ret.group()) # --> 974
  print(ret.group(1)) # --> 7
  print(ret.group(2)) # --> 4

# findall
  # 取所有符合条件的,优先显示分组中的
# search 只取第一个符合条件的,没有优先显示这件事儿
  # 得到的结果是一个变量
    # 变量.group() 的结果 完全和 变量.group(0)的结果一致
    # 变量.group(n) 的形式来指定获取第n个分组中匹配到的内容

# 加上括号 是为了对真正需要的内容进行提取
ret = re.findall('<\w+>(\w+)</\w+>','<h1>askh930s02391j192agsj</h1>')
print(ret) # --> ['askh930s02391j192agsj']

其他的内容在代码中有详细的注释，大家可以复制我的代码一步一步运行然后实验

以下的内容有：split sub subn math,compile,finditer

# split sub subn math,compile,finditer
# split
res = re.split('\d+', "cyx123456cyxx")
print(res) # --> ['cyx', 'cyxx']
res = re.split('(\d+)', "cyx123456cyxx") # 保留分组
print(res) # --> ['cyx', '123456', 'cyxx']
# sub 替换
res = re.sub('\d+', '我把数字替换了',
       "cyx123456cyxxx123456") # 默认全部替换，当然也可以替换一次re.sub('\d+','我把数字替换了',"cyx123456cyxxx123456"，1)
print(res) # --> cyx我把数字替换了cyxxx我把数字替换了
# subn 替换了并显示替换的次数
res = re.subn('\d+', '我把数字替换了', "cyx123456cyxxx123456")
print(res) # --> ('cyx我把数字替换了cyxxx我把数字替换了', 2)
# match 这个就相当与加了个^ (和search差不多) --> 主要用来规定这个字符号必须是什么样的
res = re.match('\d+', 'cyx123456cyxxx')
print(res) # --> None
res = re.match('\d+', '123cyx456cyxxx')
print(res.group()) # --> 123
# compile -- 节省代码的时间的工具
# 假如同一个正则表达式要被使用多次
# 节省了多次解析同一个正则表达式的时间
ret = re.compile("\d+")
res = ret.search("cyx12456cyxXX123")
print(res.group()) # --> 12456
# finditer --> 节省空间
ret = re.finditer("\d+", "cyx123456cyxxx125644")
for r in ret:
  print(r.group()) # --> 123456
  # 125644
# 怎么又节省时间又节省空间呢？
ret = re.compile('\d+')
res = ret.finditer("cyx222231fddsf45746sdf2123sdf56456sdf10123sdf123132sdf")
for r in res:
  print(r.group())
"""
222231
45746
2123
56456
10123
123132
"""
# 分组命名(?P<组名>正则) (?P=组名)
# 有的时候我们要匹配的内容是包含在不想要的内容之中的,
# 只能先把不想要的内容匹配出来,然后再想办法从结果中去掉
# 分组命名的用法 (找两个组里面是一样的内容)
exp = '<abc>asdasf54545645698asdasd</abc>00545sdfsdf</abd>'
ret = re.search('<(?P<tag>\w+)>.*?</(?P=tag)', exp)
print(ret) # -- > <re.Match object; span=(0, 33), match='<abc>asdasf54545645698asdasd</abc'>
# exp2：
import re
ret = re.search('\d(\d)\d(\w+?)(\d)(\w)\d(\d)\d(?P<name1>\w+?)(\d)(\w)\d(\d)\d(?P<name2>\w+?)(\d)(\w)',
        '123abc45678agsf_123abc45678agsf123abc45678agsf')
print(ret.group('name1')) # -- > agsf_123abc
print(ret.group('name2')) # -- > agsf

今日小思考

当我们有一个这样的列表：

lis = ['', 'z', 'c', 'asd', 'sdf', '', 'asd']

那么我们如何将里面的空字符删除呢？

ret = filter(lambda n: n, lis)
print(list(ret)) # --> ['z', 'c', 'asd', 'sdf', 'asd']

总结

到此这篇关于正则表达式+Python re模块详解的文章就介绍到这了,更多相关正则表达式 python re模块内容请搜索站长技术以前的文章或继续浏览下面的相关文章希望大家以后多多支持站长技术！

原文链接：https://m.jb51.net/article/183375.htm
本站部分内容转载于网络，版权归原作者所有，转载之目的在于传播更多优秀技术内容，如有侵权请联系QQ/微信：153890879删除，谢谢！

上一篇：SpringMVC+Jquery实现Ajax功能 下一篇：Ajax请求跨域问题解决方案分析

推荐图文



table中cesllspacing与cellpadding的区别详解

网络编程

XML和JSP的联手

网络编程

产品经理面试——简历填写

网络编程

基于uni-app编写的登录模板，request请求封装，全局

网络编程

详解ASP.NET Core3.0 配置的Options模式

网络编程

QQ经典说说大全：爱笑的男生不会差，逗你笑的男生更

网络编程

周排行

月排行

总排行

1 浅析mmdetection在windows10系统环境中搭

2 如何用SQL只统计工作日的数据？

3 PHP isset empty函数相关面试题及解析

4 如何获知并显示文件的大小？

5 Ajax原理与应用案例快速入门教程

6 把数据转换成XML格式的好处

7 php swoft框架实例用法

8 SpringCloud Alibaba实战之SpringCloud G

9 【JAVA程序设计】从HelloWorld开始

10 使用时间序列数据库的案例

1 git克隆远程仓库的指定分支方法(附常用gi

2 js 执行上下文和作用域的相关总结

3 Servlet实现文件上传的三种方法总结

4 21 岁理工男开源的这个编辑器火遍全球附

5 聊聊数据源集市建设的初步思路和规划

6 Linux查看硬件信息超强命令sar，以及可视

7 即刻报名 | Flutter Engage China 线上见

8 因存在诸多BUG 微软暂停Edge浏览器“启动

9 asp控制xml数据库的经典代码

10 win10安装Anaconda+tensorflow2.0-CPU+Py

1 ASP.NET Core对Controller进行单元测试的

2 JavaScript实现点击出现子菜单效果

3 Linux 或将移除传统的 IDE 驱动支持

4 Windows 10 Version 1909五月停止支持微

5 MySQL 8.0.23中复制架构从节点自动故障转

6 页面嵌入Windows Media Player播放器代码

7 CKEditor/FCKEditor 使用FCKeditor 2.6.5

8 经典语句心情：成长中，痛并快乐的日子叫

9 PHP连接MySQL数据库三种实现方法

10 从0到1部署一套TiDB本地集群

随机推荐

关于CKeditor的非主流个性应用的设置

CKeditor，以前叫FCKeditor，已经使用过好多年了，功能自然没的说。最近升级到3....

深入了解MySQL主从复制的原理

本文转载自微信公众号「SH的全栈笔记」，作者SH。转载本文请联系SH的全栈笔记公...

flash 报错捕获(Catch All Exception in

在Flash Player 10.1及以上版本中，adobe新增了全局错误处理程序UncaughtErrorEv...

AJAX+Servlet实现的数据处理显示功能示例

本文实例讲述了AJAX+Servlet实现的数据处理显示功能。分享给大家供大家参考，具...

最新IntelliJ IDEA 2020.2永久激活码(亲

idea官方推送了2020.2.4版本的更新，那么大家最关心的问题来了，之前激活idea202...

.NET Core 处理 WebAPI JSON 返回烦人的n

前言项目开发中不管是前台还是后台都会遇到烦人的null，数据库表中字段允许空值...

面试官：能说一说MySQL缓存池吗？

大家好，我是狂聊君。今天来聊一聊 Mysql 缓存池原理。提纲附上，话不多说，直...

flex项目中server的名称修改方法探讨

问题：我们在做flex的开发中，如果用到别人搭建好的框架，而别人的server名称往...

巧用Spt_Values解决SQL中的连续日期问题

本文转载自微信公众号「SQL数据库」，作者丶平凡世界。转载本文请联系开发公众...

OBLOG4.0 OBLOG4.5漏洞利用分析

来源：DeepenStudy 漏洞文件：js.asp % Dimoblog setoblog=newclass_sys oblog.a...

正则表达式+Python re模块详解

正则表达式一些小规则

①元字符

②量词

③贪婪和非贪婪匹配

④转义符问题

Python --> re模块

推荐图文

随机推荐

关于我们