Python标准库笔记(2) — re模块

  re模块提供了一系列功能强大的正则表达式(regular expression)工具,它们允许你快速检查给定字符串是否与给定的模式匹配(match函数), 或者包含这个模式(search函数)。正则表达式是以紧凑(也很神秘)的语法写出的字符串模式。

1. 常用方法

常用方法 描述
match(pattern, string, flags=0) 如果字符串string的开头和正则表达式pattern匹配返回相应的MatchObject的实例,否则返回None
search(pattern, string, flags=0) 扫描string,如果有个位置可以匹配正则表达式pattern,就返回一个MatchObject的实例,否则返回None
sub(pattern, repl, string, count=0, flags=0) 将string里匹配pattern的部分,用repl替换掉,最多替换count次
subn(pattern, repl, string, count=0, flags=0) 和sub类似,subn返回的是一个替换后的字符串和匹配次数组成的元组
split(pattern, string, maxsplit=0, flags=0) 用pattern匹配到的字符串来分割string
findall(pattern, string, flags=0) 以列表的形式返回string里匹配pattern的字符串
compile(pattern, flags=0)compile(pattern, flags=0) 把一个正则表达式pattern编译成正则对象,以便可以用正则对象的match和search方法
purge() Clear the regular expression cache
escape(string) 把string中除了字母和数字以外的字符,都加上反斜杆

2. 特殊匹配符

语法 说明
. 匹配除了换行符外的任何字符
^ 头匹配
$ 尾匹配
* 匹配前一个字符0次或多次
+ 匹配前一个字符1次或多次
? 匹配前一个字符0次或一次
{m,n} 匹配前一个字符m至n次
\ 对任一特殊字符进行转义
[] 用来表示一个字符集合
| 或,代表左右任意匹配一个

3. 模块方法

re.match(pattern, string, flags=0)

  从字符串的开始匹配,如果pattern匹配到就返回一个Match对象实例(Match对象在后面描述),否则放回None。flags为匹配模式(会在下面描述),用于控制正则表达式的匹配方式。

import re

a = ‘abcdefg‘
print re.match(r‘abc‘, a)  # 匹配成功
print re.match(r‘abc‘, a).group()
print re.match(r‘cde‘, a)  # 匹配失败

>>><_sre.SRE_Match object at 0x0000000001D94578>
>>>abc
>>>None

search(pattern, string, flags=0)

  用于查找字符串中可以匹配成功的子串,如果找到就返回一个Match对象实例,否则返回None。

import re

a = ‘abcdefg‘
print re.search(r‘bc‘, a)
print re.search(r‘bc‘, a).group()
print re.search(r‘123‘, a)

>>><_sre.SRE_Match object at 0x0000000001D94578>
>>>bc
>>>None

sub(pattern, repl, string, count=0, flags=0)

  替换,将string里匹配pattern的部分,用repl替换掉,最多替换count次(剩余的匹配将不做处理),然后返回替换后的字符串。

import re

a = ‘a1b2c3‘
print re.sub(r‘\d+‘, ‘0‘, a)  # 将数字替换成‘0‘
print re.sub(r‘\s+‘, ‘0‘, a)  # 将空白字符替换成‘0‘

>>>a0b0c0
>>>a1b2c3

subn(pattern, repl, string, count=0, flags=0)

  跟sub()函数一样,只是它返回的是一个元组,包含新字符串和匹配到的次数

import re

a = ‘a1b2c3‘
print re.subn(r‘\d+‘, ‘0‘, a)  # 将数字替换成‘0‘

>>>(‘a0b0c0‘, 3)

split(pattern, string, maxsplit=0, flags=0)

  正则版的split(),用匹配pattern的子串来分割string,如果pattern里使用了圆括号,那么被pattern匹配到的串也将作为返回值列表的一部分,maxsplit为最多被分割的字符串。

import re

a = ‘a1b1c‘
print re.split(r‘\d‘, a)
print re.split(r‘(\d)‘, a)

>>>[‘a‘, ‘b‘, ‘c‘]
>>>[‘a‘, ‘1‘, ‘b‘, ‘1‘, ‘c‘]

findall(pattern, string, flags=0)

  以列表的形式返回string里匹配pattern的不重叠的子串。

import re

a = ‘a1b2c3d4‘
print re.findall(‘\d‘, a)

>>>[‘1‘, ‘2‘, ‘3‘, ‘4‘]

4. Match对象

  re.match()、re.search()成功匹配的话都会返回一个Match对象,它包含了很多此次匹配的信息,可以使用Match提供的属性或方法来获取这些信息。例如:

>>>import re

>>>str = ‘he has 2 books and 1 pen‘
>>>ob = re.search(‘(\d+)‘, str)

>>>print ob.string  # 匹配时使用的文本
he has 2 books and 1 pen

>>>print ob.re # 匹配时使用的Pattern对象
re.compile(r‘(\d+)‘)

>>>print ob.group()  # 获得一个或多个分组截获的字符串
2

>>>print ob.groups()  # 以元组形式返回全部分组截获的字符串
(‘2‘,)

5.Pattern对象

  Pattern对象对象由re.compile()返回,它带有许多re模块的同名方法,而且方法作用类似一样的。例如:

>>>import re
>>>pa = re.compile(‘(d\+)‘)

>>>print pa.split(‘he has 2 books and 1 pen‘)
[‘he has ‘, ‘2‘, ‘ books and ‘, ‘1‘, ‘ pen‘]

>>>print pa.findall(‘he has 2 books and 1 pen‘)
[‘2‘, ‘1‘]

>>>print pa.sub(‘much‘, ‘he has 2 books and 1 pen‘)
he has much books and much pen

6.匹配模式

  匹配模式取值可以使用按位或运算符’|’表示同时生效,比如re.I | re.M, 下面是常见的一些flag。

  • re.I(re.IGNORECASE): 忽略大小写
>>>pa = re.compile(‘abc‘, re.I)
>>>pa.findall(‘AbCdEfG‘)
>>>[‘AbC‘]
  • re.L(re.LOCALE):字符集本地化

  这个功能是为了支持多语言版本的字符集使用环境的,比如在转义符\w,在英文环境下,它代表[a-zA-Z0-9],即所以英文字符和数字。如果在一个法语环境下使用,有些法语字符串便匹配不上。加上这L选项和就可以匹配了。不过这个对于中文环境似乎没有什么用,它仍然不能匹配中文字符。

  • re.M(re.MULTILINE): 多行模式,改变’^’和’$’的行为
>>>pa = re.compile(‘^\d+‘)
>>>pa.findall(‘123 456\n789 012\n345 678‘)
>>>[‘123‘]

>>>pa_m = re.compile(‘^\d+‘, re.M)
>>>pa_m.findall(‘123 456\n789 012\n345 678‘)
>>>[‘123‘, ‘789‘, ‘345‘]
  • re.S(re.DOTALL): 点任意匹配模式,改变’.’的行为

  .号将匹配所有的字符。缺省情况下.匹配除换行符\n外的所有字符,使用这一选项以后,点号就能匹配包括换行符的任何字符。

  • re.U(re.UNICODE): 根据Unicode字符集解析字符
  • re.X(re.VERBOSE): 详细模式
# 这个模式下正则表达式可以是多行,忽略空白字符,并可以加入注释。以下两个正则表达式是等价的
a = re.compile(r"""\d +  # the integral part
                   \.    # the decimal point
                   \d *  # some fractional digits""", re.X)
b = re.compile(r"\d+\.\d*")
# 但是在这个模式下,如果你想匹配一个空格,你必须用‘/ ‘的形式(‘/‘后面跟一个空格)

?

时间: 2025-01-04 23:59:53

Python标准库笔记(2) — re模块的相关文章

Python标准库笔记(6) — struct模块

该模块作用是完成Python数值和C语言结构体的Python字符串形式间的转换.这可以用于处理存储在文件中或从网络连接中存储的二进制数据,以及其他数据源. 用途: 在Python基本数据类型和二进制数据之间进行转换 struct模块提供了用于在字节字符串和Python原生数据类型之间转换函数,比如数字和字符串. 模块函数和Struct类 它除了提供一个Struct类之外,还有许多模块级的函数用于处理结构化的值.这里有个格式符(Format specifiers)的概念,是指从字符串格式转换为已编

Python标准库笔记(1) — string模块

String模块包含大量实用常量和类,以及一些过时的遗留功能,并还可用作字符串操作. 1. 常用方法 常用方法 描述 str.capitalize() 把字符串的首字母大写 str.center(width) 将原字符串用空格填充成一个长度为width的字符串,原字符串内容居中 str.count(s) 返回字符串s在str中出现的次数 str.decode(encoding=’UTF-8’,errors=’strict’) 以指定编码格式解码字符串 str.encode(encoding=’U

Python标准库笔记(5) — sched模块

事件调度 sched模块内容很简单,只定义了一个类.它用来最为一个通用的事件调度模块. class sched.scheduler(timefunc, delayfunc)这个类定义了调度事件的通用接口,它需要外部传入两个参数,timefunc是一个没有参数的返回时间类型数字的函数(常用使用的如time模块里面的time),delayfunc应该是一个需要一个参数来调用.与timefunc的输出兼容.并且作用为延迟多个时间单位的函数(常用的如time模块的sleep). 下面是一个列子: imp

【python标准库学习】re模块

1.什么是re 正则表达式一门相对通用的语言,在python中也有对正则表达式的支持,那就是的内置re模块.正则表达式就是一系列的规则去匹配字符串然后进行相应的操作,这些规则网上一搜一大片,而re则是运用正则表达式来提供一系列的功能强大的接口让我们来调用.通常我们在对日志文件进行操作的时候会对正则表达式运用的比较多来得到我们希望得到的数据. 2.python中的转义符 正则表达式中通常用反斜杠'\'来代表转义,'\d'代表数字等,但是python本身也是通过反斜杠'\'来表示转义,所以就和正则表

python标准库笔记

第1章 文本1 第2章  数据结构55 第3章  算法103 第4章  日期和时间138 第5章  数学计算157 第6章  文件系统197 第7章 数据持久存储与交换267 第8章 数据压缩与归档340 第9章 加密378 第10章 进程与线程387 第11章 网络通信452 第12章 internet514 第13章 email587 第14章 应用构建模块623 第15章 国际化和本地化729 第16章 开发工具745 第17章 运行时特性847 第18章 语言工具947 第19章 模块与

python标准库介绍——36 popen2 模块详解

==popen2 模块== ``popen2`` 模块允许你执行外部命令, 并通过流来分别访问它的 ``stdin`` 和 ``stdout`` ( 可能还有 ``stderr`` ). 在 python 1.5.2 以及之前版本, 该模块只存在于 Unix 平台上. 2.0 后, Windows 下也实现了该函数. [Example 3-9 #eg-3-9] 展示了如何使用该模块来给字符串排序. ====Example 3-9. 使用 popen2 模块对字符串排序Module to Sort

python标准库介绍——35 pipes 模块详解

==pipes 模块== (只用于 Unix) ``pipes`` 模块提供了 "转换管道 (conversion pipelines)" 的支持. 你可以创建包含许多外部工具调用的管道来处理多个文件. 如 [Example 3-8 #eg-3-8] 所示. ====Example 3-8. 使用 pipes 模块====[eg-3-8] ``` File: pipes-example-1.py import pipes t = pipes.Template() # create a

python标准库介绍——34 commands 模块详解

==commands 模块== (只用于 Unix) ``commands`` 模块包含一些用于执行外部命令的函数. [Example 3-7 #eg-3-7] 展示了这个模块. ====Example 3-7. 使用 commands 模块====[eg-3-7] ``` File: commands-example-1.py import commands stat, output = commands.getstatusoutput("ls -lR") print "s

python标准库介绍——31 threading 模块详解

threading 模块 (可选) ``threading`` 模块为线程提供了一个高级接口, 如 [Example 3-1 #eg-3-1] 所示. 它源自 Java 的线程实现. 和低级的 ``thread`` 模块相同, 只有你在编译解释器时打开了线程支持才可以使用它 . 你只需要继承 //Thread// 类, 定义好 ``run`` 方法, 就可以创建一 个新的线程. 使用时首先创建该类的一个或多个实例, 然后调用 ``start`` 方法. 这样每个实例的 ``run`` 方法都会运