正則表达式(五)浅谈两种匹配操作.docxVIP

下载本文档

2
0
约6.46千字
约 8页
2016-11-27 发布于重庆
举报
版权申诉

正則表达式(五)浅谈两种匹配操作.docx

1、原创力文档（book118）网站文档一经付费（服务费），不意味着购买了该文档的版权，仅供个人/单位学习、研究之用，不得用于商业用途，未经授权，严禁复制、发行、汇编、翻译或者网络传播等，侵权必究。。
2、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。如您付费，意味着您自己接受本站规则且自行承担风险，本站不退款、不进行额外附加服务；查看《如何避免下载的几个坑》。如果您已付费下载过本站文档，您可以点击这里二次下载。
3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等，请点击“版权申诉”（推荐），也可以打举报电话：400-050-0827(电话支持时间：9:00-18:30)。
4、该文档为VIP文档，如果想要下载，成为VIP会员后，下载免费。
5、成为VIP后，下载本文档将扣除1次下载权益。下载后，不支持退款、换文档。如有疑问请联系我们。
6、成为VIP后，您将拥有八大权益，权益包括：VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
7、VIP文档为合作方或网友上传，每下载1次，网站将根据用户上传文档的质量评分、类型等，对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档

正則表达式(五)浅谈两种匹配操作

正则表达式（五）：浅谈两种匹配操作在正则表达式中，匹配是最最基本的操作。使用正则表达式，换种说法就是“用正则表达式去匹配文本”。但这只是广义的“匹配”，细说起来，广义的“匹配”又可以分为两类：提取和验证。所以，本篇文章就来专门讲讲提取和验证。提取提取可以理解为“用正则表达式遍历整个字符串，找出能够匹配的文本”，它主要用来提取需要的数据，常见的任务有：找出文本中的电子邮件地址，找出HTML代码中的图片地址、超链接地址……提取数据时，首先要注意的，就是准确性。准确准确性分为两方面：完整和精确。前者是要提取出需要的所有文本，不能漏过；后者是要保证提取的结果中没有不需要的文本，不可出错。为保证完整，我们需要考虑足够多的变体，覆盖所有情况。一般来说，要提取的数据都只有概念的描述（比如，提取一个电子邮件地址，提取一个身份证号），如果没有拿到完整规范的特征描述，可能只能凭经验总结出几条特征，然后逐步完善，也就是不断考虑新的情况，照顾到各种情况。拿“提取文本中的浮点数字符串”为例。最容易想到的情况，就是3.14、3999.2、0.36之类，也就是“数字字符串 + 小数点 + 数字字符串”，所以用表达式『\d+\.\d+』，按照我们上一篇文章说过的“与或非”，三个部分都是必须出现的，所以这个表达式似乎是没问题了。 \d+\.\d+ 但是有些时候，0.7是写作.7的，上面的表达式无法照顾这种情况，所以必须修改表达式：整数部分是可能出现也可能不出现的，所以小数点之前的\d+应该改为\d*，就成了『\d*\.\d+』。 \d*\.\d+ 但是且慢，浮点数还包括负数，比如-0.7，但现在这个表达式无法匹配最开始的符号，所以还应该改成『-?\d*\.\d+』。 -?\d*\.\d+ 但仅仅保证完整性还不够，提取的另一方面是精确，就是排除掉那些“能够由正则表达式匹配，但其实并非期望”的字符串，所以我们还需要仔细观察目前的正则表达式，适当添加限制条件。仍然用上面的正则表达式作例子，『-?\d*\.\d+』中，『-?』和『\d*』都是可能出现的元素，所以它们可能都不出现，这时候表达式能匹配.7之类，没有错；如果只出现了『\d*』能匹配的文本，可以匹配3.14之类，也没有错；但是，如果只出现『-?』呢？-.7，通常来说，负的浮点数是应该写作-0.7的，而-.7显然是不合法的。所以，这个表达式应该修改为『(-?\d+|\d*)\.\d+』。 (-?\d+|\d*)\.\d+ 事情到这里就完整了吗？似乎还不是。我们知道有些地方，日期字符串是“2010.12.22”的形式，如果你要处理的文本中不包含这种日期字符串还好，否则，上面的表达式会错误匹配2010.12.22或者2010.12.22。为了避免这种情况，我们需要给表达式加上更多的限制。最直接想法就是，限定表达式两端不能出现点号.，变成『(?!.)(-?\d+|\d*)\.\d+(?!.)』。 (?!.)(-?\d+|\d*)\.\d+(?!.) 这样确实避免了2010.12.22的错误匹配，但它也造成了新的问题，比如“…the value of π is 3.14. Therefore…”，3.14本来是我们需要提取的浮点数，但加上这个限制之后，因为3.14之后的有一个作为英文句号使用的点号，所以3.14无法匹配。仔细观察我们要排除的2010.12.22这类字符串，我们发现点号.的另一端仍然是数字，而用作句号的点号，另一端必定不是数字（一般是空白字符，或者就是字符串的开头/末尾），所以应当把限制条件表达的更精确些，变为『(?!\d.)(-?\d+|\d*)\.\d+(?!.\d)』。 (?!\d.)(-?\d+|\d*)\.\d+(?!.\d) 好了，关于浮点数的匹配就讲到这里。回过头想想得到最后的这个表达式，我们发现，如果要用正则表达式匹配，必须兼顾完整和精确，通常的做法就像这个例子中的一样：先逐步放宽限制，保证完整；再添加若干限制，保证精确。效率提取数据时还有一点需要注意，就是效率。有时要处理的文本非常长，即便进行简单的字符串查找都很费力，更不用说可能出现各种变体的正则表达式了。这时候就应当尽量减少“变化”的范围。比如知道文本中只包含一个双引号字符串，希望将它提取出来，正则表达式写成了『.*』。在文本不长时这样还可以接受，如果文本很长，『.*』这类子表达式就会导致大量的回溯，因为『.*』的匹配过程是这样的：观察匹配过程就会发现，如果字符串很长，而引号字符串又出现在比较靠前的位置，比如quoted string and long long long text…，匹配时就需要进行大量的回溯操作，严重影响效率。如果这种问题并不是任何情况下都可能发生，但效率确实非常重要的，如果正则表达式编写不当