如何替换URL中的Query字段?

网络 通信技术
由于ParseResult对象的.query属性是只读属性,不能覆盖,因此我们需要调用一个内部方法._replace把新的.query字段替换上去,生成新的 ParseResult对象。最后再把它转回网址。

 [[420519]]

在我们写爬虫的时候,可能会需要在爬虫里面基于当前url生成一个新的url。例如下面这段伪代码:

  1. import re 
  2. current_url = 'https://www.kingname.info/archives/page/2/' 
  3. current_page = re.search('/(\d+)', current_url).group(1) 
  4. next_page = int(current_page) + 1 
  5. next_url = re.sub('\d+', str(next_page), current_url) 
  6. make_request(next_url) 

运行效果如下图所示:

但有时候,翻页参数不一定是数字。例如有些网站,访问一个URL:https://xxx.com/articlelist?category=technology&after=asdrtJKSAZFD

当你访问这个url的时候,它返回的是一个JSON字符串,并且这个JSON里面,有如下字段:

  1. ... 
  2. "paging": { 
  3.         "cursors": { 
  4.             "before""MTA3NDU0NDExNDEzNTgz"
  5.             "after""MTE4OTc5MjU0NDQ4NTkwMgZDZD" 
  6.         }, 
  7.          
  8.     } 
  9. ... 

这种情况多见于信息流网站。它只能无限下滑看下一页,不能直接通过页数跳页。每次请求的时候返回下一页的参数after。当要访问下一页的时候,用这个参数替换当前url中的after=后面的参数。

这样一来,替换url中的参数就并不是一件简单的事情了。因为网址可能有4种情况:

  • 第一页,没有after参数:https://xxx.com/articlelist?category=technology
  • 第一页,有after参数名但没有值:https://xxx.com/articlelist?category=technology&after=
  • 后续页面,after参数值后面没有内容: https://xxx.com/articlelist?category=technology&after=asdrtJKSAZFD
  • 后续页面,aster参数值后面有内容:https://xxx.com/articlelist?category=technology&after=asdrtJKSAZFD&other=abc

大家可以试一试,如果用正则表达式,怎么覆盖这4种情况,生成下一页的网址。

实际上,我们不需要使用正则表达式。Python自带的urllib模块已经提供了解决这个问题的方案了。我们先来看一段代码:

  1. from urllib.parse import urlparse, urlunparse, parse_qs, urlencode 
  2.  
  3.  
  4. def replace_field(url, name, value): 
  5.     parse = urlparse(url) 
  6.     query = parse.query 
  7.     query_pair = parse_qs(query) 
  8.     query_pair[name] = value 
  9.     new_query = urlencode(query_pair, doseq=True
  10.     new_parse = parse._replace(query=new_query) 
  11.     next_page = urlunparse(new_parse) 
  12.     return next_page 
  13.  
  14. url_list = [ 
  15.     'https://xxx.com/articlelist?category=technology'
  16.     'https://xxx.com/articlelist?category=technology&after='
  17.     'https://xxx.com/articlelist?category=technology&after=asdrtJKSAZFD'
  18.     'https://xxx.com/articlelist?category=technology&after=asdrtJKSAZFD&other=abc' 
  19.  
  20. for url in url_list: 
  21.     next_page = replace_field(url, 'after''0000000'
  22.     print(next_page) 

运行效果如下图所示:

从图中可以看到,这4种情况,都可以被我们成功添加下一页的参数after= 0000000。不用再去考虑正则表达式怎么适配所有情况。

其中urlparse 和urlunparse 是一对相反函数,前者把网址转成 ParseResult 对象,后者把ParseResult对象转回网址字符串。

ParseResult 对象的.query 属性,是一个字符串,也就是网址中,问号后面的内容,格式如下:

parse_qs与urlencode也是一对相反函数。其中前者把 .query输出的字符串转成字典,而后者把字段转成.query形式的字符串:

当使用parse_qs把 query转成字典以后,就可以修改参数的值,然后再重新转回去。

由于ParseResult对象的.query属性是只读属性,不能覆盖,因此我们需要调用一个内部方法._replace把新的.query字段替换上去,生成新的 ParseResult对象。最后再把它转回网址。

以上,就是今天我们介绍的,如何使用urllib自带的函数替换网址中的字段。

 

责任编辑:武晓燕 来源: 未闻Code
相关推荐

2010-09-28 15:54:55

SQL替换字段

2010-09-28 16:02:46

替换SQL字段

2010-11-22 12:04:09

MySQL字段

2010-09-28 16:22:23

SQL ntext字段

2014-06-27 09:34:03

AngularJS

2020-10-28 08:10:27

URL域名https

2021-11-27 23:54:44

监控Snuba数据

2010-04-23 18:11:28

Aix镜像

2011-07-21 10:44:57

Sharepoint列.net托管代码

2010-11-26 10:29:21

MySQL批量替换

2024-01-02 08:43:48

qs工具库格式化

2009-07-31 09:58:20

URL映射ASP.NET

2010-10-25 10:13:16

ibmdwWebSphere

2023-02-01 14:08:53

JavaScriptURL安全

2010-11-22 12:59:30

MySQL字段

2010-11-22 12:14:55

MySQL字段

2009-06-29 09:00:42

Hibernate的Q

2019-02-26 13:00:11

JavaScriptURL前端

2021-08-11 22:50:53

JavaScript编程开发

2021-04-16 20:50:16

URL爬虫参数
点赞
收藏

51CTO技术栈公众号